跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 21–40 条 · 共 95 条
5月23日周六
  1. Mistral AI62

    Mistral 收购 Physics AI 公司 Emmi AI,加速工业 AI 布局

    Mistral AI 本周签署最终协议收购 Physics AI 先驱 Emmi AI,以强化其作为工业企业 AI 转型伙伴的定位。Emmi AI 成立于奥地利,专注 Physics AI 与大型工程模型,可实时仿真替代多日计算并构建数字孪生,其 30 多名研究人员与工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。

    推荐理由:Mistral 通过收购 Physics AI 公司 Emmi 补强工业仿真能力,读者可了解其 Science 路线与工业 AI 布局。

5月20日周三
5月12日周二
  1. Google DeepMind74

    Google DeepMind 发布 Co-Scientist 多智能体科研系统

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化复杂科学问题的新假设。

    推荐理由:原文披露了多智能体系统的三阶段架构与辩论式排序机制,并给出多个实验室的落地案例,可据此判断 AI 参与科学假设生成的实际边界。

4月30日周四
4月29日周三
  1. Hugging Face Blog60

    Granite 4.1 LLM 是如何构建的:IBM 公开预训练、SFT 与 RL 全流程

    IBM Granite 团队发布技术长文,详解 Granite 4.1 系列稠密解码器模型(3B、8B、30B)的构建流程:在约 15T token 上分五阶段预训练,上下文窗口经分阶段扩展至 512K,随后用约 4.1M 高质量样本做 SFT,并通过 on-policy GRPO 配合 DAPO loss 的多阶段 RL 强化数学、编码、指令遵循与通用对话能力。

    推荐理由:Granite 4.1 完整披露五阶段预训练、SFT 与多阶段 RL 的数据配比和训练配置,可对照其 8B 稠密模型追平 32B-A9B MoE 的结论。

4月22日周三
3月31日周二
  1. Hugging Face Blog62

    Hugging Face 发布 TRL v1.0 后训练库

    Hugging Face 发布 TRL v1.0,将这一原本的研究代码库正式定位为带明确稳定性契约的后训练库,目前实现超过 75 种后训练方法,月下载量 300 万次。

    推荐理由:TRL v1.0 把稳定核心与实验层分开,并给出与同类后训练库的横向对比,便于判断选型。

3月21日周六
  1. Hugging Face Blog62

    如何在一天内构建领域专用嵌入模型

    NVIDIA 发布一套嵌入模型微调流程,用单张 GPU 和不到一天时间把通用嵌入模型改造成理解特定领域的模型,无需人工标注。流程基于 Llama-Nemotron-Embed-1B-v2,用 LLM 从领域文档生成合成问答对、挖掘难负样本并做多跳展开,再用对比学习微调。

    推荐理由:给出从合成数据生成到部署的完整嵌入模型微调流程,含 Atlassian 实测提升数据,可迁移到自有领域语料。

3月18日周三
  1. Mistral AI62

    Mistral AI 推出企业级模型构建系统 Forge

    Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 架构,并可按需支持多模态输入,模型可在企业自有基础设施内训练和治理。该平台以 Agent 优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数、调度任务并生成合成数据,用户只需用自然语言即可定制模型。

    推荐理由:Forge 把预训练、后训练与强化学习打包成企业自建模型的入口,读者可据此判断企业级定制模型的落地路径。

3月4日周三
2月26日周四
1月20日周二
  1. Hugging Face Blog62

    微软发布 Differential Transformer V2:差分注意力无需自定义 kernel

    微软团队发布 Differential Transformer V2,通过为每个 token 和每个 head 投影 λ 并只增加 query head 数量、保持 KV head 不变,使解码速度与标准 Transformer 持平且无需自定义注意力 kernel。

    推荐理由:微软团队给出 Differential Transformer V2 的注意力实现与消融对比,读者可了解差分注意力在解码速度与训练稳定性上的取舍。

1月13日周二
  1. Google Research62

    NeuralGCM 用 AI 改进全球长期降水模拟

    Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接使用 NASA 2001 至 2018 年卫星降水观测训练其机器学习部分,而非依赖再分析数据。

    推荐理由:NeuralGCM 改用卫星降水观测训练后,在 15 天预报与数十年气候模拟上均优于传统模型,读者可了解混合建模路线的具体收益。

12月5日周五
  1. Google Research62

    Google 发布 Titans 与 MIRAS:让 AI 拥有长期记忆

    Google Research 发布 Titans 架构和 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合,实现测试时记忆。Titans 用深度神经网络作为长期记忆模块,通过 surprise 指标、动量和自适应权重衰减选择性存储信息;MIRAS 则统一了序列建模的四个设计选择,并衍生出 YAAD、MONETA、MEMORA 三个无注意力模型。

    推荐理由:Google 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,在超长上下文任务上超过 GPT-4。

12月1日周一
11月21日周五
11月17日周一
10月29日周三
  1. Hugging Face Blog65

    Hugging Face 博客:全球算力格局正在如何变化

    Hugging Face 发布博客《On the Shifting Global Compute Landscape》,梳理中国开源权重模型与国产芯片互相牵引的现状:过去几个月,华为昇腾、寒武纪等芯片已开始承载部分高性能开源模型的推理,部分模型开始用国产芯片训练。

    推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,帮助读者理解算力受限如何影响模型架构与部署选择。

10月27日周一
  1. Hugging Face Blog62

    Hugging Face 改进 datasets 流式加载,请求量减少 100 倍

    Hugging Face 发布 datasets 库流式加载的性能改进,保持 streaming=True 的原有 API 不变,数据文件解析速度提升 10 倍、启动请求最多减少 100 倍、流式速度最多提升 2 倍。

    推荐理由:Hugging Face 官方给出流式加载的性能改进细节与配置方式,读者可据此判断大规模训练的数据读取成本。