跳到正文

#数据/训练

今日 0 条
10月1日周四
  1. Hugging Face Blog62

    AI2 发布 Olmo-core 3:面向大型 MoE 的开源可扩展训练基础设施

    AI2 发布 Olmo-core 3,这是其大语言模型开发框架的一次重大升级,重新设计了开放的 MoE 训练系统,目标是把 MoE 训练扩展到万亿参数规模并保持计算效率。

    推荐理由:原文给出 MoE 训练栈的吞吐与显存实测数据,读者可据此判断万亿参数 MoE 训练的开源方案成熟度。

9月30日周三
  1. Google DeepMind71

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质加水印

    Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时实验室测试显示其生物功能未受影响。

    推荐理由:SynthID 从图像音频扩展到合成生物学,读者可了解水印如何嵌入蛋白质序列与结构而不影响功能。

9月29日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Kumo Tabular 表格基础模型,四个基准排名第一

    NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行即可在单次前向传播中预测新行标签,无需训练、调参或特征工程,同时支持分类与回归。

    推荐理由:原文给出表格基础模型的架构设计、训练数据生成方式与四个基准排名,可据此判断免训练表格预测的可行边界。

  2. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物,最高排名化合物在湿实验中产生了最大的经典态向基底态转变,从缩小化合物搜索空间到选出候选验证仅用一个周末。

    推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。

9月22日周二
9月8日周二
  1. Google DeepMind78

    Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单核苷酸变异预测

    Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍,已通过网站门户免费开放给学术研究使用。

    推荐理由:DeepMind 把 AlphaGenome 的预测预计算成 1PB 全基因组图谱,读者可据此判断变异解读的门槛与规模变化。

9月1日周二
  1. Google Research58

    Google 发布 TimesFM-3:面向多变量预测的零样本基础模型

    Google 发布 TimesFM-3,一个原生预训练支持多变量预测的零样本时间序列基础模型,参数量 3.3 亿,预训练语料超过 1 万亿个时间点。模型支持多目标、历史协变量和已知未来协变量,采用交替注意力架构与 Contiguous Patch Masking,单次前向即可输出整个预测区间及 9 个分位数。

8月6日周四
6月30日周二
  1. Google Research78

    Google 发布表格数据零样本基础模型 TabFM

    Google 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:Google 把零样本思路从时序预测搬到表格数据,读者可了解其架构设计与在 TabArena 上的对比结果。

5月20日周三
5月15日周五
4月29日周三
  1. Hugging Face Blog60

    Granite 4.1 LLM 是如何构建的:IBM 公开预训练、SFT 与 RL 全流程

    IBM Granite 团队发布技术长文,详解 Granite 4.1 系列稠密解码器模型(3B、8B、30B)的构建流程:在约 15T token 上分五阶段预训练,上下文窗口经分阶段扩展至 512K,随后用约 4.1M 高质量样本做 SFT,并通过 on-policy GRPO 配合 DAPO loss 的多阶段 RL 强化数学、编码、指令遵循与通用对话能力。

    推荐理由:Granite 4.1 完整披露五阶段预训练、SFT 与多阶段 RL 的数据配比和训练配置,可对照其 8B 稠密模型追平 32B-A9B MoE 的结论。

1月5日周一
11月17日周一
9月26日周五
9月12日周五
8月22日周五
7月16日周三
5月21日周三
5月15日周四
  1. Hugging Face Blog62

    Falcon-Edge 发布 1B 与 3B 三值语言模型系列

    Falcon-Edge 系列发布,基于 BitNet 架构的三值(1.58bit)语言模型,提供 1B 和 3B 两种规模,各有 base 与指令微调版本。该系列采用新的预训练范式,单次训练同时产出 bfloat16 非量化版本、原生 BitNet 模型和便于微调的预量化 BitNet 变体,预训练数据约 1.5 Tera Tokens。

    推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三元量化版本,并给出可直接微调的工具链,读者可据此判断 1.58bit 模型的落地路径。

3月18日周二
3月12日周三
12月17日周二
10月24日周四
  1. Hugging Face Blog62

    Cohere For AI 发布 Aya Expanse 8B 与 32B 多语言模型

    Cohere For AI 发布 Aya Expanse 系列多语言模型,包含 8B 和 32B 两个参数规模,并以开放权重形式发布。官方称 Aya Expanse 32B 在成对比较中优于 Gemma 2 27B、Mistral 8x22B 和 Llama 3.1 70B,Aya Expanse 8B 在同参数级别模型中的胜率为 60.4% 至 70.6%。

    推荐理由:Cohere For AI 公开了 Aya Expanse 的完整后训练流程,包括数据套利、多语言偏好训练与模型合并的具体做法。

7月18日周四
7月16日周二
6月27日周四
1月19日周五
9月27日周三
9月6日周三
  1. Hugging Face Blog78

    TII 的 Falcon 180B 上线 Hugging Face

    TII 发布 Falcon 180B 并上线 Hugging Face,参数规模 1800 亿,在 3.5 万亿 token 的 RefinedWeb 数据上预训练,是当时最大的公开可用语言模型。

    推荐理由:Falcon 180B 以 1800 亿参数和 3.5 万亿 token 预训练规模进入开源生态,读者可据此了解当时开源模型与闭源模型的差距。

6月5日周一
  1. Hugging Face Blog78

    Falcon 模型家族落地 Hugging Face 生态

    阿布扎比技术创新研究院发布 Apache 2.0 许可的 Falcon 语言模型家族,包含 Falcon-40B 和 Falcon-7B 两个基础模型及对应 Instruct 版本。

    推荐理由:介绍 Falcon 系列的开源许可、训练数据与多查询注意力设计,并给出在 Hugging Face 生态中推理和微调的具体路径。

7月12日周二
  1. Hugging Face Blog82

    Hugging Face 发布 176B 参数开源多语言模型 BLOOM

    Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本,由 70 多个国家 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天。

    推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点与优化器状态,为研究大模型内部行为提供了少见的开放样本。

2月14日周四
  1. OpenAI News85

    OpenAI 训练出大规模无监督语言模型并在多项基准取得最优表现

    OpenAI 训练了一个大规模无监督语言模型,能够生成连贯的段落文本,在多项语言建模基准上取得当时最优表现。该模型无需针对特定任务训练,即可完成基础的阅读理解、机器翻译、问答和摘要任务。

    推荐理由:OpenAI 公布一个无监督语言模型在多项语言任务上取得当时最优表现,可了解大模型早期路线。