Open-R1 更新:复现 DeepSeek-R1 评测分数与训练管线进展
Hugging Face 的 Open-R1 项目在启动一周后,复现了 DeepSeek-R1 蒸馏模型在 MATH-500 上的评测分数,例如 DeepSeek-R1-Distill-Qwen-1.5B 得 81.6、7B 得 91.8、32B 得 95.0。
推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的评测分数,并公开了 GRPO 训练与合成数据生成的具体工程取舍。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Hugging Face 的 Open-R1 项目在启动一周后,复现了 DeepSeek-R1 蒸馏模型在 MATH-500 上的评测分数,例如 DeepSeek-R1-Distill-Qwen-1.5B 得 81.6、7B 得 91.8、32B 得 95.0。
推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的评测分数,并公开了 GRPO 训练与合成数据生成的具体工程取舍。
Hugging Face 博客发布 Mini-R1 教程,用 GRPO 和 Countdown 游戏在 Qwen2.5-3B-Instruct 上复现 DeepSeek-R1 的 aha moment。
推荐理由:作者用 4 张 H100 复现 DeepSeek-R1 的 aha moment,给出完整脚本与训练观察,可迁移到自己的 RL 实验。
Mistral AI 发布 Mistral Small 3,一个面向低延迟优化的 24B 参数模型,以 Apache 2.0 许可证开源,同时提供预训练和指令微调两个 checkpoint。
推荐理由:24B 参数在 Apache 2.0 下对标三倍体量模型,并给出单卡本地部署的量化条件,便于判断小模型落点。
Hugging Face 发起 Open-R1 项目,计划系统重建 DeepSeek-R1 的数据与训练流程,补上官方未公开的数据集和训练代码。项目分三步:从 DeepSeek-R1 蒸馏高质量推理数据集复现 R1-Distill 模型,复现 R1-Zero 所用的纯强化学习流程并整理数学、推理、代码数据集,以及展示从基座模型经 SFT 到 RL 的多阶段训练。
推荐理由:Hugging Face 公开复现 DeepSeek-R1 的三步计划,读者可了解开源推理模型训练链路的缺口与补全路径。
Hugging Face 在 Hub 的模型页上线 Inference Providers,首批接入 fal、Replicate、SambaNova、Together AI 四家无服务器推理服务商,并集成到 JS 和 Python 客户端 SDK。
推荐理由:Hugging Face 把四家无服务器推理服务商接入模型页与 SDK,读者可据此了解调用方式与计费差异。
Hugging Face Diffusers 团队发布博客,梳理开源视频生成模型现状,并介绍 Diffusers 对 CogVideoX、Mochi-1、HunyuanVideo、LTX-Video 等模型的支持与优化方案。
推荐理由:梳理开源视频生成模型现状与 Diffusers 的显存优化路径,给出可复用的量化与卸载配置。
Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图片既可在 run 方法中一次性传入并存入 TaskStep 的 task_images,也可通过 step_callbacks 在每步把截图写入 ActionStep 的 observation_images。
推荐理由:官方给出在 smolagents 中接入视觉语言模型的两条路径,读者可据此判断浏览器类智能体的实现方式。
Hugging Face 发布 SmolVLM 家族新成员 SmolVLM-256M 和 SmolVLM-500M,共四个 checkpoint,含两个 base 模型和两个指令微调模型,可直接加载到 transformers、MLX 和 ONNX。
推荐理由:SmolVLM 家族新增 256M 与 500M 两个小尺寸视觉语言模型,读者可据此了解小模型在端侧与浏览器推理上的取舍。
Hugging Face 发布两个静态嵌入模型 static-retrieval-mrl-en-v1(英文检索)和 static-similarity-mrl-multilingual-v1(多语言相似度),在 CPU 上比 all-mpnet-base-v2、multilingual-e5-small 等常见模型快 100 至 400 倍,同时保留至少 85% 的性能。
推荐理由:原文给出静态嵌入模型的训练配方与两个已发布模型,读者可据此评估 CPU 端检索与相似度任务的落地成本。
Hugging Face 发布 smolagents,一个让语言模型具备智能体能力的轻量库,核心是 CodeAgent,即让智能体用代码而非 JSON 编写动作,并支持通过 E2B 在沙箱中执行。
推荐理由:Hugging Face 官方开源轻量智能体库,用代码而非 JSON 表达动作,并给出可复用的工具构建方式。
Answer.AI 与 LightOn 发布 ModernBERT,一个仅编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个版本,支持 8192 token 上下文,可作为 BERT 类模型的直接替代。
推荐理由:ModernBERT 用现代 LLM 技术重做编码器,给出 8k 上下文与速度数据,可据此判断它能否替换现有 BERT 类模型。
IBM、Princeton、CMU 和 UIUC 联合发布 Bamba-9B,一个在完全开放数据上训练的混合 Mamba2 模型,训练数据量 2.2T tokens。
推荐理由:Bamba-9B 用完全开放数据训练并给出 vLLM 实测吞吐与延迟数据,可对照同尺寸 Transformer 模型判断混合 Mamba2 架构的取舍。
阿布扎比 TII 发布 Falcon3 开源模型家族,包含 Falcon3-1B-Base、3B-Base、Mamba-7B-Base、7B-Base 和 10B-Base 五款基础模型。
推荐理由:Falcon3 给出 1B 到 10B 五款开源模型及训练方法,读者可据此判断小模型在数学、代码与推理上的位置。
Google 发布新一代视觉语言模型 PaliGemma 2,用 Gemma 2 替换前代的文本解码器,保留 SigLIP 图像编码器,提供 3B、10B、28B 三种参数规模,每种均支持 224x224、448x448、896x896 三种输入分辨率,而前代 PaliGemma 仅有 3B 版本。
推荐理由:PaliGemma 2 给出 3B 到 28B 三种规模与三种分辨率组合,读者可据此判断视觉语言模型的微调选型空间。
Hugging Face 发布 SmolVLM,一个 2B 参数的小型视觉语言模型家族,包含 Base、Synthetic 和 Instruct 三个版本,模型权重、数据集、训练配方和工具均以 Apache 2.0 协议开源。
推荐理由:2B 参数 VLM 把显存压到 5GB 并开放全部训练配方,读者可据此判断端侧多模态部署的可行边界。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开源权重多模态模型,由 123B 多模态解码器和 1B 参数视觉编码器组成,支持 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
推荐理由:官方给出 Pixtral Large 在 MathVista、DocVQA 等基准上的对比数据,可据此判断开源多模态模型的当前水平。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让辅助生成不再要求目标模型与辅助模型共享同一 tokenizer,可跨模型家族配对,对任意 decoder 或 MoE 模型实现 1.5x-2.0x 推理加速。
推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的辅助生成方法,读者可了解其 2-way tokenizer 翻译思路与实测加速幅度。
Cohere For AI 发布 Aya Expanse 系列多语言模型,包含 8B 和 32B 两个参数规模,并以开放权重形式发布。官方称 Aya Expanse 32B 在成对比较中优于 Gemma 2 27B、Mistral 8x22B 和 Llama 3.1 70B,Aya Expanse 8B 在同参数级别模型中的胜率为 60.4% 至 70.6%。
推荐理由:Cohere For AI 公开了 Aya Expanse 的完整后训练流程,包括数据套利、多语言偏好训练与模型合并的具体做法。
Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中发布 SynthID Text,可通过 logits processor 为 AI 生成文本加水印,并用分类器检测。
推荐理由:Google DeepMind 与 Hugging Face 把文本水印做成 Transformers 里的生成配置,读者可据此了解其接入方式与检测流程。
Hugging Face 发布 HUGS(Hugging Face Generative AI Services),一套零配置的优化推理微服务,用于在自有基础设施上部署开源模型。
推荐理由:HUGS 把开源模型的推理部署从数周压缩到分钟级,并给出兼容 OpenAI API 的落地路径与定价。