DeepMath:基于 smolagents 的轻量级数学推理 Agent
Intel AI Software Group 发布 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调的轻量级数学推理 Agent,通过 smolagents 生成 Python 片段并在沙箱执行,将输出长度最多缩短 66%,同时在 MATH500、AIME、HMMT、HLE 等基准上提升准确率。
Intel AI Software Group 发布 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调的轻量级数学推理 Agent,通过 smolagents 生成 Python 片段并在沙箱执行,将输出长度最多缩短 66%,同时在 MATH500、AIME、HMMT、HLE 等基准上提升准确率。
ServiceNow 将 15B 推理模型改造为 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1x 吞吐,MATH500 从 0.90 升至 0.92、MTBench 从 8.30 升至 8.58,GSM8k、GPQA、AIME24 略有下降,总训练 76.8B token。
Hugging Face 发布博客提出“语音同意门”(voice consent gate),让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动语音克隆。该方案由三部分组成:生成约 20 词、含同意短语与模型名的独特句子,ASR 识别该句,以及 TTS 语音克隆系统;同一句录音也可直接用作克隆素材。配套示例 Space 与代码已公开,用于探索把同意原则嵌入 AI 系统流程。
Hugging Face 发布 huggingface_hub v1.0,这是该库五年来的首个大版本,带来多项破坏性变更。主要变化包括后端从 requests 迁移到 httpx、全新的 hf CLI 取代已弃用的 huggingface-cli、以及 hf_xet 全面替代 hf_transfer 负责文件传输。
推荐理由:官方梳理了 huggingface_hub 五年演进与 v1.0 的破坏性变更,可据此判断升级影响与迁移成本。
Sentence Transformers 从 TU Darmstadt 的 UKP Lab 转由 Hugging Face 维护,Hugging Face 的 Tom Aarsen 自 2023 年底起已负责该项目并将继续领导。
针对 vibe coding 游戏随项目增长而失控的问题,作者推出 VibeGame——一个基于 three.js、rapier 和 bitecs 构建的高层声明式游戏引擎,专为 AI 辅助游戏开发设计。
Hugging Face 发布 Smol2Operator,用两阶段训练把无 GUI 定位能力的 SmolVLM2-2.2B-Instruct 变成能理解并操作图形界面的智能体。
Hugging Face 发布 SyGra,一个面向 LLM 与 SLM 的低代码/无代码数据构建框架,用于数据集的创建、转换与对齐。它支持 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端,可生成 Q&A、DPO 偏好对、推理及多语言数据,覆盖 SFT、DPO、RAG 等场景。
Hugging Face 发布 LeRobotDataset v3.0,将多个 episode 打包进单个文件,用关系型元数据在 episode 级别检索信息,解决 v2 单文件单 episode 在百万级数据集上的文件系统瓶颈。
Hugging Face 在 Gradio 中推出可见水印功能,只需一条命令即可为 AI 生成的图像、视频和文本添加水印。图像和视频通过 watermark 参数指定水印文件,文本则在 Chatbot 组件中设置 watermark,用户复制 AI 回复时会自动附带署名。水印支持文件名、图像或 numpy 数组,还可使用 QR 水印。
WRITER 发布 Palmyra-mini 系列三款开源模型,参数规模 1.5B 至 1.7B,包括非思考基础版 palmyra-mini 及两个推理变体 palmyra-mini-thinking-a 和 palmyra-mini-thinking-b。
Kimina Prover 团队开源了 kimina-prover-rl 训练流水线,用于在 Lean 4 中训练形式化定理证明模型,基于 DeepSeek-R1 启发的"先推理后生成"范式,并完全兼容开源 Verl 框架。
Hugging Face 发布开源无代码工具 AI Sheets,可在本地或 Hub 上部署,通过类似电子表格的界面用提示词新建列来构建、转换和丰富数据集。工具可调用 Hub 上数千个开放模型(含 OpenAI 的 gpt-oss),支持模型对比、提示词迭代、数据分类与合成数据生成,并可导出到 Hub 生成可复用配置,配合 HF Jobs 脚本扩展至更大规模数据生成。
推荐理由:Hugging Face 官方开源的无代码数据集工具,读者可了解如何用开放模型批量构建、清洗和评测数据。
OpenAI 发布开源权重模型家族 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可。
推荐理由:Hugging Face 官方给出两款开源权重模型的参数、量化与部署路径,可据此判断本地推理的硬件门槛。
Hugging Face 发布开源免费的实验追踪 Python 库 Trackio,提供本地 Gradio 仪表盘,并可同步到 Hugging Face Spaces 通过 URL 分享。
在 Gradio Agents & MCP Hackathon 期间构建的多 LLM 平台 Consilium,让多个 AI 模型围绕复杂问题展开结构化辩论并达成共识,同时提供可视化 Gradio 界面和可接入 Cline 的 MCP server。
Hugging Face 发布 Ettin Suite,这是首个用完全相同数据(2T tokens)、架构和训练配方训练的 SoTA 配对编码器与解码器模型系列,参数规模覆盖 17M 到 1B。
Hugging Face 的 TRL 通过 PR #3394 支持 vLLM 的 external launcher,让训练与推理共置在同一批 GPU 上,不再需要单独的 vLLM 服务器进程。
推荐理由:原文给出同卡共置训练与推理的实现方式和多组吞吐对比,读者可据此判断 GRPO 训练的成本变化。
Hugging Face 发布 nanoVLM,一个用纯 PyTorch 训练视觉语言模型(VLM)的轻量工具包,灵感来自 nanoGPT,可在免费 Colab 上启动训练。
Falcon-Edge 系列发布,基于 BitNet 架构的三值(1.58bit)语言模型,提供 1B 和 3B 两种规模,各有 base 与指令微调版本。该系列采用新的预训练范式,单次训练同时产出 bfloat16 非量化版本、原生 BitNet 模型和便于微调的预量化 BitNet 变体,预训练数据约 1.5 Tera Tokens。
推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三元量化版本,并给出可直接微调的工具链,读者可据此判断 1.58bit 模型的落地路径。
ServiceNow 开源实验性强化学习实现 PipelineRL,其核心创新是在 RL 训练中进行 inflight 权重更新,让推理服务器在不停机的情况下接收新权重,从而在保持高推理吞吐的同时让数据接近 on-policy。
推荐理由:ServiceNow 开源 PipelineRL,用 inflight 权重更新缓解推理吞吐与 on-policy 数据采集的矛盾,并给出 7B/32B 实验对比。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,微调版可完整提取发票等文档的页眉页脚内容并保留表格解析能力。该模型已在 Hugging Face 开源。
Language Technologies Lab 发布 Visual Salamandra,将 Salamandra 大语言模型扩展至图像和视频,基于 7B 基础模型,集成 Google SigLIP-So400m 编码器与 2 层 MLP projector,采用四阶段训练和 late-fusion 架构。
Hugging Face 与 MBZUAI 合作上线 Arabic-Leaderboards Space,统一收录阿拉伯语 AI 评测,目前包含 AraGen-03-25 和阿拉伯语指令遵循两个榜单。
Gradio 为 gr.Dataframe 组件发布大规模更新,6 周内关闭超 70 个 dataframe 相关问题。新增多单元格选择、行号与列固定(pinned_columns)、复制与全屏按钮、搜索(show_search="search")与筛选("filter")、静态列(static_columns)等功能,并升级键盘导航与 styler 样式参数。
NVIDIA 在 GTC 2025 上开源三项物理 AI 成果:世界基础模型 Cosmos Transfer、Physical AI Dataset 以及人形机器人基础模型 NVIDIA Isaac GR00T N1。
推荐理由:NVIDIA 一次性开源世界模型、数据集与人形机器人基础模型,读者可据此了解物理 AI 开发可用的工具链。
Hugging Face Open R1 项目发布 OlympicCoder-7B 和 OlympicCoder-32B 两个代码模型,基于 Qwen2.5 Coder Instruct 微调,在 IOI 问题上超过 Claude 3.7 Sonnet 等闭源前沿模型。
推荐理由:Open R1 复现 R1 代码推理配方,给出数据集、IOI 基准与 7B/32B 模型,并附训练经验。
Hugging Face 推出面向视频生成模型微调的开源数据集工具链,采用三阶段流水线:用 yt-dlp 下载视频并切分为短片段,再通过 LAION-5B-WatermarkDetection。
Hugging Face 的 Xet 团队将内容定义分块(CDC)投入生产,通过把去重后的数据聚合为最大 64MB 的块、并用分片记录文件与块的映射,把 CAS 条目减少约 1000 倍,上传下载速度在部分场景提升 2-3 倍。
推荐理由:Hugging Face 官方解释 Xet 存储如何用块与分片聚合替代逐块传输,并给出量化模型仓库的实测节省数据。
Hugging Face 将 Physical Intelligence 开发的 π0 和 π0-FAST 两个机器人基础模型移植到 LeRobot 仓库,并给出 PyTorch 版本与模型合集。
推荐理由:Physical Intelligence 的 π0 与 π0-FAST 被移植进 LeRobot,读者可据此了解 VLA 与 VLM 在动作表示上的差异。
Hugging Face 在 24 小时复现冲刺中开源了 DeepResearch 所需的智能体框架,在 GAIA 验证集上达到 55.15%,高于此前开源框架 Magentic-One 的约 46%。
推荐理由:Hugging Face 用 24 小时复现 OpenAI Deep Research,给出开源框架与 GAIA 实测对比,可看代码智能体相对 JSON 智能体的差距。
Hugging Face 发布两个静态嵌入模型 static-retrieval-mrl-en-v1(英文检索)和 static-similarity-mrl-multilingual-v1(多语言相似度),在 CPU 上比 all-mpnet-base-v2、multilingual-e5-small 等常见模型快 100 至 400 倍,同时保留至少 85% 的性能。
推荐理由:原文给出静态嵌入模型的训练配方与两个已发布模型,读者可据此评估 CPU 端检索与相似度任务的落地成本。
Hugging Face 推出多语言嵌入模型 vdr-2b-multi-v1,可将文档页面截图编码为单向量,无需 OCR 即可跨语言检索视觉丰富的文档。该模型基于 MrLight/dse-qwen2-2b-mrl-v1,与 LlamaIndex 合作开发,覆盖意大利语、西班牙语、英语、法语和德语,并开源了 50 万样本的 vdr-multilingual-train 数据集。
Answer.AI 与 LightOn 发布 ModernBERT,一个仅编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个版本,支持 8192 token 上下文,可作为 BERT 类模型的直接替代。
推荐理由:ModernBERT 用现代 LLM 技术重做编码器,给出 8k 上下文与速度数据,可据此判断它能否替换现有 BERT 类模型。
Hugging Face 与 Entalpic 联合推出开源协作项目 LeMaterial,并首发数据集 LeMat-Bulk,将 Materials Project、Alexandria 和 OQMD 三大材料数据库统一为标准格式,含 6.7M 条数据、7 种材料属性,采用 CC-BY-4.0 许可。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别并混合不同模型家族与提示词复杂度。数据集基于 Flux 和 Stable Diffusion 模型生成图像,配套提供 flux-dev-lora-finetune 微调模型及 GitHub 上的预处理与后处理代码。
dottxt 与 Hugging Face 合作发布 outlines-core 0.1.0,这是 outlines 结构化生成核心算法的 Rust 移植版,Python 绑定已同步上线。
推荐理由:原文给出 Rust 重写带来的索引编译提速与轻量化拆分,读者可据此判断结构化生成如何嵌入现有推理栈。
Hugging Face 发布 Transformers.js v3,新增 WebGPU 支持,官方称比 WASM 快至多 100 倍,并引入 fp32、fp16、q8、q4 等 dtype 量化选项。
推荐理由:官方给出 WebGPU 加速、量化格式与 1200 多个预转换模型,可据此判断浏览器端推理的可用边界。
Hugging Face 委托 Trail of Bits 对 Gradio 5 完成独立安全审计,发现的全部安全风险已在 Gradio 5.0 发布前修复并通过验证。
Hugging Face 发布 Accelerate 1.0.0 首个候选版本,可通过 pip install --pre accelerate 或 Docker 镜像试用。