ProvenanceGuard:面向 MCP 智能体的来源感知事实核查
Hugging Face 博客介绍论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可在不重训智能体的前提下读取 MCP 调用轨迹,逐条核查答案中的声明是否由所标注来源支持,并输出逐条来源判定与整体放行或拦截决定。在医疗智能体的 281 条真实轨迹上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,在四项对比检查器中得分最高。
Hugging Face 博客介绍论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可在不重训智能体的前提下读取 MCP 调用轨迹,逐条核查答案中的声明是否由所标注来源支持,并输出逐条来源判定与整体放行或拦截决定。在医疗智能体的 281 条真实轨迹上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,在四项对比检查器中得分最高。
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的新方法,基于多维 IRT(MIRT)分离同一基准中混杂的能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知基准对应能力,却自行稳定复现出安全与通用推理两个主导维度。分析显示 BBQ、WMDP 等安全基准的得分与通用推理关联更强,说明单一基准分数可能混合多种信号。
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上首个 Indic 语言。
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。
Hugging Face 发布研究,提出共识分歧探针、掩蔽实体检索和拼写切换三类测试来量化语音识别中的基准优化现象。研究评测 11 个开源 ASR 模型,发现部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,即使音频与之矛盾、相关词被静音或两种写法在音频中同样成立。
推荐理由:通过三类探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 Open Reproductions 挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文主张,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,约占大会论文总数的 34%。
推荐理由:Hugging Face 用 1200 多名社区成员和编码智能体复现 ICML 2026 论文,给出了大规模论文审计的可行路径与人类角色的具体分工。
Hugging Face 的 ALTK-Evolve 与 ACE 同为无需更新权重的智能体记忆方案,区别在交付方式:ACE 每步注入完整 playbook,ALTK-Evolve 按任务检索少量高支持度 guideline。
Hugging Face 最新论文提出两项系统改动降低 LLM 知识蒸馏成本:离线缓存教师模型每位置的 top-100 logits,使教师无需与学生同时驻留显存;融合分块 KL 损失避免生成完整的词表×序列长度矩阵。
Hume 发布 Real World VoiceEQ 语音 AI 评测基准,覆盖 40 多个专有与开源语音模型、15+ 评测维度和 60+ 指标,涵盖 ASR、TTS、S2S 和语音理解。
推荐理由:Hume 用超百万条人类评分构建语音评测基准,揭示现有基准高估真实表现的问题。
Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 跨框架迁移中的表现,涵盖 Spring、Jakarta EE、Quarkus 三大生态,包含 34 个应用、102 个框架实现和 204 个迁移任务。测试显示,即便最强智能体行为成功率也不足 10%,且 Claude Code 报告 30 个应用中 29 个构建成功,实际仅 22 个通过。
Hugging Face 博客介绍 DiScoFormer(Density and Score Transformer),单次前向传播即可从一组数据点同时估计分布的密度与 score,无需针对新分布重新训练。
Hugging Face 与 Treble Technologies 联合发布 FFASR Leaderboard,这是首个开放的远场 ASR 基准,覆盖 14 个模拟房间并经过真实测量验证。所有提交模型在低 SNR 远场下的 WER 均比同内容近场高出数倍,榜单同时报告基于 NVIDIA L4 GPU 的 RTFx,用于权衡准确率与速度。多说话人、麦克风阵列与回声消除已在路线图中。
Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,测试模型普遍泄露私有信息,且只训练任务性能会加剧泄露。其提出的 Privacy-Aware Deep Research(PA-DR)强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄露从 34.0% 降至 9.9%。
Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入覆盖多口音、脚本化与对话语音的高质量英文 ASR 私有数据集,以防止 benchmaxxing 和测试集污染。默认 Average WER 仍仅基于公开数据集计算,用户可通过开关选择是否纳入私有数据集。该榜单自 2023 年 9 月上线以来访问量已超 710K 次。
Hugging Face 发布 QIMMA قِمّة,一个在评测模型前先验证基准质量的阿拉伯语 LLM 排行榜,整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖 7 大领域且 99% 为原生阿拉伯语内容。
Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含商品发现、替代品、购物车搭建、退货、订单跟踪、政策问答、组合规划、多意图旅程 8 个可验证环境,每个环境配有程序化出题、12 轴难度课程和算法可验证奖励。团队用 DAPO 训练 Qwen 3 8B 模型 300 步,早期结果显示环境扩展与自适应难度可迁移到真实智能体任务。
Hugging Face 推出 VAKRA,一个面向企业级环境的工具调用可执行基准,用完整执行轨迹评估 AI 智能体的组合式推理能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类任务,模型整体表现不佳。
OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其中 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后将模型扩展至 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。
ServiceNow 在 Hugging Face 发布 EVA,一个面向对话式语音智能体的端到端评测框架,同时给出 EVA-A(准确率)和 EVA-X(体验)两个分数,并开源代码与数据集。
Hugging Face 推出 Alyah(الياه,意为北极星)基准,用于评估阿拉伯语 LLM 对阿联酋方言的语言、文化与语用理解能力。该基准含 1,173 条由阿联酋母语者手工采集的样本,均为四选一选择题,覆盖问候、诗歌、遗产知识等七类内容。团队共评测 54 个模型,其中 google/gemma-3-27b-pt 以 74.68 的准确率居首。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
ServiceNow 将 15B 推理模型改造为 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1x 吞吐,MATH500 从 0.90 升至 0.92、MTBench 从 8.30 升至 8.58,GSM8k、GPQA、AIME24 略有下降,总训练 76.8B token。
Hugging Face 发起 AI for Food Allergies 项目,计划打造首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。全球约 2.2 亿人患有至少一种食物过敏,美国约占总人口 10%。项目将连接前沿 AI 与生物医学,开发开放协作项目,服务研究者、临床医生和患者。
NVIDIA 发布首个开放合成印度人物画像数据集 Nemotron-Personas-India,基于 NeMo Data Designer 构建,含 2100 万人物画像、77 亿 token,覆盖英语与印地语(天城文及拉丁文),涵盖印度全部 36 个邦和 640 个地区,采用 CC BY 4.0 许可。
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用于评估嵌入模型在真实应用中的检索准确率。RTEB 采用开放与私有数据集混合策略,私有部分由 MTEB 维护者评测,以暴露模型在未见数据上的过拟合。基准覆盖 20 种语言及法律、医疗、代码、金融等领域,默认榜单指标为 NDCG@10,每个数据集至少含 1k 文档和 50 条查询。
Meta 发布 GAIA 的后继智能体基准 Gaia2,并开源配套的 Agents Research Environments(ARE)框架,用于运行、调试和评估智能体。
推荐理由:GAIA 后继基准 Gaia2 转向读写与噪声环境,配套 ARE 框架可自定义场景并导出完整 trace,便于复现与调试。
SandboxAQ 将其 Structurally Augmented IC50 Repository(SAIR)数据集上线 Hugging Face,以 CC BY 4.0 许可免费开放,包含 5.24 million 个 AI 生成的蛋白质-配体 3D 复合物结构,每个结构均配 ChEMBL 或 BindingDB 的实验 IC₅₀ 数据。
NVIDIA 发布 Nemotron Post-Training Dataset V2,将此前的英文推理数据翻译为法语、德语、意大利语、日语和西班牙语五种语言,规模 600 万条。
Kimina Prover 团队开源了 kimina-prover-rl 训练流水线,用于在 Lean 4 中训练形式化定理证明模型,基于 DeepSeek-R1 启发的"先推理后生成"范式,并完全兼容开源 Verl 框架。
Hugging Face 推出 FilBench 评测套件,覆盖文化知识、经典 NLP、阅读理解与生成四大类共 12 项任务,用于评估 LLM 在 Tagalog、Filipino 和 Cebuano 上的表现,并已评测 20+ 个 SOTA 模型。
Hugging Face 推出 3LM(علم),一个评估阿拉伯语 LLM 在 STEM 与代码生成上表现的多组件基准,包含 865 道原生 STEM 选择题、1744 道合成 STEM 选择题,以及翻译自 HumanEval+ 和 MBPP+ 的阿拉伯语代码任务。
TimeScope 是一个开源长视频理解基准,通过在 1 分钟到 8 小时的基础视频中插入 5-10 秒的短片段作为“针”,评测模型的局部检索、信息综合和细粒度时序感知三项能力。
Arc Institute 发起 Virtual Cell Challenge,要求参赛者训练模型预测 CRISPR 沉默基因对(部分)未见细胞类型的影响,即"上下文泛化"。
Hugging Face 推出 FutureBench,用真实预测市场和新闻生成的问题评估 AI 智能体预测未来事件的能力。该基准通过 smolagents 智能体抓取新闻并用 DeepSeek-V3 生成预测问题,每周从 Polymarket 引入约 8 个问题,另每轮抓取生成 5 个问题、时间跨度为一周。FutureBench 认为预测类任务无法被数据污染,且结果可随时间客观验证。
Hugging Face 上线 NeurIPS 2025 E2LM 竞赛,征集能在大语言模型早期训练阶段(约 200B tokens 以内)有效区分科学知识信号的评测基准。
Hugging Face 发布 ScreenSuite,一个面向 GUI Agent 的评测套件,整合 13 项基准,覆盖感知、定位、单步动作和多步智能体四类能力。
推荐理由:Hugging Face 开源 GUI Agent 评测套件,读者可了解其 13 项基准覆盖范围与纯视觉评测设定。
Hugging Face 分享研究,将 CodeAgent 的思考与代码强制以结构化 JSON 生成,在 GAIA、MATH、SimpleQA、Frames 等基准上比普通 CodeAgent 平均高出 2-7 个百分点。
推荐理由:通过 15724 条 agent trace 量化解析错误对成功率的影响,并给出结构化 CodeAgent 的适用模型门槛。
Hugging Face 与 MBZUAI 合作上线 Arabic-Leaderboards Space,统一收录阿拉伯语 AI 评测,目前包含 AraGen-03-25 和阿拉伯语指令遵循两个榜单。
Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D,号称全球最大的开源自动驾驶数据集,包含 90+ TB 多模态数据、5000+ 小时驾驶记录,来自德国 30 个城市的 60 辆驾校电动车。
推荐理由:L2D 以 90TB 多模态驾驶数据补齐端到端自动驾驶训练集缺口,并给出 LeRobot 接入方式与分阶段发布计划。
Hugging Face 用 Math-Verify 替换旧评测器,重新评估了 Open LLM Leaderboard 上提交过的全部 3751 个模型。旧评测器因答案格式、SymPy 解析和比较环节的问题把正确答案判错,新方案平均让模型多解出 61 道题、整体提升 4.66 分,Algebra 与 Prealgebra 子集分别提升 8.27 和 6.93 分。
推荐理由:原文给出旧评测器失效的具体案例和重评后的分数变化,可据此判断数学评测口径对榜单排名的影响。