跳到正文

#Hugging Face

今日 0 条
9月29日周二
  1. Hugging Face Blog31

    ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 博客介绍论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可在不重训智能体的前提下读取 MCP 调用轨迹,逐条核查答案中的声明是否由所标注来源支持,并输出逐条来源判定与整体放行或拦截决定。在医疗智能体的 281 条真实轨迹上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,在四项对比检查器中得分最高。

9月2日周三
  1. Hugging Face Blog36

    Hugging Face 推出 BenchMIRT:LLM 基准测试究竟在测什么?

    Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的新方法,基于多维 IRT(MIRT)分离同一基准中混杂的能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知基准对应能力,却自行稳定复现出安全与通用推理两个主导维度。分析显示 BBQ、WMDP 等安全基准的得分与通用推理关联更强,说明单一基准分数可能混合多种信号。

8月28日周五
8月25日周二
8月21日周五
  1. Hugging Face Blog62

    Hugging Face 研究:语音识别基准优化现象如何测量

    Hugging Face 发布研究,提出共识分歧探针、掩蔽实体检索和拼写切换三类测试来量化语音识别中的基准优化现象。研究评测 11 个开源 ASR 模型,发现部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,即使音频与之矛盾、相关词被静音或两种写法在音频中同样成立。

    推荐理由:通过三类探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。

8月13日周四
  1. Hugging Face Blog72

    Hugging Face 复盘 ICML 2026 论文复现活动:19 天复现 2226 篇论文

    Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 Open Reproductions 挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文主张,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,约占大会论文总数的 34%。

    推荐理由:Hugging Face 用 1200 多名社区成员和编码智能体复现 ICML 2026 论文,给出了大规模论文审计的可行路径与人类角色的具体分工。

8月11日周二
8月10日周一
7月15日周三
7月1日周三
  1. Hugging Face Blog38

    ScarfBench:面向企业级 Java 框架迁移的 AI 智能体基准测试

    Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 跨框架迁移中的表现,涵盖 Spring、Jakarta EE、Quarkus 三大生态,包含 34 个应用、102 个框架实现和 204 个迁移任务。测试显示,即便最强智能体行为成功率也不足 10%,且 Claude Code 报告 30 个应用中 29 个构建成功,实际仅 22 个通过。

6月30日周二
6月24日周三
  1. Hugging Face Blog36

    Hugging Face 与 Treble 推出 FFASR 远场 ASR 排行榜

    Hugging Face 与 Treble Technologies 联合发布 FFASR Leaderboard,这是首个开放的远场 ASR 基准,覆盖 14 个模拟房间并经过真实测量验证。所有提交模型在低 SNR 远场下的 WER 均比同内容近场高出数倍,榜单同时报告基于 NVIDIA L4 GPU 的 RTFx,用于权衡准确率与速度。多说话人、麦克风阵列与回声消除已在路线图中。

6月19日周五
  1. Hugging Face Blog41

    Hugging Face 提出 MosaicLeaks:深度研究智能体能否守住秘密?

    Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,测试模型普遍泄露私有信息,且只训练任务性能会加剧泄露。其提出的 Privacy-Aware Deep Research(PA-DR)强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄露从 34.0% 降至 9.9%。

5月6日周三
  1. Hugging Face Blog34

    Hugging Face 为 Open ASR Leaderboard 引入私有数据集以抵御 benchmaxxing

    Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入覆盖多口音、脚本化与对话语音的高质量英文 ASR 私有数据集,以防止 benchmaxxing 和测试集污染。默认 Average WER 仍仅基于公开数据集计算,用户可通过开关选择是否纳入私有数据集。该榜单自 2023 年 9 月上线以来访问量已超 710K 次。

4月21日周二
4月16日周四
  1. Hugging Face Blog33

    Ecom-RLVE:面向电商对话智能体的自适应可验证环境

    Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含商品发现、替代品、购物车搭建、退货、订单跟踪、政策问答、组合规划、多意图旅程 8 个可验证环境,每个环境配有程序化出题、12 轴难度课程和算法可验证奖励。团队用 DAPO 训练 Qwen 3 8B 模型 300 步,早期结果显示环境扩展与自适应难度可迁移到真实智能体任务。

4月15日周三
  1. Hugging Face Blog39

    Hugging Face 发布 VAKRA:评测 AI 智能体推理、工具调用与失败模式的可执行基准

    Hugging Face 推出 VAKRA,一个面向企业级环境的工具调用可执行基准,用完整执行轨迹评估 AI 智能体的组合式推理能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类任务,模型整体表现不佳。

3月31日周二
  1. Hugging Face Blog22

    OpenMed 用 165 美元训练跨 25 物种的 mRNA 语言模型

    OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其中 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后将模型扩展至 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。

3月24日周二
1月27日周二
  1. Hugging Face Blog22

    Hugging Face 发布 Alyah 基准,评估阿拉伯语 LLM 的阿联酋方言能力

    Hugging Face 推出 Alyah(الياه,意为北极星)基准,用于评估阿拉伯语 LLM 对阿联酋方言的语言、文化与语用理解能力。该基准含 1,173 条由阿联酋母语者手工采集的样本,均为四选一选择题,覆盖问候、诗歌、遗产知识等七类内容。团队共评测 54 个模型,其中 google/gemma-3-27b-pt 以 74.68 的准确率居首。

1月21日周三
11月19日周三
10月17日周五
10月14日周二
10月1日周三
  1. Hugging Face Blog34

    Hugging Face 推出 RTEB:面向真实场景的检索嵌入基准测试

    Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用于评估嵌入模型在真实应用中的检索准确率。RTEB 采用开放与私有数据集混合策略,私有部分由 MTEB 维护者评测,以暴露模型在未见数据上的过拟合。基准覆盖 20 种语言及法律、医疗、代码、金融等领域,默认榜单指标为 NDCG@10,每个数据集至少含 1k 文档和 50 条查询。

9月22日周一
9月3日周三
8月21日周四
8月14日周四
8月12日周二
8月1日周五
7月23日周三
7月18日周五
7月17日周四
  1. Hugging Face Blog34

    Hugging Face 发布 FutureBench:评估 AI 智能体预测未来事件的能力

    Hugging Face 推出 FutureBench,用真实预测市场和新闻生成的问题评估 AI 智能体预测未来事件的能力。该基准通过 smolagents 智能体抓取新闻并用 DeepSeek-V3 生成预测问题,每周从 Polymarket 引入约 8 个问题,另每轮抓取生成 5 个问题、时间跨度为一周。FutureBench 认为预测类任务无法被数据污染,且结果可随时间客观验证。

7月4日周五
6月6日周五
5月28日周三
4月8日周二
3月11日周二
  1. Hugging Face Blog67

    LeRobot 与 Yaak 发布全球最大开源自动驾驶数据集 L2D

    Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D,号称全球最大的开源自动驾驶数据集,包含 90+ TB 多模态数据、5000+ 小时驾驶记录,来自德国 30 个城市的 60 辆驾校电动车。

    推荐理由:L2D 以 90TB 多模态驾驶数据补齐端到端自动驾驶训练集缺口,并给出 LeRobot 接入方式与分阶段发布计划。

2月14日周五
  1. Hugging Face Blog62

    Hugging Face 用 Math-Verify 重评 Open LLM Leaderboard 全部 3751 个模型

    Hugging Face 用 Math-Verify 替换旧评测器,重新评估了 Open LLM Leaderboard 上提交过的全部 3751 个模型。旧评测器因答案格式、SymPy 解析和比较环节的问题把正确答案判错,新方案平均让模型多解出 61 道题、整体提升 4.66 分,Algebra 与 Prealgebra 子集分别提升 8.27 和 6.93 分。

    推荐理由:原文给出旧评测器失效的具体案例和重评后的分数变化,可据此判断数学评测口径对榜单排名的影响。