Hugging Face 发布 Open TTS Leaderboard:面向多语言 TTS 与声音克隆的可扩展评测
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。
英国 AI Security Institute(AISI)正采用 EvalEval 的 Every Eval Ever schema 和 Evaluation Cards 平台公开分享评测结果,以提升评测科学的可复现性。
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 成绩给出了 Vera Rubin 与 GB300 的吞吐对比和 99% 扩展效率,可据此判断推理基础设施的性价比走向。
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的新方法,基于多维 IRT(MIRT)分离同一基准中混杂的能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知基准对应能力,却自行稳定复现出安全与通用推理两个主导维度。分析显示 BBQ、WMDP 等安全基准的得分与通用推理关联更强,说明单一基准分数可能混合多种信号。
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上首个 Indic 语言。
Google DeepMind 联合新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons,首次对专有前沿模型 Gemini Flash Lite 进行双盲评测,将外部评测限制在加密“黑箱”中,防止测试题被模型提前获取用于优化性能。该方案在隐私保护环境下用保密基准测试模型,以缓解基准污染、提升评测可信度。
Hugging Face 发布研究,提出共识分歧探针、掩蔽实体检索和拼写切换三类测试来量化语音识别中的基准优化现象。研究评测 11 个开源 ASR 模型,发现部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,即使音频与之矛盾、相关词被静音或两种写法在音频中同样成立。
推荐理由:通过三类探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型的拓扑推理能力,覆盖连通性、封闭性、顺序、分离与绳结五类关系,并区分静态推理与交互规划两个层级。测试显示,当前模型在静态识别上明显优于交互规划,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧保留结构约束时才有帮助。
Google Research 提出知识画像框架,用 WikiProfile 基准(2,150 条维基百科事实、每条配 10 道题)区分编码与召回失败。Gemini-3-Pro 和 GPT-5 有 95–98% 的事实已编码,却仍无法直接召回 26–34% 的事实,开启思考后仍有 11–12% 失败。Gemma 3 系列显示模型规模扩大主要改善存储而非取用,瓶颈正从知识获取转向知识利用。
微软研究院发布开源框架 Orchard,核心是 Orchard Env 这一可复用的 Kubernetes 环境服务,支持软件工程、网页导航和个人助理等任务,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。
推荐理由:微软研究院开源 Orchard 框架,公开环境服务、训练流程与数据,读者可据此了解小模型在真实 harness 中训练智能体的路径。
启用两个 API 设置后,GPT-5.6 在 ARC-AGI-3 基准上的得分提升至原来的三倍。这两个设置分别用于保留推理过程和启用压缩(compaction),在提升得分的同时也改善了效率。
DharmaOCR 在葡萄牙语专项基准上以 0.925 分超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过葡萄牙语监督微调加 DPO 两阶段训练,把全部参数集中于巴西葡萄牙语,从而在提取质量和稳定性上保持优势。
Hume 发布 Real World VoiceEQ 语音 AI 评测基准,覆盖 40 多个专有与开源语音模型、15+ 评测维度和 60+ 指标,涵盖 ASR、TTS、S2S 和语音理解。
推荐理由:Hume 用超百万条人类评分构建语音评测基准,揭示现有基准高估真实表现的问题。
OpenAI 发布的新分析揭示了流行编码基准 SWE-Bench Pro 存在的问题,引发对其评估 AI 模型时可靠性与准确性的担忧。
Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 跨框架迁移中的表现,涵盖 Spring、Jakarta EE、Quarkus 三大生态,包含 34 个应用、102 个框架实现和 204 个迁移任务。测试显示,即便最强智能体行为成功率也不足 10%,且 Claude Code 报告 30 个应用中 29 个构建成功,实际仅 22 个通过。
OpenAI 推出 GeneBench-Pro,一个用复杂真实数据集测试 AI 在基因组学、生物学和科研中表现的新基准。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,EEE 结果可跨平台发布到 Hugging Face 模型页和基准排行榜,并带来源徽章回链到完整 EEE 记录。
推荐理由:原文给出 EEE 与 Community Evals 互通后的数据规模与转换流程,读者可据此判断评测结果如何被统一记录和溯源。
Hugging Face 与 Treble Technologies 联合发布 FFASR Leaderboard,这是首个开放的远场 ASR 基准,覆盖 14 个模拟房间并经过真实测量验证。所有提交模型在低 SNR 远场下的 WER 均比同内容近场高出数倍,榜单同时报告基于 NVIDIA L4 GPU 的 RTFx,用于权衡准确率与速度。多说话人、麦克风阵列与回声消除已在路线图中。
Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,在 bare、clone、skill 三种层级下测量智能体完成任务所需的轮次、token 与错误率,而非只看最终答案。
推荐理由:Hugging Face 用自建 harness 实测 transformers 的 CLI 与 Skill 改动,发现同一改动对大模型提速、对小模型反而拖慢甚至破坏正确率。
OpenAI 发布 LifeSciBench,这是一个由专家编写并评审的基准,用于评估 AI 系统处理真实生命科学研究任务与决策的能力。
Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。
推荐理由:原文给出 WeatherNext 在飓风 Melissa 中的提前预警细节,读者可了解 AI 天气模型在路径与强度双预测上的实际表现。
Databricks 将 GPT-5.5 用于企业智能体工作流,该模型在 OfficeQA Pro 基准上刷新了 SOTA。
Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入覆盖多口音、脚本化与对话语音的高质量英文 ASR 私有数据集,以防止 benchmaxxing 和测试集污染。默认 Average WER 仍仅基于公开数据集计算,用户可通过开关选择是否纳入私有数据集。该榜单自 2023 年 9 月上线以来访问量已超 710K 次。
Hugging Face 发布 QIMMA قِمّة,一个在评测模型前先验证基准质量的阿拉伯语 LLM 排行榜,整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖 7 大领域且 99% 为原生阿拉伯语内容。
Hugging Face 推出 VAKRA,一个面向企业级环境的工具调用可执行基准,用完整执行轨迹评估 AI 智能体的组合式推理能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类任务,模型整体表现不佳。
Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 构建模拟对话环境,评估高中与大学生的问题解决、协作等未来技能,目前提供英文版并可注册。
Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。小模型(<120B)与前沿闭源模型在人类一致同意时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了标注条目数与每条目标注者数的权衡,并将模拟器在 GitHub 开源。
ServiceNow 在 Hugging Face 发布 EVA,一个面向对话式语音智能体的端到端评测框架,同时给出 EVA-A(准确率)和 EVA-X(体验)两个分数,并开源代码与数据集。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出用认知科学衡量 AGI 进展的框架,涵盖感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决、社会认知 10 项能力,并配套三阶段评测协议。
Google 与康奈尔大学在《PNAS》发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 及一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家按平衡性、全面性、简洁性、证据、图像相关性和定性反馈六项指标盲评打分。
OpenAI 与 Pacific Northwest National Laboratory 联合推出 DraftNEPABench,用于评估 AI 编程智能体如何加速联邦许可审批。该基准显示,NEPA 草案撰写时间最多可缩短 15%,有望推动基础设施审查现代化。
OpenAI 宣布不再评估 SWE-bench Verified,原因是该基准日益受到污染,且无法准确衡量前沿编码能力。其分析指出该基准存在测试缺陷与训练数据泄漏问题,并建议改用 SWE-bench Pro。
IBM Research 与 UC Berkeley 用 MAST 失败分类法分析 ITBench 的 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评测 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞,覆盖发现、修复与攻击三类任务。
Hugging Face 在 Hub 上线 Community Evals,基准数据集仓库可注册为 benchmark 并在数据集卡片展示排行榜,模型仓库用 .eval_results/*.yaml 存放评测分数。
推荐理由:Hugging Face 把评测结果从黑箱榜单搬到 Hub 上公开聚合,读者可据此了解评测透明化的一种新做法。
H Company 发布迄今最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 上以 3 步智能体模式达到 78.5%、OSWorld G 达 79.0%,创下新 SOTA。
Hugging Face 推出 Alyah(الياه,意为北极星)基准,用于评估阿拉伯语 LLM 对阿联酋方言的语言、文化与语用理解能力。该基准含 1,173 条由阿联酋母语者手工采集的样本,均为四选一选择题,覆盖问候、诗歌、遗产知识等七类内容。团队共评测 54 个模型,其中 google/gemma-3-27b-pt 以 74.68 的准确率居首。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。