跳到正文

#评测/基准

今日 0 条
10月1日周四
  1. The Decoder78

    Google 发布 Gemini 4 Argon,缩小与 OpenAI、Anthropic 的差距但未取得明显领先

    Google 发布新前沿模型 Gemini 4 Argon,在多项基准上缩小了与 OpenAI、Anthropic 的差距,但未取得明显领先。该模型先向 Fairwind 计划的“可信网络防御者”和 Google 内部团队开放,之后才面向开发者、企业和消费者,起步于付费 API 客户和 Google AI Ultra 订阅用户,具体日期未定。

    推荐理由:汇总第三方基准与价格数据,呈现 Gemini 4 Argon 与 OpenAI、Anthropic 前沿模型的差距与成本结构。

9月30日周三
9月29日周二
  1. Simon Willison80

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上、多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于前代。

    推荐理由:作者实测 Sonnet 5.5 的编码与推理表现,并对比免费层能力,可据此判断其性价比定位。

9月22日周二
9月16日周三
9月2日周三
  1. Hugging Face Blog36

    Hugging Face 推出 BenchMIRT:LLM 基准测试究竟在测什么?

    Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的新方法,基于多维 IRT(MIRT)分离同一基准中混杂的能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知基准对应能力,却自行稳定复现出安全与通用推理两个主导维度。分析显示 BBQ、WMDP 等安全基准的得分与通用推理关联更强,说明单一基准分数可能混合多种信号。

8月28日周五
8月27日周四
  1. Google DeepMind48

    Google DeepMind 首次对 Gemini Flash Lite 开展双盲 AI 评测

    Google DeepMind 联合新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons,首次对专有前沿模型 Gemini Flash Lite 进行双盲评测,将外部评测限制在加密“黑箱”中,防止测试题被模型提前获取用于优化性能。该方案在隐私保护环境下用保密基准测试模型,以缓解基准污染、提升评测可信度。

8月21日周五
  1. Hugging Face Blog62

    Hugging Face 研究:语音识别基准优化现象如何测量

    Hugging Face 发布研究,提出共识分歧探针、掩蔽实体检索和拼写切换三类测试来量化语音识别中的基准优化现象。研究评测 11 个开源 ASR 模型,发现部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,即使音频与之矛盾、相关词被静音或两种写法在音频中同样成立。

    推荐理由:通过三类探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。

8月17日周一
8月13日周四
  1. Microsoft Research39

    MindTopo 基准揭示 VLM 空间推理能力短板

    Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型的拓扑推理能力,覆盖连通性、封闭性、顺序、分离与绳结五类关系,并区分静态推理与交互规划两个层级。测试显示,当前模型在静态识别上明显优于交互规划,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧保留结构约束时才有帮助。

8月12日周三
  1. Google Research36

    Google 研究:召回而非编码是前沿 LLM 事实性的瓶颈

    Google Research 提出知识画像框架,用 WikiProfile 基准(2,150 条维基百科事实、每条配 10 道题)区分编码与召回失败。Gemini-3-Pro 和 GPT-5 有 95–98% 的事实已编码,却仍无法直接召回 26–34% 的事实,开启思考后仍有 11–12% 失败。Gemma 3 系列显示模型规模扩大主要改善存储而非取用,瓶颈正从知识获取转向知识利用。

8月10日周一
  1. Import AI26

    Import AI 468:23 条 RSI 政策建议、PostTrainBench+,以及信任与透明度如何影响 AI 竞赛

    Import AI 第 468 期收录了智库 IFP 提出的 23 条政策建议,分属 7 个类别,用于帮助政策制定者应对 AI 研发自动化风险。MIT 与 Columbia 的论文 Racing to Ruin 用博弈模型分析企业竞速,认为透明度和对对手可信度的判断是能否实现协同放缓的关键。本期还介绍了 PostTrainBench+ 以及一篇关于智能机器与机器人身体的虚构短篇故事。

8月4日周二
  1. Microsoft Research71

    微软研究院开源 Orchard:可扩展智能体 AI 框架

    微软研究院发布开源框架 Orchard,核心是 Orchard Env 这一可复用的 Kubernetes 环境服务,支持软件工程、网页导航和个人助理等任务,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。

    推荐理由:微软研究院开源 Orchard 框架,公开环境服务、训练流程与数据,读者可据此了解小模型在真实 harness 中训练智能体的路径。

7月16日周四
7月15日周三
7月8日周三
6月30日周二
6月18日周四
  1. Hugging Face Blog62

    Hugging Face 发布 agent-eval:用自有工具链评测开源模型的智能体能力

    Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,在 bare、clone、skill 三种层级下测量智能体完成任务所需的轮次、token 与错误率,而非只看最终答案。

    推荐理由:Hugging Face 用自建 harness 实测 transformers 的 CLI 与 Skill 改动,发现同一改动对大模型提速、对小模型反而拖慢甚至破坏正确率。

6月17日周三
5月16日周六
  1. Google DeepMind71

    WeatherNext 如何帮助美国国家飓风中心预测飓风 Melissa 登陆牙买加

    Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。

    推荐理由:原文给出 WeatherNext 在飓风 Melissa 中的提前预警细节,读者可了解 AI 天气模型在路径与强度双预测上的实际表现。

5月15日周五
5月6日周三
  1. Hugging Face Blog34

    Hugging Face 为 Open ASR Leaderboard 引入私有数据集以抵御 benchmaxxing

    Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入覆盖多口音、脚本化与对话语音的高质量英文 ASR 私有数据集,以防止 benchmaxxing 和测试集污染。默认 Average WER 仍仅基于公开数据集计算,用户可通过开关选择是否纳入私有数据集。该榜单自 2023 年 9 月上线以来访问量已超 710K 次。

4月21日周二
4月15日周三
  1. Hugging Face Blog39

    Hugging Face 发布 VAKRA:评测 AI 智能体推理、工具调用与失败模式的可执行基准

    Hugging Face 推出 VAKRA,一个面向企业级环境的工具调用可执行基准,用完整执行轨迹评估 AI 智能体的组合式推理能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类任务,模型整体表现不佳。

4月14日周二
4月3日周五
  1. Google Research40

    Google Research 评估 LLM 行为倾向与人类的对齐程度

    Google Research 提出一套框架,用改编自 IRI、ERQ 等心理学问卷的情境判断测试(SJT)评估 LLM 行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。小模型(<120B)与前沿闭源模型在人类一致同意时接近完美对齐,但共识低于 90% 时对齐率停滞在 80% 出头。

4月1日周三
3月24日周二
3月17日周二
2月26日周四
2月23日周一
2月19日周四
2月18日周三
2月4日周三
1月27日周二
  1. Hugging Face Blog22

    Hugging Face 发布 Alyah 基准,评估阿拉伯语 LLM 的阿联酋方言能力

    Hugging Face 推出 Alyah(الياه,意为北极星)基准,用于评估阿拉伯语 LLM 对阿联酋方言的语言、文化与语用理解能力。该基准含 1,173 条由阿联酋母语者手工采集的样本,均为四选一选择题,覆盖问候、诗歌、遗产知识等七类内容。团队共评测 54 个模型,其中 google/gemma-3-27b-pt 以 74.68 的准确率居首。

1月21日周三
12月17日周三
  1. Hugging Face Blog41

    NVIDIA 发布 Nemotron 3 Nano 30B A3B,公开完整评测配方

    NVIDIA 发布 Nemotron 3 Nano 30B A3B,并公开其完整评测配方,基于开源库 NeMo Evaluator 构建,任何人可复现评测流程并独立核验结果。NeMo Evaluator 将多个评测 harness 统一到单一接口,分离评测流程与推理后端,默认生成结构化结果与日志。NVIDIA 同时公开了模型卡评测所用的 YAML 配置。

12月16日周二