Hugging Face Blog·· 2026-09-02AI 评分36
Hugging Face 推出 BenchMIRT:LLM 基准测试究竟在测什么?
BenchMIRT: What are LLM benchmarks actually measuring?
AI 导读
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的新方法,基于多维 IRT(MIRT)分离同一基准中混杂的能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知基准对应能力,却自行稳定复现出安全与通用推理两个主导维度。分析显示 BBQ、WMDP 等安全基准的得分与通用推理关联更强,说明单一基准分数可能混合多种信号。
来源:Hugging Face Blog · huggingface.co