Hugging Face Blog·· 2025-02-14精选AI 评分62
Hugging Face 用 Math-Verify 重评 Open LLM Leaderboard 全部 3751 个模型
Fixing Open LLM Leaderboard with Math-Verify
AI 导读
Hugging Face 用 Math-Verify 替换旧评测器,重新评估了 Open LLM Leaderboard 上提交过的全部 3751 个模型。旧评测器因答案格式、SymPy 解析和比较环节的问题把正确答案判错,新方案平均让模型多解出 61 道题、整体提升 4.66 分,Algebra 与 Prealgebra 子集分别提升 8.27 和 6.93 分。
推荐理由
原文给出旧评测器失效的具体案例和重评后的分数变化,可据此判断数学评测口径对榜单排名的影响。
来源:Hugging Face Blog · huggingface.co