Hugging Face Blog·· 2023-06-23精选AI 评分62
Open LLM Leaderboard 的 MMLU 分数为何与 LLaMA 论文不一致
What's going on with the Open LLM Leaderboard?
AI 导读
Hugging Face 解释了 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数明显低于 LLaMA 论文的原因:榜单使用 EleutherAI LM Evaluation Harness,而论文采用 UC Berkeley 的原始 MMLU 实现,两者在提示词、答案提取方式上不同。
推荐理由
同一 MMLU 数据集在三种实现下分数与排名差异明显,读者可据此理解评测口径对模型对比的影响。
来源:Hugging Face Blog · huggingface.co