跳到正文
原文
Hugging Face Blog·· 2023-06-23精选AI 评分62

Open LLM Leaderboard 的 MMLU 分数为何与 LLaMA 论文不一致

What's going on with the Open LLM Leaderboard?

AI 导读

Hugging Face 解释了 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数明显低于 LLaMA 论文的原因:榜单使用 EleutherAI LM Evaluation Harness,而论文采用 UC Berkeley 的原始 MMLU 实现,两者在提示词、答案提取方式上不同。

推荐理由

同一 MMLU 数据集在三种实现下分数与排名差异明显,读者可据此理解评测口径对模型对比的影响。

来源:Hugging Face Blog · huggingface.co