跳到正文

#Meta

今日 2 条
今天10月2日周五
10月1日周四
9月25日周五
6月23日周五
  1. Hugging Face Blog62

    Open LLM Leaderboard 的 MMLU 分数为何与 LLaMA 论文不一致

    Hugging Face 解释了 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数明显低于 LLaMA 论文的原因:榜单使用 EleutherAI LM Evaluation Harness,而论文采用 UC Berkeley 的原始 MMLU 实现,两者在提示词、答案提取方式上不同。

    推荐理由:同一 MMLU 数据集在三种实现下分数与排名差异明显,读者可据此理解评测口径对模型对比的影响。