跳到正文
原文
Hugging Face Blog·· 2023-12-01AI 评分34

Open LLM Leaderboard 的 DROP 基准深度排查

Open LLM Leaderboard: DROP deep dive

AI 导读

Open LLM Leaderboard 新增的 DROP 基准出现异常:绝大多数模型 f1-score 低于 10。Hugging Face 排查发现,归一化步骤在数字后跟非空格空白字符时无法匹配正确答案,且以 . 作为停止词会截断浮点答案、让高质量模型生成过多内容反而拉低 f1。改用 \n 作为停止词重新计算后,分数与整体表现的相关性明显改善。

来源:Hugging Face Blog · huggingface.co