跳到正文
原文
Hugging Face Blog·· 2024-04-23AI 评分38

Hugging Face 推出 Open CoT Leaderboard,用准确率增益衡量大模型思维链能力

Introducing the Open Chain of Thought Leaderboard

AI 导读

Hugging Face 发布 Open CoT Leaderboard,不评模型绝对准确率,而是对比有无思维链提示时的准确率增益 Δ。该榜单覆盖 LogiQA、LSAT 等多项选择题任务,目前实现 Classic 和 Reflect 两种思维链生成策略,Mixtral-8x7B-Instruct-v0.1 已参与测试。

来源:Hugging Face Blog · huggingface.co