Hugging Face Blog·· 2024-04-23AI 评分38
Hugging Face 推出 Open CoT Leaderboard,用准确率增益衡量大模型思维链能力
Introducing the Open Chain of Thought Leaderboard
AI 导读
Hugging Face 发布 Open CoT Leaderboard,不评模型绝对准确率,而是对比有无思维链提示时的准确率增益 Δ。该榜单覆盖 LogiQA、LSAT 等多项选择题任务,目前实现 Classic 和 Reflect 两种思维链生成策略,Mixtral-8x7B-Instruct-v0.1 已参与测试。
来源:Hugging Face Blog · huggingface.co