跳到正文
原文
Hugging Face Blog·· 2024-06-18AI 评分43

BigCodeBench:下一代 HumanEval 代码评测基准发布

BigCodeBench: The Next Generation of HumanEval

AI 导读

Hugging Face 发布 BigCodeBench,包含 1,140 个函数级任务,要求 LLM 调用 139 个库中的多个函数作为工具,每个任务平均含 5.6 个测试用例、分支覆盖率 99%。

来源:Hugging Face Blog · huggingface.co