Hugging Face Blog·· 2024-06-18AI 评分43
BigCodeBench:下一代 HumanEval 代码评测基准发布
BigCodeBench: The Next Generation of HumanEval
AI 导读
Hugging Face 发布 BigCodeBench,包含 1,140 个函数级任务,要求 LLM 调用 139 个库中的多个函数作为工具,每个任务平均含 5.6 个测试用例、分支覆盖率 99%。
来源:Hugging Face Blog · huggingface.co