Hugging Face Blog·· 2024-06-18AI 评分38
BigCodeBench 发布:新一代代码生成基准测试
BigCodeBench: The Next Generation of HumanEval
AI 导读
Hugging Face 推出 BigCodeBench,包含 1,140 个函数级任务,覆盖 139 个库,平均分支覆盖率 99%。该基准旨在解决 HumanEval 任务过于简单及数据污染问题,通过 calibrated Pass@1 评估 LLM 在复杂真实场景下的代码生成能力。
来源:Hugging Face Blog · huggingface.co