Hugging Face Blog·· 2024-04-16AI 评分44
Hugging Face 上线 LiveCodeBench 排行榜:无数据污染的代码 LLM 综合评测
Introducing the LiveCodeBench Leaderboard - Holistic and Contamination-Free Evaluation of Code LLMs
AI 导读
Hugging Face 推出基于 LiveCodeBench 的排行榜,该基准由 UC Berkeley、MIT 和 Cornell 开发,通过按发布时间窗口评估防止数据污染。它涵盖代码生成、自我修复、执行及测试输出预测四个场景,使用 Pass@1 指标衡量能力。GPT-4-Turbo 在多数场景表现最佳,Claude-3-Opus 则在测试输出预测中超越前者。
来源:Hugging Face Blog · huggingface.co