跳到正文
原文
Hugging Face Blog·· 2024-02-02AI 评分33

Hugging Face 上线 NPHardEval 排行榜:基于复杂度类评估 LLM 推理能力

NPHardEval Leaderboard: Unveiling the Reasoning Abilities of Large Language Models through Complexity Classes and Dynamic Updates

AI 导读

Hugging Face 推出 NPHardEval 排行榜,利用密歇根大学等研发的基准测试大语言模型推理能力。该基准包含900道算法题,涵盖P、NP-complete及NP-hard复杂度类,并每月动态更新以防止过拟合。实验显示GPT 4 Turbo整体表现最佳,Claude 2在NP-complete问题上领先,Yi-34b等开源模型亦具竞争力。

来源:Hugging Face Blog · huggingface.co