跳到正文
原文
Hugging Face Blog·· 2024-11-19AI 评分50

Hugging Face 推出 Judge Arena:众包评测 LLM 作为评估者的表现

Judge Arena: Benchmarking LLMs as Evaluators

AI 导读

Hugging Face 上线 Judge Arena,通过众包投票对比 GPT-4o、Claude 3.5 Sonnet、Llama 3.1 等 18 款模型作为“LLM-as-a-Judge”的优劣。早期数据显示 GPT-4 Turbo 微弱领先,但 Qwen 2.5 7B 和 Llama 3.1 8B 等小参数开源模型表现强劲,与闭源模型竞争力相当。

来源:Hugging Face Blog · huggingface.co