Hugging Face Blog·· 2024-11-19AI 评分50
Hugging Face 推出 Judge Arena:众包评测 LLM 作为评估者的表现
Judge Arena: Benchmarking LLMs as Evaluators
AI 导读
Hugging Face 上线 Judge Arena,通过众包投票对比 GPT-4o、Claude 3.5 Sonnet、Llama 3.1 等 18 款模型作为“LLM-as-a-Judge”的优劣。早期数据显示 GPT-4 Turbo 微弱领先,但 Qwen 2.5 7B 和 Llama 3.1 8B 等小参数开源模型表现强劲,与闭源模型竞争力相当。
来源:Hugging Face Blog · huggingface.co