跳到正文
原文
Hugging Face Blog·· 2024-12-04AI 评分33

Hugging Face 推出 AraGen:基于 3C3H 指标的阿拉伯语 LLM 评测基准与排行榜

Rethinking LLM Evaluation with 3C3H: AraGen Benchmark and Leaderboard

AI 导读

Hugging Face 发布 AraGen,这是首个针对阿拉伯语大语言模型的生成式任务基准与排行榜。该框架引入 3C3H 评估指标,利用 LLM-as-judge 从正确性、完整性等六个维度综合衡量模型的事实准确性与可用性。AraGen 采用为期三个月的盲测动态评估策略,旨在解决数据污染问题并为低资源语言提供公平评测标准。

来源:Hugging Face Blog · huggingface.co