Hugging Face Blog·· 2024-12-04AI 评分33
Hugging Face 推出 AraGen:基于 3C3H 指标的阿拉伯语 LLM 评测基准与排行榜
Rethinking LLM Evaluation with 3C3H: AraGen Benchmark and Leaderboard
AI 导读
Hugging Face 发布 AraGen,这是首个针对阿拉伯语大语言模型的生成式任务基准与排行榜。该框架引入 3C3H 评估指标,利用 LLM-as-judge 从正确性、完整性等六个维度综合衡量模型的事实准确性与可用性。AraGen 采用为期三个月的盲测动态评估策略,旨在解决数据污染问题并为低资源语言提供公平评测标准。
来源:Hugging Face Blog · huggingface.co