跳到正文
原文
Hugging Face Blog·· 2025-04-16AI 评分42

Hugging Face 发布 HELMET:全面评估长上下文语言模型的新基准

Introducing HELMET: Holistically Evaluating Long-context Language Models

AI 导读

Hugging Face 联合普林斯顿大学推出 HELMET 基准,旨在解决现有长上下文语言模型(LCLM)评估中合成任务与真实性能脱节的问题。该研究评测了 59 款最新 LCLM,发现前沿模型在复杂任务上仍受限,且简单合成任务无法反映下游表现。HELMET 通过多样性、可控性和可靠性三大维度改进评估体系,并支持通过 HuggingFace Transformers 或 TGI 快速部署使用。

来源:Hugging Face Blog · huggingface.co