Hugging Face Blog·· 2025-04-16AI 评分39
Hugging Face 发布 HELMET:全面评估长上下文语言模型
Introducing HELMET: Holistically Evaluating Long-context Language Models
AI 导读
Hugging Face 发布 HELMET 基准,用于全面评估长上下文语言模型,覆盖多样性、可控性与可靠性,已评测 59 个近期 LCLM。该基准指出困惑度和 NIAH 等合成任务与真实下游表现相关性差,复杂合成任务(如 RULER MV)相关性更高,并已被 Microsoft Phi-4 和 AI21 Jamba 1.6 采用。
来源:Hugging Face Blog · huggingface.co