跳到正文
原文
Hugging Face Blog·· 2025-04-16AI 评分39

Hugging Face 发布 HELMET:全面评估长上下文语言模型

Introducing HELMET: Holistically Evaluating Long-context Language Models

AI 导读

Hugging Face 发布 HELMET 基准,用于全面评估长上下文语言模型,覆盖多样性、可控性与可靠性,已评测 59 个近期 LCLM。该基准指出困惑度和 NIAH 等合成任务与真实下游表现相关性差,复杂合成任务(如 RULER MV)相关性更高,并已被 Microsoft Phi-4 和 AI21 Jamba 1.6 采用。

来源:Hugging Face Blog · huggingface.co