跳到正文

#评测/基准

今日 1 条
10月28日周一
10月10日周四
10月4日周五
  1. Hugging Face Blog34

    Hugging Face 推出 Open FinLLM Leaderboard,面向金融场景评测大语言模型

    Hugging Face 发布 Open FinLLM Leaderboard,专门评测大语言模型在金融任务上的表现,覆盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大类。该榜单采用零样本评测,使用 Accuracy、F1、ROUGE 和 MCC 等指标,数据集聚焦真实金融场景,如信用评分、欺诈检测和股价走势预测。

10月1日周二
8月13日周二
7月25日周四
7月1日周一
  1. Hugging Face Blog62

    Hugging Face 的 Transformers Code Agent 登顶 GAIA 基准

    Hugging Face 用基于 transformers.agents 构建的 ReactCodeAgent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 个百分点;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。

    推荐理由:Hugging Face 公开了用 Code Agent 登顶 GAIA 的完整实现细节,包括工具设计、安全解释器与规划策略,可迁移到自建智能体系统。

6月18日周二
6月6日周四
5月24日周五
  1. Hugging Face Blog38

    Meta 发布 CyberSecEval 2:面向大语言模型网络安全风险与能力的综合评测框架

    Meta 发布 CyberSecEval 2,从代码不安全实践、提示词注入、网络攻击协助、代码解释器滥用和自动化攻击能力五个维度评测 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。提示词注入仍是未解难题,代码解释器滥用风险突出,评测代码已全部开源。

5月5日周日
5月3日周五
4月30日周二
4月23日周二
4月19日周五
4月16日周二
3月21日周四
3月5日周二
  1. Hugging Face Blog36

    Hugging Face 发布 ConTextual:评测多模态模型在文本密集场景中的图文联合推理能力

    加州大学洛杉矶分校研究者推出 ConTextual,一个包含 506 条指令的文本密集视觉推理数据集,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。初步评测 13 个模型显示,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上落后;开源模型在多个领域表现不佳,用 OCR 加 caption 增强 LLM 的方案人类通过率仅 17.2%。

2月27日周二
2月23日周五
2月20日周二
2月2日周五
1月31日周三
1月29日周一
1月26日周五
  1. Hugging Face Blog38

    Hugging Face 推出 AI Secure LLM Safety Leaderboard

    Hugging Face 发布 LLM Safety Leaderboard,基于 DecodingTrust 对 LLM 安全性进行评估,该平台曾获 NeurIPS 2023 杰出论文奖。评估覆盖毒性、刻板印象偏见、对抗鲁棒性、OOD 鲁棒性、隐私、机器伦理和公平性等八个可信度维度,并提供针对各维度的红队测试算法。用户可将模型权重转为 safetensors 格式后通过排行榜提交评估。

1月12日周五
  1. Hugging Face Blog28

    如何用 Hugging Face 排行榜模板搭建自己的 LLM 排行榜:以 Vectara 幻觉排行榜为例

    Vectara 基于 Hugging Face 开源的排行榜模板,搭建了全新的 HHEM 幻觉评测排行榜,用于评估 GPT-4、Google Gemini、Meta Llama 2 等 LLM 在文档摘要中的幻觉频率。该排行榜支持动态提交新模型评测请求并自动更新结果,相关源码已公开在其 Hugging Face Space 仓库中。

12月1日周五
  1. Hugging Face Blog34

    Open LLM Leaderboard 的 DROP 基准深度排查

    Open LLM Leaderboard 新增的 DROP 基准出现异常:绝大多数模型 f1-score 低于 10。Hugging Face 排查发现,归一化步骤在数字后跟非空格空白字符时无法匹配正确答案,且以 . 作为停止词会截断浮点答案、让高质量模型生成过多内容反而拉低 f1。改用 \n 作为停止词重新计算后,分数与整体表现的相关性明显改善。

9月26日周二
9月18日周一
6月23日周五
  1. Hugging Face Blog62

    Open LLM Leaderboard 的 MMLU 分数为何与 LLaMA 论文不一致

    Hugging Face 解释了 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数明显低于 LLaMA 论文的原因:榜单使用 EleutherAI LM Evaluation Harness,而论文采用 UC Berkeley 的原始 MMLU 实现,两者在提示词、答案提取方式上不同。

    推荐理由:同一 MMLU 数据集在三种实现下分数与排名差异明显,读者可据此理解评测口径对模型对比的影响。

6月12日周一
2月7日周二
10月3日周一
6月28日周二
  1. Hugging Face Blog60

    Hugging Face 发布 Evaluation on the Hub,可在 Hub 上零代码评测任意模型

    Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集评测任意模型。评测结果会以 PR 形式写入模型卡元数据,并可在数据集排行榜上比较不同模型的表现。官方已用该工具在多个关键数据集上评测了数百个模型,并给出文本分类、命名实体识别和文本摘要等可直接试用的数据集示例。

    推荐理由:Hugging Face 把模型评测做成 Hub 上的零代码流程,读者可据此了解评测结果如何进入模型卡与排行榜。