Artificial Analysis 发布文生图排行榜与竞技场
Artificial Analysis 推出文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等开源与闭源模型。
Artificial Analysis 推出文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等开源与闭源模型。
Meta 发布 CyberSecEval 2,从代码不安全实践、提示词注入、网络攻击协助、代码解释器滥用和自动化攻击能力五个维度评测 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。提示词注入仍是未解难题,代码解释器滥用风险突出,评测代码已全部开源。
Hugging Face 发布希伯来语 LLM 开放排行榜,用于评估和提升希伯来语语言模型。该排行榜包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式,模型通过 HuggingFace Inference Endpoints 部署、由 lighteval 库评估。
Artificial Analysis 将其覆盖 100 多个 serverless LLM API 端点的 LLM 性能排行榜带到 Hugging Face,综合对比模型的质量、价格、吞吐与延迟。
Hugging Face 的 Leaderboards and Evals 团队发现,同一任务下仅改变提示词格式,模型得分波动可达约 10 分,Qwen1.5-7B 在两种格式下准确率分别为 22.9% 和 51.2%,且模型排名也会随格式变化。
Hugging Face 发布 Open CoT Leaderboard,不评模型绝对准确率,而是对比有无思维链提示时的准确率增益 Δ。该榜单覆盖 LogiQA、LSAT 等多项选择题任务,目前实现 Classic 和 Reflect 两种思维链生成策略,Mixtral-8x7B-Instruct-v0.1 已参与测试。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 的医学与生物学子集。
Hugging Face 上线 LiveCodeBench 排行榜,该基准由 UC Berkeley、MIT 和 Cornell 研究者开发,从 LeetCode、AtCoder、CodeForces 持续收集带发布日期的编程题,通过“随时间滚动”评估窗口检测并防止数据污染。
Hugging Face 与 Lighthouz AI 联合推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 聊天,尝试诱导其泄露虚构银行 XYZ001 客户的敏感信息,并投票选出隐私保护更强的模型。
加州大学洛杉矶分校研究者推出 ConTextual,一个包含 506 条指令的文本密集视觉推理数据集,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。初步评测 13 个模型显示,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上落后;开源模型在多个领域表现不佳,用 OCR 加 caption 增强 LLM 的方案人类通过率仅 17.2%。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本后听两个模型朗读并投票选出更自然的一个,投票前不显示模型名以避免偏见。
Haize Labs 在 Hugging Face 团队支持下发布 Red Teaming Resistance Benchmark,用人类越狱提示词测试前沿模型的安全鲁棒性,最终得分为判定为 Safe 的提示词百分比。
Upstage 于 2023 年 9 月发起 Open Ko-LLM Leaderboard,为韩语 LLM 提供公开评测平台,采用 Ko-ARC、Ko-HellaSwag、Ko-MMLU、Ko-Truthful QA 和 Ko-CommonGEN V2 五项任务,并使用不公开的私有测试集防止数据污染。
Hugging Face 推出 NPHardEval 排行榜,基于密歇根大学和罗格斯大学研究者开发的 NPHardEval 基准,通过计算复杂度类评估 LLM 推理能力。
Patronus 团队基于 Hugging Face Leaderboard Template 推出 Enterprise Scenarios Leaderboard,用于评估语言模型在真实企业场景中的表现。
Hugging Face 推出 Hallucinations Leaderboard,基于 EleutherAI Language Model Evaluation Harness 在 NQ Open、TriviaQA、TruthfulQA、XSum、CNN/DM、RACE、SQuADv2、FEVER、FaithDial、HaluEval 等基准上评测 LLM 的幻觉表现。
Hugging Face 发布 LLM Safety Leaderboard,基于 DecodingTrust 对 LLM 安全性进行评估,该平台曾获 NeurIPS 2023 杰出论文奖。评估覆盖毒性、刻板印象偏见、对抗鲁棒性、OOD 鲁棒性、隐私、机器伦理和公平性等八个可信度维度,并提供针对各维度的红队测试算法。用户可将模型权重转为 safetensors 格式后通过排行榜提交评估。
Vectara 基于 Hugging Face 开源的排行榜模板,搭建了全新的 HHEM 幻觉评测排行榜,用于评估 GPT-4、Google Gemini、Meta Llama 2 等 LLM 在文档摘要中的幻觉频率。该排行榜支持动态提交新模型评测请求并自动更新结果,相关源码已公开在其 Hugging Face Space 仓库中。
Open LLM Leaderboard 新增的 DROP 基准出现异常:绝大多数模型 f1-score 低于 10。Hugging Face 排查发现,归一化步骤在数字后跟非空格空白字符时无法匹配正确答案,且以 . 作为停止词会截断浮点答案、让高质量模型生成过多内容反而拉低 f1。改用 \n 作为停止词重新计算后,分数与整体表现的相关性明显改善。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模,在 g5.2xlarge、g5.12xlarge、g5.48xlarge 和 p4d.24xlarge 实例上测试了 1、5、10、20 并发请求,并对比了 GPTQ 4-bit 量化与未量化性能。
Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的目标检测模型按指标排名,并详解 IoU、Average Precision(AP)与 Average Recall(AR)等评测指标的计算方式。文章还分析了不同报告中模型结果出现分歧的原因,帮助开发者按应用需求挑选开源检测模型。
Hugging Face 解释了 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数明显低于 LLaMA 论文的原因:榜单使用 EleutherAI LM Evaluation Harness,而论文采用 UC Berkeley 的原始 MMLU 实现,两者在提示词、答案提取方式上不同。
推荐理由:同一 MMLU 数据集在三种实现下分数与排名差异明显,读者可据此理解评测口径对模型对比的影响。
Hugging Face 在 Open LLM Leaderboard 评估套件中新增 GPT-4 评测,与 Scale AI 的人类标注对比,检验 LLM 能否替代人工标注偏好数据。
Hugging Face 发布开源工具 AI vs. AI,用于在深度强化学习多智能体场景中对模型进行相对排名。该工具由 Space 匹配算法、Dataset 结果存储和展示 ELO 评分的 Leaderboard 三部分组成,模型上传至 Hub 后即自动参与对战评估,初始 ELO 为 1200。
Hugging Face 在 Hub 上线由 AutoTrain 驱动的 Evaluation on the Hub,无需写代码即可对任意因果语言模型做零样本评估,目前支持最大 66B 参数模型,更大模型的支持即将推出。
Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写代码即可在 Hub 上用任意数据集评测任意模型。评测结果会以 PR 形式写入模型卡元数据,并可在数据集排行榜上比较不同模型的表现。官方已用该工具在多个关键数据集上评测了数百个模型,并给出文本分类、命名实体识别和文本摘要等可直接试用的数据集示例。
推荐理由:Hugging Face 把模型评测做成 Hub 上的零代码流程,读者可据此了解评测结果如何进入模型卡与排行榜。