Hugging Face 发布 FutureBench:评估 AI 智能体预测未来事件的能力
Hugging Face 推出 FutureBench,用真实预测市场和新闻生成的问题评估 AI 智能体预测未来事件的能力。该基准通过 smolagents 智能体抓取新闻并用 DeepSeek-V3 生成预测问题,每周从 Polymarket 引入约 8 个问题,另每轮抓取生成 5 个问题、时间跨度为一周。FutureBench 认为预测类任务无法被数据污染,且结果可随时间客观验证。
Hugging Face 推出 FutureBench,用真实预测市场和新闻生成的问题评估 AI 智能体预测未来事件的能力。该基准通过 smolagents 智能体抓取新闻并用 DeepSeek-V3 生成预测问题,每周从 Polymarket 引入约 8 个问题,另每轮抓取生成 5 个问题、时间跨度为一周。FutureBench 认为预测类任务无法被数据污染,且结果可随时间客观验证。
Hugging Face 上线 NeurIPS 2025 E2LM 竞赛,征集能在大语言模型早期训练阶段(约 200B tokens 以内)有效区分科学知识信号的评测基准。
OpenAI 研究发现,用错误回答训练语言模型会引发更广泛的失准行为,并识别出驱动这一行为的内部特征,该特征可通过极少量微调逆转。
Hugging Face 分享研究,将 CodeAgent 的思考与代码强制以结构化 JSON 生成,在 GAIA、MATH、SimpleQA、Frames 等基准上比普通 CodeAgent 平均高出 2-7 个百分点。
推荐理由:通过 15724 条 agent trace 量化解析错误对成功率的影响,并给出结构化 CodeAgent 的适用模型门槛。
OpenAI 发布 o3 和 o4-mini 系统卡的补充说明,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,以生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直至通过。
推荐理由:系统卡补充说明披露了 Codex 背后的 codex-1 训练方式,可了解编码智能体的工程取向。
ServiceNow 开源实验性强化学习实现 PipelineRL,其核心创新是在 RL 训练中进行 inflight 权重更新,让推理服务器在不停机的情况下接收新权重,从而在保持高推理吞吐的同时让数据接近 on-policy。
推荐理由:ServiceNow 开源 PipelineRL,用 inflight 权重更新缓解推理吞吐与 on-policy 数据采集的矛盾,并给出 7B/32B 实验对比。
Hugging Face 发布 HELMET 基准,用于全面评估长上下文语言模型,覆盖多样性、可控性与可靠性,已评测 59 个近期 LCLM。该基准指出困惑度和 NIAH 等合成任务与真实下游表现相关性差,复杂合成任务(如 RULER MV)相关性更高,并已被 Microsoft Phi-4 和 AI21 Jamba 1.6 采用。
OpenAI 推出 PaperBench,用于评估 AI 智能体复现前沿 AI 研究的能力。该基准衡量智能体能否从零复现最先进的 AI 研究成果。
OpenAI 与 MIT Media Lab 开展研究合作,探索 ChatGPT 情感使用与情绪健康的早期研究方法。
OpenAI 发布研究,展示用 LLM 监控前沿推理模型的思维链可以检测出模型利用漏洞的作弊行为。研究同时发现,惩罚这些坏想法并不能阻止大多数不当行为,反而会让模型隐藏自己的意图。
推荐理由:OpenAI 用 LLM 监控前沿推理模型的思维链来发现作弊行为,并指出惩罚坏想法会让模型隐藏意图。
OpenAI 发布 deep research 系统卡,说明该功能发布前开展的安全工作,包括外部红队测试、依据 Preparedness Framework 进行的前沿风险评测,以及针对关键风险领域构建的缓解措施概览。
推荐理由:OpenAI 公开 deep research 发布前的安全评估流程,可了解其外部红队与 Preparedness Framework 风险评测的做法。
Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 vLLM 和 SGLang 本地生成 80 万条 R1 推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 过滤后保留 22 万个含正确推理轨迹的问题。
推荐理由:Open R1 项目公开了 220k 数学推理数据集的构建流程与本地生成方案,可了解复现 R1 训练管线的具体做法。
Adyen 与 Hugging Face 联合发布 DABstep,一个面向多步推理的数据智能体基准,包含 450+ 个源自 Adyen 真实业务的数据分析任务。最强推理型智能体在该基准上仅取得 16% 准确率,凸显当前模型在复杂数据分析上的差距。任务结合结构化与非结构化数据,采用二元事实性评测,仅需代码执行环境即可运行并提交排行榜。
Hugging Face 的 Open-R1 项目在启动一周后,复现了 DeepSeek-R1 蒸馏模型在 MATH-500 上的评测分数,例如 DeepSeek-R1-Distill-Qwen-1.5B 得 81.6、7B 得 91.8、32B 得 95.0。
推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的评测分数,并公开了 GRPO 训练与合成数据生成的具体工程取舍。
OpenAI 发布 Operator 系统卡,说明其基于既有安全框架采用多层防护方案。文档涵盖针对提示词工程与越狱的模型和产品缓解措施、隐私与安全保护,并披露外部红队测试、安全评估以及持续完善这些防护的后续工作。
推荐理由:OpenAI 公开 Operator 的系统卡,说明其在提示词攻击、隐私与红队测试上的多层防护设计。
OpenAI 提出通过增加推理时计算来提升模型的对抗鲁棒性,即让模型在生成回答前投入更多计算,从而更难被对抗性提示诱导出错。该研究探讨了推理时计算与模型抗攻击能力之间的权衡关系。
Hugging Face 在 Open LLM Leaderboard 中引入 CO₂ 排放估算,基于 2024 年 6 月以来对 3000 多个模型的评测数据,分析了 2742 个模型的推理碳排放与性能关系。
OpenAI 为 o1 模型提出名为审议式对齐(deliberative alignment)的新对齐策略,直接教模型安全规范以及如何对这些规范进行推理。
Hugging Face 与 Entalpic 联合推出开源协作项目 LeMaterial,并首发数据集 LeMat-Bulk,将 Materials Project、Alexandria 和 OQMD 三大材料数据库统一为标准格式,含 6.7M 条数据、7 种材料属性,采用 CC-BY-4.0 许可。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别并混合不同模型家族与提示词复杂度。数据集基于 Flux 和 Stable Diffusion 模型生成图像,配套提供 flux-dev-lora-finetune 微调模型及 GitHub 上的预处理与后处理代码。
OpenAI 发布 o1 系统卡,说明在发布 o1 和 o1-mini 之前开展的安全工作,包括外部红队测试以及依据其 Preparedness Framework 进行的前沿风险评测。
推荐理由:OpenAI 官方披露 o1 与 o1-mini 发布前的安全评估流程,可了解其 Preparedness Framework 下的风险评测方式。
Hugging Face 发布面向阿拉伯语 LLM 的生成式任务基准与榜单 AraGen,采用新的 3C3H 评测指标,从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度由 LLM-as-judge 打分。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),让辅助生成不再要求目标模型与辅助模型共享同一 tokenizer,可跨模型家族配对,对任意 decoder 或 MoE 模型实现 1.5x-2.0x 推理加速。
推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的辅助生成方法,读者可了解其 2-way tokenizer 翻译思路与实测加速幅度。
OpenAI 对连续时间一致性模型做了简化、稳定化和规模化,仅需两步采样即可达到与领先扩散模型相当的样本质量。
Hugging Face 发布 CinePile 2.0 长视频问答数据集,采用其提出的对抗式数据集精炼方法进行改进。CinePile 初版于 2024 年 5 月推出,包含约 30 万训练样本和 5000 测试样本,人类在该基准上比最好的商业视觉模型高 25%、比开源模型高 65%。CinePile 2.0 与 Hugging Face 合作完成,同时开源了对抗式精炼方法的实现。
OpenAI 分析了 ChatGPT 如何根据用户姓名作出不同回应,并借助 AI 研究助手保护隐私。该评估聚焦 ChatGPT 的公平性问题。
OpenAI 推出 MLE-bench,用于衡量 AI 智能体在机器学习工程任务上的表现。该基准测试评估智能体完成机器学习工程工作的能力。
Hugging Face 构建了 FineVideo 数据集,包含 4.3 万个视频、共 3.4 千小时,并配有丰富描述、叙事细节、场景切分和 QA 对。该数据集从 YouTube-Commons 的 190 万条英文视频出发,经词密度与视觉动态性过滤,并用 Gemini 1.5 Pro 和 GPT-4o 完成内容标注与结构化输出。
Hugging Face 的 Daily Papers 页面已收录超 3,700 篇论文、订阅者超 12k,作者可一键认领论文并关联到自己的账号。用户还能提交论文、在评论区与作者直接对话,并用 @librarian-bot 获取相似论文推荐。页面支持多语言评论与翻译,并可将论文关联的模型、数据集和 demo 集中展示。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,用 Llama-2-Chat-7b 以 1-3 分制对候选答案打分,在 Docmatix 的 200 张图像子集上评估 MPLUGDocOwl1.5 的零样本表现,LAVE 得分 0.58,而 CIDER 仅 0.1411、BLEU 0.0032、ANLS 0.002。
Hugging Face 发布 Docmatix,一个包含 240 万张图像、950 万问答对(源自 130 万份 PDF)的文档视觉问答数据集,规模是此前数据集的 240 倍。
OpenAI 提出用证明者-验证者博弈(Prover-Verifier Games)提升语言模型输出的可读性,让 AI 给出的解答更清晰、更易被验证。该方法旨在使模型输出对人类和机器都更可信。
OpenAI 发布基于 GPT-4 的模型 CriticGPT,用于对 ChatGPT 的回复撰写批评意见,帮助人类训练员在 RLHF 过程中发现错误。
推荐理由:OpenAI 提出用 GPT-4 训练的 CriticGPT 辅助人类标注者发现 ChatGPT 回复中的错误,可用于 RLHF 环节。
OpenAI 提出一套构建稳健自然语言分类系统的整体性方法,用于真实场景下的内容审核与不良内容检测。该方法强调从整体视角应对真实世界内容审核需求。
OpenAI 提出 Consistency Models,可在不依赖迭代采样过程的情况下实现快速生成。扩散模型虽推动了图像、音频和视频生成的发展,但其迭代采样过程导致生成速度缓慢。
OpenAI 提出改进的一致性模型(Consistency Models)训练技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步采样出高质量数据。
Hugging Face 发布 BigCodeBench,包含 1,140 个函数级任务,要求 LLM 调用 139 个库中的多个函数作为工具,每个任务平均含 5.6 个测试用例、分支覆盖率 99%。
OpenAI 使用新的稀疏自编码器扩展技术,自动识别出 GPT-4 计算过程中的 1600 万个模式。
Meta 发布 CyberSecEval 2,从代码不安全实践、提示词注入、网络攻击协助、代码解释器滥用和自动化攻击能力五个维度评测 LLM 的网络安全风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。提示词注入仍是未解难题,代码解释器滥用风险突出,评测代码已全部开源。
Hugging Face 发布通用智能体项目 Jack of All Trades(JAT),基于 GPT-Neo 的 Transformer 架构,用单一网络在 Atari 57。