Hugging Face 开源 DeepResearch 框架,GAIA 验证集达 55.15%
Hugging Face 在 24 小时复现冲刺中开源了 DeepResearch 所需的智能体框架,在 GAIA 验证集上达到 55.15%,高于此前开源框架 Magentic-One 的约 46%。
推荐理由:Hugging Face 用 24 小时复现 OpenAI Deep Research,给出开源框架与 GAIA 实测对比,可看代码智能体相对 JSON 智能体的差距。
Hugging Face 在 24 小时复现冲刺中开源了 DeepResearch 所需的智能体框架,在 GAIA 验证集上达到 55.15%,高于此前开源框架 Magentic-One 的约 46%。
推荐理由:Hugging Face 用 24 小时复现 OpenAI Deep Research,给出开源框架与 GAIA 实测对比,可看代码智能体相对 JSON 智能体的差距。
OpenAI deep research 正被 Bain & Company 用于理解复杂的行业趋势。该工具帮助这家咨询公司分析复杂行业趋势。
OpenAI 发布 deep research 智能体,可利用推理综合大量在线信息并完成多步研究任务。该功能今日面向 Pro 用户开放,Plus 和 Team 用户随后可用。
推荐理由:OpenAI 官方发布 deep research 智能体,读者可了解其多步研究能力与分阶段开放节奏。
Hugging Face 的 Open-R1 项目在启动一周后,复现了 DeepSeek-R1 蒸馏模型在 MATH-500 上的评测分数,例如 DeepSeek-R1-Distill-Qwen-1.5B 得 81.6、7B 得 91.8、32B 得 95.0。
推荐理由:Open-R1 一周内复现了 DeepSeek-R1 蒸馏模型的评测分数,并公开了 GRPO 训练与合成数据生成的具体工程取舍。
OpenAI 封禁了一批疑似来自柬埔寨的账号,这些账号利用 AI 翻译和生成恋爱、投资类诈骗对话,用于实施"杀猪盘"骗局。
OpenAI 封禁了一批利用 AI 生成文章、帖子和虚假互动来干预加纳 2024 年总统选举的账号。该行动被定性为隐蔽影响力操作。
OpenAI 封禁了一批疑似中国来源的账号,这些账号利用 AI 起草监控工具推销方案、分析文档并调试代码。
OpenAI 封禁了一批疑似来自柬埔寨的账号,这些账号利用 AI 翻译消息,用于虚假评论招聘诈骗,要求受害者支付费用。
OpenAI 封禁了一批与伊朗关联的账号,这些账号利用 AI 生成与 IUVM 和 STORM-2035 影响行动相关的文章及社交帖子。
OpenAI 封禁了一批疑似中国来源的账号,这些账号利用 AI 生成英文社交帖子和西班牙语文章,开展代号“Sponsored Discontent”的影响力行动。
OpenAI 封禁了一批可能与公开报道的朝鲜(DPRK)关联威胁行为者有关的账号,这些账号利用 AI 研究入侵工具、钓鱼、恶意软件及加密货币攻击目标。
OpenAI 封禁了一批可能被用于协助欺诈性就业计划的账号,该计划具有公开报道中朝鲜相关 IT 工作者活动的特征。
OpenAI 发布 o3-mini 系统卡,说明该模型的安全工作,包括安全评估、外部红队测试和 Preparedness Framework 评测。
推荐理由:官方系统卡披露 o3-mini 的安全评估、外部红队与 Preparedness 框架评测范围,便于了解其安全验证流程。
OpenAI 发布 o3-mini 模型,官方页面标题为 OpenAI o3-mini,正文内容未能抓取。
Hugging Face 博客发布 Mini-R1 教程,用 GRPO 和 Countdown 游戏在 Qwen2.5-3B-Instruct 上复现 DeepSeek-R1 的 aha moment。
推荐理由:作者用 4 张 H100 复现 DeepSeek-R1 的 aha moment,给出完整脚本与训练观察,可迁移到自己的 RL 实验。
Hugging Face 发布首期《AI 艺术工具通讯》,回顾 2024 年创意 AI 关键进展并预告将推出月度汇总。
Mistral AI 发布 Mistral Small 3,一个面向低延迟优化的 24B 参数模型,以 Apache 2.0 许可证开源,同时提供预训练和指令微调两个 checkpoint。
推荐理由:24B 参数在 Apache 2.0 下对标三倍体量模型,并给出单卡本地部署的量化条件,便于判断小模型落点。
OpenAI 最新一代推理模型将供美国国家实验室的顶尖科学家使用,以推动科学突破。该合作旨在加强美国在 AI 领域的领导地位。
Hugging Face 发布指南,介绍如何在 AWS 上部署和微调 DeepSeek-R1 系列模型。
Hugging Face 发起 Open-R1 项目,计划系统重建 DeepSeek-R1 的数据与训练流程,补上官方未公开的数据集和训练代码。项目分三步:从 DeepSeek-R1 蒸馏高质量推理数据集复现 R1-Distill 模型,复现 R1-Zero 所用的纯强化学习流程并整理数学、推理、代码数据集,以及展示从基座模型经 SFT 到 RL 的多阶段训练。
推荐理由:Hugging Face 公开复现 DeepSeek-R1 的三步计划,读者可了解开源推理模型训练链路的缺口与补全路径。
Hugging Face 在 Hub 的模型页上线 Inference Providers,首批接入 fal、Replicate、SambaNova、Together AI 四家无服务器推理服务商,并集成到 JS 和 Python 客户端 SDK。
推荐理由:Hugging Face 把四家无服务器推理服务商接入模型页与 SDK,读者可据此了解调用方式与计费差异。
Hugging Face Diffusers 团队发布博客,梳理开源视频生成模型现状,并介绍 Diffusers 对 CogVideoX、Mochi-1、HunyuanVideo、LTX-Video 等模型的支持与优化方案。
推荐理由:梳理开源视频生成模型现状与 Diffusers 的显存优化路径,给出可复用的量化与卸载配置。
Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图片既可在 run 方法中一次性传入并存入 TaskStep 的 task_images,也可通过 step_callbacks 在每步把截图写入 ActionStep 的 observation_images。
推荐理由:官方给出在 smolagents 中接入视觉语言模型的两条路径,读者可据此判断浏览器类智能体的实现方式。
OpenAI 发布 Operator 系统卡,说明其基于既有安全框架采用多层防护方案。文档涵盖针对提示词工程与越狱的模型和产品缓解措施、隐私与安全保护,并披露外部红队测试、安全评估以及持续完善这些防护的后续工作。
推荐理由:OpenAI 公开 Operator 的系统卡,说明其在提示词攻击、隐私与红队测试上的多层防护设计。
NVIDIA 推出 Python 工具包 KVPress,通过一系列压缩算法降低长上下文 LLM 的 KV Cache 内存占用。以 Llama 3-70B 在 bfloat16 下处理 1M token 为例,KV Cache 需 327.6GB,占约 470GB 总内存的 70%。
Hugging Face 发布 SmolVLM 家族新成员 SmolVLM-256M 和 SmolVLM-500M,共四个 checkpoint,含两个 base 模型和两个指令微调模型,可直接加载到 transformers、MLX 和 ONNX。
推荐理由:SmolVLM 家族新增 256M 与 500M 两个小尺寸视觉语言模型,读者可据此了解小模型在端侧与浏览器推理上的取舍。
德国全球媒体、服务与教育公司 Bertelsmann 将把 OpenAI 的技术整合到其全球多个品牌中。
OpenAI 提出通过增加推理时计算来提升模型的对抗鲁棒性,即让模型在生成回答前投入更多计算,从而更难被对抗性提示诱导出错。该研究探讨了推理时计算与模型抗攻击能力之间的权衡关系。
Hugging Face 与 FriendliAI 达成合作,将 FriendliAI 的推理基础设施集成进 Hugging Face Hub 的“Deploy this model”按钮,实现一键部署。
OpenAI 宣布 Stargate 项目,原文仅给出项目名称,未披露投资规模、合作方或建设细节。
OpenAI 发布 Stargate Infrastructure 合作征集,面向数据中心基础设施领域的企业寻求合作。征集范围覆盖电力、土地、建设、设备等环节,目标是推进其 AGI 基础设施愿景。
Mistral AI 与法新社(AFP)达成全球合作,其 AI 助手 Le Chat 将接入 AFP 新闻专线内容,让回答基于可靠、最新的信息。Le Chat 将利用 AFP 每日六种语言(法语、英语、西班牙语、葡萄牙语、德语、阿拉伯语)发布的 2300 条新闻专线,覆盖其全球 1700 名记者的报道。该集成将在未来几周内向所有 Le Chat 用户推出。
Hugging Face 为 Text Generation Inference(TGI)引入多后端架构,通过 Rust 的 Backend 接口把 HTTP 服务与调度层同推理引擎解耦,让用户按模型、硬件和性能需求切换后端。
Hugging Face 发布 TimmWrapper,让任意 timm 视觉模型可直接接入 transformers 生态,支持 pipeline API、Auto 类和 Trainer 微调。该工具可用约 5 行代码通过 BitsAndBytesConfig 完成 8bit 量化,并支持 torch.compile 加速推理与 LoRA 适配器微调,微调后的模型还能回到 timm 使用。
OpenAI 宣布与 Axios 达成合作,进一步扩大其在新闻行业的合作版图。目前已有代表数百家新闻编辑室和内容品牌的出版商通过 OpenAI 的合作与资助计划采用 AI 工具,ChatGPT 用户也可获取来自领先可靠出版物的信息。
Hugging Face 发布两个静态嵌入模型 static-retrieval-mrl-en-v1(英文检索)和 static-similarity-mrl-multilingual-v1(多语言相似度),在 CPU 上比 all-mpnet-base-v2、multilingual-e5-small 等常见模型快 100 至 400 倍,同时保留至少 85% 的性能。
推荐理由:原文给出静态嵌入模型的训练配方与两个已发布模型,读者可据此评估 CPU 端检索与相似度任务的落地成本。
Adebayo Ogunlesi 加入 OpenAI 董事会。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,代码生成与补全速度约为原版 Codestral 的 2 倍,上下文长度提升至 256k。
推荐理由:官方给出 Codestral 25.01 的架构与 tokenizer 变化、256k 上下文和多项基准对比,可据此判断它在 FIM 与低延迟补全场景的位置。
Hugging Face 发布文章《AI Agents Are Here. What Now?》,指出 AI 智能体基于 LLM 构建,能自主拆解目标并执行子任务,其自主性可按从"模型不影响程序流程"到"模型自行编写并执行代码"分为多个等级。文章认为系统自主性越高、用户让渡的控制权越多,安全、隐私等风险越大,因此建议不要开发完全自主的 AI 智能体,而半自主智能体在风险与收益之间可能更可取。
Hugging Face 推出多语言嵌入模型 vdr-2b-multi-v1,可将文档页面截图编码为单向量,无需 OCR 即可跨语言检索视觉丰富的文档。该模型基于 MrLight/dse-qwen2-2b-mrl-v1,与 LlamaIndex 合作开发,覆盖意大利语、西班牙语、英语、法语和德语,并开源了 50 万样本的 vdr-multilingual-train 数据集。