OpenAI 的 Harness engineering:在智能体优先的世界中利用 Codex
OpenAI 技术人员 Ryan Lopopolo 提出 Harness engineering,主张在智能体优先的世界中利用 Codex。文章围绕这一理念展开,探讨如何借助 Codex 构建以智能体为核心的工程实践。
OpenAI 技术人员 Ryan Lopopolo 提出 Harness engineering,主张在智能体优先的世界中利用 Codex。文章围绕这一理念展开,探讨如何借助 Codex 构建以智能体为核心的工程实践。
Google DeepMind 发布两篇论文,介绍在数学家、物理学家和计算机科学家指导下,用 Gemini Deep Think 模式求解专业研究问题。团队构建了由 Deep Think 驱动的数学研究智能体 Aletheia,具备自然语言验证器、可迭代生成与修正,并能承认无法求解,在 IMO-ProofBench Advanced 上得分最高达 90%。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学与理论计算机科学上的研究级成果,并给出人机协作的分类框架。
OpenAI 的 GPT-5 与 Ginkgo Bioworks 的云端自动化结合组成自主实验室,通过闭环实验将无细胞蛋白质合成成本降低 40%。
OpenAI 发布企业平台 OpenAI Frontier,用于构建、部署和管理 AI 智能体。该平台提供共享上下文、入职引导、权限和治理等能力。
推荐理由:OpenAI 面向企业推出智能体平台,给出共享上下文、权限与治理等能力范围,可据此判断企业级 Agent 的落地形态。
OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生的智能体,将前沿编码能力与通用推理结合,用于支持长周期、真实世界的技术工作。
推荐理由:OpenAI 发布 Codex 原生的 GPT-5.3-Codex,读者可了解其在编码与通用推理上的定位。
H Company 发布迄今最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 上以 3 步智能体模式达到 78.5%、OSWorld G 达 79.0%,创下新 SOTA。
OpenAI 披露其内部数据智能体,结合 GPT-5、Codex 与记忆能力对海量数据集进行推理,可在数分钟内给出可靠洞察。该智能体为 OpenAI 自研自用,用于加速内部数据分析流程。
Gradio 团队发布开源 Python 库 Daggr,用于把 Gradio 应用、ML 模型和自定义函数串联成 AI 工作流,并自动生成可视化画布。画布中可查看任意节点的中间输出、修改输入并单独重跑某一步,无需执行整条流水线,还支持状态持久化和备份节点替换。
推荐理由:Gradio 团队开源 Daggr,用代码定义工作流并自动生成可视化画布,可单独重跑某一步,为多模型串联调试提供了一种轻量方案。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族,挑战了“智能体越多越好”的假设。
推荐理由:通过 180 种智能体配置的对照评测,给出多智能体架构在并行与顺序任务上的量化差异,可作为架构选型参考。
Hugging Face 发布新工具 upskill,可用 Claude Opus 4.5 等大模型生成并评测 agent skill,再迁移给更小或本地模型使用。
推荐理由:原文给出用大模型生成 Skill 再迁移到小模型的完整流程与评测方法,可复用到其他领域任务。
OpenAI 说明了 AI 智能体打开链接时保护用户数据的方式,通过内置防护机制防止基于 URL 的数据外泄和提示词注入。
Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选澄清、斜杠命令技能、统一智能体模式和自动更新。
推荐理由:官方给出 Vibe 2.0 的自定义子智能体、斜杠命令技能等能力与定价入口,可据此判断终端编码智能体的工作流变化。
Hugging Face 博客复盘了用 verl 框架对 GPT-OSS-20B 做 Agentic RL 训练时遇到的问题:训练初期出现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双次前向传播导致新旧 log-prob 不匹配,使 PPO 的 importance sampling ratio 偏离 1。
TRUSTBANK 与 Recursive 合作,基于 OpenAI 模型打造了 Choice AI,通过个性化对话式推荐简化故乡税(Furusato Nozei)礼品的发现与挑选流程。
OpenAI 发布 Codex 智能体循环技术解析,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词与性能。文章为技术深度剖析,未披露具体版本号、参数规模或性能数字。
Praktika 借助 GPT-4.1 和 GPT-5.2 构建自适应 AI 导师,可根据学习者情况个性化课程、跟踪学习进度,帮助其实现真实场景下的语言流利度。
Hugging Face 发布 AssetOpsBench,一个面向工业资产运维的智能体评测基准,包含 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式,覆盖 4 个智能体。
Overworld 发布 Waypoint-1,一个可通过文本、鼠标和键盘实时控制的交互式视频扩散模型,权重已上传 Hugging Face Hub,先开放 Waypoint-1-Small,Medium 版本即将推出。
推荐理由:Waypoint-1 把实时交互视频扩散模型与配套推理库一并开源,读者可据此了解世界模型从预训练到低延迟部署的完整路径。
OpenAI 发起、开源 AI 社区共建、Hugging Face 生态支持的 Open Responses 开放推理标准发布,基于 Responses API,面向智能体场景设计。该标准默认无状态,支持加密推理,将流式输出建模为语义事件序列,并原生支持内部与外部工具及子智能体循环。开发者可通过 Hugging Face Inference Providers 试用早期访问版本。
推荐理由:OpenAI 发起、Hugging Face 生态支持的开放推理标准,读者可了解 Responses API 开源化后的关键变化与迁移路径。
Netomi 借助 GPT-4.1 和 GPT-5.2 将企业级 AI 智能体规模化落地,通过并发、治理与多步推理的结合支撑可靠的生产工作流。
NVIDIA 在 CES 2026 发布教程,演示如何用 DGX Spark 搭配 Reachy Mini 搭建桌面 AI 助手。
Google 回顾 2025 年 8 大研究突破领域,Gemini 3 Pro 登顶 LMArena 排行榜,在 Humanity's Last Exam 和 GPQA Diamond 上取得突破性成绩,并在 MathArena Apex 创下 23.4% 的新 SOTA。
Hugging Face 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险及提示注入、越狱、思维链污染、记忆投毒、多智能体攻击等对抗攻击,并覆盖工具调用与推理轨迹等智能体工作流。模型提供推理与非推理两种模式,兼顾可解释分类与低延迟生产部署。
OpenAI 正在用强化学习训练的自动化红队加固 ChatGPT Atlas,抵御提示词注入攻击。这一发现与修补的循环能更早识别新型攻击手法,在 AI 智能体能力增强的同时强化浏览器智能体的防御。
推荐理由:OpenAI 披露用强化学习训练的自动化红队持续发现并修补 Atlas 的提示词注入漏洞,可了解浏览器智能体的安全加固思路。
Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得 90.4%、Humanity's Last Exam 无工具得 33.7%、MMMU Pro 得 81.2%、SWE-bench Verified 得 78%。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。
OpenAI 宣布开发者可向 ChatGPT 提交应用,经审核通过后会在产品内新设的应用目录中展示,便于用户发现。官方同时更新了工具、指南和 Apps SDK,帮助开发者构建把真实操作带入 ChatGPT 的聊天原生体验。
推荐理由:OpenAI 开放 ChatGPT 应用提交与目录入口,开发者可据此判断接入路径和审核门槛。
CUGA(Configurable Generalist Agent)在 Hugging Face Spaces 上线演示,这是一个 Apache 2.0 开源的可配置通用 AI 智能体,支持跨 Web 与 API 的多步任务。
推荐理由:CUGA 在 AppWorld 与 WebArena 上的成绩和可配置推理模式,为评估通用智能体框架提供了具体参照。
Google DeepMind 发布更新版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,提升了复杂工作流处理、指令遵循和多轮对话能力。
推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,便于判断语音智能体的可用性变化。
BNY 利用 OpenAI 在全企业范围扩大 AI 应用,通过 Eliza 平台让 20,000 多名员工构建 AI 智能体,以提升效率和客户成果。
Hugging Face 发布教程,展示如何让 OpenAI Codex 借助 Hugging Face Skills 仓库完成端到端机器学习实验,包括数据集校验、硬件选择、提交训练任务、监控进度、评测与导出 GGUF。
推荐理由:原文给出 Codex 结合 HF Skills 完成端到端微调的完整流程与成本区间,可据此判断智能体托管训练实验的可行边界。
Mistral AI 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:官方给出两款开源编码模型的参数、SWE-bench 成绩与许可差异,并附独立人工评测对比,可据此判断开源编码模型与闭源模型的差距。
Intel AI Software Group 发布 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调的轻量级数学推理 Agent,通过 smolagents 生成 Python 片段并在沙箱执行,将输出长度最多缩短 66%,同时在 MATH500、AIME、HMMT、HLE 等基准上提升准确率。
Hugging Face 推出 Hugging Face Skills,让 Claude Code、Codex、Gemini CLI 等编码智能体直接提交微调任务到云端 GPU、监控进度并把模型推送到 Hub。
推荐理由:Hugging Face 把微调流程封装成 Claude Code 可调用的 Skill,读者可据此了解对话式训练的实际操作与成本。
Tavily 分享了其构建 SOTA 深度研究智能体的经验,曾因第一版架构假设过时被迫推倒重建。其核心思路是简化编排逻辑、拥抱模型自主性,并借助 Tavily Advanced Search 在工具侧完成上下文工程,只返回最相关内容块以降低幻觉与延迟。团队还提出将工具输出蒸馏为反思、仅在生成最终结果时引入原始信息,以模拟人类研究方式。
Google DeepMind 宣布支持美国白宫 Genesis Mission,并与美国能源部合作,向全部 17 个国家实验室提供前沿 AI for Science 模型和智能体工具的加速访问计划,首批上线的是基于 Gemini 的 AI co-scientist。
推荐理由:Google DeepMind 与美国能源部 17 个国家实验室的合作,给出了 AI for Science 从模型到落地路径的具体样本。
Google 发布智能体开发平台 Antigravity,即日起公开预览且免费,支持 macOS、Linux 和 Windows。它保留 AI 驱动的 IDE 编辑器视图,同时新增面向智能体的 Manager 界面,可并行编排多个工作区中的智能体,并通过任务列表、实现方案、截图和浏览器录制等 Artifacts 呈现工作过程。
推荐理由:Google 把 IDE 拆成同步编辑器与异步 Agent Manager 两层,读者可据此判断智能体编程工具的产品形态走向。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令执行者升级为能推理目标、与用户对话并自我改进的游戏伙伴。
推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,并给出自我改进循环与在 Genie 3 生成世界中的泛化表现。
Google 推出数据科学智能体 DS-STAR,通过数据文件分析、LLM 评判验证与顺序规划三项创新,在 DABStep、KramaBench、DA-Code 上均超越 AutoGen 和 DA-Agent,准确率分别从 41.0% 提升至 45.2%、39.8% 至 44.7%、37.0% 至 38.5%,并登顶 DABStep 公开榜单。
MiniMax M2 在智能体后训练中提出"交错思考"(Interleaved Thinking),让模型在任务任意阶段都能思考,以应对工具输出带来的外部扰动。团队发现单纯扩展工具数量无法带来真正泛化,转而构建覆盖工具信息、系统提示词、用户提示词、环境与工具响应全轨迹的数据管线。内部测试中,M2 在陌生"冷启动"框架下工具调用与指令遵循表现均超出预期。
Google Research 在 UIST'25 发布 StreetReaderAI,一款面向盲人和低视力用户的可访问街景原型,基于 Gemini 提供 AI Describer 实时场景描述与 AI Chat 对话问答,支持键盘和语音导航。