OpenAI 与 Anthropic 公布联合安全评估结果
OpenAI 与 Anthropic 公布首次联合安全评估的结果,双方互相测试对方模型在失准、指令遵循、幻觉、越狱等方面的表现。评估同时呈现了进展、挑战以及跨实验室合作的价值。
推荐理由:两家头部实验室首次联合开展安全评估,读者可了解跨实验室互测在失准、越狱等维度上的进展与挑战。
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
OpenAI 与 Anthropic 公布首次联合安全评估的结果,双方互相测试对方模型在失准、指令遵循、幻觉、越狱等方面的表现。评估同时呈现了进展、挑战以及跨实验室合作的价值。
推荐理由:两家头部实验室首次联合开展安全评估,读者可了解跨实验室互测在失准、越狱等维度上的进展与挑战。
OpenAI 发布 GPT-5,称其为该公司最先进的模型,面向企业 AI、自动化和劳动力生产力。原文仅给出这一句概述,未披露具体能力、参数或可用性细节。
OpenAI 在 API 平台推出 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。
推荐理由:OpenAI 在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。
OpenAI 发布文章介绍 GPT-5 在编码与设计方面带来的新可能,但摘要未给出具体功能、能力数据或使用方式。
OpenAI 发布 GPT-5 系统卡,说明其通过统一模型路由系统实现快速与智能的响应。该系统使用 gpt-5-main、gpt-5-thinking 以及 gpt-5-thinking-nano 等轻量版本,针对不同任务和开发者用途进行优化。
推荐理由:系统卡披露 GPT-5 用统一路由在 gpt-5-main、gpt-5-thinking 与轻量版本间分配任务。
OpenAI 发布 GPT-5,称其为目前最强的 AI 系统,在智能水平上较此前所有模型有显著跃升。GPT-5 在编码、数学、写作、健康、视觉感知等方面达到 SOTA 表现。
推荐理由:OpenAI 官方公布 GPT-5 的定位与能力覆盖范围,读者可据此了解其相对前代模型的升级方向。
OpenAI for Government 宣布与美国总务管理局(GSA)达成合作,未来一年 ChatGPT Enterprise 将以近乎零成本提供给整个联邦行政部门的工作人员。该计划覆盖联邦行政部门的全部员工。
推荐理由:OpenAI 与美国 GSA 合作,一年内让 ChatGPT Enterprise 覆盖整个联邦行政部门,可观察 AI 进入公共部门的落地方式。
OpenAI 发布其能力最强的开放权重模型,称这是让先进 AI 更开放、灵活和可及的重要一步。官方表示,其使命是让尽可能多的人用上 AI,此次发布旨在推动 AI 在全球范围内的普及。
推荐理由:OpenAI 官方宣布发布其能力最强的开放权重模型,读者可据此了解其开放与可及性主张。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开放模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:OpenAI 开源两款权重模型,给出参数量、许可与部署定位,便于判断本地推理的可用边界。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两个开放权重推理模型,采用 Apache 2.0 许可证,并适用 gpt-oss 使用政策。
推荐理由:OpenAI 以 Apache 2.0 开放两个推理模型权重,读者可据此了解其开放范围与使用条件。
OpenAI 发布开源权重模型家族 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可。
推荐理由:Hugging Face 官方给出两款开源权重模型的参数、量化与部署路径,可据此判断本地推理的硬件门槛。
OpenAI 与 Oracle 达成协议,将在美国为 Stargate 开发 4.5 GW 的额外数据中心容量。OpenAI 称这笔投资将创造就业、加速美国再工业化,并推进美国在 AI 领域的领先地位,同时是 Stargate 这一 AI 基础设施平台的重要里程碑。
推荐理由:OpenAI 与 Oracle 就 Stargate 新增 4.5 GW 数据中心容量达成协议,读者可据此了解其美国 AI 基础设施扩张规模。
OpenAI 发布 ChatGPT agent,它能够思考并行动,调用工具完成研究、预订和幻灯片制作等任务,全程由用户引导。
推荐理由:OpenAI 官方发布 ChatGPT agent,读者可了解其调用工具完成研究、预订和幻灯片等任务的能力定位。
OpenAI 发布 ChatGPT agent 系统卡,介绍这一智能体模型将研究、浏览器自动化和代码工具整合在一起。系统卡还说明该模型在 Preparedness Framework 下配备了相应防护措施。
推荐理由:OpenAI 官方系统卡披露 ChatGPT agent 的能力组合与 Preparedness Framework 下的防护安排。
OpenAI 表示正在抗辩一项法院命令,该命令源于《纽约时报》及原告的要求,涉及无限期保留消费者 ChatGPT 和 API 用户数据。OpenAI 称正努力维护用户隐私、满足法律要求并坚持其数据保护承诺。
推荐理由:OpenAI 与《纽约时报》的数据诉讼进入法院命令阶段,读者可了解其用户数据留存争议的立场。
OpenAI 封禁了一批利用 AI 从事社会工程、监控主题研究和针对批评者的影响力行动的账号。该行动代号为 Operation VAGue Focus。
推荐理由:OpenAI 披露封禁账号的三类滥用场景,可了解平台对 AI 社会工程与影响力行动的处置边界。
OpenAI 宣布推出 Stargate UAE,这是其 AI 基础设施平台 Stargate 的首次国际部署。
推荐理由:OpenAI 首次把 Stargate 基础设施平台部署到美国以外,读者可据此观察其算力布局的国际化节奏。
OpenAI 发布 o3 和 o4-mini 系统卡的补充说明,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,以生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直至通过。
推荐理由:系统卡补充说明披露了 Codex 背后的 codex-1 训练方式,可了解编码智能体的工程取向。
OpenAI 发布 Codex。
OpenAI 董事会发布更新,宣布将其营利实体转型为公益公司(Public Benefit Corporation),在非营利监督下强化使命驱动的架构,以便扩大影响并长期与公共利益保持一致。
推荐理由:OpenAI 董事会披露营利实体转为公益公司的治理调整,读者可了解其非营利监督架构的延续方式。