OpenAI 为何不再评估 SWE-bench Verified
OpenAI 宣布不再评估 SWE-bench Verified,原因是该基准日益受到污染,且无法准确衡量前沿编码能力。其分析指出该基准存在测试缺陷与训练数据泄漏问题,并建议改用 SWE-bench Pro。
OpenAI 宣布不再评估 SWE-bench Verified,原因是该基准日益受到污染,且无法准确衡量前沿编码能力。其分析指出该基准存在测试缺陷与训练数据泄漏问题,并建议改用 SWE-bench Pro。
OpenAI 宣布推出 Frontier Alliance Partners,帮助企业从 AI 试点走向生产环境,实现安全、可扩展的智能体部署。
OpenAI 公开了其 AI 模型针对 First Proof 数学挑战的证明尝试,该挑战旨在测试模型在专家级问题上的研究级推理能力。
OpenAI 承诺向 The Alignment Project 投入 750 万美元,用于资助独立的 AI 对齐研究,以加强全球应对 AGI 安全与安保风险的努力。
OpenAI 推出 OpenAI for India,在印度扩大 AI 接入,建设本地基础设施、赋能企业并提升劳动力技能。该计划面向印度全国,覆盖基础设施、企业应用与人才培养三个方向。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评测 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞,覆盖发现、修复与攻击三类任务。
OpenAI 发布新预印本,显示 GPT-5.2 为胶子振幅提出了一个新公式,随后由 OpenAI 与学术合作者完成形式化证明与验证。
推荐理由:OpenAI 与学术合作者披露 GPT-5.2 提出胶子振幅新公式并被形式化证明,可观察大模型参与理论物理推导的边界。
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。
推荐理由:OpenAI 为 ChatGPT 加入面向企业的提示词注入与数据外泄防护选项,读者可了解其安全边界的新变化。
OpenAI 开源新工具包 GABRIEL,借助 GPT 把定性文本和图像转化为定量数据,帮助社会科学家大规模分析研究。该工具面向社会科学研究场景,可扩展处理规模。
OpenAI 构建了一套结合速率限制、用量追踪与积分的实时访问系统,用于支撑 Codex 和 Sora 的持续访问。该系统将速率限制、用量追踪和积分机制整合在一起,以扩展两个产品的访问能力。
Hugging Face 构建了一个 Agent Skill,教编码智能体编写生产级 CUDA kernel,并让 Claude 和 Codex 分别针对 diffusers 的 LTX-Video 和 transformers 的 Qwen3-8B 生成可用 kernel,包含正确的 PyTorch 绑定与基准测试。
推荐理由:Hugging Face 把 CUDA kernel 开发知识封装成 Agent Skill,并给出两个真实模型的端到端基准数据,可据此判断这类技能包的实际收益。
OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15 倍,支持 128k 上下文。该模型目前以研究预览形式面向 ChatGPT Pro 用户开放。
推荐理由:OpenAI 发布首个实时编码模型,15 倍生成速度与 128k 上下文让读者了解编码模型的实时化方向。
OpenAI 技术人员 Ryan Lopopolo 提出 Harness engineering,主张在智能体优先的世界中利用 Codex。文章围绕这一理念展开,探讨如何借助 Codex 构建以智能体为核心的工程实践。
OpenAI for Government 宣布在 GenAI.mil 上部署定制版 ChatGPT,为美国国防团队提供安全、注重安全的 AI 能力。
OpenAI 分享了其 AI 本地化思路:全球共享的前沿模型可在不牺牲安全性的前提下,适配各地的语言、法律与文化。
OpenAI 的 GPT-5 与 Ginkgo Bioworks 的云端自动化结合组成自主实验室,通过闭环实验将无细胞蛋白质合成成本降低 40%。
OpenAI 推出 Trusted Access for Cyber,一个基于信任的框架,在扩大前沿网络能力访问范围的同时加强对滥用的防护。
推荐理由:OpenAI 推出面向网络安全的可信访问框架,读者可了解前沿网络能力开放与滥用防护之间的平衡思路。
OpenAI 发布企业平台 OpenAI Frontier,用于构建、部署和管理 AI 智能体。该平台提供共享上下文、入职引导、权限和治理等能力。
推荐理由:OpenAI 面向企业推出智能体平台,给出共享上下文、权限与治理等能力范围,可据此判断企业级 Agent 的落地形态。
OpenAI 发布 GPT-5.3-Codex 系统卡,称其为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理和专业领域知识能力。
推荐理由:官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此了解它在编码与推理上的组合方式。
OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生的智能体,将前沿编码能力与通用推理结合,用于支持长周期、真实世界的技术工作。
推荐理由:OpenAI 发布 Codex 原生的 GPT-5.3-Codex,读者可了解其在编码与通用推理上的定位。
OpenAI 介绍 Codex App Server,这是一个双向 JSON-RPC API,用于把 Codex 智能体嵌入到其他应用中。该接口支持流式进度、工具调用、审批和 diff 等能力。
推荐理由:OpenAI 官方拆解 Codex App Server 的 JSON-RPC 接口设计,可供开发者参考如何把编码智能体嵌入自有产品。
OpenAI 公布 Sora 信息流的设计理念,主打激发创意、促进连接并保障体验安全。该信息流通过个性化推荐、家长控制和强护栏机制来平衡创作与安全。
Snowflake 与 OpenAI 达成 2 亿美元合作协议,把前沿智能引入企业数据,让 AI 智能体和洞察直接在 Snowflake 中运行。
OpenAI 发布面向 macOS 的 Codex 应用,定位为 AI 编码与软件开发的指挥中心,支持多个智能体、并行工作流和长时间运行的任务。
推荐理由:OpenAI 官方发布 Codex macOS 应用,读者可了解其多智能体与并行工作流的产品定位。
OpenAI 封禁了一批与代号 No Bell 行动相关的账号,该行动此前未被报道,疑似源自俄罗斯,利用 AI 面向非洲受众制作批评美国及其盟友的内容。
OpenAI 封禁了一批与一项此前未报告的行动相关的账号,该行动被其命名为“Trolling Stone”。这些账号利用 AI 生成关于一名据称俄罗斯邪教领袖在阿根廷被捕的评论内容。
OpenAI 封禁了一批很可能源自柬埔寨的账号,这些账号用 AI 冒充追损服务、律所和执法机构,目标是被诈骗影响的人群。
OpenAI 封禁了一批利用 AI 支持恋爱诈骗流程的账号,涉及接触目标、翻译、与受害者互动以及投资诈骗诱饵等环节。
OpenAI 封禁了与 Rybar 网络相关的账号,其中部分账号可能源自俄罗斯。这些账号利用 AI 在网站和社交平台上支持多语言影响力活动。
OpenAI 封禁了一批疑似中国来源的账号,称这些账号利用 AI 研究美国人员、地点以及社会工程手法。
OpenAI 封禁了一批很可能源自柬埔寨的账号,这些账号利用 AI 对印尼寻爱者实施诈骗,涉及翻译与互动环节。该行动代号“Date Bait”,针对的是 AI 加持的恋爱诈骗。
OpenAI 封禁了一个与中国执法相关人员关联的账号,该账号利用 AI 策划影响力活动、骚扰和网络行动。
OpenAI 披露其内部数据智能体,结合 GPT-5、Codex 与记忆能力对海量数据集进行推理,可在数分钟内给出可靠洞察。该智能体为 OpenAI 自研自用,用于加速内部数据分析流程。
OpenAI 宣布将于 2026 年 2 月 13 日从 ChatGPT 下线 GPT-4o、GPT-4.1、GPT-4.1 mini 和 OpenAI o4-mini,与此前已公布的 GPT-5(Instant、Thinking 和 Pro)下线同步进行。API 侧目前没有变化。
推荐理由:OpenAI 官方给出 ChatGPT 中多款旧模型的下线时间,并说明 API 侧暂不受影响。
Taisei Corporation 的人力资源团队正在牵头推广 ChatGPT Enterprise,以推动全公司由 AI 驱动的人才培养。
OpenAI 推出 EMEA Youth & Wellbeing Grant,投入 50 万欧元资助非政府组织和研究人员,用于推进 AI 时代的青年安全与福祉。该计划现已开放申请。
OpenAI 发布欧盟经济蓝图 2.0,以新数据、合作伙伴关系和多项举措推动欧洲 AI 应用、技能培养与经济增长。
OpenAI 说明了 AI 智能体打开链接时保护用户数据的方式,通过内置防护机制防止基于 URL 的数据外泄和提示词注入。
Calvin Klein 与 Tommy Hilfiger 母公司 PVH 正采用 ChatGPT Enterprise,将 AI 引入时尚设计、供应链和消费者互动环节。
OpenAI 推出 Prism,一个内置 GPT-5.2 的免费 LaTeX 原生工作空间,帮助研究人员在同一处完成写作、协作与推理。