OpenAI 发布 GPT-5.3-Codex-Spark 实时编码模型
OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15 倍,支持 128k 上下文。该模型目前以研究预览形式面向 ChatGPT Pro 用户开放。
推荐理由:OpenAI 发布首个实时编码模型,15 倍生成速度与 128k 上下文让读者了解编码模型的实时化方向。
OpenAI 发布 GPT-5.3-Codex-Spark,称其为首个实时编码模型,生成速度提升 15 倍,支持 128k 上下文。该模型目前以研究预览形式面向 ChatGPT Pro 用户开放。
推荐理由:OpenAI 发布首个实时编码模型,15 倍生成速度与 128k 上下文让读者了解编码模型的实时化方向。
Meta 与 Hugging Face 联合推出的开源框架 OpenEnv 用于在真实系统而非模拟环境中评测 AI 智能体,Turing 为其贡献了生产级日历管理环境 Calendar Gym。
推荐理由:OpenEnv 与 Calendar Gym 的实测数据揭示了工具型智能体在多步推理和歧义解析上的具体瓶颈,可迁移到其他 Agent 评测设计。
OpenAI 技术人员 Ryan Lopopolo 提出 Harness engineering,主张在智能体优先的世界中利用 Codex。文章围绕这一理念展开,探讨如何借助 Codex 构建以智能体为核心的工程实践。
Google 在 ACM UIST 2025 上发布开源原型框架 DialogLab,用于编排、模拟和测试动态的人机多方群组对话。该框架将对话的社交设定与时间推进解耦,通过"编排-测试-验证"三阶段工作流支持拖拽式场景搭建、human control 实时干预和对话动态可视化分析。
Google Research 与 Google DeepMind 发现,主要用鸟类数据训练的 Perch 2.0 生物声学基础模型,在未接触任何水下音频的情况下,仍能作为嵌入模型迁移用于鲸类发声分类。
Google DeepMind 发布两篇论文,介绍在数学家、物理学家和计算机科学家指导下,用 Gemini Deep Think 模式求解专业研究问题。团队构建了由 Deep Think 驱动的数学研究智能体 Aletheia,具备自然语言验证器、可迭代生成与修正,并能承认无法求解,在 IMO-ProofBench Advanced 上得分最高达 90%。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学与理论计算机科学上的研究级成果,并给出人机协作的分类框架。
OpenAI for Government 宣布在 GenAI.mil 上部署定制版 ChatGPT,为美国国防团队提供安全、注重安全的 AI 能力。
Transformers.js v4 已在 NPM 发布,可通过 npm i @huggingface/transformers 安装。最大变化是采用完全用 C++ 重写的 WebGPU 运行时,与 ONNX Runtime 团队在约 200 个模型架构上测试,同一份代码可运行在浏览器、Node、Bun 和 Deno 等环境。
推荐理由:Transformers.js v4 换用 C++ 重写的 WebGPU 运行时,并给出 BERT 嵌入约 4 倍加速等具体数据,可据此判断浏览器端推理的性能变化。
OpenAI 分享了其 AI 本地化思路:全球共享的前沿模型可在不牺牲安全性的前提下,适配各地的语言、法律与文化。
Hugging Face 发布 SyGra 2.0.0 的 Studio,将合成数据生成搬到画布上,可视化编排流程并自动生成 SyGra 兼容的图配置与任务执行脚本。
OpenAI 的 GPT-5 与 Ginkgo Bioworks 的云端自动化结合组成自主实验室,通过闭环实验将无细胞蛋白质合成成本降低 40%。
OpenAI 推出 Trusted Access for Cyber,一个基于信任的框架,在扩大前沿网络能力访问范围的同时加强对滥用的防护。
推荐理由:OpenAI 推出面向网络安全的可信访问框架,读者可了解前沿网络能力开放与滥用防护之间的平衡思路。
Google 提出 Natively Adaptive Interfaces(NAI)框架,用多模态 AI 工具让 UI 设计从一刀切转向情境感知,以动态的智能体驱动模块取代静态导航。
OpenAI 发布企业平台 OpenAI Frontier,用于构建、部署和管理 AI 智能体。该平台提供共享上下文、入职引导、权限和治理等能力。
推荐理由:OpenAI 面向企业推出智能体平台,给出共享上下文、权限与治理等能力范围,可据此判断企业级 Agent 的落地形态。
OpenAI 发布 GPT-5.3-Codex 系统卡,称其为目前能力最强的智能体编码模型。该模型结合了 GPT-5.2-Codex 的前沿编码性能与 GPT-5.2 的推理和专业领域知识能力。
推荐理由:官方系统卡给出 GPT-5.3-Codex 的能力定位,读者可据此了解它在编码与推理上的组合方式。
OpenAI 发布 GPT-5.3-Codex,这是一个 Codex 原生的智能体,将前沿编码能力与通用推理结合,用于支持长周期、真实世界的技术工作。
推荐理由:OpenAI 发布 Codex 原生的 GPT-5.3-Codex,读者可了解其在编码与通用推理上的定位。
Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文字模型。
推荐理由:官方给出两款语音转写模型的延迟、错误率与价格对比,便于判断实时语音场景的落地成本。
Google Research 提出 Sequential Attention,用贪心选择机制在单次模型训练内顺序、自适应地挑选最佳组件(层、块或特征),无需反复重训即可完成特征选择。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,兼顾效率、准确率、可解释性与大规模可扩展性。
OpenAI 介绍 Codex App Server,这是一个双向 JSON-RPC API,用于把 Codex 智能体嵌入到其他应用中。该接口支持流式进度、工具调用、审批和 diff 等能力。
推荐理由:OpenAI 官方拆解 Codex App Server 的 JSON-RPC 接口设计,可供开发者参考如何把编码智能体嵌入自有产品。
Hugging Face 在 Hub 上线 Community Evals,基准数据集仓库可注册为 benchmark 并在数据集卡片展示排行榜,模型仓库用 .eval_results/*.yaml 存放评测分数。
推荐理由:Hugging Face 把评测结果从黑箱榜单搬到 Hub 上公开聚合,读者可据此了解评测透明化的一种新做法。
Google 宣布与 Included Health 合作,待 IRB 批准后启动一项全国性前瞻性随机对照研究,评估对话式 AI 在真实虚拟诊疗工作流中的表现。
推荐理由:Google 与 Included Health 将开展全国随机对照研究,读者可了解医疗对话 AI 从模拟走向真实临床的评估路径。
H Company 发布迄今最大的 UI 定位模型 Holo2-235B-A22B Preview,在 ScreenSpot-Pro 上以 3 步智能体模式达到 78.5%、OSWorld G 达 79.0%,创下新 SOTA。
Hugging Face 博客第三篇中国开源 AI 系列文章指出,开源已成为中国 AI 机构近期的主流路线。Qwen 在 Hugging Face 上的衍生模型超过 113k,远超 Llama 的 27k 和 DeepSeek 的 6k;Kimi K2、GLM-4.5、MiniMax M2 等模型相继开源,Kimi K2 被广泛称为"另一个 DeepSeek 时刻"。
Hugging Face 公布 PRX 文本到图像模型训练消融实验,基于 1.2B 参数的 PRX-1.2B 在 Flux VAE latent 空间训练,基线配置为 100k 步、256×256 分辨率、全局 batch size 256。
OpenAI 公布 Sora 信息流的设计理念,主打激发创意、促进连接并保障体验安全。该信息流通过个性化推荐、家长控制和强护栏机制来平衡创作与安全。
Snowflake 与 OpenAI 达成 2 亿美元合作协议,把前沿智能引入企业数据,让 AI 智能体和洞察直接在 Snowflake 中运行。
OpenAI 发布面向 macOS 的 Codex 应用,定位为 AI 编码与软件开发的指挥中心,支持多个智能体、并行工作流和长时间运行的任务。
推荐理由:OpenAI 官方发布 Codex macOS 应用,读者可了解其多智能体与并行工作流的产品定位。
OpenAI 封禁了一批与代号 No Bell 行动相关的账号,该行动此前未被报道,疑似源自俄罗斯,利用 AI 面向非洲受众制作批评美国及其盟友的内容。
OpenAI 封禁了一批与一项此前未报告的行动相关的账号,该行动被其命名为“Trolling Stone”。这些账号利用 AI 生成关于一名据称俄罗斯邪教领袖在阿根廷被捕的评论内容。
OpenAI 封禁了一批很可能源自柬埔寨的账号,这些账号用 AI 冒充追损服务、律所和执法机构,目标是被诈骗影响的人群。
OpenAI 封禁了一批利用 AI 支持恋爱诈骗流程的账号,涉及接触目标、翻译、与受害者互动以及投资诈骗诱饵等环节。
OpenAI 封禁了与 Rybar 网络相关的账号,其中部分账号可能源自俄罗斯。这些账号利用 AI 在网站和社交平台上支持多语言影响力活动。
OpenAI 封禁了一批疑似中国来源的账号,称这些账号利用 AI 研究美国人员、地点以及社会工程手法。
OpenAI 封禁了一批很可能源自柬埔寨的账号,这些账号利用 AI 对印尼寻爱者实施诈骗,涉及翻译与互动环节。该行动代号“Date Bait”,针对的是 AI 加持的恋爱诈骗。
OpenAI 封禁了一个与中国执法相关人员关联的账号,该账号利用 AI 策划影响力活动、骚扰和网络行动。
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅用户开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和混编交互式世界。
推荐理由:官方披露了原型的三项核心能力与已知限制,读者可据此判断世界模型当前能做什么、还差什么。
OpenAI 披露其内部数据智能体,结合 GPT-5、Codex 与记忆能力对海量数据集进行推理,可在数分钟内给出可靠洞察。该智能体为 OpenAI 自研自用,用于加速内部数据分析流程。
Gradio 团队发布开源 Python 库 Daggr,用于把 Gradio 应用、ML 模型和自定义函数串联成 AI 工作流,并自动生成可视化画布。画布中可查看任意节点的中间输出、修改输入并单独重跑某一步,无需执行整条流水线,还支持状态持久化和备份节点替换。
推荐理由:Gradio 团队开源 Daggr,用代码定义工作流并自动生成可视化画布,可单独重跑某一步,为多模型串联调试提供了一种轻量方案。
OpenAI 宣布将于 2026 年 2 月 13 日从 ChatGPT 下线 GPT-4o、GPT-4.1、GPT-4.1 mini 和 OpenAI o4-mini,与此前已公布的 GPT-5(Instant、Thinking 和 Pro)下线同步进行。API 侧目前没有变化。
推荐理由:OpenAI 官方给出 ChatGPT 中多款旧模型的下线时间,并说明 API 侧暂不受影响。
Taisei Corporation 的人力资源团队正在牵头推广 ChatGPT Enterprise,以推动全公司由 AI 驱动的人才培养。