Jason Liu 如何用 Codex 支撑长时间运行的工作
Jason Liu 分享了他使用 Codex 保存上下文、管理复杂项目,让工作不再局限于单次提示词的经验。
Jason Liu 分享了他使用 Codex 保存上下文、管理复杂项目,让工作不再局限于单次提示词的经验。
Samsung Electronics 在全球员工中部署 ChatGPT Enterprise 和 Codex,这是 OpenAI 规模最大的企业级 AI 落地之一。
Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,测试模型普遍泄露私有信息,且只训练任务性能会加剧泄露。其提出的 Privacy-Aware Deep Research(PA-DR)强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄露从 34.0% 降至 9.9%。
OpenAI 为 ChatGPT Enterprise 新增支出控制与用量分析功能,帮助企业管理成本并规模化部署 AI。该功能面向企业客户,用于管控 ChatGPT Enterprise 的使用开销。
OpenAI 发布 GPT-5.5 Instant,用于改进 ChatGPT 在健康与养生问题上的回答,官方称其在推理、上下文理解、表达清晰度上有所增强。该版本还引入了由医生参与设计的评估方式。
推荐理由:官方披露 GPT-5.5 Instant 在健康问答上的能力变化,读者可据此判断 ChatGPT 医疗场景的可用性。
研究者使用 OpenAI 的推理模型辅助诊断罕见疾病,在先前未解决的病例中新增 18 例确诊。该结果来自对儿童罕见遗传病诊断场景的尝试。
推荐理由:材料给出推理模型在罕见病诊断中的实际命中数量,可据此了解AI在临床疑难病例中的应用边界。
Hugging Face 在 PEFT 库中新增图像生成基准,与已有的 LLM 数学基准一起,在相同基座模型、数据集、训练与评估代码和硬件下对比多种参数高效微调技术。
推荐理由:Hugging Face 用统一基准对比多种 PEFT 技术,给出 LoRA 之外在精度与显存上的具体取舍数据。
Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,在 bare、clone、skill 三种层级下测量智能体完成任务所需的轮次、token 与错误率,而非只看最终答案。
推荐理由:Hugging Face 用自建 harness 实测 transformers 的 CLI 与 Skill 改动,发现同一改动对大模型提速、对小模型反而拖慢甚至破坏正确率。
AWS 开源 SDK Strands Robots(Apache 2.0)把 LeRobot 栈封装成 AgentTools,用一个 Strands 智能体串起从 Hub 数据集到实体机器人的流程。
推荐理由:AWS 官方给出从 Hub 数据集到实体机器人的完整五步流程,可据此判断仿真与真机数据同格式的实际用法。
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家,改进了药物制造中的一项关键反应,推进了药物化学研究。
推荐理由:OpenAI 与 Molecule.one 用 GPT-5.4 驱动的近自主 AI 化学家改进药物合成反应,可看 AI 在实验科学中的落地方式。
智谱发布旗舰模型 GLM-5.2,主打长周期任务能力,首次在 1M token 上下文上稳定支撑长程工作,并采用 MIT 开源许可。新架构 IndexShare 让每 4 层稀疏注意力共享同一 indexer,在 1M 上下文下将每 token FLOPs 降低 2.9×,MTP 层改进使投机解码接受长度最高提升 20%。
推荐理由:GLM-5.2 把 1M 上下文落到长周期编码任务上,并给出与闭源前沿模型的逐项对比,可据此判断开源模型在长程工程任务中的位置。
OpenAI 发布 LifeSciBench,这是一个由专家编写并评审的基准,用于评估 AI 系统处理真实生命科学研究任务与决策的能力。
Hugging Face 发布 Agentic Resource Discovery(ARD)规范的参考实现 Discover Tool,为智能体提供跨注册表的自然语言能力搜索。
推荐理由:Hugging Face 给出 ARD 规范的参考实现与 CLI、REST、MCP 三种接入方式,读者可据此判断智能体能力发现如何落地。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 地方规划部门合作,开发一款基于 Gemini 的 AI 规划原型,目标是帮助审批人员将住户规划申请的决定时间缩短 50%。
推荐理由:原文给出英国规划审批原型的目标、试点范围与上线时间,读者可据此判断 AI 介入公共服务的落地路径。
Google Research 发布了一套矢量化的英国乡村生态特征数据集,将此前 Farmscapes 2020 的栅格地图转化为可操作的树篱、石墙和矮林清单。
Google DeepMind 发布 AI Control Roadmap,用于在 Google 内部构建和管理高级 AI 的防御纵深框架,将内部智能体视为可能未对齐的潜在内部威胁,并基于 MITRE ATT&CK 拆解攻击战术与技术。
推荐理由:Google DeepMind 公开内部 AI 控制路线图,给出分级检测与响应机制,可供部署智能体的团队参考。
OpenAI 推出 Deployment Simulation,通过真实对话数据在模型部署前预测其行为,以提升安全性和评估准确性。该方法旨在让发布前的模型行为预测更贴近实际部署场景。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,目标两三年内扩至 40-80 名全职员工,初期拟募资 1 亿至 1.5 亿美元,研究方向包括可扩展监督、学习理论、启发式论证、博弈论与 personas。
OpenAI 推出 Partner Network,投入 1.5 亿美元帮助全球合作伙伴加速企业 AI 的采用、部署与转型。
Google 公布多项关于消费者使用 AI 工具理解皮肤问题的研究,其中发表于 JAMA Dermatology 的大规模调查显示,2345 名参与者借助 AI 工具尝试命名皮肤状况的比例超过 62%,命名准确率 23%,约为无辅助对照组 8% 的近三倍。研究同时发现,AI 辅助对判断下一步就医措施帮助有限,标准 AI 组的下一步准确率未出现统计显著提升。
加州大学圣地亚哥分校在 Google 支持下,正用 2000 台退役 Pixel 智能手机的主板搭建数据中心,为数百名研究人员和学生提供低成本、低碳的云计算。SPEC 基准显示 25-50 台手机约等于一台现代服务器,这些手机以 25-50 台为单位组成由 Kubernetes 管理的自管理集群。该系统预计于 2026 年秋季全面上线。
OpenAI 推出三门 Academy 新课程,帮助人们建立实用 AI 技能、创建可复用的工作流,并在日常工作中应用智能体。课程面向下一阶段的工作方式,聚焦实际动手能力与可重复流程。
Preply 借助 OpenAI 推出 AI 生成的课程总结,为学习者提供个性化反馈和语言练习。该功能将 AI 与真人导师结合,用于个性化学习体验。
OpenAI 宣布支持欧盟 AI 内容透明度行为准则,推进内容溯源标准与工具,帮助人们识别 AI 生成内容。
OpenAI 计划收购 Ona,以扩展 Codex 的安全持久云端环境,支持在企业工作流中运行长时间运行的 AI 智能体。
推荐理由:OpenAI 收购 Ona 以扩展 Codex 的云端环境,读者可据此了解其在企业级长时智能体上的布局方向。
天体物理学家 Chi-kwan Chan 使用 Codex 构建黑洞模拟,帮助科学家研究极端物理并检验爱因斯坦的广义相对论。
BBVA 将 ChatGPT Enterprise 部署规模扩大至 10 万名员工,并与 OpenAI 建立合作,以加速全球 AI 驱动的银行业务转型。
PyTorch 性能剖析系列第二部分将手写的 matmul-add 换成 nn.Linear,并堆叠三层加激活函数构成 MLP,在 NVIDIA A100-SXM4-80GB 上分析其 profiler trace。
OpenAI 模型与 Codex 现可通过 Oracle Cloud 访问,企业可使用既有云承诺额度来构建和部署 AI。该方式支持企业级安全与治理。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上最高实现 4 倍推理提速。
推荐理由:官方给出 26B MoE 文本扩散模型的速度数据与硬件门槛,读者可据此判断本地低并发场景的取舍。
OpenAI 发布新报告,披露与中国相关的账号利用 AI 影响美国技术议题,涉及数据中心叙事、关税以及对 ChatGPT 的不实说法。
推荐理由:OpenAI 官方披露与中国相关的账号利用 AI 影响美国技术议题,读者可了解平台方如何界定此类行动。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 发起最高 1000 万美元的多智能体 AI 安全研究资助,Google.org 提供支持。
LSEG 借助 OpenAI 在全球业务中规模化可信 AI,加快洞察速度、缩短发布周期,并赋能 4000 名员工。
Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,能自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:官方披露了连续生成式语音翻译的取舍思路,以及它在 Google 各产品线的开放节奏。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的智能体多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB VRAM 或统一内存的消费级笔记本上本地运行,并首次在中等规模模型中支持原生音频输入。
推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,读者可据此判断本地智能体的硬件门槛。
Google DeepMind 推出为期 3 个月的机器人加速器项目,从欧洲选出 15 家早期机器人初创公司,本周在伦敦启动,入选团队可使用其 AI 技术栈和 Gemini 机器人模型。项目提供技术指导、产品建议与合作伙伴网络,覆盖物流、制造、医疗、气候和导航等领域,例如挪威 3D-Components 的焊接与金属 3D 打印平台号称比现有做法快 280 倍。
Nextdoor 工程师借助 Codex 与 GPT-5.5 排查难以复现的问题、跨平台构建,并聚焦产品成果。
作者让一个编码智能体通过调用两个 Hugging Face Space 搭建了展示巴黎地标的 3D Gaussian splat 网站,全程未手动打开图像生成或 3D 重建工具。
推荐理由:作者用一次真实搭建演示了 agents.md 如何让智能体串联两个 Space 完成图像到 3D 的流水线,可迁移到其他多媒体组合。
Notion 借助 Codex 一次性生成规格说明、为网页端构建 AI Voice Input,并在小团队中放大工程产能。