OpenAI 发布报告:AI 编程智能体如何加速科学计算现代化
OpenAI 发布一份新领域报告,展示科学家如何用 AI 编程智能体推进科学计算现代化,加快软件开发与发现,覆盖基因组学等领域。
OpenAI 发布一份新领域报告,展示科学家如何用 AI 编程智能体推进科学计算现代化,加快软件开发与发现,覆盖基因组学等领域。
OpenAI 新研究显示,ChatGPT 用户正在跨角色承担任务,工作边界因此被重塑。研究关注的是 AI 如何拓展人们在工作中的能力范围,而非替代具体岗位。
英国 AI Security Institute 分析显示,开源权重模型与闭源前沿模型的网络能力差距正在收窄:GLM-5.2 与 DeepSeek V4-Pro 的表现接近 4 到 7 个月前发布的闭源前沿模型,而 2025 年大部分时间这一差距为 6 到 10 个月;在长周期网络靶场 The Last Ones 上差距更大。
DharmaOCR 在葡萄牙语专项基准上以 0.925 分超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过葡萄牙语监督微调加 DPO 两阶段训练,把全部参数集中于巴西葡萄牙语,从而在提取质量和稳定性上保持优势。
Google Research 在 Nature Cities 发表研究,在 10 座美国城市开展为期六个月的实验,通过修改 Google Maps 算法将遇到预设拥堵路段的行程引导至耗时相近的替代路线,仅不到 2% 的行程收到改道建议。
推荐理由:Google Research 在 10 座美国城市做了为期半年的真实路网实验,给出了协调少量出行即可提升全城车速与减排的量化结果。
伯克利 AI 研究提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不足 $1、部分厂商低于 $0.10,数据系统面临三大新挑战:为智能体设计(Data Systems For Agents)、由智能体运行(Of Agents)、由智能体构建(By Agents)。
Import AI 464 汇总多项进展:Fable 在 KernelBench-Mega 上写出首个 megakernel,用 CUDA 在 RTX PRO 6000 Blackwell 上实现 18.71X 加速,对比 Claude Opus 4.8 的 14.4X、GLM-5.2 的 11.14X 和 GPT 5.5 的 4.34X。
Dharma AI 撰文解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》。
OpenAI Signals 新数据显示,ChatGPT 的全球采用率正在增长,用户使用频率上升、探索更多能力,并推动各地区和语言的使用增长。
OpenAI 发布报告,梳理 AI 可能如何重塑欧盟各职业,指出哪些岗位面临自动化、增长或工作流程变化。报告聚焦欧盟范围内的 AI 劳动力机会,未披露具体职业清单或量化预测。
牛津大学、英国 AI 安全研究院、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即使专家自选议题、提前研究、接受数小时结构化训练并获 1,000 英镑奖金激励。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,目标两三年内扩至 40-80 名全职员工,初期拟募资 1 亿至 1.5 亿美元,研究方向包括可扩展监督、学习理论、启发式论证、博弈论与 personas。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,试验为期八周。
推荐理由:原文给出塞拉利昂随机对照试验的量化结果与师生互动数据,可了解 AI 辅助教学的实际效果与局限。
伦敦国王学院、复旦大学与 Alan Turing Institute 构建了 SocioHack 基准,包含 72 个沙盒社会环境,测试 AI 在信用卡积分、学校成绩等场景中"钻制度空子"的能力,RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的漏洞策略。
OpenAI 发布《智能时代的生物防御》行动计划,提出面向 AI 驱动的生物韧性建设方案。该计划聚焦利用 AI 能力应对生物安全风险,具体措施与实施细节尚未在文中展开。
Hugging Face 博客指出,企业级 AI 规模化落地的关键不在 LLM 本身,而在 agentic layer 中的 agent logic——知识图谱、算法、程序分析库等软件原语,可引导 LLM 聚焦企业工作流、压缩上下文空间。
Import AI 459 讨论了 AI 监管的困难、蛋白质折叠模型的缩放定律,以及为 AI 系统灭绝风险定价。弗吉尼亚大学、Anthropic 和加拿大银行的经济学家估算,2025 年美国名义 AI GDP 约 2500 亿美元,质量调整后实际年增速约 2600%;美国 AI 算力支出从 2023 年 370 亿美元增至 2025 年 2190 亿美元。
Import AI 第 458 期收录一篇基于 2026 年 Cosmos HAI Lab 演讲的长文和一个设想"正向奇点"的虚构故事。演讲提出面对 AI 持续进步,人类只有两种选择:探索未来,或从当下退缩;退缩会让人和社会陷入被动反应。
OpenAI 新研究显示,400 万美国人正使用 ChatGPT 创办、运营和扩展小企业,AI 正在降低创业成本。该研究称 AI 正成为小企业的"首位员工"。
Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。
推荐理由:原文给出 WeatherNext 在飓风 Melissa 中的提前预警细节,读者可了解 AI 天气模型在路径与强度双预测上的实际表现。
OpenAI 的 Parameter Golf 活动吸引 1,000+ 名参与者、收到 2,000+ 份提交,探索严格约束下的 AI 辅助机器学习研究、编码智能体、量化与新型模型设计。
ChatGPT 在 2026 年第一季度采用量激增,35 岁以上用户增长最快,性别使用比例也更趋均衡,显示 AI 正被更广泛的主流人群接受。
Institute for Law & AI 提出“激进可选性”监管思路,主张政府当下投资信息收集、举报人保护、评估能力与模型权重安全等工具,避免过度监管同时为未来强 AI 冲击预留应对手段。Meta 与 KAIST 的论文提出 Neural Computer,将计算、内存与 I/O 统一在学习到的运行时状态中。
OpenAI 发文阐述企业如何将 AI 从早期实验推进到规模化复利效应,关键在于信任、治理、工作流设计与大规模质量保障。
OpenAI 的 B2B Signals 研究显示,前沿企业正通过深化 AI 应用、规模化 Codex 驱动的智能体工作流来构建持久竞争优势。
Jack Clark 在 Import AI 455 中判断,到 2028 年底出现无需人类参与、能自主训练出后继模型的 AI 研发的概率约为 60%,2027 年前出现的概率约 30%。
OpenAI 提出一套新框架,分析 921 种职业和 1.48 亿个美国岗位,识别哪些角色面临自动化风险、重组、增长或受 AI 影响较小。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后的 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、软件数据与自主性组成的系统配方,而非单一模型。文章认为开源代码与工具能通过分布式检测、验证、协调与补丁传播缩小攻防能力差距,并主张采用半自主 AI 智能体在人类控制下进行防御。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频监督。
推荐理由:Google 与 BIDMC 首次在真实门诊流程中部署对话式诊断 AI,读者可了解其安全监督机制与医患反馈。
十年前的 AlphaGo 成为首个击败围棋世界冠军的 AI 系统,其"第 37 手"证明 AI 能超越模仿人类、发现全新策略。此后 DeepMind 将这一搜索与强化学习思路延伸至 AlphaFold 2(已折叠 2 亿个蛋白质结构,超 300 万研究者使用)、AlphaProof、AlphaEvolve 及 Gemini Deep Think 等系统,并因此获得 2024 年诺贝尔化学奖。
OpenAI 提出五种 AI 价值模型,帮助领导者按从员工熟练度到流程重塑的顺序推进 AI 落地,以构建持久的业务优势。
OpenAI 分享了其 AI 本地化思路:全球共享的前沿模型可在不牺牲安全性的前提下,适配各地的语言、法律与文化。
Hugging Face 博客第三篇中国开源 AI 系列文章指出,开源已成为中国 AI 机构近期的主流路线。Qwen 在 Hugging Face 上的衍生模型超过 113k,远超 Llama 的 27k 和 DeepSeek 的 6k;Kimi K2、GLM-4.5、MiniMax M2 等模型相继开源,Kimi K2 被广泛称为"另一个 DeepSeek 时刻"。
中国开源模型已几乎一致转向 MoE 架构,Kimi K2、MiniMax M2、Qwen3 均采用该路线,以在成本约束下兼顾能力与灵活部署。0.5B–30B 小模型成为本地运行与微调主力,Apache 2.0 接近默认许可证。DeepSeek-V3.2-Exp 获华为昇腾与寒武纪 day-zero 支持,蚂蚁 Ling 用国产芯片训练 1 万亿 token 成本降约 20%。
OpenAI 发布数据报告,披露各行业员工使用 ChatGPT 的情况,涵盖 GPT-5 在工作场景中的采用趋势、高频任务与部门分布模式。报告还探讨了 AI 在工作中的未来走向。
DeepSeek 于 2025 年 1 月发布 R-1 模型,一年后成为 Hugging Face 史上获赞最多的模型,其 MIT 许可让推理能力可下载、蒸馏和微调,推动中国开源 AI 生态成型。
Google 回顾 2025 年 8 大研究突破领域,Gemini 3 Pro 登顶 LMArena 排行榜,在 Humanity's Last Exam 和 GPQA Diamond 上取得突破性成绩,并在 MathArena Apex 创下 23.4% 的新 SOTA。
OpenAI 发布企业 AI 应用现状报告,展示各组织如何从试验阶段转向实际生产力提升与新能力构建。报告以数据驱动的方式呈现企业 AI 的采用情况。
AlphaFold 2 自 2020 年在 CASP 14 上解决蛋白质结构预测难题以来,其免费开放的 AlphaFold Protein Database 已发布超 2 亿个蛋白质结构预测,被 190 多个国家的 300 多万名研究者使用。该数据库相关研究被引用超 3.5 万篇,另有逾 20 万篇论文在方法中融入了 AlphaFold 2,这项工作于 2024 年获得诺贝尔化学奖。
Hugging Face 发布博客《On the Shifting Global Compute Landscape》,梳理中国开源权重模型与国产芯片互相牵引的现状:过去几个月,华为昇腾、寒武纪等芯片已开始承载部分高性能开源模型的推理,部分模型开始用国产芯片训练。
推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,帮助读者理解算力受限如何影响模型架构与部署选择。