OpenAI 发布 GPT-6 Astra,面向商业场景强化推理与计算机使用能力
OpenAI 发布 GPT-6 Astra,称其为面向商业场景能力最强的模型,具备高级推理、计算机使用以及更强的写作与设计判断力。目前官方仅给出简要介绍,未披露具体参数、可用时间或定价信息。
推荐理由:OpenAI 官方发布 GPT-6 Astra,读者可据此了解其面向商业场景的推理与计算机使用能力定位。
OpenAI 发布 GPT-6 Astra,称其为面向商业场景能力最强的模型,具备高级推理、计算机使用以及更强的写作与设计判断力。目前官方仅给出简要介绍,未披露具体参数、可用时间或定价信息。
推荐理由:OpenAI 官方发布 GPT-6 Astra,读者可据此了解其面向商业场景的推理与计算机使用能力定位。
MIT 一名研究人员使用 GPT-5.6 Sol 配合 Codex,自主运行量子计算实验、分析结果并校准量子比特。该案例展示了 GPT-5.6 Sol 在量子计算实验流程中的自主执行能力。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍,已通过网站门户免费开放给学术研究使用。
推荐理由:DeepMind 把 AlphaGenome 的预测预计算成 1PB 全基因组图谱,读者可据此判断变异解读的门槛与规模变化。
OpenAI 发文探讨更强、更可负担的 AI 如何扩展个人与企业可完成的工作范围,并让增长更经济。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 和 PSG Equity 共同领投。公司称这是欧洲科技公司完成的最大规模股权融资,资金将用于扩展前沿研究、算力、基础设施和商业增长。Mistral 目前业务覆盖 20 个国家,服务 125 家以上全球企业,包括 Airbus、ASML 和 HSBC。
推荐理由:欧洲 AI 公司迄今最大股权融资,读者可了解主权 AI 与开放权重路线的资本背书和客户规模。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精致的图像,并更贴近用户原本的构想。
推荐理由:官方给出 ChatGPT Images 2.5 的输入类型与输出定位,可据此判断图像生成能力的迭代方向。
OpenAI 扩大对新闻业的支持,面向学生、教育者、记者和新闻机构提供工具、培训与合作伙伴关系。该计划从课堂延伸至新闻编辑室。
OpenAI 分享了一份由 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含一份书面说明和一份 Lean 形式化证明。
OpenAI 开放申请一项 500 万美元资助计划,支持关于生成式 AI 如何影响青少年发展、福祉与安全的独立研究。
OpenAI 联合 AIRPPU 和 WAN-IFRA 启动一项 AI 项目,帮助乌克兰新闻机构提升创新能力、韧性并支持独立新闻业。
OpenAI 的 Jakub Pachocki 反思日益强大的 AI 及保持其对齐的挑战,呼吁加强安全防护并推动国际协调。
OpenAI 披露内部编码智能体的早期使用数据,涵盖智能体使用情况、实验速度、任务复杂度与研究加速等方面。这些数据展示了编码智能体正在重塑 OpenAI 内部的 AI 研究方式。
GitHub 发布研究预览 Project HydraFusion,在 GitHub Copilot CLI 中通过运行时编排多个提供商的模型,自动选择 Single、Cascade、Critique 三种执行模式来平衡质量、成本与延迟。
推荐理由:GitHub 官方给出多模型编排的三种执行模式与三项基准的成本质量对比,可据此判断路由式编排在编码任务上的取舍。
Google Research 用 UK Biobank 的数十万欧洲样本与近 20 万日本人的 Biobank Japan 数据,在 8 项临床性状上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达到 15k 以上时,加入欧洲数据反而限制精度提升;遗传相关性高的性状可继续受益至 25-40k+ 样本,而 HDL、LDL 和血糖等高度人群特异性性状受益更小。
GitHub Copilot 应用支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文,可随时切换并从中断处继续。用户可在 sessions 视图中查看各会话标题与任务进度,例如在同一项目中并行完成 funded sort 功能开发、无障碍审查和测试运行。
Google 与 HHMI Janelia 及剑桥等合作者在 Cell 发表论文,发布完整雄性果蝇大脑与中枢神经系统连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。
推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体作用。
Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为目前最先进的全球天气 AI 模型,可直接学习实时观测数据,每小时生成一次预报,最高分辨率达 5 公里,整体比上一代 WeatherNext 2 清晰约 5 倍。
推荐理由:官方给出分辨率、更新频率与降水精度等具体指标,可据此判断 AI 天气预报在 Google 产品中的落地程度。
OpenAI 推出 Daybreak for Frontline Defenders,承诺投入 10 亿美元,为关键服务扩大前沿网络安全 AI 的使用权限,并提供培训与支持。
Hugging Face 推出 NeoMME 系列多模态多语言编码器,含 260M 和 800M 两个规模,用单个双向 Transformer 同时处理文本 token 与 32×32 图像 patch,无需独立视觉塔或因果语言模型。
Legora 借助 GPT-6 Astra 在数分钟内完成 41 份文档的审阅,找出了全部四处预设错误,并在该财务审阅工作流中把表现提升近 40%。
Hugging Face 发布 funes,一个面向 Claude Code、Codex、pi 和 Hermes 的持久记忆层,从本机已有会话构建索引,一条命令即可接入。
推荐理由:Hugging Face 官方发布的本地记忆层,给出安装命令与检索管线细节,可判断跨 Agent 记忆的落地方式。
一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅约 500 条样本、100 步训练,就把 IFStruct 基准成绩从 22.6% 提升到 29.7%,训练可在免费版 Colab 或 Kaggle GPU 上完成。评测通过 llama.cpp 在本地 MacBook 上运行,代码已开源在 GitHub。
Hugging Face 用 TRL 和 OpenEnv 开源复现了让语言模型画水彩的完整流程,模型通过 p5.brush 写出约 150 行 JavaScript 来作画。
Google 推出 Fairwind Program,面向政府机构、关键基础设施运营商和网络安全合作伙伴限量开放其最先进的网络防御能力,首批提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具链,用于自主发现、验证并修复漏洞。
推荐理由:Google 把 Gemini 3.8 Flash Cyber 与 CodeMender 组合成受限访问项目,读者可了解前沿模型在漏洞修复上的落地方式与准入条件。
Google DeepMind 发布 Gemini 3.8 Flash 和面向网络安全的 Gemini 3.8 Flash Cyber,称其为目前推理与编码能力最强的模型,速度与成本与 3.7 Flash 持平。
推荐理由:官方给出两个变体的基准表现与定价,读者可据此判断长时程编码与网络安全任务的成本取舍。
ATV Big Air Tour 使用 ChatGPT Work 加速营销与周边商品业务,将原本 3 天的工作缩短到 3 小时,并在 15 分钟内把商品照片变成库存网站。
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的新方法,基于多维 IRT(MIRT)分离同一基准中混杂的能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知基准对应能力,却自行稳定复现出安全与通用推理两个主导维度。分析显示 BBQ、WMDP 等安全基准的得分与通用推理关联更强,说明单一基准分数可能混合多种信号。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、预测增强并定位甲烷羽流,在专家标注羽流上召回率达 84%。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,官方称视频分析 token 消耗最多降低 88%、成本最多降低 66%、质量最多提升 7%。
推荐理由:官方给出 token 与成本降幅及准确率变化,并说明在长视频场景下与静态处理的取舍差异。
OpenAI 发布 Astra,称其是首个在 Preparedness Framework 下达到关键网络安全能力阈值的 OpenAI 模型。OpenAI 表示将为该模型的发布配备更强的安全防护措施。
推荐理由:OpenAI 首次披露 Astra 触及 Preparedness Framework 的关键网络安全能力阈值,读者可了解其发布前的安全门槛。
OpenAI 宣布医疗机构现在可以把 EHR 及其他行业数据接入 ChatGPT,让临床医生安全访问患者上下文、医学研究等信息。原文未披露具体接入方式、可用范围与上线时间。
推荐理由:官方给出 ChatGPT 接入医疗数据的入口,读者可据此判断临床场景中数据接入方式的变化。
澳大利亚律所 Gilbert + Tobin 通过 CEO 主导的投入、严格治理与人工问责机制,在全所范围规模化部署 ChatGPT Enterprise 和 Codex。
Hugging Face 发布 @huggingface/kernels,一个从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 库,同时上线 207 个 kernel 的初始集合,均以 Apache-2.0 许可发布为独立仓库。
推荐理由:Hugging Face 发布 207 个 WebGPU kernel 及配套加载库与浏览器基准工具,并给出与 ORT WebGPU 的实测对比数据。
Google 发布 TimesFM-3,一个原生预训练支持多变量预测的零样本时间序列基础模型,参数量 3.3 亿,预训练语料超过 1 万亿个时间点。模型支持多目标、历史协变量和已知未来协变量,采用交替注意力架构与 Contiguous Patch Masking,单次前向即可输出整个预测区间及 9 个分位数。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,用蒸馏自原 GigaPath ViT-g 的 22M 参数 ViT-S 编码器替换原有骨干,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。
OpenAI 宣布 ChatGPT Ads 年化收入运行率达到 10 亿美元,并在全球范围扩张。该业务通过免费和可负担的选项,支持更广泛的 AI 访问。
推荐理由:ChatGPT Ads 年化收入达 10 亿美元并启动全球扩张,可观察免费与低价 AI 访问的商业化路径。
OpenAI 宣布,在 Cursor 被 SpaceX 收购后,将逐步终止向 Cursor 提供 OpenAI 模型的合同。
推荐理由:OpenAI 官方说明在 Cursor 被 SpaceX 收购后终止模型供应合同,读者可了解这一商业动作的边界。
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上首个 Indic 语言。
Google 在 Earth AI 计划下推出实验性研究能力 planetary prediction engine(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,并生成报告,把原本需要数周人工数据工程的建模过程压缩到几分钟。
推荐理由:Google 官方给出 PPE 在公共卫生、粮食安全与疫情预测上的基准对比,可看自主地理空间建模的自动化程度。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景延展、首尾帧插值、360p 快速草稿和最高 4K 放大等生成视频控制能力,通过 Google AI Studio 的 Gemini API 与 Agent Platform API 提供。
推荐理由:官方给出场景延展、首尾帧插值与 4K 放大等具体能力与定价入口,可据此判断生成视频工作流的变化。