Google 发布 TurboQuant 等三种向量量化算法,KV cache 压缩至 3 bit 且精度无损
Google 发布 TurboQuant 压缩算法,并配套提出 QJL 和 PolarQuant,用于解决向量量化中的内存开销问题,三篇工作将分别亮相 ICLR 2026 和 AISTATS 2026。
推荐理由:Google 提出三种向量量化算法,在 KV cache 压缩与向量搜索上给出可复用的压缩思路与基准结果。
Google 发布 TurboQuant 压缩算法,并配套提出 QJL 和 PolarQuant,用于解决向量量化中的内存开销问题,三篇工作将分别亮相 ICLR 2026 和 AISTATS 2026。
推荐理由:Google 提出三种向量量化算法,在 KV cache 压缩与向量搜索上给出可复用的压缩思路与基准结果。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的模型,采用 Apache 2.0 许可开源。
推荐理由:Mistral 首次把推理、多模态与编码能力合并进单一小模型,并给出可调推理强度与部署门槛。
Mistral AI 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。
推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出与 Claude 系列及开源模型的成本与得分对比,可据此判断形式化验证路线的性价比。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在特征、数据和模型组件归因中识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层级结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
十年前的 AlphaGo 成为首个击败围棋世界冠军的 AI 系统,其"第 37 手"证明 AI 能超越模仿人类、发现全新策略。此后 DeepMind 将这一搜索与强化学习思路延伸至 AlphaFold 2(已折叠 2 亿个蛋白质结构,超 300 万研究者使用)、AlphaProof、AlphaEvolve 及 Gemini Deep Think 等系统,并因此获得 2024 年诺贝尔化学奖。
OpenAI 提出 CoT-Control,发现推理模型难以控制自己的思维链,这反而强化了可监控性作为 AI 安全防护手段的价值。
推荐理由:OpenAI 提出 CoT-Control 并观察到推理模型难以控制自身思维链,为可监控性作为安全手段提供了依据。
Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手在航班推荐任务中的预测,从而学会概率推理。在五轮模拟用户交互中,未经训练的 LLM 表现远逊于最优贝叶斯助手,且往往在单次交互后性能就停滞;而贝叶斯教学不仅提升该任务表现,还能泛化到其他任务。
Google DeepMind 发布 Gemini 3.1 Flash-Lite,这是 Gemini 3 系列中速度最快、成本最低的模型,已在 Google AI Studio 和 Vertex AI 以预览形式向开发者开放。
推荐理由:官方给出定价、速度与基准数据,读者可据此判断高并发场景下是否值得替换 2.5 Flash。
OpenAI 公开了其 AI 模型针对 First Proof 数学挑战的证明尝试,该挑战旨在测试模型在专家级问题上的研究级推理能力。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的核心推理升级,在 ARC-AGI-2 上取得 77.1% 的验证分数,超过 3 Pro 推理性能的两倍。
推荐理由:官方给出 ARC-AGI-2 上 77.1% 的验证分数,读者可据此判断 Gemini 3.1 Pro 在核心推理上的提升幅度。
OpenAI 发布新预印本,显示 GPT-5.2 为胶子振幅提出了一个新公式,随后由 OpenAI 与学术合作者完成形式化证明与验证。
推荐理由:OpenAI 与学术合作者披露 GPT-5.2 提出胶子振幅新公式并被形式化证明,可观察大模型参与理论物理推导的边界。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题。官方称其在 Humanity's Last Exam 上取得 48.4%(无工具)、ARC-AGI-2 上 84.6%、Codeforces 上 Elo 3455,并在 2025 国际数学奥林匹克达到金牌水平。
推荐理由:官方给出 Deep Think 在 HLE、ARC-AGI-2、Codeforces 等基准上的具体成绩,并说明 API 早期访问入口,便于判断其科研与工程定位。
Google DeepMind 发布两篇论文,介绍在数学家、物理学家和计算机科学家指导下,用 Gemini Deep Think 模式求解专业研究问题。团队构建了由 Deep Think 驱动的数学研究智能体 Aletheia,具备自然语言验证器、可迭代生成与修正,并能承认无法求解,在 IMO-ProofBench Advanced 上得分最高达 90%。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学与理论计算机科学上的研究级成果,并给出人机协作的分类框架。
Google Research 提出 Sequential Attention,用贪心选择机制在单次模型训练内顺序、自适应地挑选最佳组件(层、块或特征),无需反复重训即可完成特征选择。该方法在多个神经网络基准上取得 SOTA,并实现快速单遍贪心选择,兼顾效率、准确率、可解释性与大规模可扩展性。
Hugging Face 博客复盘了用 verl 框架对 GPT-OSS-20B 做 Agentic RL 训练时遇到的问题:训练初期出现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双次前向传播导致新旧 log-prob 不匹配,使 PPO 的 importance sampling ratio 偏离 1。
微软团队发布 Differential Transformer V2,通过为每个 token 和每个 head 投影 λ 并只增加 query head 数量、保持 KV head 不变,使解码速度与标准 Transformer 持平且无需自定义注意力 kernel。
推荐理由:微软团队给出 Differential Transformer V2 的注意力实现与消融对比,读者可了解差分注意力在解码速度与训练稳定性上的取舍。
NVIDIA 发布开源推理视觉语言模型 Cosmos Reason 2,面向物理 AI,在 Physical AI Bench 和 Physical Reasoning 榜单上成为排名第一的开源视觉理解模型。
推荐理由:NVIDIA 开源视觉语言模型 Cosmos Reason 2 的升级细节,读者可据此判断物理 AI 场景的可用能力。
Google Research 回顾 2025 年成果:Gemini 3 成为其事实性最强的 LLM,在 SimpleQA Verified 和与 Google DeepMind、Kaggle 联合发布的新 FACTS 基准上达到 SOTA。
OpenAI 推出针对思维链可监控性的新框架与评估套件,覆盖 24 种环境下的 13 项评估。结果显示,监控模型内部推理远比仅监控输出更有效,为 AI 系统能力提升后的可扩展控制提供了可行路径。
Google DeepMind 发布 Gemini 3 Flash,主打前沿智能与速度兼顾,在 GPQA Diamond 得 90.4%、Humanity's Last Exam 无工具得 33.7%、MMMU Pro 得 81.2%、SWE-bench Verified 得 78%。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本之间的取舍。
OpenAI 推出 FrontierScience 基准,用于测试 AI 在物理、化学和生物学领域的推理能力,衡量其向真实科学研究迈进的程度。该基准聚焦科研任务中的推理表现,而非单纯知识问答。
Google Research 在 STOC 2026 试验了基于 Gemini 2.5 Deep Think 的 Paper Assistant Tool(PAT),在投稿后 24 小时内为作者提供自动预审反馈,包括论文贡献摘要、潜在错误与改进建议以及笔误清单。
推荐理由:Google 在 STOC 2026 试用的论文预审工具给出了真实采纳率与作者反馈,可据此判断 AI 辅助数学证明审阅的边界。
OpenAI 发布 GPT-5.2,称其为目前数学与科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上取得新的 SOTA 结果。官方表示这些提升已转化为实际研究进展,包括解决一个开放理论问题并生成可靠的数学证明。
推荐理由:官方给出 GPT-5.2 在数学与科学基准上的新结果,并说明这些提升如何落到实际研究进展。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3,513 个公开样本。
Google Research 发布 Titans 架构和 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合,实现测试时记忆。Titans 用深度神经网络作为长期记忆模块,通过 surprise 指标、动量和自适应权重衰减选择性存储信息;MIRAS 则统一了序列建模的四个设计选择,并衍生出 YAAD、MONETA、MEMORA 三个无注意力模型。
推荐理由:Google 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,在超长上下文任务上超过 GPT-4。
Intel AI Software Group 发布 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调的轻量级数学推理 Agent,通过 smolagents 生成 Python 片段并在沙箱执行,将输出长度最多缩短 66%,同时在 MATH500、AIME、HMMT、HLE 等基准上提升准确率。
Mistral 发布 Mistral 3 系列,包含 Mistral Large 3 与 Ministral 3(3B、8B、14B),全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 同时给出 675B 稀疏 MoE 大模型与 3B 到 14B 端侧系列,并公开 Apache 2.0 权重与部署格式,读者可据此判断开源前沿模型与端侧路线的分工。
Hugging Face 发布博客,从 attention 机制与 KV caching 出发,通过优化吞吐量推导出 continuous batching。该技术通过并行处理多个对话、完成即换出,最大化高负载场景下的推理性能。文中指出 attention 是 token 间唯一交互之处,其计算量随序列长度呈平方增长。
ServiceNow 将 15B 推理模型改造为 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1x 吞吐,MATH500 从 0.90 升至 0.92、MTBench 从 8.30 升至 8.58,GSM8k、GPQA、AIME24 略有下降,总训练 76.8B token。
一篇博文提出用"分治"范式替代时序差分(TD)学习来做 off-policy 强化学习,通过将轨迹一分为二并组合子段价值,理论上把 Bellman 递归次数从线性降到对数级。作者称与 Aditya 合作的最新工作首次将分治价值学习扩展到目标条件强化学习这类高复杂度任务,且无需像 n-step TD 那样调节 n 超参数。
WRITER 发布 Palmyra-mini 系列三款开源模型,参数规模 1.5B 至 1.7B,包括非思考基础版 palmyra-mini 及两个推理变体 palmyra-mini-thinking-a 和 palmyra-mini-thinking-b。
Kimina Prover 团队开源了 kimina-prover-rl 训练流水线,用于在 Lean 4 中训练形式化定理证明模型,基于 DeepSeek-R1 启发的"先推理后生成"范式,并完全兼容开源 Verl 框架。
Hugging Face 推出 TextQuests 基准,基于 25 款经典 Infocom 互动小说游戏,评测 LLM 作为自主智能体的长上下文推理与探索学习能力。
OpenAI 在 API 平台推出 GPT-5,主打高推理性能、面向开发者的新控制项,以及在真实编码任务上的领先结果。
推荐理由:OpenAI 在 API 平台上线 GPT-5,开发者可据此了解新模型在推理与真实编码任务上的定位。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可。官方称这两款模型在推理任务上优于同规模开放模型,具备较强的工具调用能力,并针对消费级硬件的高效部署做了优化。
推荐理由:OpenAI 开源两款权重模型,给出参数量、许可与部署定位,便于判断本地推理的可用边界。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两个开放权重推理模型,采用 Apache 2.0 许可证,并适用 gpt-oss 使用政策。
推荐理由:OpenAI 以 Apache 2.0 开放两个推理模型权重,读者可据此了解其开放范围与使用条件。
OpenAI 发布开源权重模型家族 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均为 MoE 架构并采用 MXFP4 4-bit 量化,采用 Apache 2.0 许可。
推荐理由:Hugging Face 官方给出两款开源权重模型的参数、量化与部署路径,可据此判断本地推理的硬件门槛。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑,读者可据此判断其产品线走向。
Numina 与 Kimi 团队发布 Kimina-Prover-72B 形式化定理证明模型,基于 Qwen2.5-72B 并用 Kimi k1.5 的 RL 流程训练,同时开源 8B 和 1.7B 蒸馏版本。
Hugging Face 发布 SmolLM3,一个完全开源的 3B 模型,在 11T token 上训练,支持 think/no_think 双模式推理、6 种语言和最高 128k 上下文。
推荐理由:Hugging Face 公开了 SmolLM3 的完整训练配方与数据配比,读者可据此复现或改进 3B 级小模型的训练流程。