跳到正文

#推理

今日 2 条
今天10月2日周五
  1. Ars Technica · AI60

    Ataraxos 以 16 块 GPU 击败史上最强 Stratego 人类选手

    卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 在 Stratego 对局中以 15 胜 1 负 4 平击败被认为史上最强的选手 Pim Niemeijer。Stratego 是不完全信息博弈,棋子身份只在碰撞时揭示,隐藏信息量大且展开时间跨度长,此前连 DeepMind 也未能造出稳定战胜顶尖人类玩家的机器。该系统的训练仅用 16 块 GPU,花费几千美元。

10月1日周四
  1. The Decoder78

    OpenAI 称已阻断窃取模型推理的攻击,但该手法在 Azure 上仍然有效

    OpenAI 称已阻断一起针对其模型推理内容的提取活动,该活动 7 月 1 日起量级较低,7 月 24 至 25 日激增至来自 4000 多名用户的 16000 次请求,涉及一个超过 15000 个账号的网络,OpenAI 表示已于 7 月 28 日将其全部关停,并称核心群体与 Moonshot AI 相关人员有关。

    推荐理由:还原了推理蒸馏攻击的时间线与平台差异,可看到同一模型在不同云平台上防护并不一致。

9月28日周一
9月24日周四
9月23日周三
9月16日周三
8月25日周二
8月21日周五
  1. Hugging Face Blog62

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。

    推荐理由:官方给出三款 LFM2.5 草稿模型的加速数据与 llama.cpp、SGLang 接入方式,可据此评估端侧推理提速的落地成本。

8月17日周一
8月13日周四
  1. Microsoft Research39

    MindTopo 基准揭示 VLM 空间推理能力短板

    Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型的拓扑推理能力,覆盖连通性、封闭性、顺序、分离与绳结五类关系,并区分静态推理与交互规划两个层级。测试显示,当前模型在静态识别上明显优于交互规划,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧保留结构约束时才有帮助。

8月12日周三
  1. Google Research36

    Google 研究:召回而非编码是前沿 LLM 事实性的瓶颈

    Google Research 提出知识画像框架,用 WikiProfile 基准(2,150 条维基百科事实、每条配 10 道题)区分编码与召回失败。Gemini-3-Pro 和 GPT-5 有 95–98% 的事实已编码,却仍无法直接召回 26–34% 的事实,开启思考后仍有 11–12% 失败。Gemma 3 系列显示模型规模扩大主要改善存储而非取用,瓶颈正从知识获取转向知识利用。

7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把数十年内核经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,新增结构化 CUDA-to-MLX 翻译层,让 CUDA 内核作为知识库被改写为 Apple Silicon 内核。

    推荐理由:展示了把 CUDA 内核优化经验迁移到 Apple Silicon 的结构化翻译层,读者可了解跨硬件内核迁移的具体做法与实测差距。

7月26日周日
  1. Berkeley AI Research35

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的交互摘要隔离为自然语言"信念状态"并对其内容进行监督评分,以缓解递归摘要带来的性能损失。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。

7月10日周五
7月2日周四
  1. Mistral AI66

    Mistral 发布 Leanstral 1.5:119B 总参数、6B 激活的形式化验证模型

    Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的形式化验证模型,119B 总参数、6B 激活参数,在 miniF2F 上达到 100%,解出 PutnamBench 672 题中的 587 题,并在 FATE-H 取得 87%、FATE-X 取得 34%。

    推荐理由:原文给出模型规模、基准成绩与每道题成本对比,读者可据此判断形式化验证的实用门槛。

6月27日周六
6月25日周四
6月18日周四
  1. OpenAI News60

    OpenAI 用 GPT-5.5 Instant 提升 ChatGPT 健康智能

    OpenAI 发布 GPT-5.5 Instant,用于改进 ChatGPT 在健康与养生问题上的回答,官方称其在推理、上下文理解、表达清晰度上有所增强。该版本还引入了由医生参与设计的评估方式。

    推荐理由:官方披露 GPT-5.5 Instant 在健康问答上的能力变化,读者可据此判断 ChatGPT 医疗场景的可用性。

6月11日周四
6月3日周三
  1. OpenAI News62

    OpenAI 为 GPT-Rosalind 引入生命科学新能力

    OpenAI 为 GPT-Rosalind 引入新能力,用于推进生命科学研究。该模型增强了生物推理、药物化学专业知识、基因组分析和实验工作流能力。

    推荐理由:OpenAI 为 GPT-Rosalind 增加生命科学能力,读者可了解该模型在生物推理与基因组分析上的定位。

5月20日周三
  1. OpenAI News78

    OpenAI 模型推翻离散几何核心猜想

    OpenAI 称其模型解决了有 80 年历史的单位距离问题,推翻了离散几何中的一个重要猜想,被视为 AI 驱动数学研究的一个里程碑。

    推荐理由:OpenAI 模型推翻离散几何中悬置 80 年的核心猜想,可观察 AI 在数学证明上的实际进展。

5月14日周四
5月12日周二
5月8日周五
  1. Berkeley AI Research34

    自适应并行推理:高效推理扩展的下一个范式

    一篇综述指出,并行推理正从固定 fork-and-join、树搜索等外部预设结构,转向让模型自行决定何时分解子任务、开多少并行线程以及如何协调的自适应并行推理。文中梳理了 Self-consistency、Best-of-N、MCTS、ParaThinker、GroupThink、Hogwild! Inference 等方法,并指出顺序推理的 token 增长会带来上下文退化和延迟问题。

5月7日周四
4月24日周五
  1. Hugging Face Blog88

    DeepSeek-V4 发布:百万 token 上下文面向智能体任务

    DeepSeek 发布 V4,在 Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活,DeepSeek-V4-Flash 为 284B 总参数、13B 激活,均支持 1M token 上下文窗口。

    推荐理由:原文拆解了 V4 混合注意力如何把 1M 上下文的 KV cache 压到约 2%,并给出智能体基准对比,便于判断长任务部署成本。

4月22日周三
4月20日周一
  1. Berkeley AI Research42

    GRASP:面向世界模型的梯度规划器,让长时程规划更稳健

    伯克利 AI 研究团队提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中优化病态、非贪心结构导致的局部极小值以及高维潜空间失效模式等问题,使基于梯度的规划更稳健。

4月16日周四
  1. Google Research42

    Google 提出 Simula:用机制设计从第一性原理生成合成数据

    Google 提出推理优先的合成数据框架 Simula,无需种子数据,将生成过程拆解为全局多样化、局部多样化、复杂化和质量检查四个可控步骤。该框架用 Gemini 2.5 Flash 作教师模型、Gemma-3 4B 作学生模型,在网络安全、法律推理、GSM8k 和 Global MMLU 五个领域各生成最多 512K 数据点,完整系统在所有领域均优于简单基线。

3月25日周三
3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的模型,采用 Apache 2.0 许可开源。

    推荐理由:Mistral 首次把推理、多模态与编码能力合并进单一小模型,并给出可调推理强度与部署门槛。

  2. Mistral AI62

    Mistral 发布 Leanstral:面向 Lean 4 的开源代码智能体

    Mistral AI 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。

    推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出与 Claude 系列及开源模型的成本与得分对比,可据此判断形式化验证路线的性价比。

3月13日周五
2月20日周五
2月13日周五
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3 Deep Think 升级版

    Google DeepMind 发布 Gemini 3 Deep Think 重大升级,这一专用推理模式面向科学、研究与工程难题。官方称其在 Humanity's Last Exam 上取得 48.4%(无工具)、ARC-AGI-2 上 84.6%、Codeforces 上 Elo 3455,并在 2025 国际数学奥林匹克达到金牌水平。

    推荐理由:官方给出 Deep Think 在 HLE、ARC-AGI-2、Codeforces 等基准上的具体成绩,并说明 API 早期访问入口,便于判断其科研与工程定位。