Amazon Payments 如何用 Amazon SageMaker AI 上的上下文 bandit 提升获客漏斗转化
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂 bandit(LinUCB)做产品获客漏斗个性化,七周线上 A/B 测试中,一个人群最终漏斗转化率获得高个位数百分比相对提升,另一人群则未见改善,问题出在内容而非模型。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂 bandit(LinUCB)做产品获客漏斗个性化,七周线上 A/B 测试中,一个人群最终漏斗转化率获得高个位数百分比相对提升,另一人群则未见改善,问题出在内容而非模型。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf v6.1 成绩给出了 Vera Rubin 与 GB300 的吞吐对比和 99% 扩展效率,可据此判断推理基础设施的性价比走向。
Google Research 提出 Retrieve-for-Train 框架,用离线强化学习把奖励对齐的 fan-out 查询编译成监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询 fan-out,无需测试时 CoT 推理 token。
OpenAI 分享了一份由 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含一份书面说明和一份 Lean 形式化证明。
IBM 发布 Granite 4.2,这是其首个稠密、decoder-only 的推理模型家族,包含 3B、8B、30B 三个规模,均以 Apache 2.0 许可开源。
推荐理由:IBM 公开了 Granite 4.2 从预训练到多阶段 RL 的完整构建流程,可对照其数据配比与奖励设计理解推理模型的训练取舍。
Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。
Liquid AI 为 LFM2.5 家族的三款模型 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
推荐理由:官方给出三款 LFM2.5 草稿模型的加速数据与 llama.cpp、SGLang 接入方式,可据此评估端侧推理提速的落地成本。
OpenAI 预览新的 API 服务档 Ultrafast,运行 GPT-5.6 Sol 时最高提速 14 倍。该服务由 Cerebras 提供支持,输出速度最高可达每秒 750 个 token。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型的拓扑推理能力,覆盖连通性、封闭性、顺序、分离与绳结五类关系,并区分静态推理与交互规划两个层级。测试显示,当前模型在静态识别上明显优于交互规划,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧保留结构约束时才有帮助。
Google Research 提出知识画像框架,用 WikiProfile 基准(2,150 条维基百科事实、每条配 10 道题)区分编码与召回失败。Gemini-3-Pro 和 GPT-5 有 95–98% 的事实已编码,却仍无法直接召回 26–34% 的事实,开启思考后仍有 11–12% 失败。Gemma 3 系列显示模型规模扩大主要改善存储而非取用,瓶颈正从知识获取转向知识利用。
OpenAI 公布在数学与理论计算机科学长期未解问题上的新结果,涵盖几何、密码学和复杂度等方向。材料仅提供摘要,未给出具体问题、方法或数据。
推荐理由:OpenAI 公布数学与理论计算机科学十项进展,读者可了解其在几何、密码学与复杂度上的问题覆盖范围。
启用两个 API 设置后,GPT-5.6 在 ARC-AGI-3 基准上的得分提升至原来的三倍。这两个设置分别用于保留推理过程和启用压缩(compaction),在提升得分的同时也改善了效率。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,新增结构化 CUDA-to-MLX 翻译层,让 CUDA 内核作为知识库被改写为 Apple Silicon 内核。
推荐理由:展示了把 CUDA 内核优化经验迁移到 Apple Silicon 的结构化翻译层,读者可了解跨硬件内核迁移的具体做法与实测差距。
OpenAI 发布文章说明 GPT-5.6 在模型、推理和智能体工作流上提升了 AI 效率,目标是让每一美元带来更多可用智能。文章标题强调 GPT-5.6 将前沿智能与前沿效率结合。
推荐理由:OpenAI 官方解释 GPT-5.6 如何在模型、推理与智能体工作流上提升效率,读者可了解其单位成本智能的改进方向。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的交互摘要隔离为自然语言"信念状态"并对其内容进行监督评分,以缓解递归摘要带来的性能损失。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。
Hugging Face 博客发布《Profiling in PyTorch》系列第三部分,用 PyTorch 剖析 attention 的 profiler 表现。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的形式化验证模型,119B 总参数、6B 激活参数,在 miniF2F 上达到 100%,解出 PutnamBench 672 题中的 587 题,并在 FATE-H 取得 87%、FATE-X 取得 34%。
推荐理由:原文给出模型规模、基准成绩与每道题成本对比,读者可据此判断形式化验证的实用门槛。
Google Research 发布一种新架构,将多 Token 预测(MTP)头挂载到已冻结的 Gemini Nano v3 模型上,作为端侧推理的即插即用加速方案,已部署到 Pixel 9 和 10 系列。
推荐理由:Google 把 MTP 头挂到冻结的 Gemini Nano v3 上,读者可了解端侧推理在内存与能耗约束下的具体优化路径。
Google Research 在 COLM 2026 发表的论文揭示,让模型生成推理轨迹能召回关闭推理时几乎无法获取的事实答案,实验覆盖 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B,在 SimpleQA Verified 和 EntityQuestions 上以 pass@k 衡量。
OpenAI 发布 GPT-5.5 Instant,用于改进 ChatGPT 在健康与养生问题上的回答,官方称其在推理、上下文理解、表达清晰度上有所增强。该版本还引入了由医生参与设计的评估方式。
推荐理由:官方披露 GPT-5.5 Instant 在健康问答上的能力变化,读者可据此判断 ChatGPT 医疗场景的可用性。
研究者使用 OpenAI 的推理模型辅助诊断罕见疾病,在先前未解决的病例中新增 18 例确诊。该结果来自对儿童罕见遗传病诊断场景的尝试。
推荐理由:材料给出推理模型在罕见病诊断中的实际命中数量,可据此了解AI在临床疑难病例中的应用边界。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上最高实现 4 倍推理提速。
推荐理由:官方给出 26B MoE 文本扩散模型的速度数据与硬件门槛,读者可据此判断本地低并发场景的取舍。
OpenAI 为 GPT-Rosalind 引入新能力,用于推进生命科学研究。该模型增强了生物推理、药物化学专业知识、基因组分析和实验工作流能力。
推荐理由:OpenAI 为 GPT-Rosalind 增加生命科学能力,读者可了解该模型在生物推理与基因组分析上的定位。
OpenAI 称其模型解决了有 80 年历史的单位距离问题,推翻了离散几何中的一个重要猜想,被视为 AI 驱动数学研究的一个里程碑。
推荐理由:OpenAI 模型推翻离散几何中悬置 80 年的核心猜想,可观察 AI 在数学证明上的实际进展。
Hugging Face 发文解析连续批处理中的同步瓶颈:用 8B 模型、batch size 32 生成 8K tokens 时,总耗时 300.6 秒,其中 24.0% 的时间 GPU 在等待 CPU,纯属浪费。
Hugging Face 发文解析 AWS 上基础模型训练与推理的开源软件栈分层架构,涵盖 Slurm、Kubernetes、PyTorch、JAX 及 Prometheus、Grafana 等工具。
一篇综述指出,并行推理正从固定 fork-and-join、树搜索等外部预设结构,转向让模型自行决定何时分解子任务、开多少并行线程以及如何协调的自适应并行推理。文中梳理了 Self-consistency、Best-of-N、MCTS、ParaThinker、GroupThink、Hogwild! Inference 等方法,并指出顺序推理的 token 增长会带来上下文退化和延迟问题。
PipelineRL 在 vLLM V0 到 V1 迁移中通过修复四项问题让 V1 与 V0 参考对齐:改用 processed_logprobs、显式设置 V1 运行时默认值、调整 inflight 权重更新路径,以及最终投影使用 fp32 lm_head。
DeepSeek 发布 V4,在 Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活,DeepSeek-V4-Flash 为 284B 总参数、13B 激活,均支持 1M token 上下文窗口。
推荐理由:原文拆解了 V4 混合注意力如何把 1M 上下文的 KV cache 压到约 2%,并给出智能体基准对比,便于判断长任务部署成本。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功和失败经验中提炼高层结构化记忆的智能体记忆框架,代码已开源。
伯克利 AI 研究团队提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中优化病态、非贪心结构导致的局部极小值以及高维潜空间失效模式等问题,使基于梯度的规划更稳健。
Google 提出推理优先的合成数据框架 Simula,无需种子数据,将生成过程拆解为全局多样化、局部多样化、复杂化和质量检查四个可控步骤。该框架用 Gemini 2.5 Flash 作教师模型、Gemma-3 4B 作学生模型,在网络安全、法律推理、GSM8k 和 Global MMLU 五个领域各生成最多 512K 数据点,完整系统在所有领域均优于简单基线。
Google 发布 TurboQuant 压缩算法,并配套提出 QJL 和 PolarQuant,用于解决向量量化中的内存开销问题,三篇工作将分别亮相 ICLR 2026 和 AISTATS 2026。
推荐理由:Google 提出三种向量量化算法,在 KV cache 压缩与向量搜索上给出可复用的压缩思路与基准结果。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个重要版本,也是 Mistral 首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型中的模型,采用 Apache 2.0 许可开源。
推荐理由:Mistral 首次把推理、多模态与编码能力合并进单一小模型,并给出可调推理强度与部署门槛。
Mistral AI 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。
推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出与 Claude 系列及开源模型的成本与得分对比,可据此判断形式化验证路线的性价比。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在特征、数据和模型组件归因中识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步利用层级结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
十年前的 AlphaGo 成为首个击败围棋世界冠军的 AI 系统,其"第 37 手"证明 AI 能超越模仿人类、发现全新策略。此后 DeepMind 将这一搜索与强化学习思路延伸至 AlphaFold 2(已折叠 2 亿个蛋白质结构,超 300 万研究者使用)、AlphaProof、AlphaEvolve 及 Gemini Deep Think 等系统,并因此获得 2024 年诺贝尔化学奖。
OpenAI 提出 CoT-Control,发现推理模型难以控制自己的思维链,这反而强化了可监控性作为 AI 安全防护手段的价值。
推荐理由:OpenAI 提出 CoT-Control 并观察到推理模型难以控制自身思维链,为可监控性作为安全手段提供了依据。
Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手在航班推荐任务中的预测,从而学会概率推理。在五轮模拟用户交互中,未经训练的 LLM 表现远逊于最优贝叶斯助手,且往往在单次交互后性能就停滞;而贝叶斯教学不仅提升该任务表现,还能泛化到其他任务。