Hugging Face 提出离线 Top-K Logits 与融合分块 KL 损失,让知识蒸馏低成本跑起来
Hugging Face 最新论文提出两项系统改动降低 LLM 知识蒸馏成本:离线缓存教师模型每位置的 top-100 logits,使教师无需与学生同时驻留显存;融合分块 KL 损失避免生成完整的词表×序列长度矩阵。
Hugging Face 最新论文提出两项系统改动降低 LLM 知识蒸馏成本:离线缓存教师模型每位置的 top-100 logits,使教师无需与学生同时驻留显存;融合分块 KL 损失避免生成完整的词表×序列长度矩阵。
多伦多大学、Vector Institute、剑桥大学与ServiceNow的研究者构建了一个原型AI蠕虫,利用被攻陷机器的GPU运行开源权重LLM进行推理,自主发现漏洞并发起攻击,漏洞检测成功率约80%、利用成功率约53%、自我复制成功率88%,整体攻击成功率约37%。
OpenAI 公布在数学与理论计算机科学长期未解问题上的新结果,涵盖几何、密码学和复杂度等方向。材料仅提供摘要,未给出具体问题、方法或数据。
推荐理由:OpenAI 公布数学与理论计算机科学十项进展,读者可了解其在几何、密码学与复杂度上的问题覆盖范围。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并据此构建自主科研原型 Science One Framework 与自动化审计指标 CoE Audit。
推荐理由:原文给出可验证性框架与审计指标,并对比基线系统的引用幻觉率,读者可据此理解自主科研智能体的可信度问题。
本期 Import AI 汇总多项研究:Epoch 与 METR 发布 MirrorCode 基准,考察 AI 仅凭 CLI 访问重实现软件的能力,25 个目标程序中 17 个有满分运行,Opus 4.7 用 14 小时、251 美元推理成本完成一项人类需 2-17 周的任务。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的交互摘要隔离为自然语言"信念状态"并对其内容进行监督评分,以缓解递归摘要带来的性能损失。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。
Google Research 发布论文 SymptomAI,用五个 Gemini Flash 2.0 症状问诊智能体开展 n=13,917 的全国随机研究,参与者向智能体描述症状并得到鉴别诊断(DDx)与后续建议。
推荐理由:Google 用 13917 人随机对照研究比较五种 Gemini Flash 2.0 症状问诊智能体,并给出临床专家盲评与 Fitbit 生理信号对照结果。
Google Research 在 Nature 发表论文,提出一种强化学习框架,让智能体从量子纠错检测事件中学习,在计算过程中持续调整数千个控制参数以对抗漂移。在 Willow 超导处理器上,该方法将纠错码的逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步把逻辑错误率压低 20%,使表面码逻辑错误降至每千个纠错周期不到一次。数百量子比特的数值模拟显示,所需 RL 训练轮数不随系统规模增长。
推荐理由:Google 用强化学习让量子纠错在计算过程中持续校准控制参数,读者可了解其方法与 Willow 处理器上的实测结果。
Google Research 在 ICLR 2026 论文中揭示扩散模型的创造力源于神经网络训练中的 score smoothing 效应:权重衰减等正则化使模型学到平滑的 score function,让去噪过程在训练数据点之间插值,从而生成新样本而非简单记忆。研究通过一维实验验证,权重衰减越强,插值区域越明显,即使无显式正则化,梯度训练的隐式正则化也能产生类似效果。
Hume 发布 Real World VoiceEQ 语音 AI 评测基准,覆盖 40 多个专有与开源语音模型、15+ 评测维度和 60+ 指标,涵盖 ASR、TTS、S2S 和语音理解。
推荐理由:Hume 用超百万条人类评分构建语音评测基准,揭示现有基准高估真实表现的问题。
Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自 500 万名同意参与者、100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,并给出跨 35 项健康任务的泛化与标签效率证据。
OpenAI 发布的新分析揭示了流行编码基准 SWE-Bench Pro 存在的问题,引发对其评估 AI 模型时可靠性与准确性的担忧。
Google Research 在 Nature Cities 发表研究,在 10 座美国城市开展为期六个月的实验,通过修改 Google Maps 算法将遇到预设拥堵路段的行程引导至耗时相近的替代路线,仅不到 2% 的行程收到改道建议。
推荐理由:Google Research 在 10 座美国城市做了为期半年的真实路网实验,给出了协调少量出行即可提升全城车速与减排的量化结果。
Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 跨框架迁移中的表现,涵盖 Spring、Jakarta EE、Quarkus 三大生态,包含 34 个应用、102 个框架实现和 204 个迁移任务。测试显示,即便最强智能体行为成功率也不足 10%,且 Claude Code 报告 30 个应用中 29 个构建成功,实际仅 22 个通过。
OpenAI 推出 GeneBench-Pro,一个用复杂真实数据集测试 AI 在基因组学、生物学和科研中表现的新基准。
Hugging Face 博客介绍 DiScoFormer(Density and Score Transformer),单次前向传播即可从一组数据点同时估计分布的密度与 score,无需针对新分布重新训练。
NVIDIA 推出 ENPIRE 框架,让编码智能体驱动真实机械臂自主实验与迭代,在 PushT、整理插针、切割扎带等任务上达到 99% 成功率,测试中还尝试了往主板插 GPU。
Google Research 提出线性弹性缓存,把页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境运行数月后,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。
Google Research 在 COLM 2026 发表的论文揭示,让模型生成推理轨迹能召回关闭推理时几乎无法获取的事实答案,实验覆盖 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B,在 SimpleQA Verified 和 EntityQuestions 上以 pass@k 衡量。
Hugging Face 与 Treble Technologies 联合发布 FFASR Leaderboard,这是首个开放的远场 ASR 基准,覆盖 14 个模拟房间并经过真实测量验证。所有提交模型在低 SNR 远场下的 WER 均比同内容近场高出数倍,榜单同时报告基于 NVIDIA L4 GPU 的 RTFx,用于权衡准确率与速度。多说话人、麦克风阵列与回声消除已在路线图中。
牛津大学、英国 AI 安全研究院、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即使专家自选议题、提前研究、接受数小时结构化训练并获 1,000 英镑奖金激励。
Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,测试模型普遍泄露私有信息,且只训练任务性能会加剧泄露。其提出的 Privacy-Aware Deep Research(PA-DR)强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄露从 34.0% 降至 9.9%。
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家,改进了药物制造中的一项关键反应,推进了药物化学研究。
推荐理由:OpenAI 与 Molecule.one 用 GPT-5.4 驱动的近自主 AI 化学家改进药物合成反应,可看 AI 在实验科学中的落地方式。
OpenAI 发布 LifeSciBench,这是一个由专家编写并评审的基准,用于评估 AI 系统处理真实生命科学研究任务与决策的能力。
Google Research 发布了一套矢量化的英国乡村生态特征数据集,将此前 Farmscapes 2020 的栅格地图转化为可操作的树篱、石墙和矮林清单。
OpenAI 推出 Deployment Simulation,通过真实对话数据在模型部署前预测其行为,以提升安全性和评估准确性。该方法旨在让发布前的模型行为预测更贴近实际部署场景。
Google 公布多项关于消费者使用 AI 工具理解皮肤问题的研究,其中发表于 JAMA Dermatology 的大规模调查显示,2345 名参与者借助 AI 工具尝试命名皮肤状况的比例超过 62%,命名准确率 23%,约为无辅助对照组 8% 的近三倍。研究同时发现,AI 辅助对判断下一步就医措施帮助有限,标准 AI 组的下一步准确率未出现统计显著提升。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。
Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,试验为期八周。
推荐理由:原文给出塞拉利昂随机对照试验的量化结果与师生互动数据,可了解 AI 辅助教学的实际效果与局限。
Google 在 Nature 发表研究,提出 PHRM 系统,利用手机前摄在面部解锁后拍摄 8 秒视频,通过深度学习在后台估算心率和静息心率。在自由生活研究中,PHRM 心率估算整体 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm,并在所有肤色组别达到 MAPE 低于 10%。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开最大规模手机视频数据集与预训练模型,可看 rPPG 在真实场景的落地边界。
Google 宣布把基于 Gemini 的科研工具 Empirical Research Assistance(ERA)开放给科学家使用,相关论文当天发表于 Nature。
推荐理由:Google 把 ERA 从 Nature 论文推进到可申请使用的工具,并给出八个跨学科应用案例,读者可据此判断科研编码自动化的落地边界。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁,该假说随后经实验验证。团队还借此筛选出可供测试的候选组合疗法,并尝试解释 resmetirom 为何仅对少数符合条件的 MASH 患者有效。
斯坦福大学医学院 Gary Peltz 团队在《Advanced Science》发表研究,测试 Google DeepMind 的 Co-Scientist 能否从已有药物文献中筛选出可重定位治疗肝纤维化的候选药物。
推荐理由:通过人类专家与 Co-Scientist 候选药物的对照实验,展示 AI 在药物重定位中的实际命中率差异。
Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入覆盖多口音、脚本化与对话语音的高质量英文 ASR 私有数据集,以防止 benchmaxxing 和测试集污染。默认 Average WER 仍仅基于公开数据集计算,用户可通过开关选择是否纳入私有数据集。该榜单自 2023 年 9 月上线以来访问量已超 710K 次。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公布 AI co-clinician 研究计划,给出医生盲评与远程问诊模拟中的具体对比结果。
OpenAI 提出一套新框架,分析 921 种职业和 1.48 亿个美国岗位,识别哪些角色面临自动化风险、重组、增长或受 AI 影响较小。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,把大规模训练拆分为解耦的计算“岛屿”,岛屿间异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出分布式训练新架构的带宽、容错与跨代硬件实测数据,可据此判断大规模预训练基础设施的演进方向。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功和失败经验中提炼高层结构化记忆的智能体记忆框架,代码已开源。
Hugging Face 发布 QIMMA قِمّة,一个在评测模型前先验证基准质量的阿拉伯语 LLM 排行榜,整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖 7 大领域且 99% 为原生阿拉伯语内容。
伯克利 AI 研究团队提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中优化病态、非贪心结构导致的局部极小值以及高维潜空间失效模式等问题,使基于梯度的规划更稳健。