跳到正文

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

最新精选

第 21–40 条 · 共 88 条
6月17日周三
6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap 与智能体安全技术框架

    Google DeepMind 发布 AI Control Roadmap,用于在 Google 内部构建和管理高级 AI 的防御纵深框架,将内部智能体视为可能未对齐的潜在内部威胁,并基于 MITRE ATT&CK 拆解攻击战术与技术。

    推荐理由:Google DeepMind 公开内部 AI 控制路线图,给出分级检测与响应机制,可供部署智能体的团队参考。

6月8日周一
  1. Google DeepMind66

    Google DeepMind 在塞拉利昂开展 AI 学习随机对照试验

    Google DeepMind 公布在塞拉利昂开展的预注册随机对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度,试验为期八周。

    推荐理由:原文给出塞拉利昂随机对照试验的量化结果与师生互动数据,可了解 AI 辅助教学的实际效果与局限。

6月5日周五
  1. Google Research66

    Google 研究用手机前摄实现被动心率监测

    Google 在 Nature 发表研究,提出 PHRM 系统,利用手机前摄在面部解锁后拍摄 8 秒视频,通过深度学习在后台估算心率和静息心率。在自由生活研究中,PHRM 心率估算整体 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm,并在所有肤色组别达到 MAPE 低于 10%。

    推荐理由:Google 用手机前摄在解锁后被动测心率,并公开最大规模手机视频数据集与预训练模型,可看 rPPG 在真实场景的落地边界。

5月20日周三
  1. OpenAI News78

    OpenAI 模型推翻离散几何核心猜想

    OpenAI 称其模型解决了有 80 年历史的单位距离问题,推翻了离散几何中的一个重要猜想,被视为 AI 驱动数学研究的一个里程碑。

    推荐理由:OpenAI 模型推翻离散几何中悬置 80 年的核心猜想,可观察 AI 在数学证明上的实际进展。

5月16日周六
  1. Google DeepMind60

    斯坦福团队用 Co-Scientist 筛选抗肝纤维化药物,两候选成功阻断纤维化

    斯坦福大学医学院 Gary Peltz 团队在《Advanced Science》发表研究,测试 Google DeepMind 的 Co-Scientist 能否从已有药物文献中筛选出可重定位治疗肝纤维化的候选药物。

    推荐理由:通过人类专家与 Co-Scientist 候选药物的对照实验,展示 AI 在药物重定位中的实际命中率差异。

5月12日周二
  1. Google DeepMind74

    Google DeepMind 发布 Co-Scientist 多智能体科研系统

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论并演化复杂科学问题的新假设。

    推荐理由:原文披露了多智能体系统的三阶段架构与辩论式排序机制,并给出多个实验室的落地案例,可据此判断 AI 参与科学假设生成的实际边界。

4月30日周四
4月29日周三
  1. Hugging Face Blog60

    Granite 4.1 LLM 是如何构建的:IBM 公开预训练、SFT 与 RL 全流程

    IBM Granite 团队发布技术长文,详解 Granite 4.1 系列稠密解码器模型(3B、8B、30B)的构建流程:在约 15T token 上分五阶段预训练,上下文窗口经分阶段扩展至 512K,随后用约 4.1M 高质量样本做 SFT,并通过 on-policy GRPO 配合 DAPO loss 的多阶段 RL 强化数学、编码、指令遵循与通用对话能力。

    推荐理由:Granite 4.1 完整披露五阶段预训练、SFT 与多阶段 RL 的数据配比和训练配置,可对照其 8B 稠密模型追平 32B-A9B MoE 的结论。

4月22日周三
3月31日周二
  1. Google Research66

    Google 发布白皮书:量子计算机破解加密货币加密所需资源大幅降低

    Google Quantum AI 发布白皮书,估算未来量子计算机破解保护加密货币的椭圆曲线密码(ECDLP-256)所需的量子资源比此前认为的更少。

    推荐理由:Google Quantum AI 给出破解 ECDLP-256 的最新量子资源估算,并用零知识证明披露漏洞,读者可了解量子威胁与后量子迁移的紧迫性。

3月25日周三
3月18日周三
3月5日周四
2月13日周五
  1. OpenAI News75

    GPT-5.2 在理论物理中推导出新结果

    OpenAI 发布新预印本,显示 GPT-5.2 为胶子振幅提出了一个新公式,随后由 OpenAI 与学术合作者完成形式化证明与验证。

    推荐理由:OpenAI 与学术合作者披露 GPT-5.2 提出胶子振幅新公式并被形式化证明,可观察大模型参与理论物理推导的边界。

2月10日周二
  1. Google DeepMind71

    Google DeepMind 用 Gemini Deep Think 加速数学与科学发现

    Google DeepMind 发布两篇论文,介绍在数学家、物理学家和计算机科学家指导下,用 Gemini Deep Think 模式求解专业研究问题。团队构建了由 Deep Think 驱动的数学研究智能体 Aletheia,具备自然语言验证器、可迭代生成与修正,并能承认无法求解,在 IMO-ProofBench Advanced 上得分最高达 90%。

    推荐理由:DeepMind 公开了 Gemini Deep Think 在数学与理论计算机科学上的研究级成果,并给出人机协作的分类框架。

1月28日周三
  1. Google Research62

    Google Research 论文:智能体系统规模化何时有效、为何有效

    Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 种智能体配置做大规模对照评测,覆盖 Finance-Agent、BrowseComp-Plus、PlanCraft、Workbench 四个基准和 GPT、Gemini、Claude 三个模型家族,挑战了“智能体越多越好”的假设。

    推荐理由:通过 180 种智能体配置的对照评测,给出多智能体架构在并行与顺序任务上的量化差异,可作为架构选型参考。

1月20日周二
  1. Hugging Face Blog62

    微软发布 Differential Transformer V2:差分注意力无需自定义 kernel

    微软团队发布 Differential Transformer V2,通过为每个 token 和每个 head 投影 λ 并只增加 query head 数量、保持 KV head 不变,使解码速度与标准 Transformer 持平且无需自定义注意力 kernel。

    推荐理由:微软团队给出 Differential Transformer V2 的注意力实现与消融对比,读者可了解差分注意力在解码速度与训练稳定性上的取舍。