跳到正文

#数据/训练

今日 0 条
10月1日周四
9月21日周一
9月16日周三
9月11日周五
9月4日周五
  1. Google Research31

    Google Research 研究跨人群多基因风险评分的迁移学习

    Google Research 用 UK Biobank 的数十万欧洲样本与近 20 万日本人的 Biobank Japan 数据,在 8 项临床性状上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达到 15k 以上时,加入欧洲数据反而限制精度提升;遗传相关性高的性状可继续受益至 25-40k+ 样本,而 HDL、LDL 和血糖等高度人群特异性性状受益更小。

  2. Google Research60

    Google 与 HHMI Janelia 等发布完整雄性果蝇脑连接组图谱

    Google 与 HHMI Janelia 及剑桥等合作者在 Cell 发表论文,发布完整雄性果蝇大脑与中枢神经系统连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。

    推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体作用。

9月2日周三
  1. Hugging Face Blog36

    Hugging Face 推出 BenchMIRT:LLM 基准测试究竟在测什么?

    Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的新方法,基于多维 IRT(MIRT)分离同一基准中混杂的能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,未被告知基准对应能力,却自行稳定复现出安全与通用推理两个主导维度。分析显示 BBQ、WMDP 等安全基准的得分与通用推理关联更强,说明单一基准分数可能混合多种信号。

8月28日周五
  1. Google Research66

    Google 发布行星预测引擎 PPE,自动完成地理空间建模全流程

    Google 在 Earth AI 计划下推出实验性研究能力 planetary prediction engine(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,并生成报告,把原本需要数周人工数据工程的建模过程压缩到几分钟。

    推荐理由:Google 官方给出 PPE 在公共卫生、粮食安全与疫情预测上的基准对比,可看自主地理空间建模的自动化程度。

8月27日周四
8月25日周二
8月24日周一
  1. Import AI22

    Import AI 470:机器不应享有权利;用 SPADE 自动生成训练环境;用 Hawkeye 构建更好的 GPU kernel

    METR 研究显示 AI 对科学的加速并不均衡:网络安全漏洞报告速度在 2026 年大幅加快,数学研究仅小幅加速,AI 研究本身则无可测量的加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行环境和求解环境,在 Qwen3-30B-A3B 上游戏环境套件平均分达 58.3,比基线高 8.1。

8月22日周六
  1. Google Research39

    Google 推出 Biomarker Discovery Framework:从可穿戴传感器数据中优先筛选候选生物标志物

    Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序结构化为迭代研究循环的多智能体系统。该系统在三个队列共 9,279 条参与者观测中自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢候选标志物,并构建出睡眠时长变异性、心血管适能指数(步数除以静息心率)等新复合特征。

8月21日周五
  1. Google Research22

    Google 研究:如何用移动性数据让语言模型更深入理解地点

    Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名化移动性模式与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。在公开基准上,该方法使访问意图预测相对提升最高 81.9%,价格水平分类提升 75.1%,繁忙度估计准确率提升 24.7%。框架通过访问对齐、空间多尺度访问传播和文本-移动性协同三步流程,缓解稀疏地点数据不足的问题。

  2. Microsoft Research42

    微软 Skala 1.1 发布:训练数据增至 2.5 倍,并集成进 CP2K 等主流 DFT 软件

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已可在 CP2K 中使用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软推出持续追踪各版本计算性能的 living benchmark。

8月17日周一
  1. Google Research60

    Google 研究 PhotoScan:用手机照片估算体成分并预测胰岛素抵抗

    Google Research 提出 PhotoScan,一个从普通 2D 手机照片估算体脂率、Android-to-Gynoid 脂肪比(A/G)和内脏与皮下脂肪面积比(V/S)的深度学习框架,用于预测胰岛素抵抗。

    推荐理由:Google 用手机照片估算体成分并预测胰岛素抵抗,给出了与 DXA 的误差对比和分类指标,可看非侵入筛查的可行性边界。

8月12日周三
  1. Google Research36

    Google 研究:召回而非编码是前沿 LLM 事实性的瓶颈

    Google Research 提出知识画像框架,用 WikiProfile 基准(2,150 条维基百科事实、每条配 10 道题)区分编码与召回失败。Gemini-3-Pro 和 GPT-5 有 95–98% 的事实已编码,却仍无法直接召回 26–34% 的事实,开启思考后仍有 11–12% 失败。Gemma 3 系列显示模型规模扩大主要改善存储而非取用,瓶颈正从知识获取转向知识利用。

8月11日周二
8月10日周一
7月31日周五
  1. Google Research62

    Google Research 提出 Science One Framework:用 Chain-of-Evidence 实现可验证的自主科研

    Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并据此构建自主科研原型 Science One Framework 与自动化审计指标 CoE Audit。

    推荐理由:原文给出可验证性框架与审计指标,并对比基线系统的引用幻觉率,读者可据此理解自主科研智能体的可信度问题。

7月26日周日
  1. Berkeley AI Research35

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的交互摘要隔离为自然语言"信念状态"并对其内容进行监督评分,以缓解递归摘要带来的性能损失。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。

7月16日周四
  1. Google Research31

    Google Research 揭示扩散模型创造力来源:score smoothing 机制解析

    Google Research 在 ICLR 2026 论文中揭示扩散模型的创造力源于神经网络训练中的 score smoothing 效应:权重衰减等正则化使模型学到平滑的 score function,让去噪过程在训练数据点之间插值,从而生成新样本而非简单记忆。研究通过一维实验验证,权重衰减越强,插值区域越明显,即使无显式正则化,梯度训练的隐式正则化也能产生类似效果。

7月9日周四
  1. Google Research62

    Google 发布 SensorFM:面向可穿戴健康数据的通用基础模型

    Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自 500 万名同意参与者、100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。

    推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,并给出跨 35 项健康任务的泛化与标签效率证据。

6月30日周二
6月29日周一
6月19日周五
  1. Hugging Face Blog41

    Hugging Face 提出 MosaicLeaks:深度研究智能体能否守住秘密?

    Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,测试模型普遍泄露私有信息,且只训练任务性能会加剧泄露。其提出的 Privacy-Aware Deep Research(PA-DR)强化学习方法将严格链成功率从 48.7% 提升至 58.7%,同时把答案/全信息泄露从 34.0% 降至 9.9%。

6月17日周三
5月20日周三
5月16日周六
  1. Google DeepMind38

    Google Co-Scientist 加速肝病机制发现,提出 MASH 组合疗法新假说

    爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁,该假说随后经实验验证。团队还借此筛选出可供测试的候选组合疗法,并尝试解释 resmetirom 为何仅对少数符合条件的 MASH 患者有效。

4月22日周三
4月21日周二
4月16日周四
  1. Google Research42

    Google 提出 Simula:用机制设计从第一性原理生成合成数据

    Google 提出推理优先的合成数据框架 Simula,无需种子数据,将生成过程拆解为全局多样化、局部多样化、复杂化和质量检查四个可控步骤。该框架用 Gemini 2.5 Flash 作教师模型、Gemma-3 4B 作学生模型,在网络安全、法律推理、GSM8k 和 Global MMLU 五个领域各生成最多 512K 数据点,完整系统在所有领域均优于简单基线。

  2. Google Research36

    Google Research 用 AI 合成神经元加速脑图谱绘制,重建误差降低 4.4%

    Google Research 提出神经元形态生成模型 MoGen,通过 PointInfinity 点云流匹配生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建误差降低 4.4%,主要来自合并错误的减少。在完整小鼠脑规模下,这相当于节省 157 人年的手动校对工作。MoGen 已开源,相关论文将在 ICLR 2026 展示。

  3. Hugging Face Blog33

    Ecom-RLVE:面向电商对话智能体的自适应可验证环境

    Hugging Face 将 RLVE 框架从单轮推理题扩展到多轮、工具增强的电商对话,推出 EcomRLVE-GYM,包含商品发现、替代品、购物车搭建、退货、订单跟踪、政策问答、组合规划、多意图旅程 8 个可验证环境,每个环境配有程序化出题、12 轴难度课程和算法可验证奖励。团队用 DAPO 训练 Qwen 3 8B 模型 300 步,早期结果显示环境扩展与自适应难度可迁移到真实智能体任务。

4月9日周四
4月1日周三
3月31日周二
  1. Hugging Face Blog22

    OpenMed 用 165 美元训练跨 25 物种的 mRNA 语言模型

    OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其中 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后将模型扩展至 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。