Google 发布 SensorFM:面向可穿戴健康数据的通用基础模型
Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自 500 万名同意参与者、100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,并给出跨 35 项健康任务的泛化与标签效率证据。
Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料超过一万亿分钟多模态信号,来自 500 万名同意参与者、100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
推荐理由:Google 用一万亿分钟可穿戴数据预训练通用生理表征,并给出跨 35 项健康任务的泛化与标签效率证据。
Google 在 Nature 发表研究,提出 PHRM 系统,利用手机前摄在面部解锁后拍摄 8 秒视频,通过深度学习在后台估算心率和静息心率。在自由生活研究中,PHRM 心率估算整体 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm,并在所有肤色组别达到 MAPE 低于 10%。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开最大规模手机视频数据集与预训练模型,可看 rPPG 在真实场景的落地边界。
Google Research 在 EMNLP 2025 发表的论文提出分解式意图提取方法:先用小型多模态 LLM 逐屏总结用户交互,再从摘要序列中提取意图,在移动端和网页轨迹上均优于 CoT 与端到端微调。该方法用 Gemini 1.5 Flash 8B 即可达到 Gemini 1.5 Pro 相当的效果,成本与速度更优,适用于端侧部署。
Google 提出基于时序卷积网络(TCN)的多头深度学习模型,仅用单只 Pixel Watch 的 50 Hz IMU 信号和用户身高,即可直接估算步速、步长、摆动时间、支撑时间和双脚支撑时间等步态指标。在 246 名参与者、约 7 万个步行片段的大规模验证中,多数指标达到 Pearson r >0.80、ICC >0.80,与 Pixel 6 手机估算结果无显著差异(p >0.05)。
Google Research 介绍一种端到端语音到语音翻译(S2ST)模型,可在保留原说话人音色的同时实现实时翻译,延迟仅 2 秒,而现有系统通常有 4–5 秒延迟且会累积误差。
推荐理由:Google 端到端语音翻译把延迟压到 2 秒并保留原说话人音色,读者可了解其数据管线与流式架构。
Google Research 提出可证明隐私洞察(PPI),结合 LLM、差分隐私(DP)和可信执行环境(TEE),对非结构化 GenAI 数据做分析,保证个体数据不可被查看、聚合结果匿名。
NVIDIA 发布 Nemotron Post-Training Dataset V2,将此前的英文推理数据翻译为法语、德语、意大利语、日语和西班牙语五种语言,规模 600 万条。
Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D,号称全球最大的开源自动驾驶数据集,包含 90+ TB 多模态数据、5000+ 小时驾驶记录,来自德国 30 个城市的 60 辆驾校电动车。
推荐理由:L2D 以 90TB 多模态驾驶数据补齐端到端自动驾驶训练集缺口,并给出 LeRobot 接入方式与分阶段发布计划。