Google Research 提出 AI 视频联合导演框架,实现连贯长视频生成
Google Research 发布 AI video co-director 研究,这是一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成多镜头连贯的长视频。
推荐理由:Google 把长视频生成拆成四个协同框架,并给出多镜头一致性与角色保持的评测结果,可了解其技术路线。
Google Research 发布 AI video co-director 研究,这是一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成多镜头连贯的长视频。
推荐理由:Google 把长视频生成拆成四个协同框架,并给出多镜头一致性与角色保持的评测结果,可了解其技术路线。
Google Research 公布一项研究实验,让教师借助生成式 UI(GenUI)为课程目标动态生成互动式学习模拟,并发布 30 多个面向中学 STEM 的英文示例库,覆盖物理、化学、生物和数学。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、预测增强并定位甲烷羽流,在专家标注羽流上召回率达 84%。
Google 在 CHI 2026 发布研究原型 AgentHands,让 XR 中的 AI 智能体在说话时同步做出与语音对齐的手势,把抽象指令变成空间中的实体演示。
Google Research 提出 PhotoScan,一个从普通 2D 手机照片估算体脂率、Android-to-Gynoid 脂肪比(A/G)和内脏与皮下脂肪面积比(V/S)的深度学习框架,用于预测胰岛素抵抗。
推荐理由:Google 用手机照片估算体成分并预测胰岛素抵抗,给出了与 DXA 的误差对比和分类指标,可看非侵入筛查的可行性边界。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型的拓扑推理能力,覆盖连通性、封闭性、顺序、分离与绳结五类关系,并区分静态推理与交互规划两个层级。测试显示,当前模型在静态识别上明显优于交互规划,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧保留结构约束时才有帮助。
Google Research 发布 AMIE (Video),一个基于 Gemini 和 Project Astra 的实时视频临床问诊系统,可感知非语言线索、引导虚拟体格检查并实时进行诊断推理。
推荐理由:Google 公布 AMIE 视频版在 300 场随机 OSCE 中与初级保健医生评分相当,并给出异步多智能体架构与局限说明。
Microsoft Research 发布研究模型 CARE-X,一个统一胸部 X 光 VLM,同时支持报告生成与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。
Google Research 发布论文 SymptomAI,用五个 Gemini Flash 2.0 症状问诊智能体开展 n=13,917 的全国随机研究,参与者向智能体描述症状并得到鉴别诊断(DDx)与后续建议。
推荐理由:Google 用 13917 人随机对照研究比较五种 Gemini Flash 2.0 症状问诊智能体,并给出临床专家盲评与 Fitbit 生理信号对照结果。
Google Research 发布了一套矢量化的英国乡村生态特征数据集,将此前 Farmscapes 2020 的栅格地图转化为可操作的树篱、石墙和矮林清单。
Google 公布多项关于消费者使用 AI 工具理解皮肤问题的研究,其中发表于 JAMA Dermatology 的大规模调查显示,2345 名参与者借助 AI 工具尝试命名皮肤状况的比例超过 62%,命名准确率 23%,约为无辅助对照组 8% 的近三倍。研究同时发现,AI 辅助对判断下一步就医措施帮助有限,标准 AI 组的下一步准确率未出现统计显著提升。
Google 在 Nature 发表研究,提出 PHRM 系统,利用手机前摄在面部解锁后拍摄 8 秒视频,通过深度学习在后台估算心率和静息心率。在自由生活研究中,PHRM 心率估算整体 MAPE 为 6.09%,静息心率相对 Fitbit Charge 6 的 MAE 为 4.39 bpm,并在所有肤色组别达到 MAPE 低于 10%。
推荐理由:Google 用手机前摄在解锁后被动测心率,并公开最大规模手机视频数据集与预训练模型,可看 rPPG 在真实场景的落地边界。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公布 AI co-clinician 研究计划,给出医生盲评与远程问诊模拟中的具体对比结果。
Google Research 提出 MapTrace,一套面向多模态大模型的地图路径追踪任务、数据集与合成数据生成流程,并开源了用 Gemini 2.5 Pro 和 Imagen-4 生成的 200 万条问答对。
Google 在 ACM UIST 2025 上发布开源原型框架 DialogLab,用于编排、模拟和测试动态的人机多方群组对话。该框架将对话的社交设定与时间推进解耦,通过"编排-测试-验证"三阶段工作流支持拖拽式场景搭建、human control 实时干预和对话动态可视化分析。
Google Research 与 Google DeepMind 发现,主要用鸟类数据训练的 Perch 2.0 生物声学基础模型,在未接触任何水下音频的情况下,仍能作为嵌入模型迁移用于鲸类发声分类。
Google Research 在 EMNLP 2025 发表的论文提出分解式意图提取方法:先用小型多模态 LLM 逐屏总结用户交互,再从摘要序列中提取意图,在移动端和网页轨迹上均优于 CoT 与端到端微调。该方法用 Gemini 1.5 Flash 8B 即可达到 Gemini 1.5 Pro 相当的效果,成本与速度更优,适用于端侧部署。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3,513 个公开样本。
Google Research 在 NeurIPS 2025 发布大规模声音嵌入基准 MSEB,用统一框架评测检索、推理、分类、转录、分割、聚类、重排与重建八项听觉能力。
Google DeepMind 在 Nature 发表新研究,提出三步对齐方法,用 THINGS 数据集训练 SigLIP-SO400M 上的适配器生成百万级图像的 AligNet 数据集,再微调其他视觉模型,使其内部表征按人类概念层级重新组织。该方法改善了模型在“odd-one-out”任务上与人类判断的一致性,并提升了鲁棒性与泛化能力。
Google 发布三项生物圈研究成果:与 World Resources Institute 合作开发森林流失驱动因素模型,以 1km² 分辨率覆盖 2000-2024 年,并开放 30 米尺度砍伐风险预测基准数据集。
Google 发布 ForestCast,基于纯卫星数据与 vision transformers 预测森林砍伐风险,并公开首个面向该任务的基准数据集。模型仅用 Landsat 和 Sentinel 2 卫星数据及"变化历史"输入,精度可匹配或超过依赖道路、人口密度等专用地图的传统方法,且可在全球任意区域一致应用。团队同时公开全部输入、训练与评估数据,供社区复现并改进模型。
Google Research 在 UIST'25 发布 StreetReaderAI,一款面向盲人和低视力用户的可访问街景原型,基于 Gemini 提供 AI Describer 实时场景描述与 AI Chat 对话问答,支持键盘和语音导航。
Hugging Face 推出 FilBench 评测套件,覆盖文化知识、经典 NLP、阅读理解与生成四大类共 12 项任务,用于评估 LLM 在 Tagalog、Filipino 和 Cebuano 上的表现,并已评测 20+ 个 SOTA 模型。
TimeScope 是一个开源长视频理解基准,通过在 1 分钟到 8 小时的基础视频中插入 5-10 秒的短片段作为“针”,评测模型的局部检索、信息综合和细粒度时序感知三项能力。
Hugging Face 发布 ScreenSuite,一个面向 GUI Agent 的评测套件,整合 13 项基准,覆盖感知、定位、单步动作和多步智能体四类能力。
推荐理由:Hugging Face 开源 GUI Agent 评测套件,读者可了解其 13 项基准覆盖范围与纯视觉评测设定。
Hugging Face 发布 CinePile 2.0 长视频问答数据集,采用其提出的对抗式数据集精炼方法进行改进。CinePile 初版于 2024 年 5 月推出,包含约 30 万训练样本和 5000 测试样本,人类在该基准上比最好的商业视觉模型高 25%、比开源模型高 65%。CinePile 2.0 与 Hugging Face 合作完成,同时开源了对抗式精炼方法的实现。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,用 Llama-2-Chat-7b 以 1-3 分制对候选答案打分,在 Docmatix 的 200 张图像子集上评估 MPLUGDocOwl1.5 的零样本表现,LAVE 得分 0.58,而 CIDER 仅 0.1411、BLEU 0.0032、ANLS 0.002。
Hugging Face 发布 Docmatix,一个包含 240 万张图像、950 万问答对(源自 130 万份 PDF)的文档视觉问答数据集,规模是此前数据集的 240 倍。
Hugging Face 发布通用智能体项目 Jack of All Trades(JAT),基于 GPT-Neo 的 Transformer 架构,用单一网络在 Atari 57。
Hugging Face 推出 WebSight 数据集,用于训练视觉语言模型将网页截图转换为 HTML 代码。该数据集从 v0.1 的 823,000 对截图/HTML 样本扩展至 v0.2 的 200 万例,改用真实截图和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将网页截图转为可用的 HTML 代码,并还原截图中的图像。
加州大学洛杉矶分校研究者推出 ConTextual,一个包含 506 条指令的文本密集视觉推理数据集,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。初步评测 13 个模型显示,GPT-4V 表现最佳,在抽象推理上超过人类,但在时间相关任务上落后;开源模型在多个领域表现不佳,用 OCR 加 caption 增强 LLM 的方案人类通过率仅 17.2%。
OpenAI 在 CLIP 中发现了一类多模态神经元,无论概念以文字、符号还是概念形式呈现,这些神经元都会产生响应。这可能解释 CLIP 为何能准确分类出人意料的概念视觉变体,也是理解 CLIP 及类似模型所学关联与偏见的重要一步。
推荐理由:OpenAI 在 CLIP 中发现对同一概念的多模态神经元,为理解其分类准确性与习得偏见提供线索。