Google DeepMind 发布 Gemini 3.8 Live with Live Avatar
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的基础上为原生实时对话模型加入近实时视觉形象,可同时处理视觉与音频输入并输出带表情和唇形同步的音视频。
推荐理由:官方披露了实时视频与语音耦合的对话能力、异步工具调用和 97 种语言支持,可据此判断企业级虚拟形象的应用边界。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的基础上为原生实时对话模型加入近实时视觉形象,可同时处理视觉与音频输入并输出带表情和唇形同步的音视频。
推荐理由:官方披露了实时视频与语音耦合的对话能力、异步工具调用和 97 种语言支持,可据此判断企业级虚拟形象的应用边界。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:两款 TTS 模型给出语音克隆、逐行表演控制与多语言覆盖的具体能力,可据此判断语音生成工作流的变化。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:两款语音对话模型同时发布,给出语音智能体基准成绩与开发者接入路径,可据此判断实时语音 Agent 的当前水位。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文本模型,可将原始音频直接转为准确、格式化文本。
推荐理由:官方给出 WER、延迟与多语言等可核验指标,并说明开发者与消费端入口,便于判断语音转写能力边界。
Hugging Face 发布研究,提出共识分歧探针、掩蔽实体检索和拼写切换三类测试来量化语音识别中的基准优化现象。研究评测 11 个开源 ASR 模型,发现部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,即使音频与之矛盾、相关词被静音或两种写法在音频中同样成立。
推荐理由:通过三类探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
Google Research 发布 AMIE (Video),一个基于 Gemini 和 Project Astra 的实时视频临床问诊系统,可感知非语言线索、引导虚拟体格检查并实时进行诊断推理。
推荐理由:Google 公布 AMIE 视频版在 300 场随机 OSCE 中与初级保健医生评分相当,并给出异步多智能体架构与局限说明。
NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升了多种既有语言的质量。
推荐理由:原文给出 364M 开源权重模型的多语言扩展与 TTFA 实测数据,读者可据此判断自建语音链路的延迟与部署成本。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词和人声质量上均有提升:可生成更丰富复杂的旋律结构,歌词的提示词遵循度和结构感知更好,人声更具表现力与情感细节、发音也更准确。用户还能更便捷地控制输出的节奏和时长。
推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与创作控制上的具体改进方向,可据此判断音乐生成能力的变化。
Hume 发布 Real World VoiceEQ 语音 AI 评测基准,覆盖 40 多个专有与开源语音模型、15+ 评测维度和 60+ 指标,涵盖 ASR、TTS、S2S 和语音理解。
推荐理由:Hume 用超百万条人类评分构建语音评测基准,揭示现有基准高估真实表现的问题。
Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,能自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:官方披露了连续生成式语音翻译的取舍思路,以及它在 Google 各产品线的开放节奏。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。
推荐理由:Google DeepMind 公布 AI co-clinician 研究计划,给出医生盲评与远程问诊模拟中的具体对比结果。
NVIDIA 发布 Nemotron 3 Nano Omni,一款覆盖文本、图像、视频与音频的全模态理解模型,基于 Nemotron 3 Nano 30B-A3B 骨干,搭配 C-RADIOv4-H 视觉编码器和 Parakeet-TDT-0.6B-v2 音频编码器。
推荐理由:原文给出架构、训练配方与多模态基准对比,读者可据此判断开源全模态模型在文档、音视频与 GUI 智能体上的能力边界。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数规模 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言,可生成带情感表达的语音。
推荐理由:官方给出 4B 参数、9 种语言与 70ms 延迟等具体指标,并公开与 ElevenLabs 的人工对比结果。
Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文字模型。
推荐理由:官方给出两款语音转写模型的延迟、错误率与价格对比,便于判断实时语音场景的落地成本。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并保留 2D 图像与文本能力。官方称其在 CT 病变分类上绝对准确率较 MedGemma 1 提升 3%(61% vs. 58%),MRI 提升 14%(65% vs. 51%),MedQA 提升 5%(69% vs. 64%)。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开源入口,可据此判断医疗多模态模型的可用边界。
Google DeepMind 发布更新版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,提升了复杂工作流处理、指令遵循和多轮对话能力。
推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,便于判断语音智能体的可用性变化。
Google Research 介绍一种端到端语音到语音翻译(S2ST)模型,可在保留原说话人音色的同时实现实时翻译,延迟仅 2 秒,而现有系统通常有 4–5 秒延迟且会累积误差。
推荐理由:Google 端到端语音翻译把延迟压到 2 秒并保留原说话人音色,读者可了解其数据管线与流式架构。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑,读者可据此判断其产品线走向。
Mistral 发布 Voxtral 语音理解模型,提供 24B 和 3B 两种尺寸,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测以及从语音直接触发函数调用等能力。
推荐理由:Mistral 开源语音理解模型,给出两种尺寸、Apache 2.0 许可与 API 定价,读者可据此判断语音能力的部署与成本选择。
Hugging Face 博客介绍如何用投机解码将 Whisper 推理速度提升约 2 倍,同时保证输出与单独使用主模型完全一致。
推荐理由:给出 Whisper 投机解码的完整实现与基准数据,读者可据此在现有管线中获得约 2 倍加速且输出不变。