跳到正文

#语音

今日 0 条
9月30日周三
9月29日周二
9月25日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的基础上为原生实时对话模型加入近实时视觉形象,可同时处理视觉与音频输入并输出带表情和唇形同步的音视频。

    推荐理由:官方披露了实时视频与语音耦合的对话能力、异步工具调用和 97 种语言支持,可据此判断企业级虚拟形象的应用边界。

9月23日周三
  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:两款 TTS 模型给出语音克隆、逐行表演控制与多语言覆盖的具体能力,可据此判断语音生成工作流的变化。

9月16日周三
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模与成本效率,后者面向高复杂度任务与多步推理。

    推荐理由:两款语音对话模型同时发布,给出语音智能体基准成绩与开发者接入路径,可据此判断实时语音 Agent 的当前水位。

9月10日周四
8月28日周五
8月27日周四
8月21日周五
  1. Hugging Face Blog62

    Hugging Face 研究:语音识别基准优化现象如何测量

    Hugging Face 发布研究,提出共识分歧探针、掩蔽实体检索和拼写切换三类测试来量化语音识别中的基准优化现象。研究评测 11 个开源 ASR 模型,发现部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,即使音频与之矛盾、相关词被静音或两种写法在音频中同样成立。

    推荐理由:通过三类探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。

8月12日周三
8月11日周二
  1. Hugging Face Blog62

    NVIDIA 发布 Magpie TTS 多语言版:364M 开源权重,新增阿拉伯语、韩语和巴西葡萄牙语

    NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升了多种既有语言的质量。

    推荐理由:原文给出 364M 开源权重模型的多语言扩展与 TTFA 实测数据,读者可据此判断自建语音链路的延迟与部署成本。

8月3日周一
7月30日周四
  1. Google DeepMind62

    Google DeepMind 在 Google Flow Music 发布音乐生成模型 Lyria 3.5

    Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词和人声质量上均有提升:可生成更丰富复杂的旋律结构,歌词的提示词遵循度和结构感知更好,人声更具表现力与情感细节、发音也更准确。用户还能更便捷地控制输出的节奏和时长。

    推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声与创作控制上的具体改进方向,可据此判断音乐生成能力的变化。

7月22日周三
7月16日周四
7月15日周三
7月8日周三
7月1日周三
6月24日周三
  1. Hugging Face Blog36

    Hugging Face 与 Treble 推出 FFASR 远场 ASR 排行榜

    Hugging Face 与 Treble Technologies 联合发布 FFASR Leaderboard,这是首个开放的远场 ASR 基准,覆盖 14 个模拟房间并经过真实测量验证。所有提交模型在低 SNR 远场下的 WER 均比同内容近场高出数倍,榜单同时报告基于 NVIDIA L4 GPU 的 RTFx,用于权衡准确率与速度。多说话人、麦克风阵列与回声消除已在路线图中。

6月9日周二
5月7日周四
5月6日周三
  1. Hugging Face Blog34

    Hugging Face 为 Open ASR Leaderboard 引入私有数据集以抵御 benchmaxxing

    Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入覆盖多口音、脚本化与对话语音的高质量英文 ASR 私有数据集,以防止 benchmaxxing 和测试集污染。默认 Average WER 仍仅基于公开数据集计算,用户可通过开关选择是否纳入私有数据集。该榜单自 2023 年 9 月上线以来访问量已超 710K 次。

4月30日周四
4月28日周二
  1. Hugging Face Blog74

    NVIDIA 发布 Nemotron 3 Nano Omni:面向文档、音频与视频智能体的长上下文全模态模型

    NVIDIA 发布 Nemotron 3 Nano Omni,一款覆盖文本、图像、视频与音频的全模态理解模型,基于 Nemotron 3 Nano 30B-A3B 骨干,搭配 C-RADIOv4-H 视觉编码器和 Parakeet-TDT-0.6B-v2 音频编码器。

    推荐理由:原文给出架构、训练配方与多模态基准对比,读者可据此判断开源全模态模型在文档、音视频与 GUI 智能体上的能力边界。

4月16日周四
3月26日周四
  1. Google DeepMind76

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,精度更高、延迟更低。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。

    推荐理由:官方给出语音模型在函数调用与长程推理基准上的分数,并说明开发者与普通用户的使用入口。

3月24日周二
  1. Mistral AI71

    Mistral AI 发布 4B 参数语音合成模型 Voxtral TTS

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,参数规模 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言,可生成带情感表达的语音。

    推荐理由:官方给出 4B 参数、9 种语言与 70ms 延迟等具体指标,并公开与 ElevenLabs 的人工对比结果。

3月7日周六
  1. Google Research60

    Google Research 发布 WAXAL:覆盖 27 种非洲语言的开放语音数据集

    Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言的大规模开放语音数据集,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音,以及超过 565 小时用于 TTS 的高保真录音,由非洲学术与社区组织主导采集,覆盖 26 个以上国家、超过 1 亿使用者。该资源旨在支持非洲语言语音识别与合成系统的开发,并计划持续扩充语言种类。

    推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。

3月6日周五
2月5日周四
1月14日周三
  1. Google Research62

    Google 发布 MedGemma 1.5 4B 与医疗语音识别模型 MedASR

    Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并保留 2D 图像与文本能力。官方称其在 CT 病变分类上绝对准确率较 MedGemma 1 提升 3%(61% vs. 58%),MRI 提升 14%(65% vs. 51%),MedQA 提升 5%(69% vs. 64%)。

    推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开源入口,可据此判断医疗多模态模型的可用边界。

1月7日周三
12月13日周六
12月4日周四
11月19日周三