跳到正文

#语音

今日 1 条
1月7日周三
12月13日周六
12月4日周四
11月19日周三
10月28日周二
  1. Hugging Face Blog38

    Hugging Face 提出“语音同意门”:让声音克隆必须先获得本人明确同意

    Hugging Face 发布博客提出“语音同意门”(voice consent gate),让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动语音克隆。该方案由三部分组成:生成约 20 词、含同意短语与模型名的独特句子,ASR 识别该句,以及 TTS 语音克隆系统;同一句录音也可直接用作克隆素材。配套示例 Space 与代码已公开,用于探索把同意原则嵌入 AI 系统流程。

9月22日周一
8月28日周四
7月17日周四
  1. Mistral AI62

    Mistral 为 Le Chat 推出 Deep Research、语音模式等多项新功能

    Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

    推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑,读者可据此判断其产品线走向。

7月15日周二
  1. Mistral AI80

    Mistral 发布 Voxtral 语音理解模型,24B 与 3B 双版本开源

    Mistral 发布 Voxtral 语音理解模型,提供 24B 和 3B 两种尺寸,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测以及从语音直接触发函数调用等能力。

    推荐理由:Mistral 开源语音理解模型,给出两种尺寸、Apache 2.0 许可与 API 定价,读者可据此判断语音能力的部署与成本选择。

6月26日周四
5月13日周二
4月22日周二
4月9日周三
3月20日周四
  1. OpenAI News62

    OpenAI 在 API 中推出新一代音频模型

    OpenAI 在 API 中推出新一代音频模型,开发者首次可以指示文本转语音模型以特定方式说话,例如像有同理心的客服人员那样说话,为语音智能体带来新的定制能力。

    推荐理由:OpenAI 在 API 中开放语音风格指令,开发者可据此判断语音智能体的定制空间。

2月27日周四
2月25日周二
12月20日周五
10月22日周二
10月1日周二
6月20日周四
6月8日周六
5月20日周一
5月13日周一
5月1日周三
4月24日周三
3月29日周五
2月27日周二
1月19日周五
12月20日周三
9月25日周一
8月30日周三
8月9日周三
6月19日周一
  1. Hugging Face Blog50

    如何为低资源 ASR 微调 MMS Adapter 模型

    Hugging Face 发布教程,介绍如何为 Meta AI 的 MMS 模型微调 Adapter 层以适配低资源语言的 ASR 任务。MMS 预训练 checkpoint 覆盖 1400 多种语言、参数量 300M 到 1B,每个 Adapter 层仅约 2.5M 权重,微调 10-20 分钟即可获得极低词错率。对低资源语言,Adapter 训练比全模型微调更省内存、更鲁棒且性能更好。

6月2日周五
5月18日周四
  1. OpenAI News78

    OpenAI 推出 ChatGPT iOS 应用

    OpenAI 发布 ChatGPT 的 iOS 应用,可同步用户的对话记录,并支持语音输入。该应用同时带来 OpenAI 最新的模型改进。

    推荐理由:OpenAI 官方发布 ChatGPT iOS 应用,给出对话同步与语音输入两项核心能力。

2月8日周三
  1. Hugging Face Blog60

    SpeechT5 上线 Hugging Face Transformers,支持语音合成、识别与音色转换

    Hugging Face 宣布 SpeechT5 已集成进 Transformers,论文作者发布的官方 checkpoint 可在 Hugging Face Hub 获取,并提供语音合成、音色转换和自动语音识别三个 Spaces 演示。

    推荐理由:SpeechT5 以同一套编码器解码器架构覆盖 TTS、语音转换与 ASR,读者可据此了解多任务语音模型在 Transformers 中的接入方式。

12月15日周四
  1. Hugging Face Blog22

    Hugging Face 音频数据集完全指南:用 🤗 Datasets 一行代码加载与处理

    Hugging Face 发布音频数据集使用指南,介绍如何用 🤗 Datasets 的 load_dataset 函数一行代码下载并准备音频数据。文中以 GigaSpeech 为例,其 xs 配置含 10 小时数据,加载后自动划分 train、validation、test 三个 split。Hub 上现有 77 个语音识别数据集和 28 个音频分类数据集,并支持在线试听样本预览。

11月3日周四
  1. Hugging Face Blog62

    用 🤗 Transformers 微调 Whisper 实现多语种 ASR

    Hugging Face 发布教程,介绍如何用 🤗 Transformers 在任意多语种 ASR 数据集上微调 Whisper。教程以 Common Voice 11.0 的印地语为例,用约 8 小时训练数据微调 Whisper small,在测试集上把 WER 从预训练模型的 63.5% 降到 32.0%。

    推荐理由:以印地语为例给出 Whisper 多语种 ASR 微调全流程,8 小时数据即可把 WER 从 63.5% 降到 32.0%。

9月21日周三
2月1日周二