跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

32条精选相关主题多模态AI 视频产品更新

最新精选

第 21–32 条 · 共 32 条
7月15日周二
  1. Mistral AI80

    Mistral 发布 Voxtral 语音理解模型,24B 与 3B 双版本开源

    Mistral 发布 Voxtral 语音理解模型,提供 24B 和 3B 两种尺寸,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测以及从语音直接触发函数调用等能力。

    推荐理由:Mistral 开源语音理解模型,给出两种尺寸、Apache 2.0 许可与 API 定价,读者可据此判断语音能力的部署与成本选择。

3月20日周四
  1. OpenAI News62

    OpenAI 在 API 中推出新一代音频模型

    OpenAI 在 API 中推出新一代音频模型,开发者首次可以指示文本转语音模型以特定方式说话,例如像有同理心的客服人员那样说话,为语音智能体带来新的定制能力。

    推荐理由:OpenAI 在 API 中开放语音风格指令,开发者可据此判断语音智能体的定制空间。

2月25日周二
10月1日周二
5月13日周一
4月24日周三
12月20日周三
9月25日周一
5月18日周四
  1. OpenAI News78

    OpenAI 推出 ChatGPT iOS 应用

    OpenAI 发布 ChatGPT 的 iOS 应用,可同步用户的对话记录,并支持语音输入。该应用同时带来 OpenAI 最新的模型改进。

    推荐理由:OpenAI 官方发布 ChatGPT iOS 应用,给出对话同步与语音输入两项核心能力。

2月8日周三
  1. Hugging Face Blog60

    SpeechT5 上线 Hugging Face Transformers,支持语音合成、识别与音色转换

    Hugging Face 宣布 SpeechT5 已集成进 Transformers,论文作者发布的官方 checkpoint 可在 Hugging Face Hub 获取,并提供语音合成、音色转换和自动语音识别三个 Spaces 演示。

    推荐理由:SpeechT5 以同一套编码器解码器架构覆盖 TTS、语音转换与 ASR,读者可据此了解多任务语音模型在 Transformers 中的接入方式。

9月21日周三
2月1日周二