跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

4条精选相关主题多模态AI 视频产品更新

最新精选

第 1–4 条 · 共 4 条
9月25日周五
9月23日周三
9月16日周三
8月27日周四
  1. Google DeepMind77

    Gemini 3.5 Transcribe 实现智能语音转写

    Google 推出语音转文字模型 Gemini 3.5 Transcribe,支持自动清理口头语、自我纠正、文本格式化及超过 85 种语言的转写。Artificial Analysis 测得其流式和非流式平均词错误率分别为 4.0% 和 2.6%,最终转写耗时较 Chirp 3 改善 70%。

    推荐理由:与 Chirp 3 的延迟比较及流式、非流式识别错误率,为开发者在实时语音交互与录音转写之间选择接入方式提供了具体依据。