简体
  • 简体中文
  • 繁体中文

热门资讯> 正文

谷歌的Gemini 3.5转录将原始音频转换为格式化文本

2026-08-27 02:42

谷歌(Google)(GOOGL)发布了Gemini 3.5 Transcribe,这家科技巨头称这是其迄今为止最精确的语音转文本模型。

谷歌表示:“与传统语音识别模型难以应对背景噪音、复杂行话和不流利清理问题不同,Gemini 3.5 Transcribe可以直接将原始音频转换为准确、精美、格式化的文本。”

它旨在轻松插入开发人员工作流程,允许构建语音代理、实时字幕或通话后分析管道。它可通过Live API进行实时流媒体传输,并通过Interactions API进行预录制的音频处理。

它的一些功能包括智能转录器,可以自动清理文本,例如删除人声停顿;识别自定义词汇;支持超过85种语言;并且最多可以识别三个说话者。

它的流媒体错误率为4%,非流媒体用例错误率为2.6%。在一系列语言的FLEURS基准测试中,它的表现也更好。例如,Gemini Transcribe 3.5 Live的字错误率为5.5%,而OpenAI(OPNAI)GPT Live Transcribe的字错误率为8.9%。

新模型今天已向开发人员和企业公开预览。对于所有其他人来说,它可以在macOS上的Gemini应用程序中提供英语版本,在部分国家/地区的Android上提供Rambler。它很快将在Chrome上提供。

本月早些时候,谷歌发布了Gemini 3.7 Flash,Gemini应用程序用户数量突破1B。然而,谷歌尚未发布其下一款前沿机型Gemini 3.5 Pro,该机型原定于6月发布。

风险及免责提示:以上内容仅代表作者的个人立场和观点,不代表华盛的任何立场,华盛亦无法证实上述内容的真实性、准确性和原创性。投资者在做出任何投资决定前,应结合自身情况,考虑投资产品的风险。必要时,请咨询专业投资顾问的意见。华盛不提供任何投资建议,对此亦不做任何承诺和保证。