热门资讯> 正文
2026-10-02 00:44
微软(MSFT)周四推出了三种新的人工智能模型,旨在实现转录和语音。
微软在一篇博客文章中表示,MAI-Transcribe-2-Streaming模型旨在转录,将实时语音在到达时转化为文本。
微软在帖子中写道:“MAI-Transcribe-2-Streaming可以连续转录60种语言,并自动检测语言,而不是等待某人完成发言才返回文本。”“它在接收音频的几百毫秒内产生第一个假设,称为部分假设,然后随着更多的上下文到达而对其进行细化,并在话语结束后提交一个稳定的转录本。当应用程序需要在某人说话时执行操作时,这种区别很重要。客户服务代理可以在句子完成之前开始识别呼叫者的请求。语音助手可以更快地开始推理或准备工具调用。一个现场转录的经验可以表面的话几乎一样快,因为他们说。"
MAI-Transcribe-2-Streaming是Artificial Analysis的顶级转录模型,可用于部分和最终转录本的准确性。在大多数情况下,单词最早在说出后320毫秒就出现,而比赛中则超过500毫秒。
MAI-Transcribe-2-Streaming提供60种语言版本,截至年底,入门费用为每小时0.54美元。
新的语音模型是MAI-Voice-2.1和MAI-Voice-2.1-Flash。微软补充说:“当表达保真度是优先考虑的问题时,开发人员可以选择MAI-Voice-2.1,或者当他们需要平衡自然语音与响应能力和大规模成本时,可以选择Flash。”
MAI-Voice-2.1每100万字符售价22美元,MAI-Voice-2.1-Flash每100万字符售价15美元。MAI-Voice-2.1支持23种语言和26个地区,具有单一、一致的跨语言语音。