热门资讯> 正文
2026-09-02 01:43
Meta(META)超级智能实验室推出了一种实时语音识别模型,可以区分20多个说话者,用70多种语言训练,并且可以转录持续一个多小时的对话。
Muse Voice Transcribe被描述为Muse Spark系列的自回归多模式模型。通过以80毫秒的“块”转录,该软件可以确定对话何时出现暂停,Meta称之为“自适应延迟”。该系统可以快速处理更简单的单词,而更困难的单词则获得更多的音频上下文。
Muse Voice Transcribe现在可以通过Meta Model API(每小时0.18美元)、Meta AI for Mac和Meta Code提供。
Meta进入转录领域之前,OpenAI(OPEN)、Google(GOOG)(GOOGL)、xAI(SPCX)和阿里巴巴(BABA)也推出了类似产品。