熱門資訊> 正文
2026-09-02 01:43
Meta(META)超級智能實驗室推出了一種實時語音識別模型,可以區分20多個説話者,用70多種語言訓練,並且可以轉錄持續一個多小時的對話。
Muse Voice Transcribe被描述為Muse Spark系列的自迴歸多模式模型。通過以80毫秒的「塊」轉錄,該軟件可以確定對話何時出現暫停,Meta稱之為「自適應延迟」。該系統可以快速處理更簡單的單詞,而更困難的單詞則獲得更多的音頻上下文。
Muse Voice Transcribe現在可以通過Meta Model API(每小時0.18美元)、Meta AI for Mac和Meta Code提供。
Meta進入轉錄領域之前,OpenAI(OPEN)、Google(GOOG)(GOOGL)、xAI(SPCX)和阿里巴巴(BABA)也推出了類似產品。