
Meta今天推出了一款名为Muse Voice Transcribe的新模型,这是它第一个能实时“听懂”声音的AI产品。开发者通过Meta的API就能调用,价格定在每1000分钟音频3美元,约合20元人民币。换句话说,处理一个小时的语音,成本只要1块2左右。在AI模型普遍按分钟计费的今天,这个价格几乎是地板价。
这款模型最大的噱头,是它真正做到了“边说边出字”。传统语音转写工具往往要等你把一整段话说完,录完音再拿去处理,要等好久。Muse Voice Transcribe不一样,你说话的同时,屏幕上就在同步蹦出文字,延迟很低,很适合开会速记、打电话字幕、现场视频配字幕这些场景。
更厉害的是分轨功能。录音里如果有多个人在讲话,它能自动分辨出谁是谁,最多分开20多个说话者。比如一场圆桌会议,五个发言人你一句我一句,模型能把每个人的话单独拎出来,分别生成一条文字轨道。以后记者整理采访录音,可能再也不用对着音频一头雾水地猜谁说了什么了。
在语言能力上,这个模型训练时覆盖了70多种语言,发布时已经有25种语言完成了验证。它支持超过一个小时的音频,还允许在句子中间或句子之间自然切换语言。比如前一句说中文,后一句说英文,它不用专门设置,就能跟着切回来切过去。开发者还可以通过给关键词、指定语言或者上下文信息,来提升某些专业术语的识别准确率。
为了平衡“快”和“准”这两个矛盾,Meta用了一套叫做“自适应延迟”的机制。简单讲,系统不搞一刀切。它会对每个词单独做判断:如果这个词容易认,就立刻出结果,不耽误事;如果这个词发音含糊、专业性强,或者前后文有点绕,它就多等一小段音频,收集更多线索再输出。这样既保证了实时性,又不容易念错字。
Meta官方表示,截至2026年9月1日,Muse Voice Transcribe在Artificial Analysis的流式语音转文本排行榜上排第一。这个排行榜专门评估实时语音识别产品的综合表现,第一名对Meta来说是个不错的起点。
实时语音转写这几年竞争很激烈,OpenAI的Whisper、谷歌的模型都在抢占市场。Meta这次的打法很清晰:价格压到极低,功能做到“分轨”这种实用级别,再向开发者开放API调用。可以预见,接下来会议记录软件、直播字幕工具、智能耳机厂商,都会很快把这类能力集成进去。未来的AI助手如果能一边听一边把每个人的话分好类,那工作效率的提升就不是一点半点了。