Meta语音模型误字率3.1%夺冠,定价仅谷歌五分之一

2026年9月1日,Meta Superintelligence Labs正式发布Muse Voice Transcribe,将流式语音识别、说话人分离与断句检测三项能力整合进单一实时模型。据Artificial Analysis独立评测,该模型在AA-WER Streaming流式语音转写榜单上以3.1%误字率位列第一,在说话人识别公开基准中同样排名首位;API定价每千音频分钟3美元(折合每小时0.18美元),与谷歌Cloud Speech-to-Text标准价格相比约为其五分之一。

这是Meta Superintelligence Labs成立以来首次公开发布语音AI产品的完整成绩单。它同时在准确率和价格两个维度向竞争对手施压。Muse Voice Transcribe并非简单的工程优化,而是架构层面的一次重新设计。

单模型架构:一块砖替代三条流水线

传统商用语音识别系统通常将三个功能分开处理:自动语音识别(ASR)负责把声音变成文字;说话人分离(Diarization)判断“谁在说”;断句检测(Endpointing)确定“说完了没有”。这三个模块相互独立,输出结果需要拼接,延迟在流水线中叠加,错误也会在模块间传递。

据Meta官方博客披露,Muse Voice Transcribe将上述三项能力融合在单一自回归模型中,以80毫秒为一帧单位实时处理音频,无需任何后处理步骤。该模型引入了强化学习驱动的“自适应延迟”机制——模型根据当前词汇的识别难度动态调整输出时机,而不是按固定节拍推送文字。当一个词足够确定时,模型立即输出;当上下文模糊时,它会多等几十毫秒以换取更高准确率。

据Artificial Analysis数据,Muse Voice Transcribe最终转写稿的误字率为3.1%,在说话结束后0.16秒输出;而Cartesia Ink-2的误字率为3.4%,但延迟高达0.43秒;ElevenLabs Scribe v2的误字率为3.6%,延迟0.14秒;谷歌Gemini 3.5 Transcribe Live的误字率为4%。Muse在延迟与准确率之间找到了最优平衡点。

说话人分离能力支持20人以上同时在场,原生处理多语言输入,官方称已在70余种语言上完成训练,其中25种经过大规模验证,支持在单句内无缝切换语言(code-switching)。官方博客给出的演示场景是8人同处一室,英文、中文混说,模型能逐字区分每位说话人的内容。

定价策略:以谷歌的五分之一切入开发者市场

据Meta开发者文档披露,Muse Voice Transcribe通过Meta Model API提供服务,定价每千音频分钟3美元,折合每小时0.18美元。对照谷歌Cloud Speech-to-Text标准定价约每小时0.96美元,Meta的定价约为其五分之一。

横向来看,Cartesia Ink-2定价每千分钟4美元,ElevenLabs Scribe v2和Deepgram Flux均为每千分钟6.5美元。Muse Voice Transcribe在四款主要流式语音产品中价格最低,且误字率最优。

这种定价逻辑与Meta近年来在大语言模型领域的策略一脉相承:借助基础设施规模优势压低单位成本,以价格打开开发者市场,再通过生态粘性稳固份额。Llama系列开源模型将私有大模型API价格整体拉低的历史背景,让这次语音定价显得并不突然。

竞争格局重构:受压的不只是谷歌

谷歌在准确率和价格两端同时受压,且其Gemini 3.5 Transcribe Live的4%误字率在本次Artificial Analysis评测中是最差成绩。谷歌Cloud在企业客户中的市场优势更多来自生态整合(与BigQuery、Workspace等产品的连接),这部分护城河短期内不受影响,但在纯API选型场景中,成本差距达到5倍时需要给出更有力的理由。

ElevenLabs的处境更为微妙。其Scribe v2 Realtime在延迟上(0.14秒)与Muse接近,但误字率(3.6%)高于后者,定价(每千分钟6.5美元)则是Muse的两倍多。ElevenLabs的核心竞争力在语音合成(TTS)而非转写(STT),Muse Voice Transcribe直接攻击的是其新兴的多模态语音能力拓展方向。

对中小开发者和初创公司而言,这是一次明确的利好。实时语音转写此前的成本门槛,让许多需要高精度多语言识别的应用场景(会议纪要、实时字幕、跨语言客服)只能选择离线批处理或接受较高的运营成本。Muse在同等甚至更低成本下,提供了实时流式能力。

该模型目前仅以API形式提供,不开放模型权重。这意味着隐私敏感场景(金融、医疗、法律行业的录音转写)或有强本地部署要求的企业客户,无法将其部署在私有环境中。在这个维度上,开源的Whisper系列仍然是无可替代的选项,尽管后者在流式实时性和说话人分离上均不如Muse。

端侧整合:Mac平台是测试场

与API发布同步,Meta将Muse Voice Transcribe接入了Meta AI for Mac客户端和Muse Code。据9to5Mac报道,Mac端集成允许用户在任意应用中调用实时语音听写,这意味着它不依赖特定应用的原生支持就能工作。

Mac平台长期有Apple Dictation和第三方工具竞争,但支持多说话人、多语言混说、低延迟的实时工具几乎是空白。Meta将Muse直接植入Mac系统级场景,既是产品演示,也是收集真实用户行为数据的渠道。如果Mac端表现良好,下一个顺理成章的落地点是AR眼镜——Meta一直将智能眼镜视为个人AI助理的核心终端,而“在嘈杂真实环境中分清每个人说了什么”正是眼镜场景中最难解决的感知问题。

战略判断:准确率领先窗口有多宽

以下为分析判断,非已确认事实。

Muse Voice Transcribe目前的领先优势是真实的,但窗口宽度有限。语音识别准确率的提升在工程上是一条相对确定的路——更多数据、更长训练时间、更细的域适配,各家都在同时推进。Artificial Analysis的榜单数字会随模型更新频繁波动,3.1%对3.4%的差距在下次更新中随时可能被抹平。

Meta真正难以被复制的,是它在定价上的结构优势。每千分钟3美元背后是Meta自建算力集群的规模摊销,这不是通过技术迭代就能追上的成本差。如果这个价格策略持续,语音API市场的整体定价中枢将被拉低,这对谷歌、ElevenLabs和Deepgram均意味着持续的利润压力。

该模型目前披露的主要是技术指标,缺乏大规模生产环境下长期稳定性的验证数据,这是当前最大的不确定性。Meta是否会在某个时间节点开放Muse的权重,将直接决定它能否进入隐私敏感的企业市场,而这恰恰是语音识别变现最厚实的区域。

对当下做选型决策的开发者,有一个比较清晰的判断框架:如果应用场景是实时流式、多人混说、有多语言需求,且数据可以经由API处理,Muse Voice Transcribe在成本和准确率上目前均是最优选;如果场景涉及敏感数据或需要本地部署,开源Whisper系列仍是更安全的路径,但需要自行解决流式和说话人分离的工程问题。两条路之间的鸿沟,目前还没有既开源又能与Muse正面竞争的方案存在。