Meta推出实时音频感知模型Muse Voice

Meta推出实时音频感知模型Muse Voice

2026年9月,Meta推出首个实时音频感知模型Muse Voice Transcribe,把语音转写从传统的「识别文字」推进到「理解声音场景」。据公开报道,该模型支持20多种语言区分与多人声纹区分转录,定价约每1000分钟3美元(折合约每小时0.18美元),以极低价格把实时转写能力推向普通开发者和企业。

一、它到底解决了什么问题

过去语音识别(ASR)只负责把声音变成文字,会议摘要、客服质检、访谈整理仍需人工二次处理。Muse Voice Transcribe把「音频感知」和大模型能力边界打通,可直接输出结构化结果。

  • 支持20多种语言自动区分,跨国会议无需逐段切换。
  • 支持20多人声纹区分转录,谁说了什么一目了然。
  • 实时转写延迟低,可按分钟计费接入业务系统。
  • 价格压到约每小时0.18美元,让中小团队也用得起。

为什么价格能打到这么低

音频感知模型把转写做成端到端的大模型任务,省去传统ASR的级联模块,单位算力成本大幅下降。这与国内大模型API价格持续走低、AI应用进入「性价比竞争」阶段的方向一致。

二、行业影响:实时转录成新入口

实时转写直接把会议摘要、客服质检、访谈整理的自动化程度提升了一个台阶。价格低到可按分钟接入,意味着它不是大厂的专属玩具,而是千行百业都能用的基础设施。

能力维度 传统ASR Muse Voice Transcribe
核心任务 声音转文字 音频感知+场景理解
多人区分 需额外说话人分离 原生20多人声纹区分
语种支持 有限语种 20多种语言自动区分
计费模式 按小时或坐席 约每1000分钟3美元

FAQ

Q1:Muse Voice Transcribe是做什么的?

它是Meta推出的首个实时音频感知模型,主打实时语音转写,能在多人、多语言场景下区分说话人并输出结构化文字结果。

Q2:它的价格大概是多少?

据公开报道,定价约每1000分钟3美元,折合约每小时0.18美元,属于当前市场上极低水平的实时转写价格。

Q3:和国内AI终端进展有什么关系?

实时音频感知是AI终端的重要能力。同期国内AI手机、机器人手机等产品加速落地,音频感知模型与终端原生AI形成呼应,推动AI从云端走向设备侧。

Q4:普通企业现在能用上吗?

按分钟计费、低单价的模式降低了使用门槛,会议、客服、教育、媒体等需要大量转写的行业都可以就近接入,把人力从重复整理中解放出来。

© 版权声明
THE END
喜欢就支持一下吧
点赞9 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容