Meta推出实时音频感知模型Muse Voice
2026年9月,Meta推出首个实时音频感知模型Muse Voice Transcribe,把语音转写从传统的「识别文字」推进到「理解声音场景」。据公开报道,该模型支持20多种语言区分与多人声纹区分转录,定价约每1000分钟3美元(折合约每小时0.18美元),以极低价格把实时转写能力推向普通开发者和企业。
一、它到底解决了什么问题
过去语音识别(ASR)只负责把声音变成文字,会议摘要、客服质检、访谈整理仍需人工二次处理。Muse Voice Transcribe把「音频感知」和大模型能力边界打通,可直接输出结构化结果。
- 支持20多种语言自动区分,跨国会议无需逐段切换。
- 支持20多人声纹区分转录,谁说了什么一目了然。
- 实时转写延迟低,可按分钟计费接入业务系统。
- 价格压到约每小时0.18美元,让中小团队也用得起。
为什么价格能打到这么低
音频感知模型把转写做成端到端的大模型任务,省去传统ASR的级联模块,单位算力成本大幅下降。这与国内大模型API价格持续走低、AI应用进入「性价比竞争」阶段的方向一致。
二、行业影响:实时转录成新入口
实时转写直接把会议摘要、客服质检、访谈整理的自动化程度提升了一个台阶。价格低到可按分钟接入,意味着它不是大厂的专属玩具,而是千行百业都能用的基础设施。
| 能力维度 | 传统ASR | Muse Voice Transcribe |
|---|---|---|
| 核心任务 | 声音转文字 | 音频感知+场景理解 |
| 多人区分 | 需额外说话人分离 | 原生20多人声纹区分 |
| 语种支持 | 有限语种 | 20多种语言自动区分 |
| 计费模式 | 按小时或坐席 | 约每1000分钟3美元 |
FAQ
Q1:Muse Voice Transcribe是做什么的?
它是Meta推出的首个实时音频感知模型,主打实时语音转写,能在多人、多语言场景下区分说话人并输出结构化文字结果。
Q2:它的价格大概是多少?
据公开报道,定价约每1000分钟3美元,折合约每小时0.18美元,属于当前市场上极低水平的实时转写价格。
Q3:和国内AI终端进展有什么关系?
实时音频感知是AI终端的重要能力。同期国内AI手机、机器人手机等产品加速落地,音频感知模型与终端原生AI形成呼应,推动AI从云端走向设备侧。
Q4:普通企业现在能用上吗?
按分钟计费、低单价的模式降低了使用门槛,会议、客服、教育、媒体等需要大量转写的行业都可以就近接入,把人力从重复整理中解放出来。
© 版权声明
本网站名称:修愚分享,本站永久网址:https://xiuyu.com
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。
THE END














![修愚分享推广计划正式上线,推广可获高额奖励[限时推广]-修愚](https://xiuyu.com/wp-content/uploads/2025/05/愚你同乐-1024x410.jpg)


暂无评论内容