腾讯混元Hy ASR 3.0发布:听懂方言还能纠错上下文
8月4日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 preview。它基于最新一代大语言模型Hy3的语言理解能力,融合高精度语音识别与深度语义理解,在通用识别、上下文感知、多场景鲁棒性与方言覆盖等核心维度实现全面提升,让语音识别从「逐字转写」演进为「理解语境、兼容场景」。该模型已上线腾讯云官网提供API服务,并率先落地腾讯元宝App面向全部用户免费开放。
核心能力:不止把声音变成字
听懂方言,也懂上下文
Hy ASR 3.0 preview完成了10大方言片区、20余个细分方言覆盖,粤语、吴语、西南官话、中原官话等日常口语均可直接对话交互,用户无需刻意矫正普通话口音。底层依托Hy3大模型,实现声学识别与语义理解双协同。
| 能力 | 表现 |
|---|---|
| 方言覆盖 | 10大方言片区、20余个细分方言 |
| 上下文纠错 | 结合对话自动修正同音词歧义、匹配专业热词 |
| 复杂环境 | 厨房噪音、户外车流等嘈杂场景降噪优化 |
| 热词注入 | 增强品牌名、人名、行业术语识别 |
| 落地场景 | 智能客服、内容理解、语音搜索 |
技术路径:声学+语义双协同
模型采用自研无监督语音编码器搭配Hy3的上下文纠错能力,能够结合对话上下文自动修正同音词歧义、匹配专业热词,并对嘈杂环境进行降噪优化。元宝深度参与共研并已完成首发上线,用户打开元宝按住说话即可体验方言识别、上下文智能纠错与复杂环境稳定转写;WorkBuddy等产品也在陆续接入。
为什么语音识别重回C位
- 端侧与对话式AI爆发,语音成为最自然入口;
- 大模型让「识别+理解」一体化,转写质量跃升;
- 方言与噪声场景是真实落地的最大痛点,也是差异化壁垒;
- 免费开放降低开发者门槛,利于生态快速起量。
FAQ
Q1:Hy ASR 3.0 preview和普通语音识别有何不同?
普通识别只做「声音转文字」,Hy ASR 3.0 preview依托Hy3打通声学识别与语义理解,能结合上下文自动纠错、听懂方言、在嘈杂环境稳定输出,是从转写到理解的跃迁。
Q2:普通用户现在能用吗?
能。模型已率先落地腾讯元宝App,面向全部用户免费开放,打开对话界面长按语音按钮即可启用;同时通过腾讯云官网提供API服务。
Q3:支持哪些方言?
已完成10大方言片区、20余个细分方言覆盖,粤语、吴语、西南官话、中原官话等日常口语均可直接对话,无需刻意说标准普通话。
Q4:企业如何接入?
可通过腾讯云官网调用Hy ASR 3.0 preview的API,应用于智能客服、内容理解、语音搜索等场景,并支持热词注入以增强专业术语与品牌名识别。
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。














![修愚分享推广计划正式上线,推广可获高额奖励[限时推广]-修愚](https://xiuyu.com/wp-content/uploads/2025/05/愚你同乐-1024x410.jpg)


暂无评论内容