腾讯混元Hy ASR 3.0发布:听懂方言还能纠错上下文

腾讯混元Hy ASR 3.0发布:听懂方言还能纠错上下文

8月4日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 preview。它基于最新一代大语言模型Hy3的语言理解能力,融合高精度语音识别与深度语义理解,在通用识别、上下文感知、多场景鲁棒性与方言覆盖等核心维度实现全面提升,让语音识别从「逐字转写」演进为「理解语境、兼容场景」。该模型已上线腾讯云官网提供API服务,并率先落地腾讯元宝App面向全部用户免费开放。

核心能力:不止把声音变成字

听懂方言,也懂上下文

Hy ASR 3.0 preview完成了10大方言片区、20余个细分方言覆盖,粤语、吴语、西南官话、中原官话等日常口语均可直接对话交互,用户无需刻意矫正普通话口音。底层依托Hy3大模型,实现声学识别与语义理解双协同。

能力 表现
方言覆盖 10大方言片区、20余个细分方言
上下文纠错 结合对话自动修正同音词歧义、匹配专业热词
复杂环境 厨房噪音、户外车流等嘈杂场景降噪优化
热词注入 增强品牌名、人名、行业术语识别
落地场景 智能客服、内容理解、语音搜索

技术路径:声学+语义双协同

模型采用自研无监督语音编码器搭配Hy3的上下文纠错能力,能够结合对话上下文自动修正同音词歧义、匹配专业热词,并对嘈杂环境进行降噪优化。元宝深度参与共研并已完成首发上线,用户打开元宝按住说话即可体验方言识别、上下文智能纠错与复杂环境稳定转写;WorkBuddy等产品也在陆续接入。

为什么语音识别重回C位

  • 端侧与对话式AI爆发,语音成为最自然入口;
  • 大模型让「识别+理解」一体化,转写质量跃升;
  • 方言与噪声场景是真实落地的最大痛点,也是差异化壁垒;
  • 免费开放降低开发者门槛,利于生态快速起量。

FAQ

Q1:Hy ASR 3.0 preview和普通语音识别有何不同?

普通识别只做「声音转文字」,Hy ASR 3.0 preview依托Hy3打通声学识别与语义理解,能结合上下文自动纠错、听懂方言、在嘈杂环境稳定输出,是从转写到理解的跃迁。

Q2:普通用户现在能用吗?

能。模型已率先落地腾讯元宝App,面向全部用户免费开放,打开对话界面长按语音按钮即可启用;同时通过腾讯云官网提供API服务。

Q3:支持哪些方言?

已完成10大方言片区、20余个细分方言覆盖,粤语、吴语、西南官话、中原官话等日常口语均可直接对话,无需刻意说标准普通话。

Q4:企业如何接入?

可通过腾讯云官网调用Hy ASR 3.0 preview的API,应用于智能客服、内容理解、语音搜索等场景,并支持热词注入以增强专业术语与品牌名识别。

© 版权声明
THE END
喜欢就支持一下吧
点赞15 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容