您现在的位置是:首页 > 特别推荐 >
长音频不丢词,行业词不用教,阿里发布Qwen-Audio-3.0-ASR-Flash
2026-07-31 17:07:40作者:来源:中国信息化周报
摘要7月31日,阿里巴巴发布语音识别大模型Qwen-Audio-3 0-ASR-Flash,在上下文一致性、行业词识别和热词定制化三个维度系统性升级,同时具备语音润色能力,可直接输出结构化文本。...
目前,Qwen-Audio-ASR系列已在会议纪要整理、实时字幕、教育录播、智能客服等场景中获得广泛验证,离线版本曾在全球权威AI评测平台Artificial Analysis以1.7%的错字率位列全球第一。识准专业词汇,是ASR模型走向行业落地的最后一公里,也是本次升级的核心。全新升级的3.0版本,聚焦通用的语音识别能力,不止于把每个字听对,更要在复杂语境中持续听对、在专业领域中精准听对。
在会议、访谈、课程、直播等长音频场景中,很多专业术语、英文词汇等并不能只靠当前几秒的语音准确判断。同一个发音可能对应十几个同音词,模型必须记住前面说过什么,才能输出正确的那一个。Qwen-Audio-3.0-ASR-Flash新增长音频Context能力:模型在转写当前语音片段时,可参考近期已识别的上下文,延续同一话题中的关键词与语义线索,从而减少同音词误判,提升术语和中英文混合表达的识别准确率。在一场长达数小时的会议录音中,同一位发言人的名字、同一个技术概念,不会因为跨了多个语音片段就被忘记或认错。
上下文记忆解决了“说过的词不再认错”,而很多专业词汇在整场对话中可能只出现一次,模型需要在从未见过的情况下也能一次听对。传统方案中,行业词识别往往依赖人工维护词表,Qwen-Audio-3.0-ASR-Flash将这一过程内化为模型自身能力,无需人工逐一设置,即可在真实业务场景中持续进化。通过持续挖掘医疗、IT编程、股票、社会名人等领域的实体词,研究团队构建了覆盖多行业的高质量词库,并基于这些实体词合成相关训练数据,增强模型对专业术语和低频词的识别能力。在最新的行业词汇内部评测中,新模型的行业词召回率均有显著提升,其中医疗场景突破95.36%。

行业词库覆盖了通用场景,但各行各业还有自己的长尾词,比如人名、品牌名、产品名和各类行业黑话。这些词频率低、更新快,不可能全部预装进模型,热词定制正是为了让它们也能被精准识别。传统方案长期面临一个矛盾:热词加得越多,误触发越多,识别结果反而被带偏。Qwen-Audio-3.0-ASR-Flash对热词定制能力进行了全面升级,采用模型结合声学证据与上下文进行智能判断的方式,而非简单替换。在传入热词的条件下,热词定制化准确率在所有测试集均达到90%以上,多数场景更是突破99%。
此外,Qwen-Audio-3.0-ASR-Flash还具备语音润色能力:口语中的“那个”“嗯”等填充词被直接去除;说话时的自我修正,如“我们下周三评审,不对,是周四”只保留最终意图;散乱的口述可自动整理为结构化表达。更重要的是,这些润色由ASR模型在识别环节一步完成,无需再调用下游文本大模型,链路更短、延迟更低、使用成本也更低。
即日起,Qwen-Audio-3.0-ASR-Flash已在阿里云百炼平台开放调用,用户可前往体验。
(本文不涉密)
责任编辑:路沙





