站长之家(ChinaZ.com)7月31日 消息:阿里发布新一代语音识别大模型 Qwen-Audio-3.0-ASR-Flash,重点优化了专业词汇的识别表现。该模型已在医疗等垂直场景中展现出较高准确率,相关听写准确率突破九成五。
语音识别在通用对话中已相对成熟,但在医学、法律、工业等专业领域,由于术语密集且发音相近词多,模型常常出现误判。此次新模型强化了对专业词的处理能力,使其更贴合真实行业场景的需求。
阿里已开放三个不同版本的模型调用,方便开发者按需接入。这种分层开放的策略,既照顾了轻量应用的成本诉求,也为对精度要求更高的企业用户留出空间。
在智能助手、会议转写、无障碍辅助等需求快速增长的背景下,垂直场景的语音识别正成为大模型落地的重要入口。谁能在专业术语与方言口音上建立优势,谁就更有可能在 B 端市场占据先机。