Spark-ASR-2.0 – 讯飞推出的最新一代语音识别大模型

AI项目 2026-09-25

Spark-ASR-2.0是什么

Spark-ASR-2.0是讯飞基于星火语音基座大模型Spark-Audio的最新一代语音识别大模型。模型采用”非自回归+LLM增强自回归”协同架构,实现中英文混合、方言、专业术语、高噪小音量等复杂场景识别,效果超业界最优水平,推理成本仅增10%。模型可自动去口头禅、补标点、规范表达,已在讯飞输入法上线并开放API,后续将落地AI眼镜、办公本等终端。

Spark-ASR-2.0

Spark-ASR-2.0的主要功能

  • 中英文混合识别:复杂混说场景下精准识别,无需切换。
  • 方言免切换识别:支持全国202个城市的方言,随心说精准转。
  • 专业术语识别:医学、化学、科技等拗口术语识别能力显著提升。
  • 复杂声学场景识别:高噪声、小音量、快语速、儿童语音等场景表现出众,优于业界最优水平。
  • 上下文识别:融合识别历史、修改记录与热词,消解同音词与语义歧义。
  • 文本流畅规范化:自动精简冗余、去除口头禅、补全标点、规范数字符号单位,实现”出口成章”。

Spark-ASR-2.0的技术原理

  • 非自回归与LLM增强自回归协同架构:延续Spark-ASR-1.0的非自回归范式,并行一次性输出整个文本序列,保证推理效率;同时引入LLM增强的自回归识别,两者协同提升整体准确率与语言理解能力。
  • 中英文混合文本与声学联合增强:针对文本层面与声学层面分别建模增强,再进行联合优化,使模型在中英文混合、方言、专业术语等通用识别场景下效果大幅提升。
  • 动态上下文注入:在识别过程中实时融合用户的历史识别内容、修改记录及个性化热词信息,结合上下句语境进行理解判断,有效消解易混淆发音与相似名词带来的识别偏差。
  • 语音基座大模型能力延续:整体构建于Spark-Audio-1.0-Preview语音基座之上,继承其复杂声学场景的识别优势,在此基础上针对准确性与文本规范性做专项优化。

如何使用Spark-ASR-2.0

方式一:在线体验

  • 打开体验页面:访问 https://iflytekresearch.iflytek.com/experience/spark-asr
  • 输入或录制语音:在页面中直接说话或上传音频,即可实时查看识别结果。

方式二:讯飞输入法

  • 下载讯飞输入法:扫码或在应用商店安装最新版讯飞输入法。
  • 切换语音输入:在输入界面点击麦克风图标,长按说话即可使用Spark-ASR-2.0识别。

方式三:API接入(开发者)

  • 访问开放平台:登录讯飞开放平台 https://www.xfyun.cn/services/spark_asr_zh_en_v2.0
  • 创建应用并获取密钥:注册应用后获取AppID、APIKey等鉴权信息。
  • 调用API服务:按照接口文档传入音频流,即可在自己的应用中集成识别能力。

Spark-ASR-2.0的核心优势

  • 识别效果业界领先:方言、高噪、小音量等场景优于当前业界最好水平,WER明显降低。
  • 推理成本极低:效果大幅提升的同时,推理成本相对1.0仅增加10%。
  • 非自回归高效架构:并行一次性输出文本序列,兼顾高准确率与推理效率。
  • 复杂场景全覆盖:中英文混合、202城方言免切换、专业术语、快语速、儿童语音均能精准识别。
  • 强上下文理解:融合识别历史与热词动态消歧,准确处理同音词与相似名词。
  • 流畅成文输出:自动去口头禅、补标点、规范数字符号,直接输出工整连贯的正式文本。

Spark-ASR-2.0的同类竞品对比

对比维度 讯飞 Spark-ASR-2.0 商汤 AudioClaw
产品定位 专用语音识别大模型(ASR底座能力) AI原生智能输入法/语音智能体应用
大模型底座 星火语音基座大模型 Spark-Audio-1.0-Preview 商汤日日新多模态大模型 + OpenClaw生态
技术架构 非自回归 + LLM增强自回归协同架构 自研ASR + 多模态大模型语义优化
方言支持 全国202个城市方言免切换识别 支持部分方言与多语种互译
上下文能力 动态上下文注入,融合历史、修改记录、热词消歧 自动沉淀专属知识库,跨会议问答检索
特色功能 “流畅成文”:去口头禅、补标点、规范数字符号单位 口语净化、改口识别、会议总结、语音指令改写翻译
识别性能 方言、高噪、小音量优于业界最优水平,推理成本仅增10% 毫秒级响应,嘈杂环境与专业术语场景精准识别
落地渠道 讯飞输入法、开放平台API、AI眼镜、办公本、讯飞听见 客户端即装即用,无缝接入微信等应用

Spark-ASR-2.0的应用场景

  • 移动输入:在讯飞输入法中语音打字,中英混说、方言随意说,自动”出口成章”可直接发送。
  • 会议记录:办公本/讯飞听见实时转写会议内容,高噪会议室也能精准识别并规范成稿。
  • 专业领域记录:医学、化学、科技领域讨论与讲座的语音记录,复杂术语准确转写。
  • 智能硬件交互:讯飞AI眼镜、翻译机等设备中的语音指令与对话识别,弱音量环境稳定工作。
  • 开发者业务集成:通过开放平台API为客服、字幕生成、语音录入等企业应用提供高准确率、低成本的识别底座。
©️版权声明:若无特殊声明,本站所有文章版权均归AI工具集原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

相关文章