Spark-ASR-2.0 – 讯飞推出的最新一代语音识别大模型
Spark-ASR-2.0是什么
Spark-ASR-2.0是讯飞基于星火语音基座大模型Spark-Audio的最新一代语音识别大模型。模型采用”非自回归+LLM增强自回归”协同架构,实现中英文混合、方言、专业术语、高噪小音量等复杂场景识别,效果超业界最优水平,推理成本仅增10%。模型可自动去口头禅、补标点、规范表达,已在讯飞输入法上线并开放API,后续将落地AI眼镜、办公本等终端。

Spark-ASR-2.0的主要功能
-
中英文混合识别:复杂混说场景下精准识别,无需切换。
-
方言免切换识别:支持全国202个城市的方言,随心说精准转。
-
专业术语识别:医学、化学、科技等拗口术语识别能力显著提升。
-
复杂声学场景识别:高噪声、小音量、快语速、儿童语音等场景表现出众,优于业界最优水平。
-
上下文识别:融合识别历史、修改记录与热词,消解同音词与语义歧义。
-
文本流畅规范化:自动精简冗余、去除口头禅、补全标点、规范数字符号单位,实现”出口成章”。
Spark-ASR-2.0的技术原理
- 非自回归与LLM增强自回归协同架构:延续Spark-ASR-1.0的非自回归范式,并行一次性输出整个文本序列,保证推理效率;同时引入LLM增强的自回归识别,两者协同提升整体准确率与语言理解能力。
- 中英文混合文本与声学联合增强:针对文本层面与声学层面分别建模增强,再进行联合优化,使模型在中英文混合、方言、专业术语等通用识别场景下效果大幅提升。
- 动态上下文注入:在识别过程中实时融合用户的历史识别内容、修改记录及个性化热词信息,结合上下句语境进行理解判断,有效消解易混淆发音与相似名词带来的识别偏差。
- 语音基座大模型能力延续:整体构建于Spark-Audio-1.0-Preview语音基座之上,继承其复杂声学场景的识别优势,在此基础上针对准确性与文本规范性做专项优化。
如何使用Spark-ASR-2.0
方式一:在线体验
- 打开体验页面:访问 https://iflytekresearch.iflytek.com/experience/spark-asr
- 输入或录制语音:在页面中直接说话或上传音频,即可实时查看识别结果。
方式二:讯飞输入法
- 下载讯飞输入法:扫码或在应用商店安装最新版讯飞输入法。
- 切换语音输入:在输入界面点击麦克风图标,长按说话即可使用Spark-ASR-2.0识别。
方式三:API接入(开发者)
- 访问开放平台:登录讯飞开放平台 https://www.xfyun.cn/services/spark_asr_zh_en_v2.0
- 创建应用并获取密钥:注册应用后获取AppID、APIKey等鉴权信息。
- 调用API服务:按照接口文档传入音频流,即可在自己的应用中集成识别能力。
Spark-ASR-2.0的核心优势
-
识别效果业界领先:方言、高噪、小音量等场景优于当前业界最好水平,WER明显降低。
-
推理成本极低:效果大幅提升的同时,推理成本相对1.0仅增加10%。
-
非自回归高效架构:并行一次性输出文本序列,兼顾高准确率与推理效率。
-
复杂场景全覆盖:中英文混合、202城方言免切换、专业术语、快语速、儿童语音均能精准识别。
-
强上下文理解:融合识别历史与热词动态消歧,准确处理同音词与相似名词。
-
流畅成文输出:自动去口头禅、补标点、规范数字符号,直接输出工整连贯的正式文本。
Spark-ASR-2.0的同类竞品对比
| 对比维度 | 讯飞 Spark-ASR-2.0 | 商汤 AudioClaw |
|---|---|---|
| 产品定位 | 专用语音识别大模型(ASR底座能力) | AI原生智能输入法/语音智能体应用 |
| 大模型底座 | 星火语音基座大模型 Spark-Audio-1.0-Preview | 商汤日日新多模态大模型 + OpenClaw生态 |
| 技术架构 | 非自回归 + LLM增强自回归协同架构 | 自研ASR + 多模态大模型语义优化 |
| 方言支持 | 全国202个城市方言免切换识别 | 支持部分方言与多语种互译 |
| 上下文能力 | 动态上下文注入,融合历史、修改记录、热词消歧 | 自动沉淀专属知识库,跨会议问答检索 |
| 特色功能 | “流畅成文”:去口头禅、补标点、规范数字符号单位 | 口语净化、改口识别、会议总结、语音指令改写翻译 |
| 识别性能 | 方言、高噪、小音量优于业界最优水平,推理成本仅增10% | 毫秒级响应,嘈杂环境与专业术语场景精准识别 |
| 落地渠道 | 讯飞输入法、开放平台API、AI眼镜、办公本、讯飞听见 | 客户端即装即用,无缝接入微信等应用 |
Spark-ASR-2.0的应用场景
-
移动输入:在讯飞输入法中语音打字,中英混说、方言随意说,自动”出口成章”可直接发送。
-
会议记录:办公本/讯飞听见实时转写会议内容,高噪会议室也能精准识别并规范成稿。
-
专业领域记录:医学、化学、科技领域讨论与讲座的语音记录,复杂术语准确转写。
-
智能硬件交互:讯飞AI眼镜、翻译机等设备中的语音指令与对话识别,弱音量环境稳定工作。
-
开发者业务集成:通过开放平台API为客服、字幕生成、语音录入等企业应用提供高准确率、低成本的识别底座。
©️版权声明:若无特殊声明,本站所有文章版权均归AI工具集原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。
粤公网安备 123456789号