FireRedAudio – 小红书 FireRed 推出的通用音频语言模型
FireRedAudio是什么
FireRedAudio 是小红书 FireRed 团队推出的通用音频语言模型,基于 9B 参数 Qwen3.5 自回归 LLM。模型理解与生成分别使用独立的连续表征通道(Audio Encoder 与 RedAE),再汇入共享 LLM 统一推理。模型同时支持 ASR、音频问答、长达1小时的录音理解、Zero-shot TTS、指令 TTS 及语音编辑,在 MMAU、MMSU、多语种 ASR 和 Instruct TTS 等评测中均取得领先表现。

FireRedAudio的主要功能
-
音频理解:在 MMAU、MMSU 等综合音频问答评测中取得表内最佳成绩,覆盖语音、音乐与环境声理解。
-
多语种 ASR:支持 102 种语言识别,FLEURS-102 平均错误率 14.94%,低资源语种表现尤为突出。
-
Zero-shot TTS:给定任意参考语音即可合成新内容,中英文内容准确率表内领先。
-
Instruct TTS:遵循”用更慢的语速朗读”等自然语言指令,六项评测指标全部领跑。
-
语音编辑:支持语义层面的删除/插入/替换,以及声学层面的变速/变调/变音量。
-
长音频处理:支持最长 1 小时录音,能生成秒级精度的时间线结构化摘要。
FireRedAudio的技术原理
- 解耦连续表征:FireRedAudio 的不强迫理解与生成共享同一种音频表示,为两者分别设计独立的连续向量通道:理解侧需要紧凑语义特征以支持长上下文建模,生成侧需要可重建的精细声学特征以保留音色与韵律,两者在共享 LLM 中完成统一推理。
- 理解路径:音频由 Whisper-large-v3 初始化的 Audio Encoder 编码,经 Adapter 压缩为每秒 12.5 个连续表征后输入 9B LLM,直接输出识别文本或理解答案,适配 ASR、音频问答与长音频结构化任务。
- 生成路径:条件音频先经 RedAE(确定性自编码器)压缩为 25Hz、64 维连续 latent,预训练时通过冻结教师编码器进行语义蒸馏以保留内容线索;由 Patch Encoder 每 4 帧聚合成一个 audio step(6.25Hz)送入 LLM;LLM 每预测一个 audio-step token,以其隐藏状态驱动 flow-matching DiT 生成新 latent,最终由 RedAE Decoder 还原为 24kHz 波形。
- 五阶段渐进训练:训练依次完成 Adapter 对齐、Audio Encoder 适配、理解与生成联合训练、多任务后训练、以及 200k 长上下文扩展,累计约 2.66T 非填充多模态 token,逐步叠加能力而非一次性混合所有任务。
- 共享推理中枢:9B Qwen3.5 自回归 LLM 作为唯一可训练主干,负责跨模态推理、任务规划与上下文建模;理解与生成仅在输入表征层解耦,在推理层统一,使模型既能”听懂”又能”开口”而不牺牲各侧的信息保真度。

微信关注回复“开源”,加入AI开源项目交流群
如何使用FireRedAudio
-
环境配置:从 GitHub 仓库阅读环境与依赖安装说明,准备好运行环境。
-
获取权重:从 Hugging Face 官方页面下载模型权重与配置文件。
-
跑通样例:先执行官方提供的最小推理样例,验证模型版本、音频采样率与输出路径。
-
验证理解:分别测试 ASR 和音频问答功能,确认理解路径正常工作。
-
验证生成:分别测试 Zero-shot TTS 和指令 TTS,确认生成路径正常工作。
-
音频格式:生成任务中保持输入输出为 24 kHz 采样率,并记录 DiT 采样步数与显存峰值。
-
TTS 设置:Zero-shot TTS 时,用参考语音的最后两个 audio step 初始化声学历史,其他生成任务使用零初始化。
-
硬件评估:根据 9B 主干权重、KV cache 及 DiT 采样开销评估显存需求,长音频任务需额外预留上下文缓存空间。
FireRedAudio的核心优势
-
统一架构:一个 9B 自回归 LLM 同时承载音频理解与生成,避免多模块拼接带来的能力分散。
-
解耦表征:理解与生成分别使用最适合自身的连续表征通道,既保留语义紧凑性又不丢失声学细节。
-
性能领先:在 MMAU、MMSU、102 语种 ASR 及 Instruct TTS 六项指标上均取得表内最佳成绩。
-
长音频支持:通过 200k 上下文扩展,可处理最长 1 小时录音并输出秒级精度结构化时间线。
-
全栈覆盖:单模型支持 ASR、音频问答、Zero-shot TTS、指令 TTS、语义/声学语音编辑六大任务。
FireRedAudio的项目地址
- GitHub仓库:https://github.com/FireRedTeam/FireRedAudio
- HuggingFace模型库:https://huggingface.co/FireRedTeam/FireRedAudio
- arXiv技术论文:https://arxiv.org/pdf/2608.24168
FireRedAudio的同类竞品对比
| 对比维度 | FireRedAudio | Qwen3.5-Omni-Plus |
|---|---|---|
| 定位 | 专注音频领域的通用理解与生成模型 | 覆盖文本/图像/音频/视频的全模态通用模型 |
| 架构 | 9B 自回归 LLM + 解耦连续表征(Audio Encoder / RedAE) | 更大规模端到端多模态架构,所有模态统一处理 |
| 理解评测 | MMAU test 80.9、MMSU 83.3,均为表内最佳 | MMAU test 79.9、MMSU 80.7,略低于 FireRedAudio |
| 多语种 ASR | FLEURS-102 平均 WER 14.94%,低资源语种优势显著 | FLEURS-102 平均 WER 23.66%,多语种覆盖稍弱 |
| 生成能力 | 支持 Zero-shot TTS、Instruct TTS、语音编辑,DiT 输出 24kHz 波形 | 支持语音合成与理解,但不侧重语音编辑与细粒度声学控制 |
| 长音频 | 200k 上下文支持 1 小时录音,strict@0 通过率 73.6% | 具备长音频处理能力,但论文中未展示同量级 1 小时结构化评测 |
FireRedAudio的应用场景
-
智能会议助理:将 1 小时会议录音自动转写为带秒级时间戳的结构化纪要,并提取关键决策与待办事项。
-
多语种内容本地化:输入中文视频,自动识别原声并生成英语、日语等多语种配音,保持原说话人音色与情感风格。
-
播客/有声书后期制作:通过自然语言指令调整语速、音量或替换特定语句,无需重新录制即可完成语音编辑。
-
智能客服语音交互:实时理解用户语音咨询(含环境噪音与口音),并以指定音色、语速生成回复语音,实现端到端语音对话。
-
音频内容审核与检索:对长音频平台的海量内容做结构化理解,支持”找出所有提到价格欺诈的片段”等语义级检索与标注。
©️版权声明:若无特殊声明,本站所有文章版权均归AI工具集原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。
粤公网安备 123456789号