FireRedTTS3 – 小红书开源的统一语音生成与编辑模型
FireRedTTS3是什么
FireRedTTS3 是小红书 FireRed 团队开源的统一语音生成与编辑模型。模型基于 RedAE 语义增强连续表示与 LLM-DiT 架构,单一模型可实现24 种语言 + 21 种中文方言的零样本音色克隆、自然语言描述的声音设计,以及指定区域的精准语音编辑。模型在四个公开评测集上均取得最优结果,已全面开源可本地部署。

FireRedTTS3的主要功能
-
零样本音色克隆:给定几秒参考音频,即可用该音色合成 24 种语言及 21 种中文方言的语音。
-
声音设计:通过自然语言描述即可生成此前不存在的全新音色,无需参考音频。
-
语音编辑:对已有语音的指定区域进行精准修改,包括改词、调速、变调、调音量,其余部分保持不变。
FireRedTTS3的技术原理
- RedAE 语义增强连续表示:在 tokenizer 训练阶段引入语义教师模型进行特征蒸馏,将语义信息注入连续 latent,既保留声学细节又缓解自回归误差累积,无需额外语义模块或多阶段训练。
- LLM-DiT 生成框架:以 Qwen3-1.7B 为 Backbone 继承文本理解与指令跟随能力,通过 Aggregator 压缩序列后自回归建模,再由 DiT 模块在 Backbone 条件下做 patch 级去噪生成,保持时间连贯性。
- 先规划再合成(Instruct 版):将自然语言指令解析为结构化声学方案或编辑掩码,再映射到 RedAE 表示进行合成,实现对声音设计和语音编辑的精准控制,不破坏未指定区域。

微信关注回复“开源”,加入AI开源项目交流群
如何使用FireRedTTS3
-
环境准备:克隆 GitHub 仓库并安装
requirements.txt中的依赖。 -
模型下载:通过 ModelScope 下载
FireRedTeam/FireRedTTS3预训练模型到本地目录。 -
语种识别(可选):下载 FastText 语言识别模型,让 Base 版自动判断输入文本的语种。
-
零样本克隆:加载 Base 版模型,传入参考音频、参考文本和目标文本即可生成对应音色语音。
-
声音设计:调用 Instruct 版的
generate_voice_design,仅传入自然语言描述和目标文本即可生成全新音色。 -
语义编辑:调用
generate_semantic_edit,用自然语言指令指定插入、删除或替换内容,修改指定区域。 -
声学编辑:调用
generate_acoustic_edit,使用固定模板指令(如adjust the speed to 0.5x)调整语速、音高或音量。 -
方言合成:传入带
ZH_前缀的方言标签(如ZH_Sichuan),并尽量使用同方言参考音频以获得最佳效果。
FireRedTTS3的核心优势
- 三任务统一建模:将音色克隆、声音设计、语音编辑整合到单一模型,无需为不同任务分别训练或切换模型,降低系统复杂度。
- RedAE 语义增强连续表示:在 tokenizer 训练阶段即注入语义信息,既避免了离散 token 的声学细节损失,又缓解了连续自回归的误差累积,兼顾音质与稳定性。
- 顶尖的多语言/方言能力:支持 24 种语言与 21 种中文方言的零样本克隆,在 MiniMax-MLS-Test 的 24 语种评测中 22 个语言位列前二。
- 四个公开榜单全面领先:在 Seed-TTS-Eval、MiniMax-MLS-Test、InstructTTSEval、Ming-Freeform-Audio-Edit 上,字错率与说话人相似度均取得最优或次优成绩。
- 精准可控的先规划、再合成:Instruct 版将自然语言指令解析为结构化声学方案后再渲染,确保编辑只影响指定区域,其余内容和音色保持不变。
FireRedTTS3的项目地址
- GitHub仓库:https://github.com/FireRedTeam/FireRedTTS3
- HuggingFace模型库:https://modelscope.cn/models/FireRedTeam/FireRedTTS3
FireRedTTS3的同类竞品对比
| 对比维度 | FireRedTTS3 | CosyVoice3 |
|---|---|---|
| 开发团队 | 小红书 FireRed 团队 | 阿里通义实验室 |
| 开源状态 | 模型 + 代码 + Demo 全面开源 | 部分版本开源 |
| 核心能力 | 克隆 / 设计 / 编辑 统一建模 | 侧重语音克隆与指令控制 |
| 语言与方言 | 24 种语言 + 21 种中文方言 | 多语言支持,方言覆盖较少 |
| 技术路线 | RedAE 连续表示 + LLM-DiT | 离散 Token + Flow Matching |
| 零样本克隆 | Seed-TTS-Eval 相似度 78.8% | Seed-TTS-Eval 相似度 75.3% |
| 声音设计 | 自然语言描述生成全新音色 | 主要支持风格 / 情感控制 |
| 语音编辑 | 支持精准局部编辑(改词/调速/变调) | 编辑能力有限,非核心功能 |
| 推理部署 | 支持本地 GPU 部署,提供完整 API | 支持本地部署 |
FireRedTTS3的应用场景
-
多语言有声内容制作:用几秒参考音频克隆音色,快速生成 24 种语言的有声书或播客,无需聘请多语种配音员。
-
游戏与虚拟角色配音:通过自然语言描述设计专属角色音色,或精准编辑已有台词中的个别字词,避免整句重录。
-
视频与播客后期剪辑:在成品语音中直接替换错误词汇、调整语速或删除冗余片段,无需回到录音棚重新录制。
-
品牌智能客服:零样本克隆企业专属客服音色,保持一致的品牌声音形象,同时支持多语言服务。
-
方言内容创作:用 21 种中文方言合成本地化内容,如方言短视频、地方文化节目,大幅降低方言配音门槛。
©️版权声明:若无特殊声明,本站所有文章版权均归AI工具集原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。
粤公网安备 123456789号