IndexTTS-2.5:开源零样本文本转语音系统,支持五种语言、情感与语速控制
摘要
IndexTTS 已迭代至 2.5,可用单段参考音频完成零样本语音克隆,并支持中英日韩西阿五种语言、情感解耦、发音与语速控制。本文整理其核心能力、安装方式、WebUI、CLI、推理性能与使用限制。
本文目录
IndexTTS是一个面向零样本文本转语音(Zero-Shot TTS)的开源项目:给它一段参考音频,它就能在不针对目标说话人重新训练模型的情况下,合成接近该音色的新语音。项目目前已经迭代到 IndexTTS-2.5,重点不只是“把文字读出来”,而是进一步处理跨语言音色克隆、情感表达、语速和发音控制,以及更接近生产部署的推理效率。
2026年8月10日发布的 IndexTTS-2.5是当前仓库重点推荐的版本。它支持中文、英语、日语、西班牙语和阿拉伯语,并保留跨语言合成以及音色与情感解耦能力。对需要做配音、本地化内容、数字人语音、播客或有声内容生成的开发者来说,这类控制能力比单纯追求“像某个人说话”更实用,因为同一个参考音色可以继续调整语言、情绪、发音和节奏。
IndexTTS-2.5主要解决什么问题
传统语音克隆很容易遇到两个问题:一是音色像了,但情绪和表达容易被参考音频绑死;二是遇到多音字、外语发音或特定人名时,生成结果不够可控。IndexTTS系列一直在围绕这些问题迭代。早期版本在中文场景中加入字与拼音混合建模,IndexTTS-2又强化了情感语音合成,而2.5进一步把多语言、发音控制、语速控制和部署效率放到同一套系统里。
当前版本支持中文拼音、英语 CMU音素和日语假名控制,可以在文本中对容易读错的词直接标注目标读音。语速则通过 `duration_factor` 调整,官方给出的有效范围是0.5到2.0;数值大于1会延长语音时长、降低语速,小于1则会加快。
情感控制也是 IndexTTS-2/2.5的核心能力。项目把说话人特征和情感特征拆开处理,并支持使用情感参考音频、情感向量以及自然语言情绪描述等方式控制输出。这样做的直接好处是,不必为了获得“高兴”“紧张”或“悲伤”的表达,专门寻找同一个说话人在对应情绪下录制的参考音频。
推理速度也在继续优化
IndexTTS-2.5不只是增加功能,官方还给出了与 IndexTTS-2的推理速度对比。在 RTX 4090、启用 KV Cache的测试中,官方使用 RTF(实际计算时间 / 生成音频时长,越低越快)作为指标。以80个字符的测试为例,IndexTTS-2.5 BF16的 RTF为0.1997,而 IndexTTS-2 FP16为0.3229;200字符场景下分别为0.1997和0.3244。
仓库同时提供基于 NVIDIA TensorRT、TensorRT-LLM和 Triton Inference Server的加速后端,可用于批量请求和流式生成。IndexTTS-2.5还提供 vLLM生产部署方案,这让它不再只是一个本地 WebUI演示项目,而是开始覆盖服务化推理场景。
安装与模型下载
项目当前推荐使用 `uv` 管理环境。官方明确提醒,依赖版本与 GPU环境较复杂,因此不建议用普通 pip或 conda自行拼装完整运行环境。基础安装流程如下:
git clone https://github.com/index-tts/index-tts.git
cd index-tts
pip install -U uv
uv sync --all-extras如果安装过程中出现 CUDA相关错误,官方文档要求检查 NVIDIA CUDA Toolkit 12.8或更高版本。Windows下如果 DeepSpeed安装困难,可以不使用 `--all-extras`,只安装自己需要的额外功能。
IndexTTS-2.5模型可以从 Hugging Face或 ModelScope下载。Hugging Face方式如下:
uv tool install "huggingface-hub"
hf download IndexTeam/IndexTTS-2.5 --local-dir=checkpoints国内网络环境也可以直接使用 ModelScope:
uv tool install "modelscope"
modelscope download --model IndexTeam/IndexTTS-2.5 --local_dir checkpoints项目首次运行时还可能自动下载一些小模型和示例音频。如果 Hugging Face连接较慢,可以先配置镜像地址。
export HF_ENDPOINT="https://hf-mirror.com"最快的体验方式:直接启动 WebUI
模型准备好之后,可以直接启动项目自带的 Web界面:
uv run webui.py默认访问地址是 `http://127.0.0.1:7860`。当前默认加载 IndexTTS-2.5;如果要运行旧的 IndexTTS-2,可以通过版本参数和独立模型目录启动。
uv run webui.py --version 2 --model_dir ./checkpoints_2WebUI适合快速测试不同参考音频、文本和情感设置。对显存有限的设备,IndexTTS-2.5可以使用 BF16;IndexTTS-2则支持 FP16。官方说明半精度推理通常可以减少显存占用并加快速度,同时只带来很小的质量损失。
命令行与 Python调用
仓库也提供 CLI和 Python推理入口,适合批量生成或接入已有工作流。IndexTTS-2.5的基础命令行推理可以这样运行:
PYTHONPATH="$PYTHONPATH:." uv run indextts/infer_v2_5.py \
--cfg_path checkpoints/config.yaml \
--model_dir checkpoints \
--text "Hello world" \
--lang EN项目还注册了 `indextts` 和 `indextts2` 两套 CLI,可继续处理模型初始化、下载、环境检查、单条合成、批量合成和音频拼接等任务。对于需要自动化生产语音的场景,比手动操作 WebUI更合适。
发音和语速控制为什么重要
在实际内容生产里,TTS最影响可用性的往往不是总体音质,而是几个局部错误:品牌名读错、中文多音字读错、英文专有名词重音不对,或者一段旁白整体节奏和画面不匹配。IndexTTS-2.5对这类问题提供了更直接的控制方式。
例如中文可以为多音字指定拼音,英语可以用 CMU音素覆盖默认读法,日语则可以用假名指定发音。语速可以通过 `duration_factor` 微调,不必在生成后再依赖音频软件整体拉伸。对于视频配音、课程旁白和需要卡时长的自动化内容流程,这些功能会明显减少后期处理。
使用前需要注意的地方
IndexTTS虽然公开了代码和模型,但并不是采用 MIT、Apache这类常见宽松开源许可证。项目使用 bilibili Model Use License Agreement,并单独提供免责声明。准备把它用于商业产品、对外服务或大规模语音生成前,应先阅读仓库中的许可条款和 DISCLAIMER,确认具体使用范围。
硬件环境也需要提前评估。完整安装涉及 PyTorch、CUDA以及可选的 DeepSpeed、TensorRT等组件,不同 GPU、驱动和系统上的实际速度差异会比较明显。官方自己也提醒,DeepSpeed并不是所有机器都一定更快,最好在目标硬件上分别测试。
从目前的项目状态看,IndexTTS已经从“零样本音色克隆模型”逐渐发展成一套强调可控性的语音合成工具链。多语言、情感解耦、发音修正、语速控制、WebUI、CLI和服务化部署都已经有明确入口。如果你的目标是搭建可本地部署、可继续集成的 TTS或语音克隆工作流,IndexTTS-2.5是目前值得实际跑起来测试的一套开源方案。
