腾讯混元开源 AuK:一个把语音生成、编辑、增强和分离统一起来的 1.5B 基础模型
摘要
腾讯混元团队开源 AuK,一款 1.5B 参数语音生成与编辑基础模型。它用统一自然语言指令支持 TTS、内容编辑、情绪与音色修改、语音增强和分离,并提供 AuK Flash、Gradio、ComfyUI 与 Python API。
本文目录
腾讯混元团队最近开源了 AuK,一个面向语音生成与编辑的1.5B参数基础模型。它不是只做传统 TTS,而是试图用统一的自然语言指令接口,把语音生成、内容编辑、声学编辑、情绪与音色控制、语音增强以及音源分离放进同一套模型里。项目代码和模型权重已经公开,许可证为 MIT。
AuK于2026年9月9日正式开源。项目位于 Tencent-Hunyuan官方 GitHub组织下,许可证文件也明确标注 Copyright (C) 2026 Tencent,因此可以确认这是腾讯混元团队推出的开源项目。官方同时发布了 AuK和 AuK-Flash两个版本:前者偏重生成质量,后者通过蒸馏实现固定4步推理,用于降低推理成本、提高速度。

AuK 官方模型架构图,来源:Tencent-Hunyuan/AuK
一个模型覆盖多种语音任务
AuK最值得关注的地方,是它把原本需要多个不同模型完成的语音任务统一到了同一个自然语言指令入口。用户可以直接描述想对音频做什么,而不是为 TTS、降噪、变声、语音编辑和人声分离分别部署不同模型。
目前官方列出的能力包括零样本 TTS、基于描述生成语音、修改已经说出的内容、改写歌曲歌词、调整音高、语速和音量,以及修改情绪、音色、口音、呼吸声、笑声和咳嗽等非语言声音。它还可以完成语音去噪与去混响、多人语音分离、音乐人声提取,以及根据目标说话内容保留指定说话人。
其中一个比较有代表性的能力是 Speech Content Editing。用户可以给模型一段已有录音,再用自然语言告诉它替换、插入或删除哪一段内容,模型会直接生成编辑后的语音。对于播客、配音、短视频旁白和数字人内容来说,这类能力比单纯重新生成整段语音更接近真实生产流程。
训练规模和模型结构
根据 AuK技术报告,团队构建了约30.3亿条 instruction-audio训练实例,并形成约195万小时的有效监督数据,覆盖语音生成、内容编辑、增强与分离、副语言编辑和声学编辑五类任务。
模型结构由三部分协同工作:多模态大语言模型负责语义条件理解,VAE负责语音、通用音频和音乐的声学表示,生成部分则采用混合 rectified-flow Transformer。训练流程先从纯生成能力开始,再进入生成与编辑联合预训练,后续还加入针对开放式编辑的人类偏好优化,以及面向语音生成的奖励强化学习。

AuK 官方性能图,来源:Tencent-Hunyuan/AuK
AuK-Flash则进一步针对推理成本做了蒸馏。官方技术报告称,它可以在不使用 classifier-free guidance的情况下进行4步推理,在相同条件下相比完整模型取得约4.5倍的 wall-clock加速。对于需要批量生成或实时性更高的应用,这个版本会更有实际部署价值。
使用方式比较完整
AuK已经提供命令行、Python API、Gradio Web界面和 ComfyUI集成。官方推荐使用 Python 3.10环境,安装方式也比较直接:
git clone https://github.com/Tencent-Hunyuan/AuK
cd AuK
uv venv --python 3.10
source .venv/bin/activate
uv pip install -e .如果需要 Gradio、Prompt Enhancer和 ASR等附加能力,可以安装对应扩展:
uv pip install -e ".[gradio]"模型权重同时提供在 Hugging Face和 ModelScope。AuK Base、AuK-Flash以及当前所需的 Qwen2.5-Omni-3B编码器需要分别下载。项目当前明确使用 Qwen2.5-Omni-3B,README也说明暂不支持通过 `--qwen_path` 切换到 Qwen3-Omni。
对于不想直接写代码的用户,Gradio和 ComfyUI会更方便。ComfyUI集成已经提供 AuK Model Loader和 AuK Generate / Edit节点,可以把语音生成、编辑、增强和分离放进可视化工作流中。官方还提供 Prompt Enhancer,用 OpenAI-compatible LLM把自由描述整理成更适合 AuK执行的指令,并自动估算目标时长和所需音频预处理。
适合什么场景
从能力组合来看,AuK很适合语音内容生产、播客修订、数字人配音、短视频旁白、语音数据清洗和音乐人声处理。如果团队原本就需要同时部署 TTS、音频编辑、降噪和分离模型,AuK的统一接口会明显降低工作流复杂度。
它也有一些现实限制。不同任务对显存、推理时长和输入长度的要求并不完全相同,ComfyUI当前集成还存在 source-plus-target总时长30秒的限制;另外,复杂情绪、细粒度音色编辑和开放式语音修改的效果,也仍然需要结合实际素材测试。
AuK的意义不只是腾讯又开源了一个 TTS模型,而是把“生成”和“编辑”放进同一个基础语音模型里。对于想研究下一代语音 Agent、自动配音、可编辑播客和多模态内容生产的开发者来说,这个项目已经具备比较完整的实验和二次开发基础。
同类栏目导航