VoiceStudio:把语音克隆、配音和转写留在本地的开源语音工作台
摘要
VoiceStudio 是一套本地优先的开源语音工作台,整合语音克隆、语音设计、视频配音、实时听写、转写、有声书与 OpenAI 兼容 API,并支持 MCP、Docker 和多种本地推理后端。
本文目录
VoiceStudio:把语音克隆、配音和转写留在本地的开源语音工作台
VoiceStudio是一个开源、本地优先的语音生产平台,前身名为 OmniVoice-Studio。它把语音克隆、语音设计、视频配音、实时听写、转写、长音频与有声书制作放进同一套桌面工作流里,核心卖点不是“再做一个 TTS界面”,而是尽量让音频、文本、项目和模型都留在用户自己的设备上运行。对于不想把素材持续上传到云端,或者需要大量生成音频而不想按字符、分钟或调用量计费的用户,这类工具有比较明确的吸引力。

VoiceStudio 官方项目截图
它把多个语音工作流做成了一套本地工具
VoiceStudio当前整合了16个 TTS引擎和11个 ASR引擎,并提供646种 TTS语言目录,不过具体语言覆盖和效果仍取决于所选引擎。它支持 macOS、Windows、Linux和 Docker,计算侧可以使用 CUDA、Apple Silicon的 MPS/MLX、Linux下的 ROCm,也可以退回 CPU,另外还支持远程 worker。
项目的功能范围已经超出普通语音合成工具。除了根据短音频进行零样本语音克隆,它还支持通过年龄、口音、音高、风格和表达方式等描述来设计声音;视频配音流程可以完成转写、翻译、保留说话人、重新合成和导出;长内容方面则支持多角色脚本、EPUB/PDF导入、章节渲染和 M4B导出。系统级听写、Demucs人声分离、Pyannote/WhisperX说话人区分、批处理队列和模型目录也都被整合进同一个应用。
对实际使用者来说,这种设计的价值在于不需要为每个环节单独拼接工具。做一段视频配音时,从语音识别到翻译、说话人处理、语音生成和导出都可以在同一套工作流里完成;做有声书时,又可以继续复用相同的声音、模型和项目数据。
本地优先,是它和云端语音服务最大的区别
VoiceStudio明确把自己定位为本地运行的 ElevenLabs替代方案。默认情况下,声音、项目、设置和输出保存在本机,核心创作流程不要求账户、API Key、订阅或用量计费。远程 worker、OpenAI兼容 ASR等涉及外部连接的能力则是可选项。
这种路线并不意味着“完全没有成本”。云端语音服务把算力、部署和扩缩容交给服务商,而 VoiceStudio把这些责任重新交给用户:模型需要下载到本地,占用磁盘空间;生成速度取决于显卡和所选引擎;某些大模型需要更多显存;版本更新和运行环境也需要自己维护。它更适合重视隐私、离线、自托管、高频生成或可定制性的用户,而不是只想打开网页立刻生成几段语音的人。
架构并不只是桌面壳,后端还能单独作为语音平台使用
VoiceStudio的桌面端采用 Tauri v2和 React/Vite,底层由 FastAPI提供本地后端服务,桌面应用通过 localhost:3900与后端通信。后端再连接 TTS/ASR引擎注册表、视频配音与长音频流水线、SQLite数据层,以及可选的远程 worker。
更有意思的是,它还提供 OpenAI兼容的音频 API。已有程序如果本来通过 OpenAI风格的接口做语音合成或转写,只需要把 base URL改成本地 VoiceStudio地址,就可以复用现有客户端逻辑。项目同时提供 REST、SSE、WebSocket、MCP Server,这让它既能作为桌面应用使用,也可以被自动化脚本、AI Agent、编辑器或其他本地软件调用。
例如,Python客户端可以直接连接本地服务:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:3900/v1",
api_key="local",
)
with client.audio.speech.with_streaming_response.create(
model="tts-1",
voice="<profile-id>",
input="Made on my own hardware.",
response_format="wav",
) as response:
response.stream_to_file("speech.wav")它还内置 MCP Server,Claude Desktop、Cursor等支持 MCP的客户端可以直接调用语音生成、语音克隆和转写工具。对于已经在使用 AI Agent的用户,这一点比单纯的桌面语音工具更有扩展空间。
安装方式覆盖桌面端和 Docker
普通用户可以直接下载项目发布的安装包。当前支持 macOS 13.3以上的 Apple Silicon设备、Windows 10/11 x64,以及 glibc 2.39以上的 Linux x86_64。Linux还提供 AppImage,Docker则提供 Linux/AMD64镜像和 CUDA、ROCm、CPU等运行配置。
如果从源码运行,需要 Node 20+/Bun和 Python 3.11+:
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop桌面启动器首次运行时会通过 uv自动建立 Python环境并准备依赖,之后会复用已有环境。项目也提供浏览器开发模式和比较完整的诊断流程,如果安装失败,可以从应用内执行 self-check,或者运行深度诊断命令。
硬件要求需要提前看清楚
VoiceStudio可以在没有 GPU的情况下使用 CPU,但如果希望获得更好的生成速度,显卡仍然很重要。项目文档把4GB VRAM视为加速工作的最低起点,默认的多阶段工作流更适合8GB以上显存,部分较大的可选引擎可能需要12GB到16GB或更多。
Apple Silicon用户可以使用 MPS和 MLX,但 Intel Mac目前不能在本机运行项目的 Python后端,只能连接远程后端。Docker镜像目前也是 Linux/AMD64为主,因此 ARM64用户不能简单照搬所有容器部署方式。对于准备把它放到 NAS、家用服务器或低功耗设备上的用户,这些平台限制比功能表本身更值得先确认。
目前仍处于活跃 Beta阶段
VoiceStudio的能力已经很完整,但项目明确标注为 Active beta,并建议稳定工作优先使用最新 Release,而不是直接跟随 main分支。不同语音引擎的质量、语言支持、显存需求和速度差异也很大,因此“支持646种语言”更准确地说是语言目录规模,并不代表每个引擎都能在每种语言上获得相同质量。
项目采用 AGPL-3.0许可证,下载的模型则继续遵守各自上游许可证。对于个人本地使用,这通常不会成为障碍;如果要把 VoiceStudio嵌入商业服务、二次分发或对外提供网络服务,则应该认真确认 AGPL以及各个模型许可证的要求。
VoiceStudio最值得关注的地方,是它把过去分散在语音克隆、TTS、ASR、视频配音、长音频、系统听写和 Agent工具之间的能力,逐步收进一个本地语音平台里。它并不能消除本地部署的硬件和维护成本,但对隐私敏感、生成量大、希望离线运行,或者想把语音能力接入自己的自动化与 AI Agent工作流的人来说,已经具备了相当完整的可用形态。
同类栏目导航