腾讯混元开源 AuK:一个把语音生成、编辑、增强和分离统一起来的 1.5B 基础模型腾讯混元团队开源 AuK,一款 1.5B 参数语音生成与编辑基础模型。它用统一自然语言指令支持 TTS、内容编辑、情绪与音色修改、语音增强和分离,并提供 AuK Flash、Gradio、ComfyUI 与 Python API。2026/09/12阅读全文
MiniMax Music 3 开源:可生成最长 5 分钟完整歌曲,本地部署支持 SGLang-Omni 与 DiffusersMiniMax 在 Hugging Face 开放 MiniMax Music 3,可依据歌词与音乐描述生成最长约 5 分钟完整歌曲。模型采用 Global/Local LLM、RVQ 与 Flow VAE 架构,并提供 SGLang Omni、Diffusers 等本地推理方式。2026/08/15阅读全文
VoxCPM2:OpenBMB 开源的无 Tokenizer 多语言语音合成与声音克隆模型VoxCPM2 是 OpenBMB 推出的开源多语言语音合成模型,采用无离散语音 Token 的扩散自回归架构,支持 30 种语言、声音设计、可控克隆、48kHz 输出、流式推理以及多种生产部署方案。2026/08/13阅读全文
英伟达开源 Nemotron 3.5 Lightning:30B MoE 仅激活 3B,支持百万上下文英伟达发布开放模型 Nemotron 3.5 Lightning,总参数 30B、每次仅激活约 3B,并支持最高百万 token 上下文。模型面向 AI Agent、RAG、代码与工具调用场景,同时提供 NVFP4、DFlash 和 DSpark 等低延迟部署方案。2026/08/13阅读全文
Kimi K3 开源引发本地运行热潮:2.8 万亿参数模型正在被压缩进消费级设备Moonshot AI 发布的 Kimi K3 以 2.8 万亿参数规模进入开放模型竞争前沿,而社区量化项目进一步降低本地部署门槛。本文梳理 Kimi K3 的技术特点、Unsloth 适配进展,以及超大模型走向消费级设备背后的开源生态变化。2026/07/30阅读全文