美团开源 LongCat-Video-Avatar 1.5:一张照片加一段音频,就能生成口型同步数字人视频

开源发现

美团开源 LongCat-Video-Avatar 1.5:一张照片加一段音频,就能生成口型同步数字人视频

栏目:开源发现

摘要

美团开源 LongCat Video Avatar 1.5,支持图片、音频和文本驱动数字人视频生成,重点提升口型同步、长视频稳定性、多角色场景和推理效率,并通过 8 步蒸馏降低生成成本。

本文目录

LongCat-Video-Avatar 1.5是美团 LongCat团队开源的一套音频驱动数字人视频生成模型。它建立在 LongCat-Video基座之上,目标不是只让人物“嘴巴动起来”,而是同时改善口型同步、表情、头部和身体动作,以及长视频中的身份一致性和画面稳定性。对于需要做数字人口播、知识讲解、短视频角色或虚拟主播的开发者来说,它提供了一套可以自行部署和继续开发的开源方案。

美团开源 LongCat-Video-Avatar 1.5:一张照片加一段音频,就能生成口型同步数字人视频

图片来源:github.com

LongCat-Video-Avatar 1.5能做什么

这一版本原生支持 Audio-Text-to-Video、Audio-Text-Image-to-Video和 Video Continuation。简单理解,既可以用音频和文字生成视频,也可以把一张人物或角色图片作为参考,再配合音频生成说话视频,还可以在已有视频基础上继续生成。项目同时支持单路和多路音频输入,因此不仅适合单人口播,也能覆盖多人互动场景。

截图里展示的正是 Audio-Image-to-Video的典型用法:上传参考图片、音频和简短提示词,模型生成与音频同步的视频。需要说明的是,开源模型本身可以免费下载和部署,但“免费使用”并不等于本地推理没有成本,显卡、存储和算力仍然需要由使用者自行承担。

1.5版本的主要升级

LongCat-Video-Avatar 1.5把音频编码器从 Wav2Vec2升级到了 Whisper-Large。官方强调,这一变化主要用于改善唇形与语音之间的对应关系,让快速说话、较长语句等输入下的口型变化更平滑自然。

另一个重点是稳定性。官方把1.5定位为更接近实际生产使用的版本,针对长视频中的人物身份漂移、动作不连贯和身体状态不稳定进行了优化。模型也扩展到了动漫、动物和复杂真实环境,并能处理多人互动以及人物与物体之间的动作。

推理效率也有明显变化。LongCat-Video-Avatar 1.5使用基于 DMD2的步数蒸馏,把生成过程压缩到8个推理步。美团给出的数据是,相比此前流程,推理效率提升约15倍。对于需要批量生成数字人内容的应用,这一点比单纯提高画质更直接地影响部署成本和等待时间。

如何本地运行

官方代码集中在 LongCat-Video仓库中。环境建议使用 Python 3.10,并根据自己的 CUDA版本安装 PyTorch、FlashAttention以及项目依赖。基础安装方式如下:

bash
git clone --single-branch --branch main https://github.com/meituan-longcat/LongCat-Video
cd LongCat-Video

conda create -n longcat-video python=3.10
conda activate longcat-video

pip install torch==2.6.0+cu124 torchvision==0.21.0+cu124 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cu124
pip install ninja psutil packaging
pip install flash_attn==2.7.4.post1
pip install -r requirements.txt

conda install -c conda-forge librosa ffmpeg
pip install -r requirements_avatar.txt

模型权重可以从 Hugging Face下载。LongCat-Video-Avatar-1.5的模型仓库目前体积接近75GB,因此在本地部署前需要先准备足够的磁盘空间和合适的 GPU环境。

bash
pip install "huggingface_hub[cli]"
huggingface-cli download meituan-longcat/LongCat-Video-Avatar-1.5 --local-dir ./weights/LongCat-Video-Avatar-1.5

适合哪些场景

这套模型比较适合数字人口播、课程讲解、新闻播报、品牌虚拟角色、动漫角色驱动以及需要多人音频交互的视频生成。它的优势不是把图片简单做成“会说话的头像”,而是继续处理说话时的表情、姿态、身体运动和静音阶段的自然动作,让生成结果更接近完整的视频角色。

对于只想快速试用的人,Hugging Face社区已经有人搭建了在线 Space,但在线实例的可用性、排队时间和免费额度会随平台资源变化。真正需要稳定批量生成时,本地部署或自建推理服务更可控。

LongCat-Video-Avatar 1.5采用 MIT License,代码和模型已经公开。它更值得关注的地方,是把数字人生成从“短片演示效果”继续推向长视频、多角色和高效推理这些实际问题。如果你正在做 AI视频、虚拟主播或自动化口播内容,这个项目已经具备进一步测试和二次开发的价值。

© 2026 DGNEWLIVE 保留所有权利.