Muyang Flat Animation:把中文口播变成纸上钢笔线稿动画的 Agent Skill
摘要
Muyang Flat Animation 是一个把中文口播和抽象概念转换为纸上钢笔线稿动画的开源 Agent Skill,通过方案、静帧和视频三阶段确认,兼顾画面一致性、生成成本与知识讲解场景的可读性。
本文目录
图片来源:github.com
Muyang Flat Animation是一个面向知识类视频和口播内容的开源 Agent Skill。它可以把一句中文观点、解释性文案或抽象概念,转换成“纸上钢笔线稿 + 选择性彩铅填色”的短动画素材。相比直接让视频模型自由发挥,这个项目更强调先确定视觉命题、构图和动效逻辑,再逐步进入静帧与视频生成,从而提高画面与口播内容之间的一致性。
项目由 yokel1121开源,采用 MIT许可证,主要使用 Python、Gemini视频生成能力、FFmpeg和 Codex Skills工作流构建。它既支持人物叙事,也支持完全无人物的内容可视化,并可以调整画幅、配色、声音和时长,适合知识讲解、观点口播、课程视频以及社交媒体短视频中的辅助画面制作。
三道闸门减少返工和无效生成
Muyang Flat Animation采用分阶段确认流程。第一阶段先根据口播内容提出视觉命题、构图、动作和音效方案,用户确认后才生成动作完成状态的静帧;第二阶段检查人物、物件和纸面构图是否符合预期;第三阶段才调用 Gemini生成视频,并对成片逐帧检查。
这种流程的价值在于把创意决策放到生成成本较低的阶段。若视觉命题不准确,只需要调整文字方案;若静帧构图不理想,也不必立即重新生成视频。只有方向和画面都确认后,系统才进入成本更高的视频生成环节,适合需要稳定产出多条 B-roll或知识动画的创作者。
固定镜头与分层动效
项目默认保持固定镜头,尽量维持人物身份、物件设计和纸面布局稳定。动效被拆分为主动作、接力响应、生命微动作和短暂强调四个层次,例如人物完成操作后,图标和结构依次出现,同时保留眨眼、呼吸或轻微手部动作,让画面有节奏但不过度喧闹。
对于箭头、连接线和结构生长,Skill也提供了较严格的约束。每一条线都需要有明确起点与终点,避免模型生成无来源的杂乱线条;所谓“生长动画”也不仅用于植物,而是指一个对象从固定起点按照自身结构逐步形成。这些规则有助于保持知识图解的可读性。
纸面线稿与选择性彩铅填色
Muyang Flat Animation的核心视觉语言是纸面钢笔线稿,并使用有限的彩铅填色突出重点。项目可以根据内容自动选择语义配色,也支持鼠尾草绿等内置方案以及自定义色值。相比高饱和度的商业动画,这种风格更接近手绘笔记、知识图解和编辑插画,适合解释抽象概念和流程关系。
用户还可以加入自己拥有使用权的参考图,用于约束纸张质感、线稿粗细、彩铅颗粒、留白和图解语言。项目不会在开源仓库中附带来源不明的参考插画,相关目录也默认被加入忽略规则,以降低误提交未授权素材的风险。
安装与环境要求
项目需要 Python 3.10或更高版本,并依赖 FFmpeg、FFprobe和可用的 Gemini API Key。克隆仓库并安装依赖后,可以把 Skill目录复制到 Codex的 Skills目录中。
git clone https://github.com/yokel1121/muyang-flat-animation.git
pip install -r muyang-flat-animation/requirements.txt在 macOS或 Linux环境中,可以执行:
cp -R ./muyang-flat-animation ~/.codex/skills/muyang-flat-animation
export GEMINI_API_KEY="your_api_key"随后运行环境检查脚本,确认 Python、FFmpeg、FFprobe和 Gemini配置是否可用:
python ~/.codex/skills/muyang-flat-animation/scripts/check_setup.pyWindows用户则可以通过 PowerShell将目录复制到用户目录下的 Codex Skills路径,并把 GEMINI_API_KEY写入用户环境变量。
使用方式与可配置参数
安装完成后,可以通过 Skill名称加画幅、内容模式、配色和声音要求直接触发。例如:
$muyang-flat-animation 16:9,制作:学会用 AI 放大自己的能力也可以要求无人物画面、竖屏输出或静音版本:
$muyang-flat-animation 无人物,9:16,制作:信息不是越多越好,而是越清楚越好项目支持 character和 content-only两种主体模式,画幅可选9:16、16:9、3:4、4:5、1:1或明确像素尺寸,声音可选择轻量同步音效或静音。默认画布为720×1280,默认时长为6秒,实际可用时长还会受到当前 Gemini模型能力限制。
视频生成与质量检查
除了通过 Agent Skill运行,项目还提供独立的视频生成脚本。用户可以准备包含提示词、静帧路径、输出文件、画幅和时长的 JSON任务,然后批量调用生成器。默认模型为 gemini-omni-flash-preview,但模型名称、地区可用性、额度和计费规则可能随服务更新而变化。
成片生成后,inspect_video.py会检查镜头漂移、人物和手部一致性、随机线条、画风漂移、音轨存在性和输出规格。项目明确禁止生成铅笔、钢笔、马克笔或粉笔书写声,也不允许出现笔纸摩擦声,不过这类声音仍需要人工试听确认。
适用场景与限制
Muyang Flat Animation更适合观点口播、课程讲解、知识短视频和抽象概念可视化。它的优势不是生成任意风格的复杂动画,而是通过固定画风、明确构图规则和人工确认节点,把短动画生产变成一套可复用流程。
需要注意的是,最终视频质量仍取决于视觉命题、静帧构图和 Gemini模型表现,API调用也可能受到地区、额度与计费限制。如果需要复杂镜头运动、长时叙事或高写实角色表演,这个项目并不是通用替代方案;但对于需要稳定纸面线稿风格和轻量知识动效的创作者,它提供了清晰、可控且容易扩展的工作流。