我用 Codex、Google Flow 和 Remotion 做完了第一支 YouTube 视频
摘要
我用 Codex、Google Flow 和 Remotion 完成第一支 YouTube 视频,记录从故事脚本、字幕旁白、动画素材到 Remotion 剪辑和 1080p 导出的完整过程。
本文目录
我用 Codex、Google Flow和 Remotion做完了第一支 YouTube视频
最近,我完成并发布了自己的第一支 YouTube视频——《PlayStation游戏主机发展史》。
视频最终时长约2分29秒,包含旁白、字幕、背景音乐、动画素材、转场、定格画面和片尾声明,最后以1920×1080分辨率导出。
整个过程并不是输入一句提示词,然后等待 AI自动生成成片。我先整理故事和脚本,再生成字幕、旁白与动画素材,最后通过 Codex和 Remotion完成画面拼接、声音对齐和逐帧调整。
先把故事和场景写清楚
真正开始制作视频之前,我先整理了一份 PlayStation发展史故事方案。
这份方案不只有旁白正文,还包含视频定位、章节结构、场景设计、屏幕文字、转场方式和素材清单。
每个场景需要提前回答几个问题:
- 这一段准备讲什么;
- 旁白应该怎么说;
- 画面中应该出现哪些内容;
- 镜头如何运动;
- 下一段怎样衔接。
例如,故事开头没有直接介绍主机参数,而是从索尼进入游戏行业的经历讲起,再引出 PlayStation的诞生。
有了这份故事底稿,后面的字幕、语音和画面生成就有了统一方向。真正制作短视频时,再根据成片长度压缩脚本,保留最重要的故事线。
提前生成字幕和旁白
脚本确定后,我先提取适合朗读的旁白,将长段落拆成比较自然的句子,再整理成带时间结构的 SRT字幕。
接着使用 CosyVoice生成中文旁白。
语音生成并不是输出一个音频文件就结束了。实际测试中,我遇到过句首漏字,以及 PlayStation、1994年 这类中英文和数字混合内容读不完整的问题。
后来又使用 WhisperX检查语音内容,并根据真实发音时间重新对齐字幕。如果发现句首缺失,就重新生成对应句子,而不是直接把错误语音放进成片。
最终得到两份重要素材:
- 一条完整的旁白音频;
- 一份按照实际语音时间对齐的字幕。
到了剪辑阶段,旁白和字幕就成为整条时间线的基础。后面的动画画面需要配合声音,而不是让声音不断迁就已经拼好的视频。
根据场景脚本,用 Google Flow生成动画画面
旁白和字幕准备好以后,下一步是制作动画画面。

因为故事脚本里已经写好了每个场景的内容,所以我可以直接根据场景描述,让 Google Flow生成对应的视频素材。
例如,一个场景需要出现初代 PlayStation、CRT电视、游戏光盘和复古房间,就把这些元素连同镜头运动、光线、画面风格一起写进提示词。生成后再选择动作和构图比较合适的版本。
Google Flow在制作这种短动画素材时比较方便,尤其适合生成带有镜头运动的场景。不过使用时有一个限制需要提前考虑:它一次只能生成大约10秒的视频。
这意味着不能指望它一次完成一整段两三分钟的故事。更合适的方式,是把脚本拆成一个个短场景:
- 根据旁白内容划分镜头;
- 为每个镜头编写独立的画面描述;
- 使用 Google Flow生成10秒左右的视频;
- 选择合适的片段保存下来;
- 最后在 Remotion中裁切和拼接。
如果一段旁白超过10秒,就需要使用两个或多个动画片段。也可以将某个关键画面的最后一帧适当延长,让画面停留到旁白结束。
如果旁白比较短,则直接裁掉生成视频中多余的部分。
所以在这套流程里,Google Flow更像是一个动画素材生成器,而不是最终的视频剪辑工具。它负责生成一个个镜头,Remotion负责把这些镜头组织成完整故事。
用 Codex和 Remotion拼接画面
动画素材准备完成后,我把它们全部放进 Remotion工程。

Remotion是一个基于 React的视频制作工具。视频、字幕、旁白、背景音乐和转场都可以放在独立轨道上,每个片段通过开始帧、持续帧数和素材裁切位置控制。
实际制作时,我只需要把剪辑要求告诉 Codex,例如:
- 删除素材原来的声音;
- 把第二个视频接在第一个视频后面;
- 从指定位置裁切片段;
- 把后半段移动到新的时间;
- 延长某个镜头的最后一帧;
- 保持旁白和字幕不变;
- 在场景之间增加淡入、淡出和转场;
- 调低背景音乐,避免盖住解说。
Codex会把这些要求转换成 Remotion时间线代码。
由于 Google Flow生成的素材长度通常是10秒,而旁白长度并不固定,所以很多工作都集中在“画面对齐声音”上。
有些镜头需要裁短,有些需要提前,有些则需要提取最后一帧并定格一段时间。这样既能保留旁白的自然语速,也不会为了迁就画面而强行加速声音。
先看工程,最后再导出
在大部分制作阶段,我都会特别说明:先修改工程,不要急着导出。
每次修改后,我会在 Remotion Studio中拖动时间线,检查画面、字幕和声音是否同步。
如果两个视频被放在同一个时间段,后面的画面可能会被前面的轨道遮住;如果某个片段提前或延后几帧,旁白和字幕听起来也会不自然。这些问题需要实际播放才能发现。
音效和背景音乐也经过了多次调整。
我曾尝试从免费素材库为不同场景加入音效,但试听后觉得影响旁白,于是全部删除。背景音乐也更换过几次,最后才选择一首比较适合解说节奏的音乐,并将音量控制在不会盖住人声的范围内。
AI可以帮助搜索素材、放置轨道和调整参数,但“好不好听”“这个镜头该不该停留久一点”,仍然需要人来判断。
从720p重新导出到1080p
第一次导出并上传 YouTube后,我发现视频最高只能选择720p。
检查后才发现,大部分动画素材虽然是1920×1080,但 Remotion工程最初被设置成了1280×720,所以导出的文件也只有720p。
后来我们把工程改成1920×1080,并同步调整字幕、片尾文字、边距和阴影,避免分辨率改变后文字比例出现问题。
最终成片信息如下:
- 分辨率:1920×1080;
- 帧率:24fps;
- 时长:约149秒;
- 视频编码:H.264;
- 音频编码:AAC;
- 文件大小:约170MB。
需要注意的是,分辨率调整并不能提升原始素材的真实细节。720p素材放进1080p工程,只是被放大了。想得到更清晰的结果,最好从生成动画素材时就选择较高分辨率。
Codex已经可以完成比较细致的视频剪辑
完成这支视频后,我发现 Codex配合 Remotion,已经能够承担不少实际的视频制作工作:
- 整理故事和视频脚本;
- 根据脚本生成旁白和SRT字幕;
- 检查语音与字幕时间;
- 配合Google Flow生成场景素材;
- 删除原视频音频;
- 拼接和裁切视频片段;
- 按帧移动画面;
- 延长某一帧;
- 添加字幕、旁白和背景音乐;
- 制作简单转场;
- 调整分辨率并导出成片。
它的优势不是完全代替剪辑师,而是把自然语言变成一条可以执行、检查和反复修改的视频时间线。
当然,要求越明确,结果越稳定。
“帮我把视频剪得好一点”很难执行,而“保持旁白和字幕不变,把这个镜头裁短,再把下一个镜头提前”就清楚得多。
这支《PlayStation游戏主机发展史》是我的第一支 YouTube视频,也是我第一次完整走完故事策划、脚本整理、SRT字幕、语音生成、动画制作、画面对齐、剪辑和导出的全过程。
对我来说,这次最大的收获并不是让 AI自动完成了一条视频,而是找到了一种新的协作方式:
我负责决定故事怎么讲、画面怎么选、哪里应该停下来;Google Flow负责生成动画镜头;Codex和 Remotion负责把这些素材准确地组织到时间线上。
起初只是抱着试一试、玩一玩的心态,看看 AI能帮我做视频剪辑吗?想不到从最终结果来看,这套方式已经能够完成一套相当完整、细致并且可以继续修改的视频制作流程。
PlayStation游戏主机发展史