Sat Jun 27 2026 20:00:00 GMT-0400 (北美东部夏令时间)
我如何制作AI短视频:钩子、字幕和B画面
从钩子、字幕、B画面到内容重用:分享我每周发布Reels、TikToks和Shorts所使用的AI工作流,包括所需工具、限制以及哪些部分可以跳过。

最后更新时间:June 28, 2026
短视频垂直格式是我唯一能获得无法通过其他渠道购买的覆盖率,而 AI 现在正在处理我以前感到畏惧的部分:抓人眼球的开头、补充素材(b-roll)、字幕和将长录像剪辑成精悍片段。上个季度,我使用这个工作流程发布了大约 120 个短视频,这就是我的确切操作顺序——写一个三秒的开场白,生成或获取 b-roll 素材,烧入字幕,剪辑到合适的长度,然后发布。
对于这些片段背后的模型,我依赖 Sora video generator 和 Runway Gen-3 video;最后的精修和特效则在我们的 AI video editing 笔记中。下面是短视频组装的实际工作流程。
快速答案:如何用 AI 制作短视频?
选择一个想法,写一个能在前三秒抓住眼球的开头,生成或收集五到八秒的 b-roll 素材,转录并烧入字幕,裁剪至 9:16 的 60 秒以内,然后发布。这就是整个循环。AI 处理了其中的四个步骤——b-roll 生成、转录、加字幕和长视频切短——但你仍然需要写开场白并决定剪辑点。
我将这个确切的流程测试在一个没有露脸的金融频道和一个真人出镜的产品频道上,结果在两者上都适用。创意决策范围很小,但非常重要:开头决定了是否有人看到第二秒,而字幕风格则决定了静音观看者是否会停留。
什么是短视频?平台想要什么?
短视频是垂直的、9:16 的、少于三分钟,并且是为自动播放(静音)设计的。三个平台对“上限”的定义不同,安全的长度比最大限制要短得多。
| Platform | Aspect ratio | Max length | Length I actually post |
|---|---|---|---|
| Instagram Reels | 9:16 (4:5 accepted) | 90 seconds | 15 to 30 seconds |
| TikTok | 9:16 | 10 minutes | 21 to 34 seconds |
| YouTube Shorts | 9:16 | 60 seconds | under 58 seconds |
平台设定的两个规则决定了其他一切。根据 YouTube's Shorts guidance,Short 必须是垂直的,且不超过 60 秒,否则它根本不是 Short——它会被归类为普通视频并失去 Shorts 信息流的推荐。Instagram 的 Reels best practices 推行了相同的仅限垂直约束,并且奖励文本和字幕,因为很多人是静音观看的。
实际操作总结:每次都拍摄或渲染 9:16 素材,为静音观众写作,并将开头留在前三秒。我将 30 秒作为默认时长,只有当想法真正需要更多时间时才会更长。
开头白(The hook):撰写一个能留住用户眼球的三秒开场
开头白是你所写内容中杠杆效应最高的部分,而 AI 在这方面表现平庸,所以我自己写开头白,只用 AI 来进行压力测试。开头白做四种工作之一:做出承诺、陈述张力、展示结果,或提出需要观众回答的问题。

我测试过有效的开头白:
- "这花了我六个小时。这是 30 秒的版本。"
- "没人会告诉你关于 [topic] 的这一点,直到它让你损失金钱。"
- "我测试了 [tool] 30 天。结果并非我预期的那样。"
- "三秒后,看看价格发生了什么变化。"
我会写五个开头白,将它们粘贴到视频生成器的提示词中作为屏幕文字,然后选择阅读速度最快的那个。第一帧必须在视觉上承载开头白,因为在零秒时字幕还没有被阅读到。
B-roll 和视觉素材:当没有素材时如何生成?
如果你是真人出镜,b-roll 就是你的脸加上切片镜头。如果你是无露面(faceless)的,b-roll 就是整个视频,这也是 AI 视频素材发挥作用的地方。我生成建立场景的镜头、产品特写和抽象运动片段,然后将脚本放在这些素材之下。
我每周执行的一个无真人出镜工作流程:
- 写下 60 秒的脚本并将其分成六到八个镜头。
- 从文本提示词生成每个为期五秒的镜头。
- 通过在每个提示词中重复使用相同的风格描述符来保持一致的风格。
- 安排片段顺序,使每个片段都与正在说的台词相匹配。
- 添加来自克隆或库存 AI 语音的画外音。
- 烧入字幕并以 9:16 的比例导出。
诚实的局限性:AI 生成的片段会漂移。一个咖啡杯在镜头之间形状会改变,画面中的文字会变得模糊不清,身份认同也不会跨剪辑保持一致。我为每个镜头生成三组素材并选择最干净的,并且避免让模型生成屏幕文字或标志。当需要可信赖的素材时,我会将生成的片段与库存素材搭配使用,以确保切片不会看起来都那么人工合成。
字幕:能留住自动播放静音观众的屏幕文本
字幕是不可谈判的,因为大多数短视频观看都是静音开始的。我自动转录音频,然后美化文字样式,使其在第一眼就能阅读。默认的 AI 字幕导出可用但很丑,所以我花了两分钟来处理字体排版。

我遵循的字幕规则:
- 每个字幕卡片包含一到三个词,与语音节拍同步。
- 将文字放置在画面上部中央三分之一处,避开平台用户界面和评论区。
- 使用带有描边或背景板的粗衬线字体以增加对比度。
- 用对比色突出关键词以抓住眼球。
- 保持字幕在安全区域内,这样即使跨应用重新发布也能保留。
我将转录本身视为草稿。AI 会错误识别专有名词、数字和技术术语,字幕中的一个错字对观众来说就是个失误。在我导出之前,我会对着音频把每个字幕朗读一遍。
将长视频重用为短片段
重利用是 AI 回报最快的地方,因为长视频已经存在了,唯一的问题是哪些三十秒值得剪辑。我拿一个 20 分钟的录像,一次性提取出四到六个短片。
我使用的方法:
- 上传长视频并运行带有说话人切换的 AI 转录功能。
- 要求工具标记观看率或参与度超过某个阈值的时刻。
- 提取每个被标记的时刻,并在两侧各裁剪十秒的缓冲时间。
- 使用说话人的自动跟踪功能将水平素材重新构图为 9:16。
- 将开头白重新剪辑到最前面,确保每个片段都以其最强烈的台词开始。
- 烧入新的字幕并发布每个短片作为独立的帖子。
重新构图是经常出错的步骤。自动跟踪在说话人移动或屏幕上有两个人时会丢失说话人,所以我检查每批次第一个片段的 9:16 裁剪框,逐帧进行检查。我们的 AI video editing 指南更深入地介绍了重新构图和颜色工具。
我实际使用哪些 AI 工具?
我特意保持了工具栈的小巧。每个工具都比其他工具更好地完成一项任务,在制作过程中切换工具浪费的时间比节省的更多。
| Job | What I use | Why |
|---|---|---|
| Text or image to clip | Sora video generator | 最长的连贯镜头,运动强劲 |
| Camera-controlled clips | Runway Gen-3 video | 直接的平移、倾斜和缩放旋钮 |
| Long-to-short chopping | Built-in AI highlight finder | 自动找到观看率峰值 |
| Captions and transcription | Auto-caption with manual pass | 快速草稿,我负责修正名词 |
关于模型比较以及 Sora 与 Runway 的取舍,请参阅 Sora AI video generator 的详细分解。对于短片来说,当需要镜头保持完整性时我会选择 Sora,而当需要精确的运镜时则选择 Runway。
什么会导致你的短视频被标记或埋没?
平台会惩罚特定的内容,其中一些很容易在使用 AI 时不小心触犯规则。在发布前了解这些规则可以挽救一个原本会被审核淘汰的帖子。
我关注的风险:
- 导出时残留的竞争对手平台的水印。
- 低分辨率或信箱式(letterboxed)素材,这表明是偷懒地转发。
- 自动生成的包含脏话或歧视性语言的字幕错误转录。
- 未披露、涉及真实人物的 AI 素材,如果平台要求则必须披露。
- 版权不明或从其他创作者视频中提取的音频。
TikTok 的 business advertising and content policies 为什么会被降级设定了标准,其他平台也遵循类似的逻辑:原创、垂直、清晰和主题明确的内容才能存活。我保留了一个检查清单,在发布每个短片之前都会运行它,因为一个水印曾毁掉了我原本很棒的帖子。
总结:我的每周短视频工作流程
这是我每周执行的循环,我已经将其压缩到最重要的步骤。AI 在 b-roll、字幕和长视频切短方面承担了大部分重体力活;而我负责撰写开头白和决定剪辑点。

我的每周检查清单:
- 选择一个想法并写出五个开头白变体。
- 为每个镜头生成或获取六到八秒的 b-roll 素材。
- 录制或合成画外音。
- 自动转录并烧入样式化的字幕。
- 裁剪至 9:16,少于 60 秒,开头白在前三秒。
- 运行风险检查清单,然后发布。
我要强调的注意事项是:AI 加速了生产速度,但它不能制造需求。对我而言表现最好的短片,其底层一定有一个真正有用或令人惊讶的想法。一个关于平淡无奇、快速、廉价、字幕完整的视频仍然会失败。请使用这个工作流程来发布更多你优秀的想法,而不是用来掩盖缺乏想法的事实。
图片鸣谢
- A modern smartphone on a tripod recording a content styling video setup — photo by Tracy Le Blanc on Pexels
- A content creator recording a video at a desk with camera and lighting gear — photo by RODNAE Productions on Pexels
- A close-up of a video editing timeline interface on a computer screen — photo by Alex Fu on Pexels
- A smartphone screen displaying popular social media applications — photo by cottonbro studio on Pexels
继续阅读

Wed Mar 25 2026 20:00:00 GMT-0400 (北美东部夏令时间)
批量图片尺寸调整器:一次性调整数百张图片(免费)
使用浏览器工具、ImageMagick、XnConvert 或 Python 脚本,免费批量调整数百张图片。它提供真正的字节节省和安全的批处理工作流程。

Wed Mar 18 2026 20:00:00 GMT-0400 (北美东部夏令时间)
WebP 转换器:如何将图片转换为 WebP 格式(并显示实际尺寸)
将 JPEG 和 PNG 图片转换为 WebP,以获得更小的网页文件。本指南涵盖了实际测量尺寸、使用 cwebp 命令、Python 和浏览器方法,以及一套完整的 JPEG/PNG 回退策略,帮助您优化图片大小。

Wed Mar 11 2026 20:00:00 GMT-0400 (北美东部夏令时间)
Real-ESRGAN AI 上采样:工作原理及使用时机
本文将详细介绍 Real-ESRGAN 是什么,其基于 GAN 的超分辨率工作原理。我们将探讨它擅长的领域(如照片和艺术品的 4x upscaling)以及局限性所在,并提供操作命令和真实的性能限制分析。