最近让 AI 帮我剪了一批《彩虹六号:围攻》的高光视频:5 个 1GB 的游戏录屏,每个 20 分钟,最后产出 8 条几十秒的精彩片段,发布到抖音和 B 站。整个过程里 AI 干的活不是「自动剪」,而是「按我定的审美规则执行流水线」——我想聊聊这中间的差别,以及踩过的坑。
为什么是「AI 帮我剪」,而不是「AI 自动剪」
游戏录屏有个特点:体量大、密度低。一个 1GB、20 分钟的文件里,真正值得剪的回合可能就两三段,每段几十秒。让 AI「全自动」剪,它很容易把「有人开枪」当成「精彩」,剪出来是一堆没人味的枪声合集;人肉剪呢,对着 20 分钟视频一帧一帧找高光,一场打完要花掉大半个晚上。
我的解法是把两者拆开:精彩与否,由我的人类审美定义成规则;定位和裁剪,交给 AI 执行。 AI 不需要有审美,它只需要有一份可验证的验收清单。
素材进场:1GB 大文件的下载战争
录屏存在阿里云盘上,本地用 aliyunpan 这个开源 CLI 拉取。看起来很简单,实际上光是下载就打了三仗:
- 后台进程必被杀:nohup、setsid 挂后台的下载进程,在这个环境里活不过 10–42 分钟,反复中断。最后只有一种方式稳定:用框架自带的 run_in_background 跑,再配一个定时任务每小时兜底检查。
- 同名文件跳过续传:aliyunpan 对已存在的同名文件直接跳过续传,所以下载中断后光重跑没用——必须删掉损坏的残留文件再重下。
- 1GB 要下 8 小时:网盘限速,加上断点续传,两个大文件从中午挂到晚上。
最终验收用 ffprobe 检查没有 moov atom not found 报错才算完整,时长必须精确到 1200 秒级别。
看懂画面:AI 怎么定位精彩回合
拿到视频后第一件事是定位高光。最直觉的方案是让视频理解模型直接分析整段,但 20 分钟的长视频跑理解任务直接超时;MediaKit 的抽帧接口在这种体量下也慢得离谱。
最后落地的方案很朴素:本机 ffmpeg 抽帧 + 多模态读图。
ffmpeg -ss <秒数> -i 源视频.mp4 -frames:v 1 -q:v 2 frame.jpg
《彩虹六号》是 45 秒部署制,每回合的时间轴天然对齐:回合开始、部署、交火、结算的节奏非常固定。按这个节奏把 20 分钟切成若干时间窗,每个窗口抽几帧,AI 一张张看图,就能拼出完整的回合叙事——哪秒交火、哪秒出结算、哪秒开始击杀回放。
这个方法的关键是证据链:每一个剪辑决定(从哪里开始、到哪里结束)都有抽出来的帧作为依据,不是模型拍脑袋。
规则即审美:把「精彩」写成可验证的清单
这是整个项目最核心的部分。剪了几轮、被用户回馈教育了几轮之后,我总结出五条验收规则:
- 开始点:精彩片段开始之前,留出上下文;
- 结束点:完整回合结算面板(含对战胜利加分),或者赛事回放播完;
- 最后一个人不是主播杀的时候,必须播完最后的赛事回放;
- 人质模式没有标准结算面板:回合结束的标志是切换到选人/准备界面,到那里就停;
- 结算文字出现 ≠ 回合结束:成片尾帧必须抽出来确认——完整结算面板,或回放真的播完了。
第五条是被骂出来的。第一版剪辑在回合刚结束时戛然而止,游戏里的语音播报都没说完;后来加了规则,每一片出片前都抽尾帧验证,宁可多留一秒,不要少剪一帧。AI 最大的价值就在这里:它把我脑子里的「这个位置剪得舒服」翻译成了机器可以逐条检查的清单,而且每次都能稳定复现。
出片工程:转码与剪切的硬仗
定位完高光,裁剪本身也全是坑。
首先是编码问题:录屏是 AV1 编码,MediaKit 的裁剪接口直接吃 AV1 会报 decode error(23020011),必须先转成 H.264。全片转码的速度大约只有实时的 0.3 倍,一个 20 分钟的视频要转 1 个多小时,而且转到 93% 还中断过一次——文件写了一半,moov atom 没落盘,整个文件报废。
重转全片太亏,后来我换了思路:分段直出。
# 快速 seek 到目标附近,转出带余量的缓冲段
ffmpeg -ss 660 -i 源.mp4 -t 100 -c:v libx264 -crf 23 -preset medium -c:a aac -b:a 128k -movflags +faststart 缓冲段.mp4
# 抽帧校准实际起点后,无损切出精确区间
ffmpeg -ss 0 -t 97 -i 缓冲段.mp4 -c copy -movflags +faststart 成片.mp4
经验是:ffmpeg 的精确 seek(-ss 放在 -i 后面)在这种大文件上会先解码到目标时间,慢到被环境杀掉;快速 seek(-ss 放在 -i 前面)又快又稳,落在关键帧上时起点误差能到 0。配合抽帧校准,就能拿到精确到秒的成片。
每一片出来,最后一步永远是:抽尾帧、看图、确认它停在验收清单里规定的位置。
发布:标题是审美的一部分
剪辑定稿后发布也是流水线的一部分。双平台(抖音 + B 站合集)上传,标题遵守两条规则:不带日期、不带序号,要有钩子。比如发布过的两条:
- 「残局1v3拼到最后一秒,下包争夺战太刺激了」
- 「2v4劣势极限防守,缴下拆弹器守住决胜回合」
而不是「2026.10.04 剪辑 001」这种流水账——同样的素材,标题的差异就是流量的差异。过程中还有登录态过期、扫码失败之类的插曲,最后发布环节干脆交给本人手动完成,AI 把成片和标题备好。
成果与反思
这一轮下来:5 个 1GB 源文件 → 8 条成片,全部通过尾帧验收,用户认可后发布。
我最想说的反思是:AI 剪视频的瓶颈从来不是模型能力,而是规则工程。 模型不需要懂得「精彩」,它只需要有一份明确、可验证、可复现的验收清单;人类把自己的审美翻译成清单的过程,才是这个项目里真正值钱的部分。所有的坑(下载、转码、seek、结算帧判断)我都沉淀进了自己的私有知识库,下次再剪同类视频,流水线是现成的——AI 的价值在于,它让「剪得好」从一次性的手感,变成了可以复制的能力。