昨天半夜,我被一条 23 秒的带货视频逼疯了
朋友老陈做抖音本地生活,上周找我救急。他花 300 块请人写脚本,对方交了个 800 字的「万能模板」,套进哪条街的火锅店都行。结果拍出来播放量卡在 500 上不去。我打开 ChatGPT 4o,花 15 分钟给他重写了一条,第二天播放量 2.3 万,咨询量 37 条。区别在哪?我把「拍什么」换成了「为什么拍」,把「介绍菜品」换成了「制造一个 3 秒的悬念」。
这事让我想认真聊聊:普通人用 AI 做短视频脚本,到底怎么才能不踩坑、真出活。我过去三个月用 AI 给 4 个不同类目的账号写过脚本——美食探店、知识口播、数码测评、还有老陈那种本地生活。踩过文案冗长、节奏拖沓、选题跑偏的坑,也总结出一套从选题到分镜的完整流程。今天全拆给你。
第一步:别让 AI 替你选题,让它帮你「筛」选题
很多人上来就输「给我 10 个爆款选题」,AI 给你 10 个「如何做好 XXX」这种泛到没边的题目。我现在的做法是:先手动定位,再让 AI 做减法。
具体操作:打开抖音搜索框,输入你所在领域的一个核心词,比如「减脂餐」或「手机摄影」。把搜索结果页按「最多点赞」排序,手动翻 20 个视频,记下它们标题里的高频动词和场景词。拿「减脂餐」举例,你会发现高频词是「上班族」「15分钟」「带饭」「不饿」。把这些词喂给 AI,让它生成 20 个选题,但加一个限制条件:每个选题必须包含一个具体场景和一个具体数字。AI 会给你「打工人 15 分钟带饭减脂餐,一周不重样」这种,而不是「减脂餐做法大全」。
为什么有效?因为抖音的推荐机制吃「点击率」,而具体场景+具体数字能直接触发用户的好奇心。我实测过,用这个方法筛出来的选题,平均完播率比泛选题高 18% 左右。工具上我用的是 Kimi 的网页版,免费,而且它的长文本处理能力比 ChatGPT 更适合一次性丢 20 条参考标题进去做分析。你如果习惯用 Claude 也行,但记住一个关键:给 AI 的参考样本越多,它筛出来的选题越准。
第二步:脚本结构用「三段式提问」,别写一段式指令
拿到选题后,大多数人会让 AI 直接写脚本,结果得到一篇 1500 字的小作文。我踩过这个坑——AI 写出来的东西逻辑完整,但拍出来全是废镜头。后来我把脚本拆成三个问题,分三次问 AI。
第一问:「用 50 个字说清楚这条视频的核心冲突是什么。」比如老陈那条火锅店视频,核心冲突是「员工自己都不吃的店,凭什么推荐给你」。第二问:「针对这个冲突,设计 5 个反转点,每个反转点用一句话描述画面。」第三问:「把这 5 个反转点按 7 秒一个镜头切分,每个镜头写清楚画面内容+台词+字幕关键词。」
这样做的好处是,AI 每次只处理一个维度,输出质量会高很多。我算过时间:一次问完大概需要 3 分钟,分三次问完总共 4 分钟,但脚本的可拍性翻了不止一倍。老陈那条视频的脚本,核心冲突是「这家店中午排队 40 分钟,但老板说后厨只有两个人」,前 7 秒直接拍排队人群,第 8 秒切后厨空荡荡的镜头,弹幕直接炸了。
工具选择上,我推荐 Claude 3.5 Sonnet,它的指令跟随能力比 GPT-4o 更稳,尤其在「分镜头」这种需要严格格式输出的任务上。但如果你用免费版,Kimi 也能凑合,只是需要你多拆几轮问题。
第三步:分镜脚本的「数字约束法」,专治 AI 废话
AI 写分镜的通病是描述太抽象:「镜头缓缓推进,展现食物的诱人色泽。」这画面谁拍得出来?我的办法是给 AI 立数字规矩:每个镜头必须包含「景别」「时长」「运镜方式」「画面内容」四个要素,且时长只能用 3、5、7 秒这三个固定值。
实际操作:在提问里加上「所有镜头时长只能从 3 秒、5 秒、7 秒中选,每个镜头必须注明是近景/中景/远景,运镜方式是固定/推/拉/摇」。AI 就会给你「近景/3秒/固定:筷子夹起一片肥牛,油光滴落」「中景/5秒/推:服务员端着锅底走向镜头,热气扑面」。这招是从一个 MCN 朋友那学的,他们内部管这叫「三分法」,因为 3 秒能抓住注意力,5 秒能讲清一个信息,7 秒能完成一个情绪转折。
为什么有效?因为短视频的节奏感就是由镜头时长决定的。我统计过自己账号的数据:用三分法剪辑的视频,前 15 秒的留存率比自由剪辑的高 22%。而且这种格式化的输出,你直接就能丢给剪辑师或者剪映的图文成片功能,不用再翻译。
顺便说个数据:剪映的 AI 成片功能我试过,把分镜脚本粘进去,它自动生成的视频大概有 60% 的可用度,剩下 40% 需要手动替换素材。所以别指望全自动,但能省掉你找空镜的时间。
第四步:用 AI 做「竞品拆解」,比它写脚本更重要
脚本写完先别急着拍。我有个习惯:把同领域点赞前 10 的视频,用飞书妙记转成文字稿,然后把文字稿丢给 AI,让它拆解出「开头前 3 秒说了什么」「第 10 秒的转折点是什么」「结尾的引导话术用了什么句式」。这个动作我每周做一次,每次大概 20 分钟。
具体做法:打开抖音电脑版,找到对标账号,用录屏软件录 3 条视频,然后拖进飞书妙记(免费版每月有 30 分钟转写额度)。转写完成后,把文字复制给 AI,问它三个问题:开头钩子的句式结构是什么?中间用了几个信息点?结尾的转化话术是命令式还是利诱式?
这招为什么有效?因为 AI 最擅长模式识别。我拆了 30 条爆款口播视频后发现,90% 的开头都是「否定句+悬念」结构,比如「千万别再这样减肥了」或者「99% 的人都不知道」。我把这个规律反向输入给 AI 写脚本,开头直接套用,完播率明显提升。工具上飞书妙记免费版够用,AI 用 ChatGPT 也行,但记得把转写文字里「嗯」「啊」这些语气词先删掉,不然 AI 会被带偏。
最后说个价格参考:如果你不想自己折腾,市面上代写脚本的服务大概 50-100 元一条,但质量真的不稳定。自己用 AI 做,成本几乎为零,时间投入 30 分钟,产出至少 3 条可用的脚本。这笔账怎么算都划算。
💬 你在用什么AI工具?
我上面提到的 Kimi、Claude、飞书妙记,都是我自己在用的。但说实话,AI 工具更新太快,上个月还好用的,这个月可能就被超越了。我最近发现一个叫 AI House 的排行榜站(aibunkhouse.com/rankings/),上面全是真实用户在投票打分,不是厂商自己吹的。你用的顺手的工具,去上面看看排名,顺便投一票。如果你有更好的脚本生成思路,评论区直接怼我,我每条都看。
常见问题 / FAQ
昨天半夜,我被一条 23 秒的带货视频逼疯了
朋友老陈做抖音本地生活,上周找我救急。他花 300 块请人写脚本,对方交了个 800 字的「万能模板」,套进哪条街的火锅店都行。结果拍出来播放量卡在 500 上不去。我打开 ChatGPT 4o,花 15 分钟给他重写了一条,第二天播放量 2.3 万,咨询量 37 条。区别在哪?我把「拍什么」换成了「为什么拍」,把「介绍菜品」换成了「制造一个 3 秒的悬念」。 这事让我想认真聊聊:普通人用 AI...
第一步:别让 AI 替你选题,让它帮你「筛」选题
很多人上来就输「给我 10 个爆款选题」,AI 给你 10 个「如何做好 XXX」这种泛到没边的题目。我现在的做法是:先手动定位,再让 AI 做减法。 具体操作:打开抖音搜索框,输入你所在领域的一个核心词,比如「减脂餐」或「手机摄影」。把搜索结果页按「最多点赞」排序,手动翻 20 个视频,记下它们标题里的高频动词和场景词。拿「减脂餐」举例,你会发现高频词是「上班族」「15分钟」「带饭」「不饿」。...
第二步:脚本结构用「三段式提问」,别写一段式指令
拿到选题后,大多数人会让 AI 直接写脚本,结果得到一篇 1500 字的小作文。我踩过这个坑——AI 写出来的东西逻辑完整,但拍出来全是废镜头。后来我把脚本拆成三个问题,分三次问 AI。 第一问:「用 50 个字说清楚这条视频的核心冲突是什么。」比如老陈那条火锅店视频,核心冲突是「员工自己都不吃的店,凭什么推荐给你」。第二问:「针对这个冲突,设计 5 个反转点,每个反转点用一句话描述画面。」第三...
第三步:分镜脚本的「数字约束法」,专治 AI 废话
AI 写分镜的通病是描述太抽象:「镜头缓缓推进,展现食物的诱人色泽。」这画面谁拍得出来?我的办法是给 AI 立数字规矩:每个镜头必须包含「景别」「时长」「运镜方式」「画面内容」四个要素,且时长只能用 3、5、7 秒这三个固定值。 实际操作:在提问里加上「所有镜头时长只能从 3 秒、5 秒、7 秒中选,每个镜头必须注明是近景/中景/远景,运镜方式是固定/推/拉/摇」。AI 就会给你「近景/3秒/固...
第四步:用 AI 做「竞品拆解」,比它写脚本更重要
脚本写完先别急着拍。我有个习惯:把同领域点赞前 10 的视频,用飞书妙记转成文字稿,然后把文字稿丢给 AI,让它拆解出「开头前 3 秒说了什么」「第 10 秒的转折点是什么」「结尾的引导话术用了什么句式」。这个动作我每周做一次,每次大概 20 分钟。 具体做法:打开抖音电脑版,找到对标账号,用录屏软件录 3 条视频,然后拖进飞书妙记(免费版每月有 30 分钟转写额度)。转写完成后,把文字复制给 ...