
《妈,我回来啦》视频教程拆析
先看这类视频和之前的区别(决定怎么做)
古风田园AI视频(上一条) | AI叙事短片(这条) | |
核心 | 单镜头氛围 | 多角色剧情+对白+情感 |
一致性要求 | 一个场景风格统一 | 角色跨镜头必须同一张脸 |
工作流 | 生图→图生视频→拼 | 剧本→定妆照→分镜→逐镜生成→配音→剪辑 |
难度 | ★★ | ★★★★(但流程是固定的) |
核心心法(作者原话):先完成,再完美;积分有限,优先补掉最影响观看的镜头——不是所有瑕疵都要重做。
全流程总览(6 步)
步骤 | 干什么 | 软件 |
第1步 | 写剧本(故事+对白+分场) | 豆包/DeepSeek |
第2步 | 角色定妆照+场景参考图 | 即梦AI |
第3步 | 分镜图逐镜生成 | 即梦AI |
第4步 | 图生视频(运镜指令) | 可灵AI / 即梦AI |
第5步 | 角色配音 | 剪映文本朗读 |
第6步 | 剪辑合成(对轨+字幕+BGM+音效) | 剪映 |
第 1 步:写剧本(软件:豆包 / DeepSeek · 免费)
这一步做什么
写一个有情感冲突的短故事——作者那条是"重组家庭母女情":女儿回家喊"妈,我回来啦",一句台词串起细腻的情感戏。叙事短片不需要宏大剧情,一个场景、一个情绪、一句扣题的台词就够。
输入什么提示词(复制即用)
你是影视编剧。请为一个AI叙事短片写剧本,要求: 【选题】现实主义家庭温情:重组家庭的母女情,女儿多年后回家 【时长】3-5分钟(AI短片黄金时长,作者同款) 【结构】三幕:
【输出格式】
|

限制指令怎么输(喂给AI时的约束)
时长卡死 3-5 分钟:AI 一放开就容易写长,限制"不超过6场"是硬约束
场景数 ≤3 个:AI 短片场景越少越稳,场景一多角色和光线全乱
台词越少越好:每句对白 = 一个要生成的镜头,台词越少,要重做的越少
剧情用"一个细节"推动,不要"事件推进"(AI 做不了复杂事件,但能做好一个眼神)
为什么这么做
作者自述"预算和积分有限"——AI 叙事短片最大的成本是反复生成,剧本写得越收敛,生成次数越少,质量越高。
不这么做会怎样
剧本写 20 场戏、每场 3 句台词 → 要生成 60+ 镜头,积分烧光、人物脸全崩、半年做不完;剧情靠"车祸/打斗/变装"这种复杂事件 → AI 生成必崩,整段作废。
第 2 步:角色定妆照 + 场景参考图(软件:即梦AI · 免费)
这一步做什么
把剧本里的角色和场景"定下来"——生成母亲、女儿的角色定妆照(多角度),以及家里/门口的场景参考图。这是全流程最关键的一步,直接决定角色会不会"换脸"。
输入什么提示词(角色定妆照 · 复制即用)
母亲定妆照:
一位50岁左右的朴素中年女性,短发微卷,眼角有细纹,穿素色棉质家居服,站在暖黄色灯光的老式客厅里,神情温柔中带着一丝期待。现实主义电影质感,自然光,浅景深,正面全身照,人物清晰,背景柔化。 |

女儿定妆照:
一位25岁左右的年轻女性,长发扎低马尾,穿米色风衣背双肩包,站在家门口,神情犹豫带着紧张。现实主义电影质感,自然光,浅景深,正面全身照,人物清晰,背景柔化。 |

限制指令怎么输
固定外貌描述:两段提示词里的"短发微卷/眼角细纹/素色棉质家居服""低马尾/米色风衣/双肩包"就是角色的"身份证",后面每一个镜头都要带上(复制粘贴,一个字别改)
多角度生成:正面、侧面、特写各生成一张,存成一个"角色参考图包"
风格锁定:所有图都加"现实主义电影质感,自然光,浅景深"——全片风格统一就靠这半句
负面提示词:动漫感,古风,赛博朋克,磨皮过度,欧美面孔,多人同框,文字水印
为什么这么做
AI 视频工具是按"参考图+指令"出片的,定妆照就是演员本尊;作者能做出"重组家庭母女"的细腻感,靠的就是角色从头到尾同一张脸。
不这么做会怎样
不定妆照直接生成 → 第一场母亲是圆脸,第二场变成方脸,第三场变年轻了——观众一眼出戏,全片报废;每场重新描述角色 → 描述一不一致就换脸,AI 短片 90% 的"穿帮"都是这个原因。
第 3 步:分镜图逐镜生成(软件:即梦AI · 免费)
这一步做什么
按剧本的分场表,一个镜头一个镜头地生成静态分镜图。比如"女儿站在门口迟疑"是一个镜头、"母亲开门看到女儿"是一个镜头、"两人对视特写"是一个镜头。
输入什么提示词(分镜图 · 复制即用)
分镜示例 · 母女对视特写:
【母亲】一位50岁左右的朴素中年女性,短发微卷,眼角有细纹,穿素色棉质家居服,站在门口,眼眶泛红,嘴唇微微颤抖。【女儿】一位25岁左右的年轻女性,长发扎低马尾,穿米色风衣背双肩包,站在门外,眼里含泪。两人隔着门槛对视,暖黄色门厅灯光,现实主义电影质感,自然光,浅景深,中景特写,情感张力。 |

限制指令怎么输
每镜一句【画面】描述:人物(必须带第2步的"身份证"外貌)+ 位置 + 动作 + 表情 + 光线
景别写进提示词:远景/中景/特写,AI 认这个
一镜一图:不要试图一张图塞两个镜头
生成后逐镜检查角色脸,脸不对的重新生成(同外貌描述多抽几次,总有一张对的)

为什么这么做
分镜图是"每个镜头的定稿",先定图再动视频——图对了视频才可能对;图错了直接生成视频,浪费的是最贵的积分。
不这么做会怎样
跳过生图直接文生视频 → 每镜头的构图、光线、人物全随机,拼起来像不同电影;分镜图不检查脸 → 视频生成后才发现脸崩,一张图废掉整段视频。
第 4 步:图生视频(软件:可灵AI / 即梦AI · 免费额度)
这一步做什么
把第 3 步的分镜图上传,输入运镜指令,让画面动起来——推近、人物转头、眼眶泛红。提示词只写"动"的部分,画面长什么样由分镜图决定。
输入什么提示词(运镜指令 · 复制即用)
运镜示例 A · 女儿迟疑进门:
缓慢推进镜头,女儿在门口站定,微微低头,手指攥紧双肩包背带,犹豫两秒后轻轻抬脚跨过门槛。动作自然,情绪克制,镜头平稳。 |

运镜示例 B · 母女对视:
镜头缓慢推近两人面部特写,母亲的嘴唇微微颤抖,眼眶泛红,女儿的眼眶慢慢湿润,两人沉默对视。氛围安静,只有呼吸感,镜头极稳。 |
限制指令怎么输
首帧:上传对应的分镜图(图生视频入口,不是文生视频)
时长:每段 5 秒(叙事短片以"情绪镜头"为单位,5 秒足够表达一个情绪)
运动幅度选最小档:叙事短片要"克制",幅度一大就变狗血
一次只动一个主体:要么推镜头、要么人物转头,别写"转头+流泪+抬手+镜头转"
负面提示词:人物变形,脸部扭曲,表情夸张,肢体异常,剧烈动作,多出指头,画面闪烁
每段生成 2-3 版挑一版:作者说的"先完成再完美",别跟一个镜头死磕
为什么这么做
分镜图管"画面",运镜指令管"情绪怎么动"——两条词分开写是 AI 短片的标准做法;5 秒一镜、运动最小,是"现实主义细腻感"的保证。
不这么做会怎样
运镜指令写"她冲过去抱住母亲痛哭" → AI 生成人物扭曲变形(AI 最怕大动作+强情绪一起上);一镜 20 秒 → 后半段必崩;追求每镜完美 → 积分烧光、片子永远做不完。
第 5 步:角色配音(软件:剪映 · 免费)
这一步做什么
给角色配对白。剪映文本朗读有多个音色,母女选两个不同的、贴合年龄的音色,分开录。
怎么做(剪映操作)
剪映 →「文本」→「文本朗读」→ 输入台词
母亲选中年女声(低沉温柔),女儿选年轻女声(清亮带哽咽感)
语速调慢一点(叙事短片台词要留气口),情绪重的台词单独生成多试几个音色
限制指令怎么输(给剪映文本朗读)
台词里加标点控制节奏:句号=停顿,"……"=哽咽迟疑,比如"你……你怎么回来了?"
每个角色固定一个音色,全片别换
为什么这么做
配音是叙事短片的灵魂——作者那条"妈,我回来啦"能打动人,一半靠这句台词的语气;音色固定,角色才立得住。
不这么做会怎样
母女共用一个音色 → 分不清谁在说话;机械感重的音色 → 情绪全无,观众出戏;语速太快 → 没有气口,情感戏变新闻播报。

第 6 步:剪辑合成(软件:剪映 · 免费)
这一步做什么
把视频片段+配音拼成完整短片,加字幕、BGM、音效,导出发布。
怎么做(剪映操作顺序)
建工程:导入所有视频片段和配音
对轨:先铺配音轨道,再按配音节奏摆视频片段(配音是骨架,画面跟着配音走)
补镜头:配音长于画面 → 回去补生成 1-2 秒的空镜(手部特写/窗外/静物),这是叙事片常见补法
字幕:自动字幕 → 校正错字 → 选纤细字体+白字黑边(文艺感)
BGM:搜"亲情/温暖/钢琴",音量压到对话之下(对话时 BGM 自动闪避)
音效:关门声、脚步声、环境底噪(剪映音效库搜"生活"类),这是"电影感"的重要来源
调色:全片统一加一个暖色滤镜(叙事温情片用暖调)
合规:标注"内容由 AI 生成"(平台硬要求,作者也标了)
发布配置
标题:带情绪+剧情(作者格式:《妈,我回来啦》+一句话剧情简介)
话题:#AI短片 #AIGC #AI创作浪潮计划 #重组家庭(蹭比赛/计划话题,作者就蹭了"瓦卡奖""AI创作浪潮")
合集:建"自制AI短片"合集,系列化更新(作者合集已更新到第4集,这是涨粉关键)
不这么做会怎样
不对轨 → 口型台词对不上,全片穿帮;不配音先剪画面 → 节奏完全失控;不加音效 → 画面干巴巴,没有"电影感";不标 AI 生成 → 下架风险。
原作者:阿哲AIGCer(抖音号:MS6688_88)
原作品链接:https://www.douyin.com/user/MS4wLjABAAAAX-0WRBSp2H19PaSS5AvwYofX2ukBvuDeSzvKEmRCYow?from_tab_name=main&modal_id=7677978157199601905
物界前沿