
AI新手村|1分钟教你用AI做猫咪日常vlog
用豆包和剪映复刻猫咪打工 Vlog
从四段分镜到二十秒成片的图文教程
结论:这套方法可以复刻。初学者能够按照本文完成一条约二十秒的猫咪打工短片,但人物外观和动作细节不能保证与原作品逐帧一致。最稳妥的做法是先确定同一只猫的角色锚点,再制作四张场景图,每张图只生成一个核心动作,最后在剪映中按顺序拼接。
证据与复刻说明:本文区分来源画面事实、创作者披露、官方资料和复刻方案。原帖展示的工具和界面可以作为路线依据;本文给出的提示词、导出参数和排错方法属于复刻方案。复刻方案不等于创作者原始完整流程。

图 1:原视频展示的猫咪打工 Vlog 效果 来源为原视频画面
一 先看复刻结论
评测项 | 判断 | 原因 |
|---|---|---|
技术可行性 | 高 | 图像生成 视频生成和剪辑三个环节都有明确工具 |
新手难度 | 中 | 操作不复杂 主要时间花在筛选一致的猫咪形象 |
外观一致性 | 中 | 同一角色锚点和参考图能提高稳定性 仍需要多次生成 |
动作稳定性 | 中 | 单镜头只写一个主动作时更稳 复杂连续动作容易变形 |
可复刻范围 | 同类型结构 | 可以复刻叙事和制作链 不承诺逐帧复制原作品 |
原帖是一条约一分十六秒的教程视频。画面先展示猫咪成片,再演示分镜文字、图像生成、视频生成和剪映拼接。作者在置顶评论中公开了两张文字版参考图,评论回复还说明豆包和即梦都可以完成图像环节。
二 原帖实际展示的工具
环节 | 原帖可见工具 | 本文采用方式 |
|---|---|---|
分镜策划 | 豆包对话和公开文字版 | 让模型先输出四个五秒分镜 |
图片生成 | 界面模型选择器显示 Seedream 5.0 Lite | 生成十六比九场景图 |
视频生成 | 结果页显示 Seedance 2.0 Mini | 每张图片生成约五秒视频 |
后期剪辑 | 剪映桌面端 | 顺序排列视频并补字幕和音乐 |
需要注意一个字幕误差:原视频烧录字幕在图像生成画面写着 Seedance 5.0,但同一画面的模型选择器清楚显示 Seedream 5.0 Lite。图像环节应以界面和官方产品名称为准,Seedance 2.0 Mini 则出现在视频生成结果页。
截至 2026 年 9 月 23 日,字节跳动 Seed 官方页面列出了 Seedream 5.0 Lite 和 Seedance 2.0;火山方舟产品页也列出了 Doubao Seedream 5.0 lite 和 Doubao Seedance 2.0 mini。官方链接:字节跳动 Seed 火山方舟

图 2:图像生成界面下方模型选择器显示 Seedream 5.0 Lite 来源为原视频画面
三 准备素材和成片规格
一张清楚的猫咪参考图 正面或四分之三侧面 毛色和脸部花纹可辨认
可以使用豆包图像生成和视频生成功能的账号 入口名称可能随版本调整
剪映桌面端 用于拼接字幕音乐和导出
建议先做四个镜头 每段约五秒 成片约十八至二十二秒
横屏教程使用十六比九 发布竖屏平台时可改为九比十六 但所有镜头必须统一
四 第一步先让豆包写四个分镜
不要一开始就生成视频。先把故事拆成四个短动作,能明显减少返工。原作者公开文字版采用闹钟失灵、摸鱼艺术、午餐纠结和下班冲刺四个段落,每段约五秒。
下面是本文重新整理的可复制模板。它保留原帖的结构,但文字由本文改写。
你是一名熟悉都市打工生活的短视频编导。请把一只拟人化猫咪的一天拆成 4 个连续镜头,每个镜头约 5 秒。主题依次为早晨被闹钟叫醒、上班摸鱼、午餐选择困难、看到下班时间立刻离开。全片只有同一只猫,不出现其他主要角色。每个镜头必须写清场景、机位、构图、猫咪动作、环境细节和情绪。使用 16:9 横屏,生活化写实质感。只输出分镜文字,不生成图片。

图 3:作者置顶评论公开的分镜要求 来源为原帖评论图片

图 4:作者公开的四段分镜示例 来源为原帖评论图片
五 第二步生成统一的猫咪场景图
进入图像生成,选择 Seedream 5.0 Lite,并把比例设为 16:9。先写一段固定角色描述,再把它原样放进四个镜头。毛色、脸型、眼睛颜色和标志性花纹不要换词。
固定角色锚点
同一只银灰色短毛猫,圆脸,额头有清楚的深灰 M 形花纹,绿色眼睛,粉色鼻子,右耳尖有一小块深色斑,毛发细节清楚,体型略圆,拟人化直立行动,四个镜头保持相同脸型、毛色、眼睛和体型。
如果你的入口支持参考图,四次生成都上传同一张猫咪照片;如果不支持参考图,就完整复用这段角色锚点。不要把四个镜头分别交给模型自由设计角色。
四张图片提示词
镜头 | 可复制的场景补充词 |
|---|---|
闹钟失灵 | 清晨卧室 猫咪趴在凌乱床铺上 手机在枕边震动 猫咪半睁眼 一只爪子伸向手机 固定中景 自然晨光 |
上班摸鱼 | 开放式办公室 猫咪坐在电脑前 一只爪子搭在键盘上 另一只爪子拿手机 表情心虚 桌面有咖啡杯 固定中景 |
午餐纠结 | 办公室工位 猫咪盯着手机外卖页面 眉头微皱 桌边有便签和水杯 午间自然光 固定近景 |
下班冲刺 | 办公室临近下班 墙上时钟指向下班时间 猫咪突然站起 朝门口迈步 桌椅和电脑保持原位 固定全身中景 |
每一行场景补充词都要接在固定角色锚点后面,再补上写实摄影、自然室内光、生活化、16:9、无其他猫咪、无文字水印。一次生成多张时,只挑脸型和花纹最接近的版本。
六 第三步把四张图片变成五秒视频
进入视频生成,选择 Seedance 2.0 Mini,分别上传四张图片。原视频结果页显示该模型会提交异步任务,等待时间会随账号、队列和版本变化,不要把视频画面的预计等待时间当作固定承诺。

图 5:视频生成结果页显示 Seedance 2.0 Mini 左下为生成出的猫咪片段
动作提示词写法
一段五秒视频只安排一个主要动作,并把动作拆成先后顺序。原视频示例中,作者会把不自然的连续动作改成停顿后再被手机叫醒,这种节奏比让猫咪同时完成多个动作更稳。
镜头 | 复刻动作提示词 |
|---|---|
闹钟失灵 | 手机轻微震动 猫咪先闭眼侧头睡约一秒 再睁开一只眼 用前爪缓慢碰手机 被子轻微起伏 镜头固定 |
上班摸鱼 | 猫咪缓慢敲两下键盘 停顿后低头看手机 耳朵轻轻转动 镜头固定 动作自然 |
午餐纠结 | 猫咪用前爪轻轻滑动手机页面 停顿后皱眉 视线在手机和电脑之间移动 镜头固定 |
下班冲刺 | 猫咪先看一眼墙上时钟 随后迅速站起 向门口走两步 物品保持稳定 镜头不跟随 |
建议在每条动作提示词末尾加入约束:保持同一只猫的脸型和毛色,不新增肢体,不出现第二只猫,不改变场景布局,不快速推拉镜头,不做突然转场。复杂动作仍可能抽卡,需要重新生成。
七 第四步在剪映完成成片
新建 16:9 项目,把四段视频导入素材区。
按照闹钟失灵、上班摸鱼、午餐纠结、下班冲刺的顺序拖入时间线。
逐段检查开头和结尾。若出现静止、变形或闪帧,只裁掉异常部分,不必强行保留整整五秒。
添加简短字幕和轻量背景音乐。字幕不要遮住猫咪脸、手机和关键动作。
建议导出 MP4 H.264,1920×1080,25 或 30 帧。这里是本文建议值,不是原作者公开参数。

图 6:剪映中把生成的视频按顺序拖入时间线 来源为原视频画面
八 人物一致性和镜头语言
这类视频的关键不是镜头数量,而是同一只猫在四个场景中看起来仍是同一个角色。每个镜头都要重复角色锚点,办公场景还应固定电脑、咖啡杯和桌面色调。若第一张图最稳定,可以把它作为后续生成的外观参考。
控制项 | 具体做法 |
|---|---|
脸和毛色 | 固定 M 形花纹 眼睛颜色 耳尖斑点和体型 不使用近义词轮换 |
机位 | 以固定中景和近景为主 少用环绕 跟拍和大幅推拉 |
动作 | 每镜头一个主动作 动作之间留停顿 不写连续十几个动作 |
道具 | 手机 电脑 咖啡杯只保留必要数量 道具越多越容易错位 |
剪辑 | 镜头靠动作和主题推进 不依赖花哨转场 需要时使用短淡化 |
九 常见失败和处理办法
问题 | 原因 | 处理办法 |
|---|---|---|
四个镜头像不同的猫 | 角色描述有变化或独立抽卡 | 完整复用角色锚点 使用同一参考图 只改场景和动作 |
爪子或手机变形 | 道具和动作过多 | 减少物品数量 一次只让一只爪子完成动作 |
视频抖动或突然变焦 | 提示词没有限制镜头 | 加入镜头固定 无推拉 无旋转 并缩短动作链 |
起止帧不自然 | 生成片段前后有缓冲动作 | 在剪映裁掉异常的零点二至零点五秒 |
账号里找不到同名模型 | 灰度发布或版本入口不同 | 选择当前可用的图像和图生视频模型 保留同一提示词逻辑 |
十 发布前检查
□ 四个镜头是否使用同一只猫的脸型 毛色 眼睛和体型
□ 每个视频是否只有一个主要动作 是否出现多余肢体或第二只猫
□ 字幕是否避开猫咪脸部 手机和重要道具
□ 四段视频的比例 分辨率和画面方向是否一致
□ 剪辑后是否删除闪帧 重复帧和明显变形
□ 发布前是否确认原素材 授权范围 平台水印和音乐版权要求
来源和版本说明
原帖:AI新手村 1分钟教你用AI做猫咪日常vlog 页面作者为阿喵聊AI 页面标注编辑于 08-21
模型与界面核验日期:2026 年 9 月 23 日。产品名称、积分、入口和可用模型可能继续变化。本文使用原帖公开画面进行教学分析;对外转载图片和大段原文前,应再次确认授权范围。
物界前沿