数字人宣传片制作-实战干货
原创作品 · 创作者联盟

数字人宣传片制作-实战干货

starvenstarven创作者联盟2026/09/09 238 浏览

物界前沿 · 项目复盘

一条77秒数字人宣传片的制作复盘

一条不到77秒的数字人网站宣传片,经历了配音确认、分段生成、页面遮挡、导航裁切、字幕与音画同步等问题。记录MiniMax Design、Liblib、Remotion、HyperFrames和本地音视频工具如何分工,以及哪些检查值得提前做。

最近,我给物界前沿做了一条面向AI内容创作者的网站宣传片。

最后交付的视频不到77秒,却经历了配音确认、数字人生成、网站画面制作、字幕调整、转场返工,以及两种发布版本的检查。

最有代表性的反馈,来自两张成片截图:"人物将页面挡住了""页面上面没有展示全面"。

这两个问题都发生在视频已经能正常播放之后。人物能说话,页面也放进去了,但观众真正需要看的内容,被构图挡住了。

这篇文章就记录这次制作里比较有用的经验:工具怎么分工,哪些地方容易返工,以及我最后怎样把问题拆开解决。如果你也准备做网站介绍、产品演示或数字人口播,可以把这套流程作为起点。

先确定观众为什么要看

物界前沿有公司、评测、人才、创作者联盟等内容入口。最初很容易沿着网站导航,逐个介绍"这里有什么、那里能点什么"。但这条视频主要给UP主看,功能清单不足以回答他们最关心的问题。

我把开场落在两个具体场景上:认真做了一期评测,热度过去以后,作品很快被信息流盖住;教程散落在不同平台,观众刷到一条内容,却看不到创作者的完整积累。

接下来才介绍网站,说明文章、作品链接、相关栏目与创作者之间怎样建立联系。

这里还有一个重要边界:当时网站正在建设内容,不能把尚未开展的企业合作、接单案例或收益承诺写成已经实现的权益。最终口径围绕内容展示、作品积累、真实表达和参与共建展开,没有承诺加入就有订单、流量或收入。

先把这些话说准确,后面才知道该展示哪些页面,也能避免做完数字人口播以后再大幅改词。

几个工具分别负责什么

这次不是在一个软件里完成所有步骤。前期,我在MiniMax Design制作并确认配音,再在Liblib制作数字人口播素材;后期通过Codex编排本地工程,完成画面、字幕、音频处理和检查。

Remotion承担整条片子的编排,HyperFrames负责一段约8秒的关系动画。把动效先做成独立片段,检查完成后再接入主时间轴,问题更容易定位。

这张图是本次项目的分工,不是"每个人都必须装齐"的清单。若只是固定人物加字幕,没必要一开始就引入这么多环节。

配音先定稿 再做数字人口型

前期最容易低估的返工成本,是修改台词。

改文案很快,但已经生成的人物视频不会随着新文案自动改变嘴型。如果新声音说的是另一句话,仅替换音轨或拉伸视频,通常不足以解决口型问题。

因此,更合理的顺序是先定文案,再确认配音,最后用确认好的音频驱动数字人。需要明显改词时,应重新生成对应段落的口播,或使用真正支持口型重生成的流程。

这次我遇到的另一个限制,是所用界面当时对文字和音频上传有长度要求:文字不超过500字,音频上传最多一分钟,还需要控制文件体积。这里说的是当时使用的入口,不代表所有模型或现在的套餐都一样。

为了处理约75秒的口播,我采用两段素材进入后期,而不是为了塞进上传限制,把整段话压得非常快。

分段时最好落在完整句子的停顿处;两段继续使用同一人物、服装、背景、构图和声音。拼接点再安排在网站演示或流程说明附近,可以减轻镜头姿态变化带来的突兀感,但不能靠遮挡画面掩盖台词缺失或声音断裂。

让声音更有活力不能只拉高音量

第一轮反馈希望声音更自然、更有活力。这里需要区分三个问题:声音偏小,表达平淡,以及语速拖沓。它们不是同一件事。

单纯加大音量,可以让声音更响,却不能自动生成重音、情绪和停顿。后期均衡、压缩和轻度变速,也不能替代配音阶段的表演。

这次后期采用了比较克制的处理:削减部分低频浑浊感,轻度提亮人声,适当控制强弱差异,再把声音、人物画面和字幕一起提速4%。原本80秒的合成时间轴,最后变成约76.97秒。

没有只加速声音、让人物视频继续按原速度播放;否则即使开头看起来正常,后面也容易逐渐对不上。

处理后的音频测得综合响度约为-14.52 LUFS,真峰值约为-1.50 dBTP。前者可以理解为整段听起来有多响,后者用于观察峰值是否留有余量。这是本片的处理结果,不是所有平台通用的强制标准。

背景音乐则保持在人声后面。本片使用本地合成的轻量配乐,通过前段稀疏、中段增强、后段回落来支持讲解,没有让鼓点盖住口播。

导出后,我还检查了音轨时间。有一轮导出出现约一帧的整体延迟和响度变化,后续重新合成并校准。最后修画面时直接沿用已经确认的音轨,避免每改一次布局就重新处理一次声音。

参考视频要拆成画面规则

我手上有一条参考视频。真正有用的,不只是它的颜色、圆角或人物形象,而是它怎样分配观众的注意力。

人物全屏时,画面重点是讲解,肩侧出现少量关键词。进入软件演示后,页面成为主画面,人物缩到角落。需要解释抽象关系时,再切到图示,用箭头和卡片帮助理解。

我按这个逻辑组织了自己的视频:开场讲创作者痛点,中段展示网站页面和内容关系,后段解释参与方式与创作边界。

但参考片的构图不能原样照搬。对方页面留白够多,不代表我的网站也有同样的空间。人物框、网页和说明文字都需要根据自己的内容重新安排。

人物框的落点比放大效果更重要

这一点在人才页返工时特别明显。

最初,我想在"作品版权仍然属于你"这句话出现时放大人物,同时叠加一张说明卡片。强调是有了,但人物挡住网页左下区域,说明卡片又占住页面中部。网站画面虽然存在,观众却无法完整阅读。

修正后,布局变得明确:人物放在左下独立区域,版权说明放在左侧上方,网页固定在右侧。观众不需要在被遮住的内容之间猜测。

同时,转场不能只看最后一帧。即使人物最终停在正确位置,从全屏缩小的途中,也可能继续压住网页。

我给这段转场补了先后顺序:人物先缩小到位,网页再出现;人物准备放大时,网页和页面标题先淡出。这样,页面在可阅读的阶段有稳定的空间,不会一边展示,一边被移动的人物遮住。

检查其他段落时,还发现关系图中的人物小窗碰到了第一张卡片的下沿。最后也一起调整,让人物、卡片和底部字幕分别留有间距。

去掉浏览器装饰以后还要检查真实页面

早期页面展示用了仿浏览器外框,顶部有三色圆点和地址栏。它能让画面看起来像一个电脑窗口,却也占用了展示空间。

根据反馈,我去掉了这些装饰,只保留网站页面本身。

接着暴露出第二个问题:联盟页为了给右侧说明区留位置,只显示了截图的一部分,还设置了向上的偏移。结果网站自己的顶部导航也被裁切、遮住了。

最终修正保留了完整宽度的顶部导航,取消向上裁切,把二维码或权益说明限制在右侧正文区域。还修正了本地展示画面里错误的导航选中状态,没有改动线上网站。

这里说的"完整",是指定好的展示区域没有误裁导航和关键信息,并不意味着把整张长网页缩成一张小图。长页面仍然需要挑选与口播相关的部分展示。

另外,1080P导出不等于所有素材都具有原生1080P细节。本片的人物源素材约为1264×720;输出画布是1920×1080,标题和字幕由代码渲染。后期可以改善排版和可读性,但不能凭空补回低分辨率原片没有的细节。

字幕要按整个画面居中

字幕看起来位置差不多,并不代表真正居中。

早期字幕为了避开人物,左右留白不一致,视觉上偏向右侧。后来我按整个1920像素画面的中心重新排布,让字幕固定在底部居中,再通过移动人物解决遮挡。

稳定的位置很重要。每换一个镜头都挪字幕,观众就需要反复寻找文字。长句拆成短语之后,也要检查句首标点、换行和停留时间。

本片字幕以校对过的文本和已有时间信息为底稿,部分句内短语时间采用估计切分。这里不能把"音轨没有整体偏移"理解为"每个字都经过逐字强制对齐",也不能把它理解为已经重新生成了人物嘴型。

检查时,我把三个层面分开:文字有没有错,字幕出现得是否合适,以及声音与原人物动作有没有新增错位。

一条视频为什么要保留两种结尾

当视频准备对外使用时,还要考虑它会发到哪里。

我保留了两个版本。公开平台版不放站外二维码和网址,结尾说明创作者联盟的内容价值;定向邀请版保留我放进片尾的二维码,方便有意向的创作者直接了解。

这不是一个保证不限流的技巧。平台审核、商业推广规则和账号可用的承接入口需要另外核对;播放量低,也不能直接归因于某个二维码。

二维码没有交给生成模型重画,而是直接嵌入原图。完成编码后,再从视频里抽帧识别,确认不同时间点仍然能读出正确地址。原图能扫出来,不代表缩放、转场和压缩之后还一定可靠。

最终画面也保留了数字人标识。发布生成合成内容时,应按要求主动声明并使用平台的标识功能,不能把去掉必要标识当成后期优化。[1]

导出成功以后还要做一轮检查

这次最值得留下来的,是最后的检查方式。

我对两版视频做了全片解码,检查文件能否完整读取;按全片分镜抽帧,在人才页、联盟页和关键转场附近增加检查点;对网页显示期间的人物与页面位置逐帧计算,确认没有矩形区域重叠。

声音方面,比较了修正版与上一版音轨的数据和时间戳,确认布局修改没有改变已确认的音轨。邀请版则在多个时间点重新验证扫码结果。

这些检查各自解决不同问题。解码正常不代表版式正确,几何不重叠不代表视觉一定舒服,二维码可识别也不代表宣传内容已经获得平台许可。工具负责提供证据,最后仍然需要人看画面、听声音、判断信息是否讲清楚。

所有已经交付的版本都保留,修正后另存新文件。这样既可以比较改动,也能在新方案不合适时回到旧版。

下次我会按这个顺序做

先确定目标观众,写清真实可提供的内容和边界。

定稿口播,制作短试听,确认声音后再生成整段。

按实际上传限制分段,保持人物和场景一致。

先做一小段"人物讲解加网站演示",验证布局再扩展。

给人物、页面、说明和字幕划定固定区域。

用主时间轴统一组织素材,把独立动效作为片段接入。

锁定声音后再细修画面,变速时同步处理所有相关轨道。

根据使用场景输出不同版本,检查成片,而不只检查编辑器预览。

这次做完后,我得到了一条约77秒的数字人宣传片,也留下了一套可以继续修改的工程。

对我而言,AI减少了人物、声音和画面素材的部分制作工作,但没有替代内容判断和成片检查。真正影响观看体验的,往往就是这些很具体的细节:一句话有没有说准确,一块页面有没有被挡住,一个二维码在最终视频里还能不能扫出来。

下次再做同类项目,我会更早确认这些问题,而不是等整条视频完成之后,再从头返工。

参考资料

[1] 国家互联网信息办公室《人工智能生成合成内容标识办法》第十条 cac.gov.cn/2025-03/14/c_1743654684782215.htm

Remotion官方文档 remotion.dev/docs | HyperFrames官方介绍 hyperframes.heygen.com/introduction

本文复盘的是本次项目的实际流程。文中上传限制为当时使用界面的条件,工具功能、套餐与发布规则可能调整,使用时请核对当前信息。

作品来自 创作者联盟,已通过内容审核。