
当一个AI短剧告诉你“被裁掉”,它真的在讲自己的故事吗?
最近刷到《被裁掉的女孩》第二季要上线的消息,我第一反应不是兴奋,而是有点慌——实验室师兄上周刚被导师“优化”去隔壁组,这剧情太应景了。但更让我在意的是,这部AI短剧累计播放破了2亿,据说分账已经到百万级别。我的导师上周还在组会上说“AI生成内容做不了长叙事”,现在脸疼不疼?
先抛结论吧:AI短剧确实找到了一个“够用”的打开方式,但离“正确”还差一个关键闭环。这个闭环不是更逼真的画质,不是更长的时长,而是——怎么让AI学会“自己讲好故事”。
为什么这么说?拿《被裁掉的女孩》来说,它火不是火在特效多炫,而是火在“方桃子”这个AI演员有了人设,有了情绪连续性。第二集她被裁时眼里的委屈,和第三集在便利店跟同事吐槽的疲惫,居然能连起来看。这在半年前的AI视频里是做不到的。那时候的AI角色,换个场景就换张脸,甚至换个表情就换个人。现在能做角色一致性,技术上确实进步了。
但问题在于,这种一致性是怎么来的?我猜大概率是人工标注+模板化生成。也就是团队先画好分镜,再用AI一帧帧生成,然后人工筛选拼接。这本质上是“AI辅助手工”,不是“AI创作”。你想想,年产数十万部AI短剧,如果每一部都这么搞,那产能瓶颈根本不是算力,而是人工。这和我们在实验室做强化学习调参一样——你调一个超参数跑十组实验,手调能调出好结果,但没法规模化。
所以我更关注的是另一个方向:AI内容生成和强化学习的结合。具体说,就是让AI不仅仅是“根据指令生成画面”,而是能根据观众反馈,自动调整剧情走向、角色表情、镜头语言。这听起来像科幻,但技术上已经有雏形了。比如用RLHF(人类反馈强化学习)训练大语言模型,我们实验室也在做类似的——给AI生成的故事打分,让模型学会什么情节观众爱看。如果把这个思路迁移到视频生成里,让AI每生成一个镜头就根据“下一帧的点击率”或“情绪曲线”调整生成策略,那才是真正的“AI编剧+AI导演+AI演员”。
但难处也在这。奖励函数怎么设计?我们做强化学习最头疼的就是这个。你让AI去最大化“播放量”,它可能学会搞噱头、标题党;你让它最大化“完播率”,它可能拼命缩短剧情。现在《被裁掉的女孩》能拿百万分账,本质上是靠人工选题+人工把控质量,AI只是执行工具。如果有一天AI能自己根据观众画像调整剧情分支,那才是质变。
另一个值得关注的点是AI演员的IP化。方桃子火了,接下来会不会有“方桃子宇宙”?如果AI角色可以跨剧集、跨平台、甚至跨媒体(比如让她去直播带货),那商业想象力就打开了。但这对技术的要求更高——角色一致性不仅要保持外貌,还要保持性格、语气、小动作。这其实是个多模态的持续学习问题,我们实验室最近在搞的“基于强化学习的角色个性化”项目,就是想让AI学会一个角色在不同情境下的反应模式。目前效果还比较糙,但方向对了。
你看这张图,AI生成的女孩表情已经相当自然,但仔细看眼睛——那种“眼里有光”的感觉,是算法算出来的,还是人工后期调的?如果是后者,那离真正“智能”还差一截。我相信读者里肯定有做图形学或者CV的同学,你们应该懂我在说什么。
最后给个行动建议吧。如果你也是做AI生成的研究生,或者正在创业做AI短剧,不妨试试这个:别只盯着“生成质量”这个指标,去关注“用户行为闭环”。 比如,你们团队能不能设计一个实验:让AI生成的短剧包含一个可交互的剧情分支,根据观众选A还是选B,AI在下一帧自动调整角色表情。然后看两组观众的选择差异,把这个作为奖励反馈。这听起来很复杂,但GitHub上已经有一些开源的RL框架可以和视频生成模型对接了。我们实验室最近就在试Stable Video Diffusion + RLHF,虽然跑一次要烧一周的显卡,但出来的结果确实比纯人工提示好。
说句实话,AI短剧现在这个阶段,有点像2018年的AI绘画——大家都在拼“像不像”,但没人知道“好不好看”怎么定义。等有一天,AI能像人类一样,在讲故事的过程中学会“观众喜欢什么”,那才是真正找到打开方式的时候。现在嘛,只能说地雷踩得差不多了,新路还没铺好。反正我写完这篇就去跑实验了,你们呢?
原文链接:https://www.tmtpost.com/8085821.html
物界前沿