
从电驱到推荐引擎:抖音的多模态大模型适龄算法,有什么工程可学的
我注意到一个有意思的细节:抖音这次升级未成年人模式,不是简单加个开关,而是把“适龄推荐算法”的核心引擎换成了多模态大语言模型。作为一个在比亚迪天天跟电驱和电池管理打交道的工程师,我第一反应不是“这算法多厉害”,而是“这玩意儿怎么落地,怎么保证实时性,功耗怎么控制”。
做整车研发的人都懂一个道理:任何新功能,如果不能在有限算力、有限功耗、有限成本下跑起来,那就是实验室里的花架子。抖音这次面对的挑战,本质上和我们把高阶智驾芯片塞进十万元级车型是一样的——要在手机这个低功耗终端上,用多模态大模型做实时内容理解,还要保证推荐响应的延迟在毫秒级。
先看技术路径。多模态大语言模型,通常是指同时处理文本、图像、语音甚至视频片段的模型。传统的推荐系统靠的是用户行为标签(点赞、时长、转发)加内容标签(关键词、分类),本质上是统计匹配。而多模态模型能直接“看懂”视频内容——比如一段视频里有个小孩在玩火,模型可以识别出画面中的危险行为,结合音频里的笑声,判断这个内容不适合低龄儿童。这个能力,比关键词过滤强太多了。
但问题来了:手机端跑大模型,算力够吗?抖音的日活用户里,大量是千元机,芯片的AI算力可能只有几TOPS,而一个7B参数的多模态模型,推理一次需要几十甚至上百TOPS的算力。我猜抖音的工程方案是端云混合:云端跑大模型做离线内容理解,给每个视频打上细粒度的“适龄维度标签”,比如适合3-6岁、7-12岁、13-17岁,然后手机端只做轻量级的标签匹配和实时排序。这个思路和我们做电池管理系统(BMS)很像——云端做大数据训练和模型更新,本地只运行轻量推理模型,保证响应速度。
从公告看,他们提到“系统会基于内容中的角色、场景、情节等元素,以及用户年龄阶段的行为特征,进行综合判断”。这句话里“角色、场景、情节”的识别,就需要多模态模型对视频帧进行语义理解。技术上,这涉及视频理解中的时序建模——不是单帧识别,而是连续几秒甚至几十秒的片段分析。比如一个动画片,开头是可爱的动物,中间突然出现暴力镜头,模型需要捕捉这个变化。这比我们做电池热失控预测要复杂得多,因为电池的时序信号是周期性、可预测的,而视频内容的变化毫无规律。
做工程的人都清楚,最难的不是算法本身,而是数据标注。给短视频打“适龄”标签,需要大量人工标注和专家评审。抖音这次敢上线,说明他们在数据积累上下了血本。我猜他们用了类似“对比学习”的方法,让模型先学大量无标签视频,再通过少量标注样本做微调。这就像我们做电池健康状态估计,先让模型在大量充放电数据上预训练,再针对特定车型做微调。
再聊聊实际效果。从工程视角,一个推荐算法好不好,要看三个指标:覆盖率(能覆盖多少种不良内容)、误杀率(把正常内容误判为不适合)、以及用户投诉率。抖音的公告里没提具体数据,但作为同行,我推断他们肯定做了A/B测试,对比旧算法和新算法下,家长投诉率的变化。如果家长投诉率下降,同时青少年用户的使用时长没有暴跌,那就说明算法达到了平衡。
我比较关心的是推荐算法的“可解释性”。在汽车行业,我们做自动驾驶功能时,必须能解释清楚“为什么这个场景下系统决定刹车”。抖音的适龄推荐也面临同样问题:如果系统判定某个视频不适合孩子,家长需要知道原因。多模态大模型有个好处,它可以用自然语言生成解释,比如“该视频包含暴力场景,建议12岁以上观看”。但生成解释又涉及额外算力消耗,可能只有部分高端机型能支持。
最后,给各位家长一个行动建议:不要只看抖音的“未成年人模式”开关,要定期检查孩子实际看到的推送内容。算法再强,也挡不住孩子用其他账号看。你可以把抖音的“青少年模式”看作一个辅助驾驶系统,它不能完全替代人的监管,但至少能在你开车或者做家务时,把事故概率降低一个数量级。作为工程师,我期待看到抖音后续公布更多技术细节和实测数据,如果能像我们车企发布电池包针刺测试报告一样透明,那就更
原文链接:https://www.ithome.com/0/982/119.htm
物界前沿