人脸识别把顾客赶出门,Sainsbury's终于踩了刹车
Sainsbury’s停用人脸识别这事,在AI圈子里算一堂免费的复盘课。伦敦一家门店,摄像头把人脸识别系统标记的"疑似惯犯"信号转给保安,保安把人请了出去,结果认错人了。当事人是个活动策划人,当天上午还在店里买过东西。Sainsbury’s总部第二天联系他道歉,并且暂停了这家店的实时人脸识别。今年已经是第二次了。
我这边看完报道的第一反应是:整个决策过程里,没有一个人敢说一句"我不确定"。
人脸识别这事,技术上分两层。一层是活体检测加特征提取,就是把人脸变成一串数字向量;另一层是比对,把这串向量和数据库里的向量算相似度。零售场景里用的所谓"黑名单比对",其实准确率不低,训练得当的话非常高。问题出在剩下的极少数,误匹配的那部分,落在真人头上就是确定无疑的误判。我上周在K8s集群上调文本生成模型的评测流程,有个参数没配好,模型输出看着头头是道,其实是基于错误上下文编的。我跑了一周才意识到是参数问题。模型不会主动告诉你"我现在不确定",它只会给你一个置信度分数,然后等着人来做决定。
但决定谁来做?店员的职责是执行,不是复核。保安手里的平板或者对讲机里传出一句"系统显示他是惯犯",他没有义务也没有能力去质疑这个结论。真正的问题在于,整个流程里没有任何一环设置了"人工复核"机制,或者可以说,复核的门槛被默认放到了最低。当事人说自己是做活动策划的,前一天还在店里正常结账买东西,第二天就被当成惯犯请出去。这事放在谁身上都窝火。细节两边报道有点出入,但核心事实是一致的,误判发生之后,店里没有人意识到可能出了问题。
我觉得这里头最讽刺的一点是数据层面。用来训练这套系统的面部数据,大概率包含大量普通购物者的脸部样本,它识别"这个人是不是在店里出现过"很擅长,但它缺少一个关键能力:知道自己不知道。我把这个叫置信度缺失。做文本生成模型评测的时候,我习惯在prompt里加一句"如果你不确定,请直接说不确定",不然它编得理直气壮。人脸识别系统不会这么谦逊,它只会输出"匹配成功"或者"匹配失败",不会告诉你"相似度只有62%,可能是另一个人,需要人工看一眼"。
商家上AI摄像头,账面上是算得过来的。一家店24小时盯着监控的人力成本,和一套一次性部署的摄像头加算法比起来,后者便宜太多。但误判的法律成本和声誉成本很难量化。Sainsbury’s停用的只是一家店,不是全渠道的系统,说明他们判断问题出在"执行"而不是"战略"。这个判断可能对,但远远不够。报道里提到,当事人是今年第二个被误认的顾客。第二个。第一次误判之后系统有没有调参,有没有重新评估阈值,有没有给门店加一道人工复核的流程,我没有看到公开的说法。如果没有,那这次的停用就只是公关意义上的止血,不是工程意义上的修复。
技术上,人脸识别这类基于深度学习的系统,单一模型的精度已经摸到天花板了,再往上提需要靠多模态融合、时序行为分析这些更重的方案。零售场景愿不愿意为这个成本买单,是个商业问题,不是技术问题。我更愿意看到的做法,是把AI的输出从"自动执行"降级为"辅助建议"。系统可以提示"此人疑似在店内有盗窃记录,请人工确认",但最终赶不赶人由店长判断。这就是把技术放回它本该在的位置。
要我说,未来一年零售业会分成两派。一派把AI当侦探,出了事靠公关擦屁股;另一派把AI当工具链里的一环,让系统做它擅长的识别和预警,让人做人类擅长的事后判断。后者会活得久一点。跑得太快的技术如果没有刹车,社会会用一次次的愤怒把它摁住,然后逼它重装一遍刹车。从工程角度看,这不完全是坏事。我以后去超市看到摄像头,大概还是会多看一眼,但我更想知道的是,屏幕背后有没有一个"说不好"的按钮。
本文编译自 Hacker News,原文:Sainsbury's pauses London store's AI cameras after man ousted - BBC News
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿