
数据审计,终于有人把矛头指向训练数据本身了
刚在arxiv上刷到这篇,标题就让我精神一振。Beyond Shapley,基于影响的数据审计流水线,针对LLM对齐和评估。我最近正好被导师要求读几篇关于数据筛选的论文,读得头大。数据质量大家都知道重要,但怎么量化“这段对话对模型有害”或者“这个偏好标注错了”,一直是模糊的。
这篇的思路很直接:用影响力函数代替Shapley值来做数据审计。Shapley值我之前稍微了解过,合作博弈论里的概念,算每个数据点对模型性能的边际贡献。但问题是,在大模型上算Shapley值基本不现实,计算量指数级。这篇说,我们换个工具,用影响力函数,近似估计每个训练样本对模型输出的影响。我觉得这个思路对,但有个疑问:影响力函数的近似本身也有误差,尤其在非凸的深度学习损失曲面里,稳定性如何保证?
论文里提到一个流水线,包括数据筛选、错误标注检测、偏见识别。这让我想起之前看到的DataComp和DCLM这些工作,都是试图从数据层面提升模型质量。但那些大多依赖规则或启发式,比如去重、过滤脏话。这篇试图用更理论化的方式,直接计算每个样本的“影响分数”。有点意思,但我不确定在实际大规模训练中,这个计算量能否承受。
配图里展示的是他们流水线的示意图,看起来是先训练一个代理模型,然后计算影响力,再根据分数做审计。我注意到他们特别强调了对齐场景,比如RLHF中的偏好数据。确实,RLHF里标注员的偏好往往有噪声,有些标注本身就可能包含偏见。如果能用这种方法自动找出那些“有毒”的偏好对,那会很有价值。但问题是,影响力函数需要二阶导数,大模型上做这个计算,Hessian矩阵的近似又是一个坑。
我最近在实验室看论文,最大的感受是,很多方法在小模型上漂亮,一上大模型就崩。这篇是2026年的论文,可能已经考虑了计算效率,但我不确定它是否真的能在实践中跑通。作为研一新生,我特别想找一些入门资料,比如有没有开源的代码实现,或者有没有人复现过这个流水线。如果谁有相关资源,麻烦分享给我。
不过,这篇论文让我更确信一个观点:数据审计不应该只是后验的事后检查,而应该嵌入到训练流程中。就像代码审计一样,数据也要审计。Shapley值也好,影响力函数也罢,总得有人先趟这趟浑水。这篇论文至少给出了一个可操作的框架,至于能不能落地,等代码出来再说吧。
我继续去啃论文的附录了。
原文链接:https://arxiv.org/abs/2607.22766
物界前沿