社区讨论 · 政策

当高中生用旧数据挖出150万颗天体:AI范式革命的工程关隘

黑产克星黑产克星7月25日2026/07/25 69 浏览

我每天的工作是盯着异常检测模型打出来的告警,跟规则引擎的误报率死磕。上周有个同事兴奋地跟我说,团队新上的图神经网络模型能发现之前漏掉的团伙,但代价是误报率从0.5%飙到了2.3%。我让他先别急着上线,先拿历史数据回测三个月再说。不是我不信新技术,而是风控这东西,漏掉一个黑产团伙和误杀一千个正常用户,哪个更痛,做工程的都懂。

所以当我看到那个18岁高中生用退役卫星的旧数据发现150万颗未编目天体的新闻时,第一反应不是膜拜,而是好奇:他是怎么绕过数据质量这个坑的。那颗卫星的设计用途根本不是找这些天体,数据格式、噪声特征、甚至时间戳的精度,大概率都是为原始任务优化的。换到我们风控领域,这就好比用交易日志去反推用户意图,日志里本来就没有“是否被黑产诱导”这个字段,你得从频次、设备指纹、IP关联性里硬抠特征。

[!note] 这位高中生显然没有用现成的深度学习大模型,而是基于旧数据重新设计了信号处理流程,把噪声转化为信号。这背后是工程上的两个关键动作:一是对数据生成机制的理解,二是针对性的规则设计,而不是堆模型。

短期看,这场“范式革命”在落地时面临的最大挑战是数据复用成本。新闻里说卫星“当初的设计用途不是为了寻找这些天体”,这太常见了。我们在蚂蚁做反欺诈,每天要处理几十亿条事件,大部分数据采集时只考虑了核心业务需求,比如“用户是否登录成功”“交易金额是否合理”,但黑产的行为模式会变,原有的数据特征可能很快失效。这时候,是重新标注数据、训练新模型,还是像那个高中生一样,用旧的规则框架去挖掘隐藏信号?

我见过太多团队一上来就上Transformer,结果数据量不够、特征分布偏移,模型在测试集上漂亮,上线后一触即发。短期来看,更务实的做法是:先做数据盘点,找出那些“被忽略但强相关”的字段。比如支付场景里,用户点击“忘记密码”的频率,之前没人关注,但黑产在碰撞测试时会频繁触发。这个字段的覆盖率可能只有0.1%,但异常值对区分黑产有奇效。这就是工程上的“旧卫星数据”——数据就在那里,看你会不会用。

长期看,范式革命真正改变的不是模型结构,而是工程方法论从“为任务定制数据”转向“为数据定制任务”。传统风控是定义明确的目标(比如识别欺诈交易),然后收集对应标签数据,训练模型。但黑产对抗是动态的,目标会变。那个高中生做的事,本质上是先把数据里的结构找出来,再反推数据能解决什么问题。这跟无监督异常检测的思路很像——我们不预设欺诈是什么样子,而是让模型自己去发现群体中偏离的部分。

但长期落地有两个硬约束。第一,数据质量必须可解释。天文数据有物理定律约束,噪声有明确来源;而金融数据里的噪声是人为制造的,黑产会故意加噪声来混淆模型。第二,规则引擎的兜底能力不能丢。任何端到端模型都有黑盒问题,一旦误判,你必须能回退到可解释的规则上。那个高中生用的方法,本质上还是基于规则的特征工程——他发现了旧数据中某些信号模式,然后编目。这跟风控里的“规则编译器”异曲同工:先写规则,再调权重,最终用模型补漏。

[!tip] 如果你正在做AI落地,别急着追求“大模型+大数据”的范式。先拿你手头最便宜的旧数据,试一个简单的信号处理流程,看看能不能挖出之前忽略的异常。这比上GPU集群跑模型更能让你理解这场革命的本质。

最后说一句:范式革命不是从0到1,而是从1到100,而那个1,往往是像高中生一样,用最笨的工程方法把旧数据里的灰尘擦干净。

原文链接:AI下一步将迈向何方?一场正在发生的范式革命-钛媒体官方网站

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧