AI芯片需求狂飙后的“价值最大化”:一场风控工程师视角的规则重构
上周在蚂蚁风控团队,我们内部开了个关于AI模型部署的复盘会。业务方拍了一个新的欺诈检测模型,理由是“用了最新的Transformer架构,效果应该更好”。但实际生产线上跑了三天,发现误报率比老模型高了12%,而且推理延迟增加了30%,导致线上交易拦截的响应时间超过200毫秒——这个数字在风控场景里意味着大量用户流失。
我当时的反应是:这不就是现在企业AI部署的缩影吗?从疯狂堆芯片、堆模型,转向“价值最大化”(valuemaxxing),本质上和我们在风控领域做规则优化是一回事:从全量规则覆盖,到精准规则匹配,再到成本收益平衡。
[!tip] 核心观点
企业AI需求依然强劲,但已经从“买芯片-跑模型”的粗放模式,进入“优化规则-降低误报”的精细化阶段。这对芯片厂商、云服务商和AI应用企业都是规则重构,不是简单的需求波动。
从“堆芯片”到“调规则”:一个风控工程师的熟悉剧本
过去的AI热潮,像极了我们早期做风控时的状态:所有风险特征都上,所有规则都开,只要能拦截更多欺诈,硬件成本无所谓。结果就是规则引擎越来越臃肿,误报率飙升,真实用户被拦得怀疑人生。
现在的企业AI部署就是这种状态。2023-2024年,大家拼命买NVIDIA H100/A100,训练大模型,无论效果如何先把集群建起来。但到了2025年下半年,企业开始算账了:训练一个70B参数模型需要多少GPU小时?推理成本占营收比例多少?模型提升的准确率能否覆盖硬件投入?
[!success] 关键数据
据CNBC报道,芯片高管表示AI需求“几乎无限”,但企业客户的采购行为正在发生变化:从“我需要更多芯片”转向“我需要更高效的芯片和更精准的模型”。这和我们风控中的“规则覆盖度”与“误报率”的平衡如出一辙。
技术落地细节:模型推理的“规则引擎”优化
作为风控工程师,我特别关注的是“valuemaxxing”对技术栈的影响。具体来说,有三点值得我们关注:
1. 推理成本成为新的“误报率”指标
以前我们关心的是规则命中率,现在企业关心的是推理成本。推理成本相当于风控中的“误报损耗”——每次推理都需要消耗GPU算力,如果模型响应了大量无效请求,成本就上去了。
企业开始做“推理分流”:把简单查询交给小型模型(如DistilBERT或量化后的LLaMA),把复杂推理留给大模型。这就像我们在风控中做“分层过滤”:先用轻量规则过滤90%的流量,只有异常流量才进入深度模型。
2. 芯片的“规则覆盖度”问题
H100的算力很强,但企业发现它在大规模推理场景下并不经济。因为推理任务对内存带宽和延迟敏感,而对计算密度要求相对较低。这导致很多企业转向定制化芯片(如Google TPU、AWS Trainium、AMD MI300),或者更便宜的推理专用芯片(如Groq、Cerebras)。
在我们风控领域,这等价于“规则引擎的硬件选型”:不是最贵的设备最好,而是匹配业务场景的才最优。比如蚂蚁做实时风控,我们用的是FPGA来做低延迟规则匹配,而不是直接上GPU。
3. 黑产怎么绕过“价值最大化”?
有趣的是,企业追求“valuemaxxing”的过程,其实给黑产留下了空间。如果企业为了降成本,使用了过于简化的模型或规则,黑产就会找到漏洞。
比如,一些企业开始用“模型蒸馏”生成小模型来替代大模型,但小模型的泛化能力可能不足,面对精心构造的对抗样本时,准确率会大幅下降。这就像我们在风控中,如果为了降低误报率砍掉了一些规则,黑产就会在那些被砍掉的维度上做文章。
从工程视角看可行性:企业如何落地“valuemaxxing”
企业要真正实现“价值最大化”,需要解决几个工程问题:
1. 建立成本-收益的量化指标体系
很多企业连自己的AI模型推理成本都算不清(因为GPU集群共享、电力成本分摊复杂)。这就像风控部门早期算不清“每条拦截的欺诈交易成本是多少”。需要建立类似“每推理成本带来的业务价值”的指标,比如每个GPU小时能减少多少客户流失,或者提升多少转化率。
2. 动态资源调度
企业AI流量有高峰低谷(比如白天用户多,推理请求多),但GPU集群往往按固定规格配置。我们可以借鉴风控中的“弹性规则引擎”:根据实时流量动态调整规则复杂度,低峰期用大模型,高峰期用小模型+缓存。
[!example] 案例分析
蚂蚁的实时风控系统,每天处理数十亿次
原文链接:‘Almost unlimited’: Execs says AI demand remains strong even as enterprises move to ‘valuemaxxing’
物界前沿