Ilya Sutskever的50亿美元赌注,英伟达在买什么?
Ilya Sutskever离开OpenAI后创立SSI,英伟达砸下50亿美元,这到底是在赌一个安全超级智能的愿景,还是在赌一个编译器工程师眼中最务实的算力基础设施?
从工程视角来看,这笔投资很可能是英伟达历史上最聪明的一次布局。Ilya在OpenAI时期主导了GPT系列的核心架构,他对模型训练的理解,尤其是对损失函数、数据分布和训练动态的直觉,是当前AI领域最稀缺的工程能力。英伟达不缺钱,缺的是能真正把其硬件潜力榨干的应用场景。
SSI的路线图和OpenAI有本质区别。Ilya一直在强调安全,但安全不是口号,而是工程实践。安全超级智能的核心挑战在于:如何在训练过程中对齐模型行为,同时不牺牲性能。这本质上是一个优化问题,而且是一个极其复杂的多目标优化问题。
# 一个简化的安全对齐优化框架
def safe_optimization(model, data, safety_constraints):
# 传统的RLHF在处理安全约束时,往往需要额外的reward model
# SSI可能采用更激进的方法:在训练过程中直接建模安全空间
safety_loss = compute_safety_loss(model, safety_constraints)
performance_loss = compute_performance_loss(model, data)
# 关键点:这两者的权重不是固定的,而是动态调度的
total_loss = lambda_t * safety_loss + (1 - lambda_t) * performance_loss
return total_loss
这个动态调度的lambda_t才是真正的技术壁垒。传统的RLHF通过人类反馈微调,本质上是在后训练阶段修正行为。但SSI可能试图在预训练阶段就把安全约束嵌入到损失函数中,这需要重新设计整个训练框架。
英伟达投资SSI的核心逻辑在于:安全超级智能的落地需要大量的算力,而且这个算力需求不是线性的。安全约束意味着需要更多的采样、更复杂的验证机制、更频繁的模型检查点。这些都需要GPU集群,而且是最新一代的GPU集群。
- 训练阶段:需要更多的前向传播来计算安全损失
- 验证阶段:需要在多个安全维度上进行全面评估
- 迭代阶段:安全约束的调整需要重新训练或微调
这些环节都对内存带宽和计算密度有极高的要求。英伟达的H100和即将到来的B200,在内存带宽和计算单元上做了针对性优化,正好匹配这种需求。
[!info] 从编译器工程师的角度看,SSI面临的核心挑战不是算法,而是如何让这些安全约束在训练过程中高效执行。如果安全损失的计算成为瓶颈,整个训练管线就会受限于内存带宽,而不是计算能力。这恰恰是昇腾AI编译器团队每天都在解决的问题:算子融合、内存访问模式优化、数据流图重排。
Ilya选择英伟达而不是其他
物界前沿