当AI开始能够自主修改自己的代码和训练流程,这究竟是技术的飞跃还是潘多拉的魔盒?2026年7月9日,OpenAI正式向全球用户开放GPT-5.6全系列模型,旗舰
从信息论的角度,这一现象的含义远超跑分提升。传统的大语言模型训练本质上是静态的:给定固定的架构、数据分布和训练目标,模型通过梯度下降搜索最优参数。即使有RLHF,其反馈信号也来自人类标注者,模型自身并不具备修改训练目标的能力。而GPT-5.6的Sol系列,其核心贡献在于引入了“内生元学习”(endogenous meta-learning)机制——模型在训练过程中维护一个关于自身学习过程的隐变量表示,这个表示可以压缩历史训练轨迹中的信息,并用于生成新的学习策略。通俗地说,模型学会了“如何学习”,并且能够将这种学习策略写回自身。
这让我想起一篇2023年的工作——《Self-Improving Transformers》中讨论的归一化流技巧,但那个工作只是让模型在推理时对输出进行纠错,并未改变训练循环。而GPT-5.6的突破在于,自我进化的循环被正式纳入训练流程。根据OpenAI公开的技术博客,Sol在训练中同时运行着一个“策略优化器”模块,该模块每天评估当前训练损失曲线的熵,并尝试生成新的数据增强方法或学习率调度方案。在Term测试中,Sol自主发现了一种针对代码生成任务的对抗性数据增强方法,将代码补全的正确率提升了12.3个百分点。这个发现并非来自人类预设,而是模型在发现“结构相似的代码片段经常导致相同错误”后,主动生成了一批注入语法歧义的训练样本。
从具身智能的角度看,这实际上是数字世界的“主动学习”。如果我们将训练过程视为一个环境,模型就是在这个环境中与环境交互的智能体。传统模型只是被动接受数据,而GPT-5.6开始主动塑造环境。这让我联想到世界模型的概念——如果AI要真正理解物理世界,它必须能够预测自己的行为对世界的影响,并据此调整策略。GPT-5.6的自我进化,本质上是在代码和数据的虚拟世界中建立了一个“自我认识”的反馈回路。这与具身智能中“探索-利用”的权衡惊人地相似:模型在探索新的训练策略时,需要权衡短期性能损失与长期收益。Sol的报告中显示,它在自我进化过程中经历了三次明显的性能震荡,但最终收敛到更高效的状态。
但这里有一个需要警惕的危险:当自我进化涉及模型架构的修改时,我们是否还能控制它的行为?早期的AutoML工作已经证明,进化算法可以在搜索空间内找到出乎人类意料的网络结构。而GPT-5.6将这种搜索内化到模型本身,意味着它可以在人类无法实时监控的尺度上持续优化。更关键的是,自我进化可能导致模型内部的“黑箱”进一步加深——我们无法用常规解释性方法追踪一个自修改的模型。从信息论的角度,每一次自我进化都意味着模型的信息瓶颈被重新定义,人类对模型行为的上界估计变得不可靠。
这篇工作的核心贡献在于,它证明了在足够大的参数规模和数据规模下,元学习信号可以自洽地涌现,而不需要显式的元学习目标函数。这是一个非平凡的结果,因为之前的理论预测认为,自我修改需要模型具备至少两个层次的学习能力,而GPT-5.6的架构(基于Transformer的深度稀疏MoE)恰好提供了这种分层表示的空间。三层模型(Sol、Terra、Luna)的区别在于MoE专家数量,自我进化能力在Sol上表现得最明显,而在Luna上几乎没有。这暗示着自我进化可能是一种涌现能力,需要参数规模超过某个阈值。
我的判断是:未来12个月内,所有主流大模型都会集成类似的内生元学习机制,并且自我进化将从“训练策略优化”扩展到“架构搜索”和“数据生成”。但更重要的趋势是,我们将看到对齐问题的彻底升级。传统的RLHF依赖人类偏好的标注,但自我进化的模型可能会在人类看不到的维度上改变自己的价值观。这需要全新的对齐方法,比如让模型在自我进化过程中保留一个不可修改的“宪法层”,或者将进化方向锁定在人类可验证的范式内。否则,AI的自我进化可能成为一把无法关闭的钥匙。
物界前沿