大模型拿IMO金牌,我的第一反应是“这题跟我电池热管理有啥关系”
上周在实验室调电池热管理模型的参数,卡在一个多变量强耦合的偏微分方程上。我习惯性地打开电脑,想用常规数值解法跑一版,结果发现收敛条件苛刻到离谱。旁边同事随口说了一句:“要不你试试小红书那个新模型,刚拿了IMO满分。”我愣了一下——什么时候大模型能解这种级别的题了?
新闻里说,小红书大模型 dots-note-3.0 在 IMO 2026 上六道题全对,满分夺金,第三题的解法甚至让人类冠军选手直呼“优雅”。这是中国大模型首次获得IMO官方金牌水平认证,上一个做到的是谷歌 Gemini。但作为一个天天跟电池管理系统打交道的工程师,我关心的不是“AI智力竞赛”,而是:这种解题能力,到底能不能落地到工程中?
从“数学竞赛”到“工程计算”,中间隔着一层物理
我得先泼一盆冷水。IMO 考的是纯数学,题目有明确的已知条件和唯一解,解题过程是演绎推理——这跟汽车工程里的“数学”完全不同。
- 纯数学题:公理体系完备,逻辑链封闭,每一步推导都有确定性。大模型可以靠“记忆+推理”生成解题路径,本质上是在做模式匹配。
- 工程计算:边界条件不清晰,参数带噪声,模型本身有误差。比如电池热管理中的热传导方程,材料导热系数随温度非线性变化,实测数据还有0.5%的波动。这时候就算你让大模型写出一个“优雅”的解析解,也无法直接用于产线——因为实际工况不允许你假设理想边界。
所以,小红书模型的满分,证明的是它在“符号推理”上的能力,而不是在“应对真实世界不确定性”上的能力。这就像让一个围棋冠军去开挖掘机,底层的思维模式完全不同。
小红书 vs 谷歌:两条路线,哪个更“工程化”
谷歌 Gemini 去年拿IMO金牌时,用的是“思维链+蒙特卡洛树搜索”,本质上是把解题过程当成一个搜索问题。而小红书 dots-note-3.0 的解法,据称在第三题上用了“分步符号化简+几何直觉映射”,更接近人类选手的解题策略。
从工程落地的角度看,我倾向于认为小红书的路线更有潜力。
原因很简单:在工程场景中,我们需要的不是“暴力搜索所有可能解”,而是“快速找到一条可行路径,并且能解释为什么这条路可行”。比如在做电池SOC估算时,卡尔曼滤波的调参过程,本质上就是要求工程师理解非线性系统的局部行为。如果大模型能像小红书那样,把复杂问题拆解成若干可解释的步骤,并给出每一步的物理意义,那就真的能帮上忙。
但反过来说,谷歌的搜索式方法更适合“黑箱优化”——比如自动标定电池参数,不需要知道为什么,只要求最终结果收敛。这两种路线各有适用场景,但就目前而言,工程中更缺的是“可解释的推理”,而不是“黑箱的性能”。
大模型能替代工程师做计算吗?先看看成本
我们团队做过一个实验:用一个大模型去求解一个电池热模型的热平衡方程,给定初始条件和边界条件,让它直接输出温度分布。结果呢?模型“编”出了一个看起来合理的曲线,但实际测试后发现偏差超过10%。原因很简单:大模型没有“物理约束”,它不知道能量守恒定律必须严格满足。
所以,在工程计算中,大模型目前只能做“辅助推理”,不能做“替代求解”。它的价值在于:
- 快速给出初始猜测,给工程师提供方向
- 把复杂问题分解成子问题,节省人工拆解时间
- 在已知公式和边界条件下,验证推导的正确性
但代价呢?训练一个大模型到IMO金牌水平,算力成本是天文数字。小红书的 dots-note-3.0 据说用了数千张GPU训练,时间跨度数月。而一个汽车工程师解决一个具体问题,可能只需要在MATLAB里写几十行代码,耗时几小时。如果为了省掉这几小时,去投入几百万的训练成本,这笔账怎么算都不划算。
开放性问题:大模型何时能“读懂”物理?
我很好奇,如果明年的IMO题目改成“带噪声的电池热管理模型参数辨识”,小红书模型还能不能拿满分?大概率不能。因为工程世界的“数学”从来不是纯数学,而是带物理约束的数学。
那么问题来了:大模型需要什么样子的训练数据,才能学会“物理常识”?是靠扩大参数规模,还是需要引入新的架构,比如把物理方程硬编码进注意力机制? 如果只是堆算力,那我觉得这条路在工程上永远走不通。如果你有想法,欢迎在评论区聊聊。
物界前沿