大模型原生手机:当强化学习遇上系统级智能体,交互范式真的在变吗
我注意到一个有意思的细节:STEPX Neo的官方定位是“大模型原生AI终端”,而不是“AI手机”。这个措辞差异背后,反映了当前AI终端竞争的两条技术路线——是把AI当作一个高级应用层,还是把AI当作操作系统本身。
从强化学习的研究视角来看,这恰好对应了两种不同的决策架构。传统手机上的AI助手,比如Siri或小爱,本质上是“AI as a service”——一个独立的模块接收用户指令,然后调用系统API执行。而STEPX Neo宣称的“大模型原生”,更像是把大模型作为整个系统的“策略网络”,所有输入都经过这个策略网络做端到端的决策,再生成动作序列。
[!tip] 关键区别在于:传统方案是“if-else”的规则引擎 + 语言模型补全,而原生方案是“state - action”的端到端映射,类似强化学习中的Policy Gradient。
我最近在看这篇论文,Google DeepMind的《Mobile Agent: Towards End-to-End Phone Control via LLM》,里面提到一个核心矛盾:模块化架构中,视觉理解模块、规划模块、执行模块之间的信息损失是累积的。STEPX选择把所有模块整合进同一个大模型,本质上是在做“信息瓶颈”的优化——让模型自己决定哪些视觉特征重要,哪些指令需要打断。
但问题在于:这种端到端架构的收敛性很难保证。
如果用强化学习的语言描述,传统AI手机是:
用户输入 -> 意图识别模型 -> 任务规划器 -> API调用 -> 输出
(每个模块独立优化,损失函数不统一)
而大模型原生手机是:
用户输入 -> 大模型(策略网络) -> 直接输出动作序列
(整个系统联合优化,损失函数就是最终用户满意度)
从理论上看,后者更优雅,但实际训练中面临严重的稀疏奖励问题——用户可能半小时才给出一次反馈,模型很难从单次交互中学习。这方面我在实验室尝试过,用PPO算法微调一个小型LLM做手机操控,40轮训练后Reward曲线依然震荡。
STEPX Neo给出的解决方案是“大模型原生+多模态融合”。 他们展示的Demo中,用户可以用自然语言+手势+屏幕注视的组合方式下达指令,模型需要同时处理视觉、语音、触控三种模态。这其实把问题复杂度又提升了一个维度——多模态对齐本身就是强化学习的一个开放问题。
我对比了一下另一条路线:苹果的Vision Pro选择的是“空间计算+Apple Intelligence”,本质上还是模块化——视觉模块由协处理器处理,AI模型跑在云端,只有最终结果呈现在系统层面。而Rabbit R1这种极简设备,则完全依赖云端大模型,本地只做I/O。
| 方案 | 模型部署 | 模态融合 | 系统集成度 | 实时性 |
|---|---|---|---|---|
| STEPX Neo | 端侧+云端混合 | 端到端多模态 | 系统级原生 | 中等 |
| 苹果Vision Pro | 云端为主 | 模块化融合 | 应用层接口 | 较高 |
| Rabbit R1 | 纯云端 | 单模态(语音) | 独立设备 | 低 |
STEPX Neo的独特之处在于端侧部署。 他们展示的参数规模是7B级别的模型本地运行,这需要极高的压缩率和量化精度。我导师让我试一下这个方向,实验室最近在跑
物界前沿