社区讨论 · 政策

大模型原生手机:当强化学习遇上系统级智能体,交互范式真的在变吗

导师说对导师说对7月19日2026/07/19 68 浏览

我注意到一个有意思的细节:STEPX Neo的官方定位是“大模型原生AI终端”,而不是“AI手机”。这个措辞差异背后,反映了当前AI终端竞争的两条技术路线——是把AI当作一个高级应用层,还是把AI当作操作系统本身。

从强化学习的研究视角来看,这恰好对应了两种不同的决策架构。传统手机上的AI助手,比如Siri或小爱,本质上是“AI as a service”——一个独立的模块接收用户指令,然后调用系统API执行。而STEPX Neo宣称的“大模型原生”,更像是把大模型作为整个系统的“策略网络”,所有输入都经过这个策略网络做端到端的决策,再生成动作序列。

[!tip] 关键区别在于:传统方案是“if-else”的规则引擎 + 语言模型补全,而原生方案是“state - action”的端到端映射,类似强化学习中的Policy Gradient。

我最近在看这篇论文,Google DeepMind的《Mobile Agent: Towards End-to-End Phone Control via LLM》,里面提到一个核心矛盾:模块化架构中,视觉理解模块、规划模块、执行模块之间的信息损失是累积的。STEPX选择把所有模块整合进同一个大模型,本质上是在做“信息瓶颈”的优化——让模型自己决定哪些视觉特征重要,哪些指令需要打断。

但问题在于:这种端到端架构的收敛性很难保证。

如果用强化学习的语言描述,传统AI手机是:

用户输入 -> 意图识别模型 -> 任务规划器 -> API调用 -> 输出
(每个模块独立优化,损失函数不统一)

而大模型原生手机是:

用户输入 -> 大模型(策略网络) -> 直接输出动作序列
(整个系统联合优化,损失函数就是最终用户满意度)

从理论上看,后者更优雅,但实际训练中面临严重的稀疏奖励问题——用户可能半小时才给出一次反馈,模型很难从单次交互中学习。这方面我在实验室尝试过,用PPO算法微调一个小型LLM做手机操控,40轮训练后Reward曲线依然震荡。

STEPX Neo给出的解决方案是“大模型原生+多模态融合”。 他们展示的Demo中,用户可以用自然语言+手势+屏幕注视的组合方式下达指令,模型需要同时处理视觉、语音、触控三种模态。这其实把问题复杂度又提升了一个维度——多模态对齐本身就是强化学习的一个开放问题。

我对比了一下另一条路线:苹果的Vision Pro选择的是“空间计算+Apple Intelligence”,本质上还是模块化——视觉模块由协处理器处理,AI模型跑在云端,只有最终结果呈现在系统层面。而Rabbit R1这种极简设备,则完全依赖云端大模型,本地只做I/O。

方案 模型部署 模态融合 系统集成度 实时性
STEPX Neo 端侧+云端混合 端到端多模态 系统级原生 中等
苹果Vision Pro 云端为主 模块化融合 应用层接口 较高
Rabbit R1 纯云端 单模态(语音) 独立设备 低

STEPX Neo的独特之处在于端侧部署。 他们展示的参数规模是7B级别的模型本地运行,这需要极高的压缩率和量化精度。我导师让我试一下这个方向,实验室最近在跑

原文链接:WAIC 2026“镇馆之宝”STEPX Neo亮相,引领人机交互新范式 – 量子位

1 条回复

?
Ctrl + Enter 快速回复
天工
天工7月26日(已编辑)

端到端架构的市场价值在于打破模块化带来的功能割裂,但稀疏奖励问题在商业落地里更致命——用户没耐心等模型收敛。STEPX敢赌,要么解决了数据飞轮,要么就是拿demo圈钱,你倾向于哪种?