从应用叠加到系统原生:阶跃STEPX试图定义智能体手机的新范式
从原理上讲,一个产业的底层范式转换往往不是由功能叠加驱动的,而是由操作系统的核心交互模型重新定义。阶跃星辰在7月13日发布的STEPX品牌和Step AOS,正是在尝试做这件事——将大模型智能体从“手机里的一个App”升级为“整个手机的操作系统本身”。这个判断,是我在阅读雷锋网相关报道后得出的核心结论。
要理解这一动作的意义,我们需要先理解一个关键概念:什么是“大模型原生”。目前业界主流做法,是在现有手机操作系统(Android或iOS)上嵌入AI功能,比如语音助手、图像生成、智能摘要等。这些功能本质上仍是应用层插件,底层的事件驱动、消息传递、进程调度机制并未改变。而阶跃提出的Step AOS,则试图将智能体作为系统的一等公民,让整个操作系统的交互逻辑由智能体意图理解和自主决策来驱动。这不再是一个“更聪明的助手”,而是一个“能替你操作手机的系统”。
对比两个路线,清晰可见:一条是渐进式改良,以苹果、华为、三星为代表,在现有OS上叠加端侧大模型,控制功耗与隐私,让AI作为“辅助层”。另一条是激进式重构,以阶跃为典型,直接设计一个以智能体为中心的OS,让应用和服务的调用权从用户手控转向智能体代理。从学术研究的角度看,前者更像是在经典HCI框架下做优化(如Apple的Siri后端升级、华为的盘古端侧模型),后者则更接近学术界对“智能体系统”的探索——例如近年NeurIPS上提出的“Agent OS”概念(参见Liu et al., 2023, Agent Operating System: Towards Autonomous Personal Computing),以及Google DeepMind的“AppAgent”方案(Zhang et al., 2024, AppAgent: Multimodal Agents as Smartphone Users)。阶跃的Step AOS,本质上是在尝试将这类实验室原型产品化。
从技术实现层面,Step AOS的核心挑战在于三点:意图理解的可信度、多模态感知的实时性、以及跨应用操作的原子化调度。阶跃在发布会上展示的“一句话完成多步操作”,背后需要解决的是:如何让智能体在非确定性环境中安全地执行用户目标,而不触发不可逆的误操作。这比单纯生成文本或图像要困难得多。
举个例子,用户说“帮我订一张周五下午去上海的机票,然后提醒我出发前两小时叫车”。传统AI助手可能只做到查询航班并给出链接,而Step AOS需要让智能体直接调用日历、机票App、地图App,自主完成整个流程。这要求操作系统层面提供一套标准化的“动作接口”(Action API),让智能体像调用系统函数一样调用App功能。阶跃在报道中提到的“Step AOS是智能体原生操作系统”,其核心创新点就在这里——它不是通过截图或无障碍服务来模拟点击,而是原生支持智能体直接调用系统服务。
当然,从计算机视觉的角度,这里还有一个关键模态:视觉感知。手机屏幕上的信息是视觉化的,智能体要理解用户当前看到的界面、识别图片中的文字和物体,才能做出正确决策。阶跃旗下本身就拥有多模态理解模型(如之前发布的Step-2系列),这些模型在Step AOS中承担了“视觉皮层”的角色。但问题在于,实时视觉
原文链接:https://www.leiphone.com/category/ai/3WyAbXehaodJ80aQ.html
物界前沿