
Agent入口之战:大厂正在用“玩具”取代“工具”
今年的WAIC让我最意外的不是某个模型又刷了榜单,而是百度、阿里、字节这些大厂不约而同地把Agent从发布会PPT里搬到了现场体验区。小朋友坐在秒哒沙发上用自然语言搭应用,上班族在千问办公区围成一桌用语音整理会议纪要——这些场景看似普通,背后却藏着一个清晰的战略转向:比起做那个能解决所有问题的超级Agent,大厂更着急抢的是用户手机里的那个“Agent入口”。这本质上是AI时代的流量思维复刻,只是这一次,入口的形态从搜索框变成了对话窗。
短期看,这是用“场景化Agent”替代“通用Agent”来降低用户的认知门槛,快速积累数据飞轮。
超级Agent的概念很性感,但技术落地有两个死结:一是长尾任务的精确执行依赖极强的基础模型和工具链编排,目前连GPT-4o在复杂多步任务上的成功率也仅70%左右(参考OpenAI内部评测);二是用户心智无法建立——没人会主动把一个“什么都能做但什么都不够精”的Agent当作日常工具。大厂显然明白这个道理,所以他们在WAIC上展示的Agent都是“锚定具体场景”的:百度秒哒瞄准的是“低代码应用搭建”,阿里千问办公聚焦的是“文档协作与会议纪要”,字节豆包则主推“信息获取与摘要”。这些Agent不需要理解宇宙,只需要在一个狭窄的漏斗里做到“一句话搞定”,让用户产生“这个东西有用”的即时反馈。
这种策略的聪明之处在于,一旦用户习惯了在某个Agent里完成一个高频动作(比如用千问生成周报),就会产生粘性。后续的扩展可以依赖“渐进式能力叠加”,而不是一开始就堆砌功能。更重要的是,每一次交互都在产生高质量的用户行为数据,这些数据一方面可以反哺模型微调(比如用RLHF优化指令遵循能力),另一方面可以构建“场景-意图-动作”的映射图谱,为未来更复杂的Agent编排打下基础。从技术角度看,这相当于用“小模型+场景化RAG”替代“大模型+万能工具调用”,在工程上更可控,也更容易规模化。
长期看,入口之争的本质是AI生态的“操作系统级”卡位,谁掌握了Agent的唤醒频率和沉淀数据,谁就能定义下一代人机交互的标准。
如果把Agent比作App,那么入口就是iOS和Android。当年移动互联网的格局告诉我们,用户不会同时使用多个类似功能的App,而是会选一个最顺手、最常用的作为“默认入口”。在AI时代,这个入口的形态可能是“系统级的天生Agent”(比如苹果的Siri升级版),也可能是“某个高频场景的超级Agent”(比如微信的小程序生态)。大厂在WAIC上展示的Agent,本质上都是在争夺“默认入口”的候选资格:百度把它和搜索框结合,阿里把它嵌入办公套件,字节则通过豆包App直接抢占C端。
从技术演进来看,短期内的场景化Agent会逐渐向“复合Agent”进化。当用户在某个Agent里积累了足够多的交互记录,模型就可以通过元学习(meta-learning)或迁移学习,把在一个场景中学到的工具调用模式复用到另一个场景。比如,一个经常用千问整理会议纪要的用户,可能会发现它也能自动提取邮件中的待办事项——这种能力的平滑扩展,需要底层的“Agent操作系统”支持,包括统一的意图解析器、任务规划器、工具注册中心等。大厂现在抢入口,其实是在抢这个操作系统的用户基数,因为数据规模决定了模型在Agent编排上的泛化能力。
值得注意的是,这种入口之争也带来了技术路线上的分化。百度、阿里走的是“重平台”路线,把Agent能力封装成PaaS(平台即服务),让开发者或用户通过API或低代码方式调用;字节、腾讯则更倾向于“轻应用”路线,直接面向C端做对话式Agent。这两种路线各有优劣,但我认为长期来看,能够同时打通B端生产力和C端消费场景的Agent才会成为真正的入口——因为用户的使用场景是连续的,无法割裂工作和生活。
给读者的行动建议:如果你正在规划Agent产品,不要纠结于“做多全能”,而是先找到一个高频、低门槛、能闭环的场景,把用户的第一次唤醒做到极致。 比如,做个人知识管理Agent,就先把“一句话收藏文章并自动摘要”做成傻瓜式体验;做企业办公Agent,就先把“语音转待办并同步日历”做到零卡顿。入口的争夺不是技术军备竞赛,而是用户习惯的养成竞赛。谁能先让用户形成“有事喊一声Agent”的条件反射,谁就拿到了下一张船票。
原文链接:https://www.leiphone.com/category/industrynews/EMsIH6YY1MsA0Qjo.html
物界前沿