从录屏到技能:Claude 的“教学”功能如何模糊强化学习与监督学习的边界
社区讨论 · 政策

从录屏到技能:Claude 的“教学”功能如何模糊强化学习与监督学习的边界

导师说对导师说对7月22日2026/07/22 57 浏览

我注意到一个有意思的细节,Claude 这次推出的“录制技能”(Record a skill)功能,表面上是一个产品更新,但底层逻辑恰好踩中了我们强化学习领域一个经典难题——如何让智能体从人类演示中高效学习。作为每天在实验室里跟 reward 函数和 policy gradient 缠斗的博士生,我第一反应不是“这功能好用”,而是“Anthropic 用了什么训练方案”。

功能拆解:一次录屏,一次行为克隆

根据官方描述,用户只需在 Claude Cowork 中录制一段操作演示,AI 就能学会这个技能。这听起来像是强化学习里的 behavioral cloning(行为克隆)——把人类演示数据当作监督信号,直接训练一个策略网络。但传统行为克隆有个致命问题:数据分布偏移。一旦 AI 遇到与演示略有不同的状态,就容易犯错,因为模型只学到了“跟随”而非“理解”。

Claude 的实现可能有几个关键点:

  • 多模态对齐:录屏不仅包含鼠标轨迹和点击,还有屏幕上的文字、图像、UI 元素。AI 需要同时理解视觉信息和操作序列,这比单纯的按键序列难得多。
  • 长上下文记忆:演示可能持续几分钟,Claude 必须记住前因后果,否则容易在复杂任务中丢失目标。
  • 逆强化学习(IRL)的影子:如果只是单纯模仿,AI 很难应对用户操作中的细微变化。更可能的是,Claude 在后台隐式地学习了用户的目标函数——比如“把文件拖到右侧文件夹”这个动作,目标可能是“归档”,而不是“拖到那个特定位置”。

从实验室到产品:研究者的焦虑与兴奋

作为一个正在赶论文的强化学习博士生,我第一反应是羡慕。我们实验室想用人类演示来训练机器人抓取物体,光是收集干净数据就要花几天,还要处理手腕抖动、光照变化等噪声。Claude 直接让用户在日常使用中生成数据,这个数据量级和多样性,我们想都不敢想。

[!info] 数据效率的差异

实验室的模仿学习,通常需要数百次高质量演示才能泛化。而 Claude 的“录制技能”可能只需要一次演示,背后是预训练语言模型和视觉模型提供的强大先验知识。这让我思考:强化学习是否应该更多利用基础模型的泛化能力,而非从头训练?

当然,这也带来了新的问题。比如,用户录制的技能是否能跨界面迁移?如果用户演示的是在 Mac 上操作项目,换到 Windows 上还能用吗?Anthropic 没有细说,但大概率是 per-UI 绑定,因为 Claude 的注意力机制已经记住了屏幕布局。

对研究者的启示:别只盯着 reward 设计

我最近在看一篇论文,核心是“通过人类反馈学习奖励函数”,本质上是逆强化学习的变体。Claude 的“录制技能”让我想到:也许未来的强化学习不再需要显式设计 reward,而是让用户直接演示期望行为,然后由模型自动推断 reward。这其实是一种 apprenticeship learning(学徒学习) 的规模化落地。

但这里面有个坑:用户演示的质量参差不齐。如果用户操作失误,AI 会学到错误行为。如何让模型识别出哪些是“教学意图”,哪些是“操作失误”?这需要模型具备一定的因果推理能力——知道用户为什么这么做,而不是只看做了什么。

行业影响:AI 从“工具”变成“学徒”

过去,我们教 AI 需要写代码、调参、做标注。现在,Claude 把过程压缩到“演示一遍就行”。这降低了 AI 定制化的门槛,也让更多人能参与“训练”AI。对于企业来说,这可能是自动化流程的捷径——让员工录一遍操作,AI 就能接手重复性工作。

但我不禁担心:这种“教学”会不会导致 AI 技能碎片化?每个用户都教自己的偏好,AI 可能会学到相互矛盾的“技能”,而缺乏系统性知识。比如,有人教 Claude 用某个快捷键,另一人教它用鼠标菜单,Claude 到底该听谁的?这涉及到多策略融合和冲突解决,是当前研究还没有很好解决的问题。

给读者一个行动建议

如果你和我一样在研究强化学习或人机交互,不妨去申请体验这个功能。

原文链接:https://www.ithome.com/0/980/004.htm

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧