Prentis融资1亿美元:计算机使用模型会成为我的面试新考点吗
作为正在刷LeetCode准备AI算法岗面试的应届生,看到这条新闻的第一反应是:又有一个新方向需要关注了。Prentis,这个由Reid Hoffman和Mark Pincus联合创立的AI实验室,正在洽谈融资1亿美元,主攻计算机使用模型(computer use models)。我查了一下,这个领域远不止“用AI操作电脑”那么简单,它可能指向Agent落地的关键瓶颈。
先看新闻核心信息。Prentis由连续创业者Ritankar Das与LinkedIn联合创始人Reid Hoffman、Zynga创始人Mark Pincus共同创立。两位科技大佬的背书让这个实验室起点不低——1亿美元的融资传闻,对应的是他们瞄准的“计算机使用模型”赛道。这个词听起来像“让AI学会用鼠标键盘”,但实际技术栈涉及视觉理解、动作规划、界面交互等多个层面,有点像让AI在数字世界里拥有“手和眼睛”。
我回想自己刷过的300道LeetCode,大部分是算法题,偶尔遇到系统设计题涉及Agent架构。但计算机使用模型这个方向,在面试中似乎还没成为主流。不过,如果Prentis真的融到1亿美元,说明资本认为这个方向有爆发潜力。作为求职者,我需要判断它是否值得投入时间学习。
为什么“计算机使用”突然重要
传统AI能力集中在语言理解、图像生成,而“使用计算机”意味着AI需要完成多步骤任务:看到屏幕截图 → 理解元素 → 规划点击/输入 → 观察反馈 → 调整行动。这本质上是VLA(视觉-语言-动作)模型的落地场景。我想到OpenAI的Operator、Anthropic的Computer Use,以及Google的Mariner,都是类似方向。但Prentis的差异化在于,它可能专注于更通用的计算机操作模型,而不是单一任务的Agent。
从面试角度,这个方向的技术栈融合了多个领域:
| 技术领域 | 常用模型/方法 | 面试常见问题 |
|---|---|---|
| 多模态视觉理解 | CLIP、SigLIP、ViT | 如何对齐视觉和语言特征 |
| 动作规划与推理 | 基于LLM的Agent框架 | 如何设计ReAct循环 |
| 界面元素定位 | 对象检测、OCR | 如何处理动态UI |
| 环境交互 | 强化学习、模仿学习 | 样本效率问题 |
这些知识点在常规AI面试中都会涉及,但计算机使用模型把它们组合成了完整的闭环。我在准备面试时,更多地是孤立地学每个模块,而Prentis的新闻提醒我:企业可能正在寻找能打通这些模块的候选人。
从融资数据看赛道热度
我整理了一下今年公开的AI实验室融资情况:
| 实验室 | 融资额 | 主要方向 | 创始背景 |
|---|---|---|---|
| Prentis | 1亿美元(传闻) | 计算机使用模型 | 连续创业者+科技大佬 |
| 某知名Agent公司 | 6000万美元 | 通用Agent | 前Google研究员 |
| 某多模态公司 | 4000万美元 | 视觉理解 | 学术背景 |
1亿美元在AI领域不算最高,但考虑到Prentis刚成立,这个数字说明投资者对“计算机使用”这个细分赛道的信心。Reid Hoffman和Mark Pincus的投资记录一向不错,他们押注的方向往往代表产业趋势。作为面试者,我得思考:未来半年到一年,面试官会不会开始问“如何训练一个能操作电脑的Agent”这类问题。
我看到的三个关键点
第一,数据获取难度。计算机使用模型需要大量屏幕截图和操作序列数据。不同于语言数据可以从互联网爬取,这类数据需要模拟环境或真实用户录制。如果Prentis能解决数据瓶颈,它可能占据护城河。面试中常见的“数据增强”和“自监督学习”在这个场景下会很有价值。
第二,安全与可控性。让AI操作电脑,最怕的是它乱点弹窗或误操作。Prentis必须设计安全过滤器和回滚机制。这让我联想到强化学习中的“约束优化”问题,或者LLM中的“对齐”问题。面试中如果被问到“如何保证AI Agent的安全”,我至少能举出具体例子。
第三,与现有模型的竞争。OpenAI、Anthropic、Google都在做类似方向,Prentis作为初创公司,凭什么吸引人才?我认为是专注度。大公司往往把计算机使用作为众多项目之一,而Prentis可以全情投入,这可能是它面试时强调的“技术深度”优势。
我的学习计划调整
看完这条新闻,我决定在接下来的面试准备中加入以下内容:
- 阅读1-2篇计算机使用模型的论文(如V
原文链接:Prentis, new AI lab co-founded by Reid Hoffman, Mark Pincus in talks to raise $100M | TechCrunch
物界前沿