
空间智能才是具身智能的终局,但面试官会问这个吗
World Labs 收购 SceniX,李飞飞和李昀烛把赌注压在空间智能上。我的第一反应是:这题面试会考吗。
刷了 300 道 LeetCode,我以为把动态规划、图论、树轮完了就能拿下算法岗。结果最近看面经,发现 top 厂都在问具身智能、3D 场景理解、Sim-to-Real 迁移。我连 SceniX 是做什么的都不知道,今天才补课。
先说结论:纯语言模型在物理世界面前是纸老虎。GPT-4 能写诗,但不知道苹果掉地上会碎。李飞飞团队从 ImageNet 到空间智能,路径很清晰——让 AI 理解三维空间的结构、物理规律、交互方式。收购 SceniX 是为了补齐机器人仿真环节,相当于给 AI 一个虚拟的物理教室,让它先在里面犯错。
[!note] 面试官可能会问:空间智能的核心技术栈是什么?我猜是多模态 3D 表示、神经辐射场(NeRF)、扩散模型生成场景。这些我还没系统学过,得补。
两个细节让我觉得这事靠谱。一是 a16z 全力押注,Martin Casado 说这是“物理世界的操作系统”。二是李昀烛(Fei-Fei Li 的学生)在斯坦福的博士论文就是关于 3D 场景理解的。师生联手,技术积累扎实。作为应届生,我羡慕这种从学术到产业的闭环——我的论文还在调参阶段。
现在刷题有点焦虑。空间智能需要 transformer 处理 3D 点云,需要 diffusion 生成场景,需要强化学习做机器人控制。这些都不是 LeetCode 能练的。我打算先啃几篇论文:NeRF、PointNeXt、RT-2。如果面试问“空间智能的终局是什么”,我可以说:让 AI 从“看世界”变成“在物理世界行动”,而 World Labs 的收购就是第一步。
不过话说回来,offer 比较纠结时,到底选纯视觉岗还是具身智能岗。空间智能听起来酷,但落地难。我得再想想。
原文链接:https://www.tmtpost.com/8083646.html
物界前沿