精华简报 | Gen1.5 模型带来重要进展:物理 AI 正在接近 GPT-3 时刻
来源:极客公园
链接:http://www.geekpark.net/news/369223
类型:技术与商业分析简报
一、核心摘要
Generalist 发布具身基座模型 GEN-1.5,展示了机器人领域罕见的“智能涌现”迹象:
- 机器人能在未教过的情况下,把“用刷子扫积木”泛化为“用香蕉扫”“用簸箕推倒再倒”,自行推理新工具用法。
- 模型具备 物理提示(physical prompting) 能力:只看一次 3–12 秒的人类示范,不微调、不更新参数,即可在新物体位置和初始状态下尝试新任务。
- 在 10 项新任务上,一次示范平均成功率为 59%;使用约 5 分钟数据、调整 10 次参数后,提升至 83%。
- 新任务学习所需的参数更新次数,从过去的数百次逐步压缩到 0 次——模型不再需要重新训练,看一遍就能开始做。
这被多位研究者视为机器人领域追寻多年的“圣杯”,其能力跃升感让人联想到 GPT-3 时刻。
二、关键能力:从“复现轨迹”到“理解任务”
GEN-1.5 展示了三种层次的新能力:
1. 未教过的变化,直接换办法
机器人学过“把积木放进碗”,但没学过“碗被纸盖住”。它会先移开纸;乐高卡在夹爪上,会用另一只手取下;只学过单手开罐,有时会换成双手。
本质:任务本身学过,变化没学过,模型直接泛化。
2. 物理提示:看一次示范,立刻尝试新任务
研究人员在机器人面前拉开一次拉链、拧开一次罐盖,或从钱包抽出一张纸币。演示只有 3–12 秒,GEN-1.5 不调整任何参数,随即在新位置尝试。
本质:示范没有被训练进模型,只是临时告诉它“这次要做什么”,类似大语言模型的 in-context learning。
物理提示还可以组合:分别示范两个任务,模型会把它们接成连续动作,并补上示范里没有的调整位置、换手和重新抓取。模拟器动作可以提示现实机器人,人手示范也能被复现。
3. 几分钟数据,快速学得更稳
提供 1–5 分钟、约 10–50 次演示,再调整 1–10 次参数。使用约 5 分钟数据和 10 次调整时,平均成功率从 59% 提高到 83%。
关键细节:即使调整 10 次,模型内部参数整体变化不到 0.15%——这已经不像从头学习,更像“提醒模型一件它几乎已经会做的事”。
三、为什么说这是“GPT-3 时刻”
GPT-3 之前,语言模型已经偶尔表现出 few-shot 能力;GPT-3 的不同在于,这种现象突然在广泛任务上变得明显。GPT-3 只看一个例子平均准确率约 45%,看到约 100 个例子后约 65%。
GEN-1.5 的类比点在于:
- 新任务学习所需的梯度更新从数百次 → 数十次 → 10 次 → 1 次 → 0 次。
- 一次示范平均成功率 59%,5 分钟数据 + 10 次参数调整后 83%。
- 能力来源并非针对新任务的训练,而是基座模型在海量物理数据中已经学会了大量基础动作和物理规律。
曾参与 Google DeepMind Gemini Robotics 的研究者 Ted Xiao 评价:这种“看一次示范就学会新任务”的能力是机器人领域追寻多年的圣杯,GEN-1.5 是这条路线迄今最好的结果,让他想起第一次使用 GPT-3。
能力涌现的可能原因:
Generalist 目前没有确定答案,但提出两种猜测:
- 人类工作中天然充满重复:拧完一颗螺丝通常还要拧下一颗,模型在海量连续动作中可能已经无数次练习了“看见前一个实例,延续下一个实例”。
- 失败数据可能很重要:人会失手、调整、重新抓起物体。如果数据清洗时保留了“失误—修正—继续”的完整过程,模型学到的就不是只有正确动作的轨迹。英伟达机器人研究负责人 Jim Fan 认为,这可能正是 GEN-1.5 会恢复和换办法的重要原因。
四、公司路线:押注物理智能 scaling
Generalist 成立于 2024 年,三位联合创始人来自两条机器人技术主线:
- Pete Florence、Andy Zeng:曾在 Google DeepMind 从事机器人研究,参与 PaLM-E、RT-2 等具身模型。
- Andrew Barry:曾是 Boston Dynamics 资深机器人研究员。
公司不做明星人形机器人,而是试图训练一套可以进入不同机械臂、夹爪和工具的底层智能。其过去两年的技术路线可以概括为一个词:scaling(缩放)。
数据规模
- 2025 年 11 月 GEN-0:超过 27 万小时真实操作数据,每周增加约 1 万小时。
- 2026 年 4 月 GEN-1:数据超过 50 万小时。
- GEN-1.5 未公布最新总量,但可推测有明显新增。
数据采集方式
不走传统遥操作路线,而是类似 UMI:让人拿着一只带相机的“机器人手”,直接在家庭、仓库和工厂里干活,再把动作转换成机器人可学习的数据。
公司称已部署 数千套低成本手持采集硬件,训练系统一天可以读取相当于 6.85 年的人类操作经验。
模型设计
- GEN-1 约 99% 参数从头训练,不依附 Gemini、GPT 或其他互联网图文模型。
- 拒绝简单称为 VLA 或 world model,而是直接根据当前画面和刚才的示范,以 100Hz 输出动作轨迹,在 30 秒上下文窗口中持续观察和修正。
- 公司认为,当真实操作数据达到几十万小时,模型可以主要从物理经验中建立自己的能力。
scaling 证据
- GEN-0 扩大预训练后,16 组新任务的动作预测误差同时下降。
- GEN-1 使用约 1 小时机器人任务数据后,一组简单任务平均成功率从 GEN-0 的 64% 提高到 99%,折盒和手机包装等任务速度提高到此前系统的约 3 倍。
- 今年 7 月,GEN-1 接入五指手、夹钳、电动螺丝刀、打蛋器等不同工具,以及约 9000 种标准夹爪的改装形态,证明物理智能不必被锁在人形机器人的手上。
五、商业与产业影响
1. 资本已为这条路线给出高价
Generalist 在大众传播中不如 Figure 知名,但在机器人研究、创业和投资圈一直是被密切追踪的公司。投资人 陈哲 认为,Generalist 和 Sunday Robotics 对行业的推动“巨大”:它们总能拿出一些此前少见、事后看来又很合理的设计。
2. 改变中国投资人对数据路线的判断
深度机智创始人 陈凯 提到,Generalist 用大规模人类操作数据展示出模型能力,又以 27 万小时数据跑出清晰的 scaling 结果。原本被认为难以迁移到机器人的人类数据,开始成为资本愿意下注的技术路线。
3. 数据与硬件壁垒
鹿明机器人联合 CTO 丁琰 估算,即使完全照着 Generalist 已公开的采集方式重建,仅制造采集硬件就需要四到六个月;若要积累 27 万小时数据,至少需要约 1000 人持续采集大半年甚至一年。这意味着先发者在数据规模和采集硬件上已经形成明显时间窗口。
4. 行业竞争焦点可能转移
如果物理智能 scaling 成立,机器人竞争将从硬件集成转向数据、模型和算力的竞争。新任务学习的边际成本将大幅下降,基座模型可能成为跨形态、跨任务的平台型基础设施。
六、局限与风险
尽管进展显著,GEN-1.5 仍处于早期阶段:
- 成功率仍低:一次示范平均 59%,10 项任务,离“可以放心交付工作”的机器人还有距离。
- 透明度不足:未公布准确参数规模、从头训练比例,也没有论文级别的完整训练配方。
- 真实场景泛化:演示任务相对受控,真实工厂、家庭环境中的长尾变化、安全约束和复杂操作仍需验证。
- 数据采集成本与隐私:大规模人类操作数据采集涉及成本、隐私和合规问题。
- 演示可能挑选:需要独立第三方验证,避免“cherry-picking”造成的过度乐观。
七、结语
GEN-1.5 是物理智能 scaling 路线上的一个重要信号:机器人开始从“忠实复现训练轨迹”走向“理解任务并自行组织动作”。它让“物理 AI 的 GPT-3 时刻”从口号变成可观测的趋势。
但 GPT-3 时刻只是起点,不是终点。从演示到产品,仍需跨越可靠性、安全性和经济性三重鸿沟。对于产业而言,真正的分水岭不在于机器人能否在视频里惊艳一次,而在于它能否在真实工作中稳定、安全、低成本地完成任务。
关键词:物理 AI、具身智能、scaling law、物理提示、few-shot learning、机器人基座模型、Generalist、GEN-1.5