GEN-1.5 导读:具身智能的“Prompt 时刻”
GEN-1.5 最重要的突破,是它开始像大语言模型一样,把示范当作 Context,直接用于理解和执行新任务。
GEN-1.5 展示了一条新路径:给机器人看一段 3—12 秒的动作示范,不更新参数、不做微调,它就能推断人类意图并立即执行。Generalist 将其称为 Physical Prompting(物理提示)。
GEN-1.5 是近期具身智能领域非常值得重视的进展。它最重要的意义已经超越59%或83%的成功率:它第一次比较清晰地展示,当物理预训练跨过某个阈值后,教机器人新任务可能不再需要专门训练,而会逐渐转化为Prompt和Context Engineering问。
下一步真正决定其产业价值的,是能否把这套能力从十几秒的原子动作,扩展到分钟级、多步骤、开放环境任务,同时把成功率提高到95%—99%以上。
一、GEN-1.5 到底是什么?
GEN-1.5 是一个端到端的机器人多模态基础模型:
•输入:视频、语言、传感器信号和机器人本体状态;
•上下文记忆:30 秒;
•输出:100Hz 的连续动作轨迹;
•核心能力:通过示范进行 one-shot / few-shot 学习,并在新物体、新环境和新工具上泛化。
这里的 Prompt 从一句扩展为一段包含视觉、动作和传感器信息的“身体经验”。用户可以把几秒钟的示范直接放进模型上下文,机器人一边记住示范,一边根据实时视觉闭环执行。这相当于把:“给机器人编程”变成:“做给机器人看”。
二、核心数据怎么看?
GEN-1.5 在10项未专门训练的短时操作任务上取得:(图)
相比之下,传统机器人策略学习经常需要成千上万次梯度更新。GEN-1.5 用10步微调,模型权重变化不到0.15%,说明它很可能是在用少量示范激活预训练阶段已经形成的物理知识,而非从头构建一项新技能。
GEN-1解决的是可靠性:用约1小时任务数据,把简单任务成功率提高到99%以上;
GEN-1.5解决的是适应速度:用几秒钟获得基础能力,再用几分钟接近可用水平。
三、真正值得重视的四项能力
1. 物理Prompt可以组合
分别给模型看“拉开拉链”和“从包里取出钞票”,GEN-1.5 可以把两段示范拼成一个连续任务,并自行生成示范中没有出现的换手、重新抓取和衔接动作。
这意味着未来复杂机器人技能可能不必整体采集,而是由一组可复用的“物理技能片段”组合
 
 
Back to Top