关于AIGC人工智能、思维方式、知识拓展,能力提升等。投稿/合作: @inside1024_bot
AIGC 领域的最新工具、开源项目以及行业大事件
而成——很像 Agent 调用 Skills。
2. 仿真示范可以直接提示真实机器人
GEN-1.5 的预训练数据不包含仿真数据,但它可以把仿真环境中的动作轨迹当作 Prompt,在现实中完成相应任务。这不等于彻底解决 sim-to-real,但意味着仿真数据可能不仅能用来训练,还能在推理时直接定义任务。
3. 人类可以直接用手示范
在部分任务中,人类在机器人摄像头前用自己的手完成动作,机器人随后可以用机械手复现。这是在跨越 human-to-robot 的 embodiment gap。
4. 它开始从复制轨迹走向泛化“策略”
训练示范使用刷子把方块扫入碗中,模型面对新工具时会:用香蕉充当刷子;用簸箕铲起方块再倒入碗中;换手操作;移开障碍物;在物体卡住时用另一只手解围。
真正有价值的是,模型似乎学到了“把物体送入容器”这一目标,并能重新组合已有动作知识。
四、它是不是机器人领域的 GPT-3 时刻?
在能力范式上很像,但在成熟度上仍未达到相同阶段。
它像 GPT-3 的地方在于:随着预训练规模扩大,模型没有被显式训练,却涌现出 one-shot in-context learning。任务适配开始从“修改参数”转向“提供上下文”。
但必须看到四个限制:
•目前主要是简单、短时、原子级操作任务;
•one-shot平均成功率只有59%,远低于工业部署要求;
•评测仅覆盖10项任务,且由公司自行设计和披露;
•尚未公开足够完整的模型架构、训练数据、失败分布和独立第三方评测。
GEN-1.5 展示了机器人版 in-context learning 的规模化涌现迹象,但尚未证明它已经成为可稳定部署的通用机器人模型。
五、产业和投资含义
如果这条路线继续成立,具身智能价值链会发生三项变化。
第一,任务适配成本可能断崖式下降。
第二,物理数据引擎成为真正的Scaling基础。
第三,机器人也将出现Context与Harness层。
未来机器人系统可能由四层组成:
•基础具身模型;
•用户和场景的物理Context;
•可组合的Physical Skills库;
•负责安全、验证、记忆和技能调度的具身Agent Harness。
2026年6月,Generalist完成4亿美元融资,投后估值20亿美元,累计融资超过5亿美元。投资者包括Radical Ventures、8VC、USV、NVIDIA、Bezos Expeditions、Norwest,以及李飞飞、林斌等。
https://generalistai.com/blog/gen-1.5
@aigc1024
GEN-1.5 导读:具身智能的“Prompt 时刻”
GEN-1.5 最重要的突破,是它开始像大语言模型一样,把示范当作 Context,直接用于理解和执行新任务。
GEN-1.5 展示了一条新路径:给机器人看一段 3—12 秒的动作示范,不更新参数、不做微调,它就能推断人类意图并立即执行。Generalist 将其称为 Physical Prompting(物理提示)。
GEN-1.5 是近期具身智能领域非常值得重视的进展。它最重要的意义已经超越59%或83%的成功率:它第一次比较清晰地展示,当物理预训练跨过某个阈值后,教机器人新任务可能不再需要专门训练,而会逐渐转化为Prompt和Context Engineering问。
下一步真正决定其产业价值的,是能否把这套能力从十几秒的原子动作,扩展到分钟级、多步骤、开放环境任务,同时把成功率提高到95%—99%以上。
一、GEN-1.5 到底是什么?
GEN-1.5 是一个端到端的机器人多模态基础模型:
•输入:视频、语言、传感器信号和机器人本体状态;
•上下文记忆:30 秒;
•输出:100Hz 的连续动作轨迹;
•核心能力:通过示范进行 one-shot / few-shot 学习,并在新物体、新环境和新工具上泛化。
这里的 Prompt 从一句扩展为一段包含视觉、动作和传感器信息的“身体经验”。用户可以把几秒钟的示范直接放进模型上下文,机器人一边记住示范,一边根据实时视觉闭环执行。这相当于把:“给机器人编程”变成:“做给机器人看”。
二、核心数据怎么看?
GEN-1.5 在10项未专门训练的短时操作任务上取得:(图)
相比之下,传统机器人策略学习经常需要成千上万次梯度更新。GEN-1.5 用10步微调,模型权重变化不到0.15%,说明它很可能是在用少量示范激活预训练阶段已经形成的物理知识,而非从头构建一项新技能。
GEN-1解决的是可靠性:用约1小时任务数据,把简单任务成功率提高到99%以上;
GEN-1.5解决的是适应速度:用几秒钟获得基础能力,再用几分钟接近可用水平。
三、真正值得重视的四项能力
1. 物理Prompt可以组合
分别给模型看“拉开拉链”和“从包里取出钞票”,GEN-1.5 可以把两段示范拼成一个连续任务,并自行生成示范中没有出现的换手、重新抓取和衔接动作。
这意味着未来复杂机器人技能可能不必整体采集,而是由一组可复用的“物理技能片段”组合
今日分享一款本地数据管理工具:WeFlow
支持 Win / Mac / Linux,适合做本地聊天数据整理、记录查看和内容归档管理。
对于有聊天资料整理需求的人来说,实用性还不错。
工具地址:
https://github.com/hicccc77/WeFlow/releases

@meiriyishu
Back to Top