以前不懂事跟着xhs的人嘲笑小扎不懂ai,花天价收购Scale AI,让Alexandr Wang代替Lecun负责Meta的大模型是多么蠢的举动,等到我开始负责搭建我们具身模型训练的数据管线才意识到这是一件多么困难且复杂的事情。
具身的数据和模型发展阶段其实有点类似Scale AI成立的2016年时候AI模型的发展阶段。每家模型的标准不一,LLM的冲锋白皮书《你一定要立正》是2017年才出来的。即使在transformer成为主流之后,各种数据标准也还是十分混乱、管理粗放的。而Scale AI正是让这些数据变得精细化、有标准可依的重要推手。
在我自己接手具身数据生产之后,痛苦首先来自于:标注员、动捕演员、动画师完全不懂机器人,其中大部分人员学历低下(当然主要是因为工资也不高),素质一般,管理他们去看我们的标准就已经是一件困难的事情,更别说更高一级的让他们理解我们的要求了。再往下一步,采集的动作哪些是可用的、哪些不可用,更加是无据可依、没有现成标准和工作的,第一天接手的时候我的主观判断成了所有环节的质量标准。同时,机器人的模型训练除了llm有的预训练和后训练之外,还要更进一步的去解决仿真到实机的gap,一环扣着一环,训练效果不好,每一个环节的人都非常有动力去甩锅给上一个环节的人。拿出依据让环节负责人心服口服去做开发又是一个巨大挑战。
可能Alexandr在理论水平上确实不如Lecun,但是在工程水平上无疑是个天才,能够解决如此庞杂的系统工程问甚至梳理出标准、作为数据供应商理清需求方的标准并能批量化生产,他确实值Meta的100多亿刀。
@aigc1024
具身的数据和模型发展阶段其实有点类似Scale AI成立的2016年时候AI模型的发展阶段。每家模型的标准不一,LLM的冲锋白皮书《你一定要立正》是2017年才出来的。即使在transformer成为主流之后,各种数据标准也还是十分混乱、管理粗放的。而Scale AI正是让这些数据变得精细化、有标准可依的重要推手。
在我自己接手具身数据生产之后,痛苦首先来自于:标注员、动捕演员、动画师完全不懂机器人,其中大部分人员学历低下(当然主要是因为工资也不高),素质一般,管理他们去看我们的标准就已经是一件困难的事情,更别说更高一级的让他们理解我们的要求了。再往下一步,采集的动作哪些是可用的、哪些不可用,更加是无据可依、没有现成标准和工作的,第一天接手的时候我的主观判断成了所有环节的质量标准。同时,机器人的模型训练除了llm有的预训练和后训练之外,还要更进一步的去解决仿真到实机的gap,一环扣着一环,训练效果不好,每一个环节的人都非常有动力去甩锅给上一个环节的人。拿出依据让环节负责人心服口服去做开发又是一个巨大挑战。
可能Alexandr在理论水平上确实不如Lecun,但是在工程水平上无疑是个天才,能够解决如此庞杂的系统工程问甚至梳理出标准、作为数据供应商理清需求方的标准并能批量化生产,他确实值Meta的100多亿刀。
@aigc1024