GPT-3 3
这是Generalist AI刚刚发布的机器人基础模型GEN-1.5(原名GEN-1.5),主打一次性学习。通过大规模物理数据预训练,机器人只需看几秒演示就能快速学会新任务。模型甚至能把两段不同的教学演示拼接起来,在模拟器里看一遍,到了真实世界也能直接上手。整个训练过程可以做到零梯度更新、零微调。更关键的是,这些能力并没有被专门训练出来,而是在大规模物理数据预训练过程中自己“悟”出来的。
团队将这种能力形容为“物理版Prompt Engineering”。以前给大模型的提示是一句话,现在变成了一段真实世界里的动作演示。看完演示,动作直接进入机器人的上下文,成为它理解当前任务的提示。不同演示还能像拼积木一样拼起来用,中间没人教过的衔接动作,比如重新定位、调整抓法、切换姿势,甚至出错后怎么继续,都由模型自己补全。而且“老师”不一定是真人,虚拟世界里的演示同样有效。先看模拟器里的操作,再到现实中复现,这项任务此前既没在模拟器里专门练过,也没在真实世界练过,属于典型的“云学艺,线下直接上岗”。
当然,几秒学会目前还谈不上百发百中。在十种任务上只给一次物理提示、零梯度更新的情况下,GEN-1.5平均成功率为百分之五十九。如果每个任务再给五分钟数据并做十步梯度更新,成功率能提升到百分之八十三。现阶段测试任务大多还是短程、相对原子化的操作,团队也承认,通过上下文临时学到的技能,稳定性还比不上专门微调后的模型。但真正让研究圈兴奋的是,零次训练就能做到百分之五十九,这才吓人。
更令人惊讶的是,团队压根没有专门教它一次性学习。没有特制模型架构,没有设计元学习循环,也没有额外加目标函数。这些能力是在大规模物理数据预训练中自己冒出来的。最初团队发现新任务需要的数据越来越少,从几百步微调变成几十步,又从几十步变成十步,最后只用一分钟数据、一个梯度步也能学会,于是他们试着问:零步呢?结果真的能跑。这让人想起GPT-3当年的转折点——模型规模和预训练量一路堆上去,少样本学习和上下文学习能力突然变得明显。Generalist认为,机器人数据里可能存在类似规律,而关键就藏在长期连续的真实物理数据中。真实世界的动作很少孤立发生,整理、装配、搬运的数据里天然充满重复、延续和失败恢复。模型长期在这样的轨迹上预训练,就会渐渐学会先看看刚才发生了什么,再决定下一步怎么做。这已经很接近上下文学习的雏形。如果这条路继续规模化,未来机器人出厂时最重要的技能或许就是四个字:看着学。
Источник: www.qbitai.com
Поделиться