Модель робота из Кремниевой долины учится с одного видео без дообучения
Разработчики сравнивают переход от традиционного подхода к контекстному обучению (in-context learning, ICL) с переходом от BERT к GPT-3. Как и в больших языковых моделях, контекстное обучение позволяет роботу временно осваивать новые задачи без изменения весов. Вместо текстовых промптов используются видео, которые лучше соответствуют действиям. Эксперименты показали: чем больше данных, тем сильнее ICL обходит языковые промпты, особенно на незнакомых задачах. Skild называет это ICL scaling law.
Компания основана в 2023 году профессорами CMU Дипаком Патаком и Абхинавом Гуптой. За два года она привлекла крупные инвестиции: раунд A на 300 миллионов долларов при оценке в 1,5 миллиарда и раунд C на 1,4 миллиарда при оценке свыше 14 миллиардов, в котором участвовали SoftBank, Nvidia и Джефф Безос. Стратегия компании — создать универсальный «мозг» для любых роботов, от манипуляторов до гуманоидов, что сравнивают с Android для робототехники.
Если этот scaling law продолжит работать, стоимость обучения новым навыкам может снизиться с сотен демонстраций до одного показа, что приближает «момент GPT» для робототехники.
Источник: www.qbitai.com
Поделиться