Модель робота из Кремниевой долины учится с одного видео без
новости
27.08.2026

Модель робота из Кремниевой долины учится с одного видео без дообучения

Модель робота из Кремниевой долины учится с одного видео без дообучения

Американский стартап Skild AI представил робототехническую фундаментальную модель S1, которая умеет осваивать новые действия, просто наблюдая за человеком. Роботу не требуется пост-обучение на специальных данных: достаточно один раз посмотреть видео с демонстрацией, чтобы выполнить целый сложный процесс, которого раньше никогда не встречал. В официальных роликах S1 печет блины, варит кофе, пересаживает растения и собирает оборудование. На незнакомых задачах успешность достигает 66%, тогда как у традиционных моделей с языковыми подсказками (VLA) — всего 9%. Чтобы обычный VLA достиг такого же уровня, ему требуется около 380 демонстраций для дообучения. При этом S1 может работать с задачами длительностью до 10 минут и понимает, на каком этапе находится, как комбинировать навыки и как продолжать после сбоя.

Разработчики сравнивают переход от традиционного подхода к контекстному обучению (in-context learning, ICL) с переходом от BERT к GPT-3. Как и в больших языковых моделях, контекстное обучение позволяет роботу временно осваивать новые задачи без изменения весов. Вместо текстовых промптов используются видео, которые лучше соответствуют действиям. Эксперименты показали: чем больше данных, тем сильнее ICL обходит языковые промпты, особенно на незнакомых задачах. Skild называет это ICL scaling law.

Компания основана в 2023 году профессорами CMU Дипаком Патаком и Абхинавом Гуптой. За два года она привлекла крупные инвестиции: раунд A на 300 миллионов долларов при оценке в 1,5 миллиарда и раунд C на 1,4 миллиарда при оценке свыше 14 миллиардов, в котором участвовали SoftBank, Nvidia и Джефф Безос. Стратегия компании — создать универсальный «мозг» для любых роботов, от манипуляторов до гуманоидов, что сравнивают с Android для робототехники.

Если этот scaling law продолжит работать, стоимость обучения новым навыкам может снизиться с сотен демонстраций до одного показа, что приближает «момент GPT» для робототехники.

Источник: www.qbitai.com