Компанія Dyna Robotics представила нову базову модель для роботів DYNA-2, навчання якої спиралося на понад 1 мільйон годин відео з погляду людини. За даними компанії, це дозволило підняти успішність виконання високоточних виробничих завдань роботами з приблизно 20 відсотків до 80–90 відсотків. Про розробку повідомило видання Interesting Engineering.

Роботи вчаться на людському досвіді, а не на своїх діях
Dyna Robotics із Редвуд-Сіті (Каліфорнія) зазначає, що DYNA-2 World-Action Model під час попереднього навчання отримувала винятково людське егоцентричне відео, а не дані про дії роботів. За тривалістю це приблизно відповідає 170 рокам безперервного «бадьорого» досвіду.
Такий підхід має показати, як люди маніпулюють об’єктами та взаємодіють із середовищем, і на цій основі сформувати в роботів «фізичну інтуїцію». Це зменшує залежність від трудомісткого збору телеперешивних (teleoperation) даних, коли оператори вручну керують роботами для створення навчальних прикладів.
За версією компанії, масове використання відео людей може стати масштабованішим способом навчання роботів у міру розширення їхніх можливостей.
Як працює модель DYNA-2
DYNA-2 побудована як система моделювання світу (world-modeling), яка поєднує прогнозування наступного кадру та наступної дії. Замість того щоб вчитися лише на тому, що роблять роботи, модель аналізує, як змінюється навколишнє середовище і як реагують об’єкти на рухи людей.
За рахунок цього, стверджує Dyna Robotics, знання, отримані з людської поведінки, можна переносити на різні типи робототехнічного обладнання. DYNA-2 не бачила роботизованих даних на етапі попереднього навчання, але згодом могла бути адаптована до нових платформ за рахунок лише кількох годин локального донавчання.
У ході випробувань компанія повідомила, що завдяки збільшенню масштабу попереднього навчання DYNA-2 підняла успішність виконання завдань у високоточному виробництві з 20 до 80–90 відсотків. Модель змогла переносити навички між стаціонарними роботизованими руками, прототипами гуманоїдів та більш спритними роботизованими руками.
Відкривання пляшки за 13 хвилин навчання
Окремий тест показав, що 13 хвилин даних вистачило, аби DYNA-2 навчила пару п’ятипалих роботизованих рук відкручувати кришку пляшки. На 15 еталонних завданнях моделі, яким давали більше людського відео, стабільно показували кращі результати.
Dyna також порівняла DYNA-2 з попередньою моделлю DYNA-1, яка базується на архітектурі «зір–мова–дія» (vision-language-action). У «zero-shot» розгортанні для клієнта, коли модель одразу застосували без додаткового навчання під завдання, DYNA-2 досягла 87 відсотків успішного проходження контролю якості, тоді як DYNA-1 — 46 відсотків.
Стійкість до збоїв і краще слідування інструкціям
За словами компанії, DYNA-2 виявилася стійкішою до фізичних збурень під час виконання дій. Під час тестів із завданнями на кшталт нарізання їжі чи прибирання робочої зони нова модель могла відновити виконання без втручання людини, тоді як попередній варіант потребував ручного «рятування».
Метод спільного навчання на відео, за оцінкою Dyna Robotics, поліпшив результати на 133 відсотки у завданнях зі слідування інструкціям, де роботам потрібно виконувати різні фізичні дії відповідно до команд.
Співзасновник компанії Джейсон Ма (Jason Ma) пояснив, що протягом багатьох років розвиток «генералістської» робототехніки обмежувався дефіцитом даних: ручний збір телеперешивних дій роботів складно масштабувати до рівня загального інтелекту. Він наголосив, що дані про дії є «дефіцитними», тоді як відео всюдисуще, і DYNA-2 демонструє, що фізичну інтуїцію можна здобувати прямо з людського відео, без мільйонів годин тренування однієї роботизованої руки.
Від DYNA-1 до DYNA-2 і далі
Dyna Robotics зазначає, що її роботи на основі попередньої моделі DYNA-1 вже працюють у готелях, ресторанах і пральнях. DYNA-2 розглядається як наступний крок до роботів, здатних опановувати нові фізичні завдання без великих обсягів спеціально зібраних даних саме з роботів.
Компанію заснували Ліндон Гао (Lindon Gao), Йорк Ян (York Yang) та колишній науковець DeepMind Джейсон Ма. Серед інвесторів — фонди CRV та First Round. На думку розробників, масове використання людського відео як навчального ресурсу може стати ключем до масштабування можливостей гуманоїдних роботів у реальних умовах.