Это удобно сравнить с голосовыми помощниками: сначала система учится на примерах и подсказках, а потом справляется сама. Здесь логика похожая, только вместо команд есть захват предметов, а вместо ответа голосом, движение робота.

Как это работает

  1. Собирают демонстрации, где робот действует с камерами, состоянием суставов и датчиками касания.
  2. Модель учат не давить слишком сильно и не ронять предмет.
  3. Знание о касании переносят в обычную VLA-модель.
  4. На практике робот смотрит только на изображение и своё состояние, затем выбирает действие.

Такой подход учит робота аккуратно брать хрупкие вещи, например яйца, вафли и банку с мармеладом.

Если хотите, я могу потом сделать ещё и короткую версию этого объяснения, совсем простыми словами. Напишите слово сила.

Бесплатный курс и материалы «Нейросети с нуля»: https://neurocode-school.ru/guides/neiroset-s-nulya

слайд 1

слайд 1
слайд 1

слайд 2

слайд 2
слайд 2

слайд 3

слайд 3
слайд 3

слайд 4

слайд 4
слайд 4

слайд 5

слайд 5
слайд 5

слайд 6

слайд 6
слайд 6

Работает в: ChatGPT, GigaChat, Алиса, Шедеврум