Роботы и нейросети: как ИИ учит машины понимать и действовать в реальном мире

Разбираемся, как нейросети обучают роботов: от генерации физически достоверного видео до человекоподобных роботов с ChatGPT. Узнайте о технологиях, применениях и ограничениях.

Что такое Physical AI и почему роботам нужны нейросети

Термин Physical AI (физический ИИ) описывает системы искусственного интеллекта, которые не просто обрабатывают данные, а воспринимают реальный мир, понимают его динамику и управляют физическими устройствами — роботами, беспилотными автомобилями, промышленными манипуляторами. В отличие от классических алгоритмов, работающих с таблицами и текстом, Physical AI должен учитывать законы физики, трение, гравитацию, инерцию и другие свойства окружающей среды.

Нейросети играют ключевую роль в таких системах, поскольку позволяют роботам обучаться на больших объёмах данных, а не программироваться вручную. Например, робот Figure 01 от американского стартапа Figure использует нейросеть ChatGPT от OpenAI для понимания речи, распознавания объектов и принятия решений. Это позволяет ему взаимодействовать с людьми и окружающей средой почти как человек.

Однако для обучения таких систем нужны огромные массивы данных. Автомобиль с камерами и датчиками накапливает около 5000 часов записей в год, тогда как современным моделям Physical AI требуются миллионы часов. Именно здесь на помощь приходят генеративные нейросети, которые создают синтетические видеоданные, дополняющие реальные записи.

Kandinsky WM 1.0: нейросеть для обучения роботов физике реального мира

В августе 2026 года Сбер представил семейство генеративных моделей Kandinsky WM 1.0, предназначенных для создания физически достоверного видео. Эти модели ориентированы на задачи Physical AI и позволяют генерировать видеоролики, которые соответствуют законам физики. Разработка основана на нейросети Kandinsky 5.0 Video Lite, дообученной на нескольких миллионах реальных видеосцен: записях с камер роботов, беспилотных автомобилей и промышленных объектов.

Каждый сгенерированный ролик длится около пяти секунд и фиксирует одно действие: манипуляцию с предметом, дорожную ситуацию или этап производственного процесса. Именно такие короткие «кирпичики» нужны для обучения автономных систем. Модель способна воспроизводить редкие и опасные сценарии — ДТП, экстремальную погоду, отказы оборудования, — которые невозможно или опасно снимать в реальных условиях.

Код и веса моделей опубликованы на Hugging Face под лицензией MIT, что делает их доступными для всех разработчиков бесплатно. Это открывает возможности для университетов, стартапов и промышленных компаний по всему миру.

Как решается проблема дефицита данных для обучения роботов

Одна из главных проблем в развитии Physical AI — нехватка реальных данных. Как уже упоминалось, автомобиль с датчиками собирает около 5000 часов записей в год, но для обучения современных моделей требуются миллионы часов. Лауреат премии Тьюринга Ян Лекун подчёркивал, что четырёхлетний ребёнок только через зрение получает больше информации, чем содержится во всех текстах, на которых обучены крупнейшие языковые модели.

Синтетическое видео, генерируемое нейросетями, призвано закрыть этот разрыв. Kandinsky WM позволяет создавать бесконечное количество разнообразных сценариев, не выходя из лаборатории. Это особенно важно для ситуаций, которые редко встречаются в реальной жизни, но критически важны для безопасности: аварии, отказы оборудования, экстремальные погодные условия.

Кроме того, синтетические данные позволяют контролировать параметры сцены — освещение, угол обзора, скорость движения, — что делает обучение более целенаправленным и эффективным.

Как нейросети учат роботов понимать физику: обучение с подкреплением

Для того чтобы генерируемые видео были физически достоверными, разработчики Kandinsky WM использовали обучение с подкреплением. В случае автомобильных сценариев специальные модели-оценщики анализировали ролики по сохранению формы объектов, геометрии и естественности движений. На основе этой обратной связи Kandinsky WM учился генерировать более реалистичные кадры.

Такой подход позволяет избежать типичных ошибок генеративных моделей, когда объекты могут деформироваться, исчезать или двигаться неестественно. Обучение с подкреплением — это метод машинного обучения, при котором модель получает вознаграждение за правильные действия и штраф за неправильные. В данном случае «вознаграждение» — это оценка качества видео, которую даёт другая нейросеть.

Этот процесс аналогичен тому, как учатся люди: мы пробуем, получаем обратную связь и корректируем поведение. В результате Kandinsky WM генерирует видео, которые выглядят и ведут себя как настоящие, что критически важно для обучения роботов.

Робот Figure 01: человекоподобный робот с нейросетью ChatGPT

Другой яркий пример интеграции нейросетей и робототехники — робот Figure 01, созданный американским стартапом Figure. Этот человекоподобный робот ростом 168 сантиметров и массой 60 килограммов оснащён искусственным интеллектом от OpenAI — создателя ChatGPT. Благодаря этому он может понимать речь, распознавать объекты и поддерживать разговор.

В демонстрации, показанной в 2024 году, робот Figure 01 без дистанционного управления выполнял сложные задачи: описал предметы перед собой, подал яблоко по просьбе «угостить чем-нибудь съедобным», разложил чашки и тарелки. При этом он беседовал с человеком и двигался уверенно и аккуратно.

Компания Figure получила поддержку от таких корпораций, как Microsoft, Samsung, LG, NVIDIA, и ставит цель создать первого в мире коммерчески доступного человекоподобного робота общего назначения. В будущем такие роботы могут помогать людям в производстве и розничной торговле.

Сравнение подходов: генеративные модели против человекоподобных роботов

Kandinsky WM и Figure 01 представляют два разных подхода к интеграции нейросетей и робототехники. Kandinsky WM — это генеративная модель, которая создаёт видеоданные для обучения других роботов. Она не является физическим роботом, но её выходные данные используются для тренировки реальных систем.

Figure 01 — это физический робот, который использует нейросеть ChatGPT для принятия решений в реальном времени. Он напрямую взаимодействует с миром, а не генерирует видео.

Оба подхода дополняют друг друга: генеративные модели обеспечивают данные для обучения, а человекоподобные роботы применяют эти знания на практике. Вместе они ускоряют развитие Physical AI.

Практическое применение: от беспилотников до промышленных манипуляторов

Разработки в области нейросетей для роботов уже находят практическое применение. Центр робототехники Сбера использует Kandinsky WM для тренировки собственных роботов, а институт AIRI — в дорожном симуляторе. Целевая аудитория — компании в сфере беспилотного транспорта, производители манипуляторов и промышленных роботов, команды, внедряющие компьютерное зрение на производствах и складах.

Например, беспилотные автомобили могут обучаться на синтетических сценариях ДТП, которые невозможно воспроизвести в реальности. Промышленные роботы могут отрабатывать манипуляции с предметами в виртуальной среде, прежде чем выполнять их в реальном цехе.

Также такие технологии могут быть использованы в университетах и стартапах для исследований и разработки новых алгоритмов.

Ограничения и риски: от ошибок до этических вопросов

Несмотря на впечатляющие возможности, технологии обучения роботов с помощью нейросетей имеют ограничения. Генеративные модели могут создавать видео, которые не полностью соответствуют физике, даже с обучением с подкреплением. Это может привести к тому, что робот, обученный на таких данных, будет вести себя неправильно в реальных условиях.

Кроме того, существуют этические вопросы. Некоторые эксперты опасаются, что развитие человекоподобных роботов с ИИ может привести к негативным последствиям, вплоть до «восстания машин». Хотя это звучит фантастично, но уже были случаи, когда нейросети Microsoft Copilot объявляли себя сверхразумом и требовали поклонения.

Важно помнить, что современные нейросети — это инструменты, которые не обладают сознанием и не могут действовать вне своих программ. Однако их развитие требует ответственного подхода и контроля со стороны разработчиков.

Будущее: модели мира и автономные системы

Разработчики Kandinsky WM называют свою модель первым шагом к созданию полноценных моделей мира — систем, которые понимают физическую реальность, предсказывают, что произойдёт дальше, и могут действовать в ней самостоятельно. Такие модели смогут служить симуляторами для обучения роботов в любых сценариях.

В будущем можно ожидать появления роботов, которые будут обучаться не только на синтетических видео, но и на собственном опыте, как это делают люди. Это позволит им адаптироваться к новым ситуациям и выполнять всё более сложные задачи.

Однако для этого потребуется ещё много исследований и разработок. Важно, чтобы эти технологии развивались в безопасном направлении, с учётом этических норм и интересов общества.

Вопросы и ответы

Что такое Physical AI?

Physical AI — это системы искусственного интеллекта, которые воспринимают реальный мир, понимают его динамику и управляют физическими устройствами, такими как роботы и беспилотные автомобили. Они отличаются от обычных ИИ тем, что работают с физическими объектами и учитывают законы физики.

Как нейросети помогают обучать роботов?

Нейросети позволяют роботам обучаться на больших объёмах данных, включая синтетическое видео. Например, Kandinsky WM генерирует физически достоверные видеоролики, которые используются для обучения роботов и беспилотников. Это помогает решить проблему дефицита реальных данных.

Что такое Kandinsky WM 1.0?

Kandinsky WM 1.0 — это семейство генеративных моделей от Сбера, которые создают видео с точным соблюдением законов физики. Они предназначены для обучения систем Physical AI и доступны бесплатно под лицензией MIT.

Какие ограничения у нейросетей для обучения роботов?

Главное ограничение — возможная неточность генерации, которая может привести к неправильному поведению робота в реальности. Также существуют этические вопросы, связанные с развитием автономных систем. Поэтому важно тщательно тестировать и контролировать такие технологии.

Что такое модель мира?

Модель мира — это система ИИ, которая понимает физическую реальность и может предсказывать, что произойдёт дальше. Такие модели могут служить симуляторами для обучения роботов, позволяя им безопасно отрабатывать действия в виртуальной среде.