Проблема нехватки данных для роботов
Развитие физического ИИ сталкивается с серьезным препятствием — нехваткой качественных данных из реального мира. В отличие от текстовых моделей, которым достаточно собрать информацию из интернета, роботам нужны детальные сценарии физических взаимодействий. Чтобы роботы могли эффективно выполнять задачи, им требуются огромные массивы данных, объем которых может в пять раз превышать весь массив видео на YouTube.
Сегодня компании используют два основных метода: видео от людей, работающих в камерах (эгоцентрические данные), и дистанционное управление роботами. Однако даже этих методов недостаточно для создания по-настоящему универсальных машин.
Нейроинтерфейсы как новый источник данных
Стартап Encord совместно с немецкой компанией Zander Labs проводит эксперименты по использованию датчиков активности мозга для обучения моделей. Человек выполняет задачу, например, разбирает башню из деревянных блоков, а гарнитура фиксирует его мозговые волны.
Цель этого метода — научить ИИ распознавать ментальные состояния человека: моменты ошибки, намерения или удивления. Это поможет разработчикам понять, в какие моменты выполнения задачи требуется максимальная вычислительная мощность модели.
Создание высокоточных сценариев
Помимо нейроинтерфейсов, Encord разрабатывает другие способы получения данных. Например, использование датчиков на предплечье позволяет считывать электрические сигналы мышц. Это помогает создать точную 3D-модель движения руки, которую невозможно полностью зафиксировать обычной камерой.
В лаборатории также используют системы «ведущий-ведомый»: человек управляет одной роборукой, а вторая в точности повторяет его движения. Это позволяет собирать данные о сложных задачах, таких как переливание жидкости или соединение кабелей в серверной стойке.
Экономика обучения физическому ИИ
Создание качественных данных обходится значительно дороже, чем сбор текстов из сети. Плотная аннотация — когда каждое действие в видео описывается словами (например, «правая рука затягивает болт») — стоит в 20 раз дороже, чем обычная съемка, но при этом она в 100 раз полезнее для обучения конкретным задачам.
Поскольку физические данные нельзя просто «скачать» из интернета, их приходится производить вручную. Это превращает процесс обучения роботов из чисто исследовательской задачи в масштабный производственный бизнес.
Что это значит
Для обучения роботов недостаточно простого наблюдения за видео. Чтобы роботы могли выполнять сложные манипуляции, индустрии потребуются специализированные данные, включающие не только визуальный ряд, но и биометрические показатели человека, такие как активность мозга и сигналы мышц.
