ИИ в роботах: на каком железе он на самом деле работает
Когда говорят «робот с искусственным интеллектом», обычно имеют в виду две совершенно разные машины: ту, что ездит и хватает, и ту, что стоит в стойке и учит первую это делать. Разбираем, какое железо реально стоит на борту современных роботов, что оно умеет — и почему интеллект в них приезжает из дата-центра.
Сравнительная таблица
| Модуль | Производительность ИИ | Память | Потребление | Где встречается |
|---|---|---|---|---|
| NVIDIA Jetson Orin Nano Super | около 67 TOPS INT8 | 8 ГБ LPDDR5, 102 ГБ/с | 7–25 Вт | дроны, лёгкие AMR, умные камеры |
| NVIDIA Jetson Orin NX 16 ГБ | около 100 TOPS INT8 | 16 ГБ LPDDR5, 102 ГБ/с | 10–40 Вт | сервисные роботы, инспекция |
| NVIDIA Jetson AGX Orin 64 ГБ | около 275 TOPS INT8 (sparse) | 64 ГБ LPDDR5, 204 ГБ/с | 15–60 Вт | гуманоиды, манипуляторы, AMR |
| NVIDIA Jetson AGX Thor | около 2070 TFLOPS FP4 | 128 ГБ LPDDR5X, 273 ГБ/с | 40–130 Вт | VLA-модели на борту, гуманоиды |
| Huawei Atlas 200I / Ascend 310B | около 20 TOPS INT8 | 8–16 ГБ | 8–20 Вт | промышленное зрение, edge-инференс |
| Rockchip RK3588 | 6 TOPS INT8 (NPU) | до 32 ГБ LPDDR4x/5 | 5–12 Вт | недорогие AMR, видеоаналитика, панели управления |
Два контура, которые постоянно путают
Любая работающая роботизированная система разделена на два контура. Первый — обучение: модель видит десятки и сотни тысяч примеров, считает градиенты, обновляет веса. Это происходит в GPU-кластере, длится от суток до месяцев и требует сотен гигабайт памяти. Второй — инференс: обученная модель уже ничего не меняет в себе, а только на каждом такте превращает картинку с камер и показания датчиков в команды на приводы. Это происходит на борту, за 10–50 миллисекунд, при бюджете в несколько десятков ватт.
Требования у этих контуров противоположны. Обучению нужны абсолютная пропускная способность и память, ему безразличны габариты, шум и питание — всё равно стойка. Инференсу нужны предсказуемая задержка, устойчивость к вибрации и температуре, работа от аккумулятора и компактный корпус, а абсолютная производительность вторична, потому что модель уже сжата и оптимизирована.
Из этого следует главное и неочевидное: покупая робота, вы покупаете исполнительное устройство с довольно скромным вычислителем. Интеллект в него загружен снаружи. И если вы хотите не просто эксплуатировать чужую модель, а обучать свою под свои сцены, объекты и операции — вычислительные мощности вам нужны отдельно от робота.
Что реально стоит на борту
Бортовые вычислители укладываются в довольно узкий коридор: от 5 до 130 Вт, от 6 до тысячи с лишним TOPS, от 8 до 128 ГБ памяти. Верхняя граница задана не технологией, а физикой платформы — тепло надо куда-то деть, а энергию взять из того же аккумулятора, который питает приводы.
Линейка NVIDIA Jetson остаётся отраслевым стандартом де-факто, в первую очередь из-за программной экосистемы: та же CUDA и тот же TensorRT, что и в кластере, позволяют перенести модель с обучающих карт на борт без переписывания. Orin Nano и Orin NX закрывают лёгкий сегмент, AGX Orin — рабочая лошадка в гуманоидах и манипуляторах, а AGX Thor со 128 ГБ памяти появился именно потому, что на борт поехали крупные мультимодальные модели, которым восьми или шестнадцати гигабайт уже не хватает.
Huawei Ascend в семействе Atlas 200I и 300I — основной китайский ответ в промышленном зрении и edge-инференсе. Производительность скромнее, но для конвейерной детекции и классификации её достаточно, а связка с собственным программным стеком делает решение самодостаточным вне экосистемы NVIDIA.
Rockchip RK3588 занимает нижний ценовой этаж: 6 TOPS на встроенной нейронной сопроцессорной части при потреблении 5–12 Вт и цене модуля в разы ниже. Этого хватает на одну-две модели детекции в реальном времени и обвязку интерфейсов — типовой сценарий недорогого складского AMR или терминала видеоаналитики, где нужно распознать паллету и не наехать на человека, а не строить план манипуляции.
Обратите внимание на строчку «память» в сравнительной таблице: она ограничивает не меньше, чем TOPS. Модель на 7 миллиардов параметров даже в INT4 занимает около 4 ГБ весов, и на модуле с 8 ГБ на всё остальное — буферы камер, карту, планировщик — остаётся немного.
Оговорка по цифрам: заявленные TOPS у разных производителей меряются по-разному — с разрежённостью и без, в INT8 и INT4, на пике и в устойчивом режиме. Таблицу стоит читать как ориентир порядка величин, а сравнивать модули — на своей модели и своём фреймворке.
Что умеют современные роботы с ИИ
Гуманоидные платформы — самый шумный сегмент. За последние два года они действительно перешли от постановочных демонстраций к повторяемым задачам: устойчивая ходьба по неровной поверхности, подъём по лестнице, перенос предметов массой 5–20 кг, сортировка и загрузка коробок в темпе, сопоставимом с человеческим на простых операциях. Автономность от аккумулятора — обычно 2–5 часов при непрерывной работе. Ограничение здесь не столько механика, сколько обобщение: робот уверенно делает то, что видел в обучающих данных, и заметно хуже — то, чего не видел.
Промышленные манипуляторы с ИИ-обвязкой — сегмент менее заметный и куда более зрелый. Здесь ИИ решает две конкретные задачи: захват произвольно лежащих деталей из ящика по трёхмерному облаку точек и контроль качества по зрению. Успешность захвата на неструктурированной насыпи у современных систем — порядка 90–98 % в зависимости от геометрии деталей, такт — 3–8 секунд на объект. Это уже промышленная эксплуатация, а не пилоты.
Складские AMR — самый массовый класс. Навигация по SLAM без разметки пола, объезд людей и погрузчиков, координация десятков и сотен машин на одной площадке. Вычислительные требования здесь скромнее всего: детекция препятствий, локализация и планирование маршрута укладываются в 6–100 TOPS, поэтому здесь и живут RK3588 и младшие Jetson.
Отдельная категория — роботы с языковыми интерфейсами, где оператор ставит задачу словами, а модель сама раскладывает её на последовательность действий. Именно этот класс двинул требования к бортовому железу вверх: языковая часть модели тяжёлая, и её приходится либо сильно квантовать, либо ставить модуль уровня AGX Thor.
Роботы, дроны и беспилотный транспорт не входят в ассортимент ЗероКвант — этот раздел здесь как фактическая картина рынка, а не как предложение. Мы разбираем вычислительную часть задачи.
Почему мозг робота нельзя обучить на самом роботе
Первое ограничение — арифметика. AGX Orin выдаёт около 275 TOPS в INT8, одна H100 в том же INT8 — порядка 2000 TOPS, то есть в семь раз больше на кристалл. Но обучение считается не в INT8, а как минимум в BF16, и здесь разрыв становится непреодолимым: обучающая карта работает с плотностью и форматами, для которых бортовой модуль просто не имеет блоков. Узел из восьми H100 быстрее одного AGX Orin на обучающей нагрузке примерно на два порядка.
Второе и более жёсткое ограничение — память. При обучении в ней одновременно живут веса, градиенты, состояния оптимизатора и активации: для модели на 7 миллиардов параметров с оптимизатором Adam это около 112 ГБ только под состояния, без учёта активаций и батча. Восемь H100 дают 640 ГБ HBM с пропускной способностью более 3 ТБ/с на карту. AGX Orin даёт 64 ГБ LPDDR5 при 204 ГБ/с — и дело даже не в объёме, а в том, что обучение упирается в пропускную способность памяти, а она отличается в пятнадцать раз.
Третье — энергия и время. Даже если бы модель поместилась, дообучение, которое узел из восьми H100 закрывает за двое суток, на бортовом модуле заняло бы годы непрерывной работы. Робот в это время должен работать, а не считать, и его аккумулятора хватит на несколько часов.
Отсюда простое правило, которое стоит запомнить: TOPS на борту определяют, насколько сложную модель робот сможет запустить, и не имеют отношения к тому, насколько умной эта модель будет. Умнеет она в кластере.
Как выглядит реальный конвейер
Шаг первый — сбор данных. Телеоперация, запись демонстраций, логи с камер и датчиков уже работающих машин. На типовую задачу манипуляции набирают от 10 до 100 тысяч эпизодов; это месяцы работы операторов или парка роботов и десятки терабайт видео. Хранение и подготовка этих данных сами по себе требуют инфраструктуры.
Шаг второй — обучение или дообучение в кластере. Здесь работают карты уровня A100, H100, H200 и B200 в узлах по восемь штук с быстрым межсоединением. Дообучение адаптерами на базовой модели укладывается в один узел и несколько суток; полное обучение крупной модели требует десятков карт и недель.
Шаг третий — сжатие. Обученная модель квантуется в INT8 или INT4, компилируется под конкретный бортовой модуль и проверяется на деградацию точности. Именно этот шаг превращает 112 гигабайт обучающего состояния в четырёхгигабайтный файл, который влезает в Jetson.
Шаг четвёртый — обратная связь. Робот в эксплуатации собирает новые данные, редкие и сложные случаи возвращаются в датасет, цикл повторяется. Это значит, что кластер нужен не один раз при запуске, а постоянно — с той разницей, что нагрузка идёт волнами, а не ровной полкой.
Волнообразность нагрузки — важный практический факт для бюджета. Собственный кластер под роботный ИИ большую часть времени недозагружен: между итерациями обучения проходят недели сбора данных.
Что из этого следует для планирования железа
Если вы эксплуатируете готовых роботов с моделью от вендора — вычислительные мощности вам не нужны, всё уже на борту. Если вы адаптируете модель под свои сцены, объекты и операции — нужен как минимум один узел на восьми ускорителях; это точка входа, ниже которой цикл обучения растягивается настолько, что теряет смысл. Если вы разрабатываете собственную модель — счёт идёт на десятки карт.
Подобрать конфигурацию под конкретный сценарий обучения удобно в подборщике GPU, а прикинуть, во что это выльется по питанию и теплу, — в калькуляторе мощности ЦОД. Сами карты и готовые узлы — в каталоге ИИ-ускорителей и серверов с GPU.
Под волнообразную нагрузку роботного обучения часто разумнее не покупать: аренда вычислительных мощностей закрывает итерацию обучения за те же деньги без простаивающего капитала между циклами. Если сравниваете оба варианта, в гайде купить или арендовать GPU разобрана точка, где покупка начинает выигрывать.
И если задача сводится к обучению моделей действия, продолжение этого разбора с расчётом памяти и GPU-часов — в материале об обучении VLA-моделей.