Главная/Гайды/Обучение или инференс: как выбрать GPU под задачу
ГАЙД · ВЫБОР ЖЕЛЕЗА

Обучение или инференс: как выбрать GPU под задачу

Один и тот же GPU может быть отличным для обучения и невыгодным для инференса — и наоборот. Разбираем, чем эти режимы отличаются по нагрузке на железо, и как под каждый выбрать ускоритель, не переплатив за ненужное.

Автор: Вячеслав Днестранский · обновлено 2026-07-17 · 9 мин чтения
Коротко

Начните с режима работы. Обучение LLM упирается в вычисления и скорость межсоединений (NVLink, InfiniBand) — сюда берут флагманы Hopper/Blackwell (H100, H200, B200) в плотных узлах 8× GPU. Инференс чувствителен к объёму памяти под модель и KV-кэш и к стоимости на запрос — здесь часто выгоднее A100, L40S или китайский Ascend. Универсального ответа нет: сначала определите задачу и масштаб модели, потом карту. Для разовых нагрузок дешевле аренда, чем покупка.

Чем обучение отличается от инференса

Обучение — это разовый или периодический тяжёлый процесс: модель прогоняет данные, считает градиенты и обновляет веса. Он вычислительно интенсивный, длится часами и сутками и хорошо масштабируется на много карт и узлов — но только если сеть между ними не становится узким местом.

Инференс — это постоянная эксплуатация обученной модели: она отвечает на запросы пользователей. Здесь важны не пиковые флопсы, а то, помещается ли модель в память карты, какова задержка ответа и сколько стоит один запрос. Это разные профили нагрузки, и оптимальное железо под них тоже разное.

Что важно для обучения

Первое — вычислительная мощность и поддержка низкой точности. Обучение крупных трансформеров выигрывает от FP8 и Transformer Engine (H100/H200) и нового FP4 (Blackwell): это прямо сокращает время обучения. A100 без FP8 здесь заметно медленнее на тех же задачах.

Второе — межсоединения. Внутри узла карты связывает NVLink/NVSwitch, между узлами — InfiniBand. При обучении на нескольких узлах именно сеть, а не GPU, часто становится бутылочным горлышком: экономия на InfiniBand означает недогруженные дорогие ускорители.

Третье — память под большие модели и батчи. Если модель не помещается на карту, её шардируют между GPU, что добавляет накладные расходы. Поэтому под крупные LLM берут карты с большим объёмом (H200 — 141 ГБ, B200/MI300X — 192 ГБ), чтобы сократить число карт на модель.

Что важно для инференса

Главный параметр — объём памяти. Модель целиком плюс KV-кэш под контекст должны поместиться в VRAM карты; иначе нужны несколько GPU и растёт задержка. Часто под инференс важнее объём памяти, чем пиковые вычисления.

Дальше — латентность и пропускная способность. Для интерактивных сценариев критична задержка ответа, для пакетной обработки — суммарный throughput. Под разные цели оптимальны разные карты и настройки батчинга.

И главное для экономики — стоимость на запрос. Флагман под инференс средней модели часто избыточен: A100, L40S или Ascend 910C дают нужную память и производительность дешевле. Считайте цену не за карту, а за миллион обработанных токенов или тысячу запросов.

Какая карта под какой режим

Ниже — ориентир по подбору. Это отправная точка, а не жёсткое правило: финальный выбор зависит от размера модели, бюджета и требований по легальности ввоза.

ЗадачаРазумный выборПочему
Обучение крупных LLM с нуляH100 / H200 / B200 в узле 8× GPUFP8/FP4, быстрый NVLink, много памяти
Дообучение и средние моделиA100 80GB или H100баланс цены и скорости
Инференс крупных моделейH200, B200, MI300X (192–256 ГБ)модель и KV-кэш помещаются на карту
Продуктовый инференс средних моделейA100, L40S, Ascend 910Cнужная память дешевле, ниже цена запроса
Импортозамещение под инференсHuawei Ascend 910Cпрямой ввоз из КНР без санкций США
Локальная разработка и рендерRTX PRO 6000, L40Sставится в рабочую станцию без ЦОД

Частые ошибки

Покупать флагман под инференс средней модели. Если модель помещается в 48–80 ГБ и не нужна пиковая скорость, B200 переплачен: A100 или L40S закроют задачу дешевле и с меньшими требованиями к питанию.

Экономить на сети при обучении на многих узлах. Быстрые GPU без быстрой InfiniBand простаивают в ожидании данных — и вы платите за недогруженное железо.

Считать только цену карты. Blackwell требует ~1 кВт и жидкостного охлаждения — инфраструктура ЦОД добавляет к бюджету. И не забывайте про альтернативу: под нерегулярную загрузку аренда обычно дешевле закупки.

Частые вопросы

Технически да — многие используют H100 и для обучения, и для инференса. Но экономически под массовый инференс средней модели флагман часто избыточен: дешевле A100, L40S или Ascend. Оптимально подбирать железо под преобладающий режим нагрузки.