Обучение или инференс: как выбрать GPU под задачу
Один и тот же GPU может быть отличным для обучения и невыгодным для инференса — и наоборот. Разбираем, чем эти режимы отличаются по нагрузке на железо, и как под каждый выбрать ускоритель, не переплатив за ненужное.
Начните с режима работы. Обучение LLM упирается в вычисления и скорость межсоединений (NVLink, InfiniBand) — сюда берут флагманы Hopper/Blackwell (H100, H200, B200) в плотных узлах 8× GPU. Инференс чувствителен к объёму памяти под модель и KV-кэш и к стоимости на запрос — здесь часто выгоднее A100, L40S или китайский Ascend. Универсального ответа нет: сначала определите задачу и масштаб модели, потом карту. Для разовых нагрузок дешевле аренда, чем покупка.
Чем обучение отличается от инференса
Обучение — это разовый или периодический тяжёлый процесс: модель прогоняет данные, считает градиенты и обновляет веса. Он вычислительно интенсивный, длится часами и сутками и хорошо масштабируется на много карт и узлов — но только если сеть между ними не становится узким местом.
Инференс — это постоянная эксплуатация обученной модели: она отвечает на запросы пользователей. Здесь важны не пиковые флопсы, а то, помещается ли модель в память карты, какова задержка ответа и сколько стоит один запрос. Это разные профили нагрузки, и оптимальное железо под них тоже разное.
Что важно для обучения
Первое — вычислительная мощность и поддержка низкой точности. Обучение крупных трансформеров выигрывает от FP8 и Transformer Engine (H100/H200) и нового FP4 (Blackwell): это прямо сокращает время обучения. A100 без FP8 здесь заметно медленнее на тех же задачах.
Второе — межсоединения. Внутри узла карты связывает NVLink/NVSwitch, между узлами — InfiniBand. При обучении на нескольких узлах именно сеть, а не GPU, часто становится бутылочным горлышком: экономия на InfiniBand означает недогруженные дорогие ускорители.
Третье — память под большие модели и батчи. Если модель не помещается на карту, её шардируют между GPU, что добавляет накладные расходы. Поэтому под крупные LLM берут карты с большим объёмом (H200 — 141 ГБ, B200/MI300X — 192 ГБ), чтобы сократить число карт на модель.
Что важно для инференса
Главный параметр — объём памяти. Модель целиком плюс KV-кэш под контекст должны поместиться в VRAM карты; иначе нужны несколько GPU и растёт задержка. Часто под инференс важнее объём памяти, чем пиковые вычисления.
Дальше — латентность и пропускная способность. Для интерактивных сценариев критична задержка ответа, для пакетной обработки — суммарный throughput. Под разные цели оптимальны разные карты и настройки батчинга.
И главное для экономики — стоимость на запрос. Флагман под инференс средней модели часто избыточен: A100, L40S или Ascend 910C дают нужную память и производительность дешевле. Считайте цену не за карту, а за миллион обработанных токенов или тысячу запросов.
Какая карта под какой режим
Ниже — ориентир по подбору. Это отправная точка, а не жёсткое правило: финальный выбор зависит от размера модели, бюджета и требований по легальности ввоза.
| Задача | Разумный выбор | Почему |
|---|---|---|
| Обучение крупных LLM с нуля | H100 / H200 / B200 в узле 8× GPU | FP8/FP4, быстрый NVLink, много памяти |
| Дообучение и средние модели | A100 80GB или H100 | баланс цены и скорости |
| Инференс крупных моделей | H200, B200, MI300X (192–256 ГБ) | модель и KV-кэш помещаются на карту |
| Продуктовый инференс средних моделей | A100, L40S, Ascend 910C | нужная память дешевле, ниже цена запроса |
| Импортозамещение под инференс | Huawei Ascend 910C | прямой ввоз из КНР без санкций США |
| Локальная разработка и рендер | RTX PRO 6000, L40S | ставится в рабочую станцию без ЦОД |
Частые ошибки
Покупать флагман под инференс средней модели. Если модель помещается в 48–80 ГБ и не нужна пиковая скорость, B200 переплачен: A100 или L40S закроют задачу дешевле и с меньшими требованиями к питанию.
Экономить на сети при обучении на многих узлах. Быстрые GPU без быстрой InfiniBand простаивают в ожидании данных — и вы платите за недогруженное железо.
Считать только цену карты. Blackwell требует ~1 кВт и жидкостного охлаждения — инфраструктура ЦОД добавляет к бюджету. И не забывайте про альтернативу: под нерегулярную загрузку аренда обычно дешевле закупки.