H100, H200 и B200 — три ступени линейки NVIDIA под обучение и инференс LLM. H100 (80 ГБ HBM3) — оптимум цена/производительность; H200 (141 ГБ HBM3e) — та же Hopper, но больше памяти под крупные модели; B200 на Blackwell (192 ГБ, формат FP4) даёт кратный прирост инференса. Все три легальны в РФ по параллельному импорту, ориентир — $25–50 тыс. за карту. Под нерегулярную загрузку часто выгоднее аренда мощностей в РФ, чем покупка.
Сравнительная таблица
| Параметр | H100 | H200 | B200 |
|---|---|---|---|
| Архитектура | Hopper | Hopper | Blackwell |
| Память | 80 ГБ HBM3 | 141 ГБ HBM3e | 192 ГБ HBM3e |
| Пропускная способность | 3.35 ТБ/с | 4.8 ТБ/с | 8 ТБ/с |
| Пиковая производительность | ~1979 TFLOPS FP8 | ~1979 TFLOPS FP8 | ~9000 TFLOPS FP4 |
| TDP | 700 Вт | 700 Вт | ~1000 Вт |
| Цена, ориентир | $25–35 тыс. | $30–40 тыс. | $35–50 тыс. |
| Канал поставки в РФ | параллельный импорт | параллельный импорт | параллельный импорт |
| Срок, ориентир | 2–6 нед. | 3–6 нед. | 4–10 нед. |
Пиковые цифры приведены в разных форматах вычислений: у Hopper (H100/H200) считают FP8, у Blackwell (B200) — новый формат FP4, поэтому напрямую числа не сопоставимы. Цены и сроки — ориентир для оценки бюджета; точную стоимость под объём называем по запросу. ТТХ — ориентир по справочнику.
Память: где на самом деле разница
Главное различие между тремя картами — объём и скорость памяти, а не «сырые» вычисления. H100 несёт 80 ГБ HBM3: этого хватает на инференс средних моделей и обучение с шардингом между картами. H200 — та же архитектура Hopper, но 141 ГБ HBM3e и 4.8 ТБ/с: крупная модель и длинный контекст помещаются на меньшее число карт, падают накладные расходы на коммуникацию в кластере.
B200 на Blackwell поднимает планку до 192 ГБ HBM3e и 8 ТБ/с. Для моделей на сотни миллиардов параметров это означает меньше ускорителей на ту же вместимость и меньше межсоединений — а значит, проще и дешевле кластер при том же размере модели.
Скорость и форматы вычислений
H100 и H200 по вычислительной мощности близки: обе Hopper выдают порядка 1979 TFLOPS в формате FP8, и выигрыш H200 идёт почти целиком от памяти, а не от блоков. B200 добавляет второй Transformer Engine и новый формат FP4 — за счёт него и растёт производительность инференса, ориентировочно кратно относительно H100 на подходящих нагрузках.
Важная оговорка: FP8 у Hopper и FP4 у Blackwell — разные форматы точности, поэтому пиковые числа нельзя сравнивать «в лоб». Реальный прирост зависит от модели, длины контекста и того, поддерживает ли ваш стек FP4. Точные бенчмарки под вашу задачу — предмет теста, а не таблицы.
Питание и инфраструктура
H100 и H200 укладываются в 700 Вт на карту и живут в стандартных GPU-серверах с воздушным или гибридным охлаждением. B200 требует около 1000 Вт и, как правило, более серьёзной инфраструктуры — усиленного питания и часто жидкостного охлаждения.
Это переносит часть стоимости с самой карты на ЦОД: под Blackwell нужно закладывать питание и охлаждение соответствующего класса. Если считаете полную стоимость владения, инфраструктуру учитывайте сразу — детали разбираем в разделе инфраструктуры ЦОД.
Легальность и доступность в России
Все три карты — американские и подпадают под экспортные ограничения США, но в Россию ввозятся легально по параллельному импорту. H100 — самый зрелый и предсказуемый по срокам вариант, B200 — самый дефицитный и дорогой, H200 занимает промежуточную позицию: заметный прирост памяти при умеренной наценке к H100.
Если независимость от санкций США критична (госсектор, чувствительные проекты), как альтернативу для инференса стоит рассмотреть Huawei Ascend 910C — прямой ввоз из КНР без ограничений США. Прежде чем покупать флагман, оцените и аренду: для коротких и пиковых задач она обычно выгоднее закупки.