Разбираемся в дефиците за вас
Расчётные материалы ЗероКвант о том, как ИИ-вычисления работают в смежных областях — энергетике и охлаждении ЦОД, робототехнике, компьютерном зрении. С формулами, таблицами и честными оговорками.
Каждый материал — практический разбор с числами: сколько батарей нужно под кластер на 300 кВт, на каком железе работает ИИ в роботах, сколько GPU-часов стоит обучение VLA-модели, чем охлаждать стойку на 100 кВт, сколько видеопотоков тянет одна карта и почему ИИ упирается в подведённую мощность. Цифры — ориентиры порядка величины для оценки и разговора с инженерами, а не проектные значения. Ниже — лента статей, под ней навигация по разделам сайта.
Слова «облако», «платформа» и «аренда GPU» описывают не разные технологии, а разные границы ответственности: где кончается чужая работа и начинается ваша. От этой границы зависит и то, за какую единицу приходит счёт — за час сервера, за час карты, за миллион токенов или за вызов функции. Разбираем пять способов по одному признаку и показываем, где на сайте лежит цена по каждому.
Память под локальную модель складывается из двух частей, и вторую почти всегда оценивают на глаз — «добавьте 10–20 % на контекст». Мы посчитали её по характеристикам, снятым с карточек десяти открытых моделей 26 августа 2026 года: доля вышла от 1 % до 118 % от веса самой модели, и ни одна из десяти не попала в это правило. Разбираем, из чего вторая часть складывается и почему она меняет класс карты, а не проценты.
Одна и та же модель на 70 миллиардов параметров требует то ста сорока гигабайт видеопамяти, то тридцати пяти. Разница — в разрядности, в которой хранятся её веса. Квантование переводит «нужен кластер» в «хватит одной карты», и поэтому решение о нём принимается раньше, чем решение о железе, а не после.
«Эта карта выдаёт три тысячи токенов в секунду» — фраза, которая звучит как характеристика железа, а на деле является характеристикой эксперимента. Поменяйте модель, длину ответа или число одновременных запросов — и число изменится в разы. Разбираем на опубликованных замерах, что нужно спрашивать, прежде чем верить цифре.
Вопрос «можно ли просто арендовать GPU в Казахстане или Китае» звучит всё чаще, а ответ на него зависит не от страны, а от того, что за данные вы туда отправляете. Разбираем правовой контур по подтверждённым источникам: где проходит граница локализации персональных данных, что изменилось с 1 июля 2025 года, как работает уведомительный порядок трансграничной передачи и почему для большинства российских компаний отечественная площадка оказывается проще и дешевле по совокупности издержек.
Спрос на ИИ-вычисления упёрся в дефицит подведённой мощности, а у майнинговых площадок мощность есть. Отсюда волна переоборудования — и одновременно волна разочарований, потому что совпадает у этих двух миров только энергетика. Разбираем по пунктам, что у фермы уже готово, что придётся построить заново и как считать экономику перехода.
Майнинг-ферма — это не «комната с видеокартами», а инженерное сооружение, где 90 % задачи составляют питание, охлаждение и стоимость киловатт-часа. Разбираем, как такие площадки устроены физически, чем ASIC-ферма отличается от GPU-фермы, почему GPU-майнинг фактически закончился в сентябре 2022 года и почему освободившаяся инфраструктура оказалась востребована совсем другой отраслью.
Когда говорят «робот с искусственным интеллектом», обычно имеют в виду две совершенно разные машины: ту, что ездит и хватает, и ту, что стоит в стойке и учит первую это делать. Разбираем, какое железо реально стоит на борту современных роботов, что оно умеет — и почему интеллект в них приезжает из дата-центра.
Вопрос «сколько камер потянет одна карта» звучит просто, а корректного ответа в отрыве от задачи не имеет: разброс между сценариями — от восьми потоков до четырёхсот на одном и том же железе. Разбираем, что именно ограничивает плотность, даём формулу, считаем пример на 200 камерах и собираем конфигурации под 500, 2 000 и 10 000 камер.
Vision-language-action модели — то, что превращает робота из исполнителя жёсткой программы в машину, понимающую задачу словами. Считаем без маркетинга: сколько нужно данных, сколько памяти съедает обучение, во сколько GPU-часов обходится дообучение моделей на 7 и 70 миллиардов параметров и что из этого реально помещается в один узел.
За семь лет тепловыделение одного ускорителя выросло с 300 до 1200 ватт, а стойки перешагнули отметку в 100 кВт. Воздух на этих числах физически заканчивается. Разбираем три подхода — воздух, direct-to-chip и иммерсию — по потолку мощности, PUE, капзатратам и обслуживанию и считаем, во сколько обходится разница в PUE.
Дефицит ускорителей постепенно сменился дефицитом другого рода: карты купить можно, а вот включить — не везде. Разбираем по шагам, как из 700 ватт TDP вырастает 1,8 киловатта подведённой мощности, сколько мегаватт стоит за кластером на тысячу карт и какие три ответа на это есть у рынка.
ИИ-нагрузка ведёт себя не как обычный серверный зал: 300 кВт при обучении держатся ровной полкой, а батарея разряжается коротко и очень мощно. Разбираем, как посчитать нужную ёмкость честно — с КПД, глубиной разряда и старением, — и почему выбор химии в ЦОД решается не удельной энергией, а током и безопасностью.
Разделы сайта
Остальные материалы ЗероКвант разложены по профильным разделам — сравнения ускорителей, практические гайды, цены, инструменты расчёта и правила ввоза.
Что происходит с поставками, ценами и регулированием вычислительного железа.
Лобовые сравнения ускорителей: характеристики, цена, что брать под задачу.
Пошаговые разборы: как выбрать, ввезти и запустить оборудование.
Калькулятор ввоза, проверка параллельного импорта, конвертер валют.
Ориентиры стоимости ИИ-ускорителей и серверов с учётом ввоза в РФ.
Вендоры мировые и китайские: страна, модельный ряд, канал поставки.
Короткие определения терминов из мира ИИ-железа и инфраструктуры.
Что законно ввозить в 2026 году и по какому каналу это делать.
Строительство и оснащение дата-центров: питание, охлаждение, стойки.