Из майнинга в ИИ: как фермы переходят на аренду вычислений
Спрос на ИИ-вычисления упёрся в дефицит подведённой мощности, а у майнинговых площадок мощность есть. Отсюда волна переоборудования — и одновременно волна разочарований, потому что совпадает у этих двух миров только энергетика. Разбираем по пунктам, что у фермы уже готово, что придётся построить заново и как считать экономику перехода.
Сравнительная таблица
| Подсистема | Что было у майнинг-фермы | Что нужно ИИ-площадке | Что доделывать |
|---|---|---|---|
| Подведённая мощность | мегаватты, есть | мегаватты, те же | почти ничего — главный переносимый актив |
| Вычислитель | ASIC или потребительские GPU на райзерах x1 | серверные узлы с 4–8 GPU на полной PCIe x16 или SXM | полная замена парка |
| Плотность на стойку | 3–5 кВт на полку | 20–40 кВт на воздухе, 60–130 кВт на жидкости | стойки, шинопроводы, контуры охлаждения |
| Охлаждение | прямоток уличным воздухом, без фильтрации | контролируемый климат, фильтрация, часто direct-to-chip | изоляция коридоров, CDU, фильтры, увлажнение |
| Сеть внутренняя | 100 Мбит до устройства, коммутатор «какой был» | 10–100 Гбит и выше, RDMA, низкая задержка | фабрика целиком: оптика, коммутаторы, топология |
| Канал наружу | десятки Мбит | от 1–10 Гбит, желательно два оператора | новые вводы связи, резервирование |
| Хранилище | нет | быстрое общее хранилище под датасеты и чекпойнты | СХД или распределённая ФС целиком |
| Резервирование питания | как правило, отсутствует | ИБП на всю нагрузку, часто ДГУ | ИБП, батареи, АВР, генерация |
| Софт | прошивка устройства и клиент пула | драйверы, контейнеры, планировщик, изоляция арендаторов | полный стек с нуля |
| Персонал | электрики и монтажники | инженеры эксплуатации, сетевики, DevOps, поддержка 24/7 | новая команда или сервисный партнёр |
| Обязательства перед клиентом | нет, работа на себя | SLA, договор, ответственность за простой | юридическая и процессная часть |
Почему это вообще происходит
Совпали два движения. С одной стороны, после перехода Ethereum на Proof-of-Stake в сентябре 2022 года GPU-фермы потеряли основной доход, а часть ASIC-площадок столкнулась с сжатием маржи, региональными ограничениями и халвингом. Появились площадки с мегаваттами и без загрузки. Подробный разбор их устройства — в материале о том, как устроены майнинг-фермы.
С другой — обучение и инференс больших моделей превратились в самую энергоёмкую задачу отрасли. Одна стойка GB200 NVL72 потребляет 120–132 кВт: столько же, сколько занимал целый ряд майнингового оборудования. Спрос быстро упёрся не в наличие карт, а в наличие места, куда их можно поставить и запитать.
Так подведённая мощность стала главным дефицитом. Технологическое присоединение на несколько мегаватт в развитом энергорайоне — это годы согласований и капитальные затраты; готовая площадка с действующим договором на 5 МВт превращается в самостоятельную ценность независимо от того, что на ней стоит. Отсюда логика: железо заменить можно, мощность — нет.
Но дальше начинается расхождение. Майнинг — это плотная сетка независимых устройств без обмена данными. ИИ-обучение — это единый связанный вычислитель, где сотни карт синхронизируются на каждом шаге, и скорость всего кластера определяется самым медленным звеном. Из этой разницы вытекают почти все требования, перечисленные ниже.
Какие карты вообще годятся под ИИ
Первое, что нужно понять: «карта для ИИ» — не одна категория. Требования различаются на порядок в зависимости от того, обучаете вы модель или обслуживаете запросы к готовой.
Датацентровые ускорители (A100, H100, H200, B200 и аналогичного класса) — единственный практичный вариант для обучения крупных моделей. Ключевые свойства: большой объём памяти с высокой пропускной способностью (HBM), ECC-коррекция ошибок, скоростной межкартовый интерконнект NVLink, пассивное охлаждение под серверный поток воздуха и, что не менее важно, лицензионная чистота использования в датацентре и многопользовательской среде.
Потребительские RTX высоких моделей вполне применимы, но в своей нише: инференс, дообучение и адаптация моделей умеренного размера, генеративная графика и видео, компьютерное зрение, рабочие места исследователей. Здесь важнее цена за производительность, чем масштабируемость, а задачи чаще помещаются в одну карту. Это реальный и востребованный сегмент аренды — просто не тот, где считают фундаментальные модели.
Практический водораздел — объём видеопамяти, потому что модель должна в неё поместиться. Ориентир: 24 ГБ хватает для инференса моделей среднего размера в квантованном виде и для дообучения адаптеров; 48 ГБ открывают комфортную работу с моделями заметно крупнее; 80 ГБ и больше нужны для обучения и для инференса крупных моделей без агрессивного квантования. Как только модель не помещается, приходится разбивать её между картами — и тогда критичной становится скорость связи между ними.
Подобрать конфигурацию под конкретную задачу удобнее в подборе GPU, а лобовые сравнения флагманов — в разделе сравнений. Разбор границы между обучением и инференсом при выборе железа — в гайде «Обучение или инференс: выбор GPU».
Почему майнинговые GPU часто не подходят
Соблазн понятен: карты уже стоят на площадке, они уже оплачены, надо просто «переключить их на ИИ». На практике этому мешают пять конкретных вещей, и каждая из них самостоятельно способна закрыть вопрос.
Объём памяти. Массовые майнинговые карты несли 6–12 ГБ видеопамяти, потому что для хеширования этого хватало с избытком. Для современных ИИ-задач это ниже практического порога: модель либо не помещается вовсе, либо помещается в таком урезанном виде, что теряется смысл. Никакой настройкой это не лечится.
Разводка PCIe. Райзеры в майнинговых ригах дают линию шириной x1, часто ещё и предыдущего поколения. Майнингу это было безразлично — данные почти не передавались. Для ИИ через шину идёт весь поток обучающих данных и все обмены между картами; x1 вместо x16 означает падение пропускной способности в шестнадцать раз на самом узком месте. Карта будет простаивать в ожидании данных.
Отсутствие NVLink. Потребительские карты в майнинговых сборках не имеют высокоскоростного прямого интерконнекта. Любой обмен между картами идёт через PCIe и центральный процессор. Пока задача помещается в одну карту, это терпимо; как только начинается распределённое обучение с синхронизацией градиентов на каждом шаге, кластер упирается в связь и масштабируется всё хуже с ростом числа карт.
Отсутствие ECC. Потребительская память не корректирует одиночные ошибки. Для майнинга ошибка означала отброшенный результат и ничего больше. При обучении, которое идёт неделями, необнаруженная ошибка в памяти способна незаметно испортить веса и обесценить весь прогон. Для арендной площадки, где клиент платит за результат, это ещё и вопрос ответственности.
Износ и режим эксплуатации. Карты работали круглосуточно под полной нагрузкой, часто с изменёнными частотами и напряжениями, в прямоточном потоке уличного воздуха без нормальной фильтрации. Кристалл такой режим переносит сравнительно неплохо, а вот вентиляторы, термопаста и элементы цепей питания вырабатывают ресурс существенно быстрее. Плюс форм-фактор: потребительские карты рассчитаны на собственный обдув, а не на сквозной поток серверного шасси, и в стойке ведут себя хуже.
Реалистичный вывод: майнинговый парк GPU почти никогда не становится ИИ-парком. Переносимый актив — площадка, а вычислитель приходится закупать заново. Отдельные исключения существуют для задач начального уровня — простого инференса небольших моделей или пакетного рендеринга, — но строить на этом арендный сервис с обязательствами перед клиентами не получится.
Сеть: разница на три порядка
Это самая недооценённая статья перехода. Майнинговой площадке хватало 100 Мбит на всю ферму, потому что трафик — короткие задания от пула и короткие ответы. Внутренняя сеть была нужна только для управления, и её собирали из самых дешёвых коммутаторов.
ИИ-кластеру нужна сеть как часть вычислителя. При распределённом обучении карты обмениваются градиентами на каждом шаге — это регулярные всплески трафика в десятки и сотни гигабит, причём критична не только полоса, но и задержка и её стабильность. Практический ориентир для серьёзной обучающей площадки: от 100 Гбит на узел с поддержкой RDMA, чтобы данные шли в память напрямую, минуя процессор и стек операционной системы.
Для инференс-площадки требования мягче — там нагрузка распадается на независимые запросы, и 10–25 Гбит на узел часто достаточно. Но это всё равно на два порядка больше того, что было на ферме, и всё равно означает новую оптическую фабрику: коммутаторы, трансиверы, кабельная система, продуманная топология без переподписки на критичных направлениях.
Отдельно — канал наружу. Датасеты и образы контейнеров надо загружать, результаты выгружать, клиенты подключаются извне. Ферма жила на десятках мегабит; арендной ИИ-площадке нужны гигабиты, желательно от двух независимых операторов с разными физическими вводами. В промзоне или у сельской подстанции — там, где выгодно строить фермы, — второго магистрального оператора может просто не быть поблизости, и это превращается в отдельный инфраструктурный проект.
Практический смысл: сеть — та статья, где расхождение между «было» и «нужно» максимально, а сэкономить нельзя. Медленная сеть не делает кластер медленнее пропорционально — она обесценивает дорогие карты, которые простаивают в ожидании данных.
Плотность и охлаждение: другой порядок величин
Майнинговая полка — это 3–5 кВт, ряд — 15–20 кВт, а оборудование стоит на открытых стеллажах и обдувается уличным воздухом. ИИ-стойка на восьмикартовых узлах — это 20–40 кВт на воздухе; стойка с плотной компоновкой флагманов — 60–130 кВт и жидкостное охлаждение как обязательное условие. Разница в плотности на квадратный метр — от пяти до тридцати раз.
Это меняет всё, что ниже пола и выше потолка. Нужны настоящие 19-дюймовые шкафы вместо стеллажей, шинопроводы и PDU, рассчитанные на десятки киловатт на шкаф, изоляция горячего или холодного коридора, а при переходе за 40 кВт — контур direct-to-chip с CDU, коллекторами и вторичным контуром. Сравнение подходов и их цены — в материале об охлаждении ИИ-стойки.
Меняются и требования к качеству воздуха. Прямоток без фильтрации, приемлемый для ASIC, для серверного оборудования означает ускоренную деградацию: пыль в радиаторах, загрязнение оптических разъёмов, коррозия при неконтролируемой влажности. Серверный зал требует фильтрации, контроля влажности и, как правило, замкнутого или частично замкнутого контура с фрикулингом через теплообменник — а не улицы напрямую.
Полезная новость в том, что здание, вентиляционные проёмы, вытяжные шахты и электрические мощности при этом остаются полезными. Пересобирается внутренняя часть зала, а оболочка и энергетика — переносимый актив. Посчитать требуемую мощность, число стоек и тепловую нагрузку под конкретный состав кластера можно в калькуляторе мощности ЦОД.
Хранилище: подсистема, которой не было вовсе
У майнинговой фермы хранилища нет как класса: устройству нужен образ прошивки и адрес пула. ИИ-площадке хранилище нужно постоянно и в больших объёмах — под обучающие датасеты, под промежуточные чекпойнты, под образы контейнеров и под результаты клиентов.
Ориентиры по объёму: обучающий датасет для задач компьютерного зрения — десятки терабайт; корпуса для языковых моделей — сотни терабайт и выше; чекпойнты крупной модели пишутся регулярно и занимают сотни гигабайт каждый. Для площадки на несколько десятков узлов это означает сотни терабайт быстрого хранилища плюс более дешёвый ёмкостный уровень под холодные данные.
Критична не только ёмкость, но и пропускная способность на узел. Если восемь ускорителей ждут данные с медленного хранилища, дорогая карта считает вхолостую. Практическая конфигурация — распределённая файловая система или параллельная СХД на NVMe с сетевым доступом на десятки гигабит, плюс локальные NVMe на узлах под кэш и временные данные.
И отдельно — вопрос изоляции. На арендной площадке данные разных клиентов не должны пересекаться ни на уровне доступа, ни на уровне остаточных данных на носителях после освобождения узла. Это уже не инженерная, а процессная задача: политики удаления, шифрование, разграничение доступа. Компоненты хранения — в каталоге СХД, сетевая часть — в каталоге сетевого оборудования.
Резервирование: цена обязательства перед клиентом
Пока ферма работает на себя, отключение питания стоит недополученной выручки за часы простоя. Как только площадка сдаёт мощности в аренду, отключение стоит нарушения договора, компенсаций и потерянного клиента — а в случае обучения ещё и потерянного прогона, если чекпойнт не успел записаться.
Отсюда ИБП на всю IT-нагрузку — статья, которой на ферме обычно не было вовсе. Порядок величин: система на 300 кВт с приемлемым временем автономии — это уже серьёзный шкаф с батарейным массивом, а не «источник на стойку». Расчёт батарейной части под кластер разбирается в материале о батареях под GPU-кластер на 300 кВт.
Дальше — дизель-генератор, автоматика ввода резерва, второй луч питания, регламент переключений и испытаний. Для площадки, претендующей на корпоративных клиентов, это не опция: без резерва невозможно подписать SLA с внятной доступностью, а без SLA не приходят те клиенты, ради которых всё затевалось.
Практический вывод по деньгам: резервирование и сеть вместе часто оказываются сопоставимы по стоимости с переоборудованием машзала, и именно они чаще всего ломают исходную бизнес-модель «у нас уже всё есть, надо только карты купить».
Софт и оркестрация: невидимая половина проекта
Майнинговая площадка программно проста: прошивка, клиент пула, скрипт мониторинга. Арендная ИИ-площадка — это полноценная облачная платформа, и её приходится строить с нуля.
Минимальный состав: согласованные версии драйверов и вычислительного стека, контейнерная среда с доступом к GPU, реестр образов, планировщик заданий с очередями и квотами, система мониторинга загрузки и температур карт, биллинг по GPU-часам, портал самообслуживания. Отдельная задача — разделение карт между задачами: аппаратное разбиение ускорителя на изолированные экземпляры или тайм-шеринг, в зависимости от модели услуги.
Самое сложное — изоляция арендаторов. Клиенты не должны видеть данные, задачи и трафик друг друга; освобождённый узел должен возвращаться в пул в заведомо чистом состоянии; сеть должна быть сегментирована. На виртуализованной инфраструктуре это решаемо стандартными средствами, на выделенном железе (bare metal) требует дисциплины в процедурах переустановки и очистки.
И эксплуатация. Круглосуточное дежурство, реакция на инциденты, обновление драйверов без остановки клиентских задач, замена отказавших карт, диагностика проблем, которые проявляются только под нагрузкой. Это другая команда, чем та, что обслуживала ферму: нужны инженеры эксплуатации, сетевики и специалисты по контейнерной инфраструктуре. Кадровая часть на практике оказывается более узким местом, чем закупка оборудования.
Договоры, SLA и сервисная часть
Переход от работы на себя к оказанию услуги — это в первую очередь принятие на себя обязательств. Появляется договор, в котором зафиксированы доступность, время реакции, порядок компенсаций и ответственность за сохранность данных клиента.
Разумный минимум, который спрашивают корпоративные заказчики: заявленная доступность и порядок её измерения, время реакции и восстановления по классам инцидентов, регламент планового обслуживания и уведомлений, порядок обращения с данными при расторжении, условия по резервному копированию (и явное указание, если бэкап — зона ответственности клиента). Для части заказчиков добавляются требования к площадке и к обработке персональных данных.
Отдельная строка — прозрачность конфигурации. Клиент, арендующий восемь ускорителей, обоснованно хочет знать, какая между ними связь, идёт ли карта целиком или её долей, какая пропускная способность до хранилища и не делит ли он узел с кем-то ещё. Площадки, выросшие из майнинга, на старте часто описывают услугу в терминах «столько-то карт по такой-то цене», и этого недостаточно для сравнения предложений.
Сопоставить условия российских провайдеров по конфигурациям, ценам и уровню сервиса можно в сравнении провайдеров аренды.
Экономика: считаем переход
Сравним две модели на одной и той же площадке — на уровне логики, а не точных цифр, потому что точные цифры здесь неустойчивы по определению.
Майнинг. Выручка — функция курса актива, сложности сети и событий протокола; оператор не влияет ни на один из этих параметров. Расходы предсказуемы и на 60–80 % состоят из электричества. Капитальные затраты умеренные, но железо обесценивается за 1–2 года почти полностью. Итог: высокая волатильность дохода при коротком горизонте планирования.
Аренда вычислений. Выручка — функция загрузки и контрактных ставок, то есть гораздо более предсказуемая величина, поддающаяся управлению через продажи. Расходы шире: помимо электричества это амортизация заметно более дорогого железа, связь, персонал, лицензии и обслуживание. Капитальные затраты кратно выше — сюда входят и карты, и сеть, и хранилище, и резервирование. Зато оборудование сохраняет остаточную стоимость дольше, а горизонт контрактов длиннее.
Практический ориентир по структуре: у майнинга электричество — доминирующая статья, у арендной ИИ-площадки на первое место обычно выходит амортизация вычислительного оборудования, а электричество отходит на вторую позицию. Это принципиально меняет чувствительность бизнеса: майнинг умирает от роста тарифа, арендная площадка — от низкой загрузки.
Оценить окупаемость карт при сдаче в аренду — с учётом цены закупки, тарифа на электричество, ставки аренды и предполагаемой загрузки — можно в калькуляторе окупаемости GPU. Оговорка, которую стоит держать в голове при любом таком расчёте: ставки аренды ИИ-мощностей не являются стабильной величиной, они зависят от доступности карт на рынке и от появления новых поколений железа. Считать проект по сегодняшней ставке на пять лет вперёд некорректно; разумнее строить сценарии с консервативной ставкой и умеренной загрузкой.
И ещё один трезвый пункт: часть площадок не переходит целиком, а работает в гибридном режиме — часть мощности под прежнюю нагрузку, часть под аренду. Это снижает риск, но и не даёт получить полноценную ИИ-площадку: сеть, резерв и климат всё равно приходится строить на весь контур, если вы хотите продавать услугу с обязательствами.
Как это выглядит на российском рынке
Констатируем факт, без оценок и рекомендаций: среди российских провайдеров аренды GPU есть компании, чья инфраструктура выросла из майнингового опыта. Immers пришёл в аренду со стороны иммерсионного охлаждения — технологии, которую в России массово освоили именно майнинговые площадки. «Интелион Облако» развивалось на базе группы, работавшей с размещением вычислительного оборудования. Это распространённая для отрасли траектория, а не что-то исключительное.
Практический смысл для арендатора в том, что происхождение площадки само по себе не говорит ни о плохом, ни о хорошем. Оно объясняет сильные и слабые стороны: у выросших из майнинга операторов обычно всё в порядке с энергетикой, охлаждением и стоимостью киловатт-часа, а вопросы стоит задавать по сетевой фабрике, хранилищу, резервированию и зрелости SLA. У операторов, выросших из классического облака, картина ровно обратная.
Поэтому выбирать разумно по параметрам, а не по происхождению: конфигурация узла и тип связи между картами, полоса до хранилища, заявленная доступность и порядок компенсаций, наличие резервного питания, условия по данным. Полный список российских провайдеров с условиями — в разделе аренды вычислительных мощностей, лобовое сопоставление — в сравнении, а прикинуть стоимость своей задачи можно в калькуляторе аренды.
Если же вы смотрите на вопрос с другой стороны — строить своё или арендовать, — сравнение подходов с расчётом разобрано в гайде «Купить или арендовать GPU». Состав вычислительной части, если решение всё-таки в пользу собственной площадки, — в каталоге ИИ-ускорителей и серверов.