API, аренда или своё железо: как выбрать и не переплатить
Выбор почти всегда начинают с железа, а начинать надо с двух вопросов: какие данные увидит модель и насколько ровно пойдёт нагрузка. Первый вопрос часто закрывает тему до всякой экономики, второй переворачивает арифметику. Здесь — как пройти оба и чем считать.
Три пути: API по подписке, аренда GPU в России и своё железо. По цене токена при полной загрузке арендованная карта выигрывает у API кратно, но платится она за всё время, включая простой, — поэтому сравнение честно только при ровной нагрузке. Данные решают раньше денег: если модель видит персональные данные или сведения ограниченного доступа, разговор про внешний сервис заканчивается, не начавшись. Порядок действий один и тот же: задача → данные → нагрузка → деньги.
Сначала данные, потом деньги
Самая частая ошибка — начать с прайсов. Правовой режим данных отсекает варианты раньше, чем экономика успевает вмешаться, и переигрывать потом дороже.
Если модель увидит персональные данные, включается требование о том, что их запись и хранение ведутся в базах на территории России, а работа через внешний сервис становится передачей третьему лицу со всеми договорными последствиями. Если вы государственное учреждение, вуз или НИИ — вопрос уже решён нормой: требования ФСТЭК с 1 марта 2026 года прямо запрещают передавать разработчику модели сведения ограниченного доступа, включая передачу «для улучшения модели».
Есть и обратная сторона, о которой честно стоит сказать: если данные не чувствительные — маркетинговые тексты, публичные материалы, обезличенная аналитика, — этот раздел вас не касается, и выбор становится чисто экономическим. Тогда переходите сразу к следующему.
Три пути и чем они отличаются
API по подписке. Вы платите за обработанные токены и не думаете об инфраструктуре. Запуск — за день, порог входа почти нулевой, масштабирование мгновенное. Взамен данные уходят к поставщику, модель меняется без вашего участия, а цена зависит от чужого прайса.
Аренда GPU. Вы получаете карту в российском дата-центре и ставите на неё открытую модель. Данные остаются в контуре, который вы контролируете по договору, модель ваша и не меняется сама. Платите за время, а не за токены, — и это главное отличие, из которого следует вся арифметика ниже.
Своё железо. Карта стоит у вас, данные не покидают периметр физически, зависимости от чужих тарифов нет вовсе. Взамен — капитальные затраты, питание, охлаждение, эксплуатация и люди, которые всё это ведут.
Между вторым и третьим нет пропасти: аренда — это способ проверить сценарий до закупки. У 91% организаций своих серверов с GPU нет, поэтому почти любой путь начинается с арендованной карты, и это нормальный порядок, а не полумера.
Как считается цена токена
У API цена опубликована: рубли за тысячу токенов, умножаем на тысячу — получаем цену миллиона. Разброс внутри одного поставщика десятикратный, а асинхронный режим вдвое дешевле синхронного при том же результате, если задача терпит задержку.
У аренды опубликована другая величина — рубли за час. Чтобы перевести её в цену токена, нужно знать, сколько токенов карта выдаёт в час. Это измеряется, а не выводится из числа параметров: результат зависит от модели, длины входа и выхода, числа одновременных запросов и инференс-сервера. На одной карте разброс достигает разов.
Поэтому любое число «столько-то токенов в секунду» без условий бессмысленно, а сравнение по нему — недостоверно. Мы берём опубликованные замеры вместе с их условиями и показываем условия рядом с ценой; там же видно время до первого токена, потому что оно и решает, живой это сервис или пакетная обработка.
Точка, где аренда обгоняет API
Считать удобнее не «во что обойдётся токен», а «сколько токенов надо, чтобы сравняться». Это чистое деление: месячная стоимость аренды разделить на цену миллиона токенов у API. Никаких допущений о производительности в этом действии нет.
Порядок получается такой: карта среднего класса за пару десятков тысяч рублей в месяц сравнивается с самым дешёвым тарифом на сотнях миллионов токенов в месяц. Если пересчитать это в часы полной загрузки — примерно сутки непрерывной работы под насыщенной нагрузкой.
Отсюда практический вывод, неудобный для продажи железа: всё решает загрузка, а не цена карты. Наберёте ровный поток — аренда дешевле кратно. Не наберёте — платите за простой, и API выигрывает без вариантов. Нагрузка волнами — худший случай для аренды, даже при цене токена в десять раз ниже.
И вторая оговорка, о которой забывают: цена токена — не цена качества. Маленькая модель на скромной карте даёт дешёвый токен, но если она не решает вашу задачу, дешевизна не имеет значения. Сначала проверяется пригодность модели, потом считается её цена.
Когда покупать своё
Покупка обгоняет аренду на длинном горизонте и ровной загрузке — то есть тогда же, когда аренда обгоняет API, только сильнее. Считать надо не карту, а контур целиком: сервер, питание, охлаждение, сеть, хранение, монтаж и люди. Карта в этой смете обычно самая заметная, но далеко не единственная строка.
Есть случаи, когда покупка выбирается независимо от арифметики: данные нельзя выпускать за периметр ни при каких условиях, требуется аттестация, нужна работа без интернета или дообучение на закрытых данных. В этих случаях считают не «выгодно ли», а «сколько это стоит».
Проверять сценарий до закупки почти всегда дешевле на арендованной карте: реальный поток запросов выясняется на живом сервисе за пару недель, а не на совещании.
Порядок действий
1. Сформулируйте задачу, а не спецификацию. «Находить нужное в договорах» — задача. «Сервер с двумя A100» — уже ответ, и часто не на тот вопрос.
2. Определите класс данных. Персональные данные, коммерческая тайна, сведения ограниченного доступа или ничего из этого. Этот шаг отсекает варианты.
3. Оцените нагрузку в токенах, а не в людях. Сто человек, которые заходят раз в неделю, и десять, работающих непрерывно, — совершенно разные системы.
4. Возьмите карту в аренду и померьте. Две недели живого потока стоят дешевле любой ошибки в закупке.
5. Считайте контур целиком. Сравнивать цену карты с ценой подписки некорректно: у своего железа есть эксплуатация, у подписки её нет.