Агенты во внутренних процессах: где запускать и сколько это стоит
Модель не отвечает, а выполняет процедуру. Ниже — 3 способа запуска, доведённые до денег, и что из них оставляет режим данных этой задачи. Разбор типовой: допущения по нагрузке и модели зафиксированы на этой странице и под конкретную организацию не подстраиваются. Закрытый контур в ряд способов не входит: это не способ выполнения модели, а режим данных поверх своего железа.
Режим данных этой задачи — персональные данные и коммерческая тайна, и он делит способы до всякого счёта. Данные не покидают ваш периметр только у одного из посчитанных способов — Свой сервер в своей стойке. У остальных двух они уходят к поставщику модели либо лежат в дата-центре площадки. ⚠️ Если договорный режим такую передачу запрещает, эти способы отпадают по условию — и считать их цену незачем. Допускает ли её ваш договор с контрагентом и получено ли поручение на обработку персональных данных, мы не знаем: это вопрос к договору, а не к цене. При заданных допущениях у API плюс обычный сервер разовых вложений нет и запуск занимает дни — но при нём наружу уходят и персональные данные, и сведения под коммерческой тайной. Аренда карты начинает сравниваться по деньгам где-то между 5,5 млрд и 25,9 млрд выходных токенов в месяц — это сравнение с той же самой моделью у поставщика API. ⚠️ Это нижняя граница, а не точка выгоды: ниже неё аренда точно не дешевле, выше — ещё не значит дешевле. В делении «месячная аренда ÷ цена выходного токена» нет входных токенов, за которые у API платят отдельно, нет скорости и задержки — карта может такой объём и не выдать, — и нет загрузки: карта берёт деньги и в простое. Покупать ли карту вместо аренды — отдельный вопрос с другим ответом: он решается сроком загрузки, а не объёмом токенов.
Под типовую нагрузку этой задачи модели нужно 176,8 ГБ видеопамяти — считалось по Qwen3-32B при контексте 32 768 токенов и 16 одновременных запросах.
Варианты исполнения рядом
| Способ | Разовые вложения | Ежемесячно | Чем подтверждено |
|---|---|---|---|
| API плюс обычный сервер | нет | — | наблюдаемые цены |
| Аренда GPU в российском облаке | нет | 814 665 ₽ | часть цен наблюдаема |
| Свой сервер в своей стойке | от 898 608 ₽ только карты, без обвязки | — | часть цен наблюдаема |
Прочерк в колонке «ежемесячно» — не пропуск, а отказ выдумывать: сумма зависит от вашего объёма работы либо от статей, которых мы не наблюдаем. Причина названа в каждом разделе.
Граница между первой и второй ступенью
токенов в месяц — столько должна прогонять модель, чтобы аренда B300 у Cloud4Y (814 665 ₽ в месяц) сравнялась с оплатой API. Это граница между первым способом и вторым, а не между арендой и покупкой: покупка сравнивается с арендой по сроку загрузки и считается отдельно.
Сравнение идёт с моделью того же названия: Qwen3 32B у поставщика RouterAI стоит 31 ₽ за миллион сгенерированных токенов. Вопрос здесь — держать модель на своей карте или платить тому, кто уже её поднял. ⚠️ Одинаковое публичное имя не доказывает одинаковую сущность: версия, длина контекста, квантование и режим обработки у поставщика проверяются отдельно. Верхний край диапазона — та же модель у поставщика Cloud.ru Foundation Models, где миллион токенов стоит 148 ₽.
Считается делением двух наблюдаемых чисел — оценки производительности здесь нет: сколько токенов карта успевает выдать, мы не измеряли и потому не утверждаем. В расчёт берётся цена генерации, а не чтения: карта заменяет собой выработку токенов. Пакетные тарифы исключены — там ответ приходит из очереди. Базы НДС у сторон разные: тарифы API публикуются одними, ставки аренды другими.
API плюс обычный сервер
Рассуждения модели приходят из чужого API по сети, а на своём недорогом сервере живут поиск по документам, векторная база, права доступа и сама логика работы. Видеокарта не нужна вовсе.
| Что | Сколько | Как получено | На какое число |
|---|---|---|---|
| Токены модели Qwen3 32B (обычный режим) | 31 ₽ за 1 млн | наблюдение | 02.09.2026 |
| Токены модели Qwen3-32B (обычный режим) | 148 ₽ за 1 млн | наблюдение | 02.09.2026 |
| Сервер под обвязку — AdminVPS, start-3-6ghz-m8 | 1 289 ₽ в месяц | наблюдение | 02.09.2026 |
| Конфигурация сервера | 4 vCPU · 8 ГБ RAM · 80 ГБ | наблюдение | 02.09.2026 |
Итог складывается из платы за сервер и объёма прогнанных токенов, а объём знаете только вы. Придумывать его за вас мы не будем — вместо этого ниже посчитана требуемая выработка: сколько выходных токенов в месяц должна выдать арендованная карта, чтобы сравняться с оплатой генерации у API. Это нижняя граница, а не точка выгоды.
За
- Запускается за дни, а не за месяцы: ни закупки, ни размещения, ни наладки.
- Разовых вложений нет. Ошибиться с выбором дёшево — переключиться на другую модель стоит правки одной строки.
- Модель обновляет поставщик. Вам не нужен инженер, который умеет её поднимать.
Против
- Документы уходят к поставщику API. Для персональных данных и коммерческой тайны это решается договором и выбором площадки, а не молчанием — см. правовой режим задачи ниже.
- Цена растёт вместе с объёмом: чем лучше работает, тем дороже обходится.
- Между младшей и старшей моделью одного поставщика разница в цене — десятикратная. Какая из них справится с вашим материалом, показывает только проверка на нём: качество моделей мы не измеряли.
- Вы зависите от чужой доступности и чужой цены.
Аренда GPU в российском облаке
Карта арендуется у площадки вместе с сервером. Модель работает на ней, данные лежат в её дата-центре. Промежуточный шаг: железо уже ваше по управлению, но ещё не по владению.
| Что | Сколько | Как получено | На какое число |
|---|---|---|---|
| B300 у Cloud4Y | 814 665 ₽ в месяц | пересчёт | 02.09.2026 |
| Наблюдаемая ставка | 1115.98 ₽/час — в месяц пересчитано по 730 часам непрерывной работы | наблюдение | 02.09.2026 |
| Памяти на карте | 288 ГБ при требуемых 176,8 ГБ | наблюдение | 02.09.2026 |
За
- Данные не покидают российскую площадку, и с ней подписывается договор.
- Модель и её настройки полностью ваши: можно дообучать, менять, держать закрытой.
- Отказаться можно в конце месяца — вложений, которые пропадут, нет.
Против
- Платится всё время, пока карта закреплена, а не только пока она считает.
- Нужен человек, который умеет поднять и держать инференс-сервер.
- При постоянной круглосуточной загрузке за год набегает больше, чем стоит своя карта.
Свой сервер в своей стойке
Карты покупаются и ставятся в собственный сервер. Дальше — только электричество и обслуживание. Имеет смысл там, где нагрузка постоянная и предсказуемая.
| Что | Сколько | Как получено | На какое число |
|---|---|---|---|
| A16 64 ГБ — ServerMall | 299 536 ₽ за карту | наблюдение | 02.09.2026 |
| Карт под требуемую память | 3 шт. — 898 608 ₽ | пересчёт | 02.09.2026 |
| Обвязка: шасси, процессоры, память, питание, охлаждение | считается по конкретной платформе | не наблюдали | — |
Ежемесячных платежей за само железо нет, но есть электричество, охлаждение и труд обслуживающего человека. Наблюдаемых чисел по ним у нас нет, поэтому месячную сумму мы не называем.
За
- При постоянной загрузке дешевле аренды: считается точкой окупаемости, а не на глаз.
- Данные не покидают периметр вообще. Для части регуляторных требований это единственный проходящий вариант.
- Железо остаётся активом и переживает смену модели.
Против
- Цена карт — не цена сервера. У наблюдаемых нами платформ обвязка занимает от пятой части до двух третей стоимости.
- Разовые вложения возвращаются месяцами, и всё это время деньги не работают.
- Нужны стойка, питание, охлаждение и человек, который всё это держит.
РЕЖИМ ДАННЫХ ПОВЕРХ Полностью закрытый контур — не отдельный способ запуска, а режим данных поверх этого: отключение от внешней сети, разграничение доступа, журналирование и, где требуется, аттестация. Цену определяют не карты, а требования режима — помещение, персонал, средства защиты; наблюдаемых чисел по ним у нас нет, и называть сумму значило бы её выдумать. Что такое закрытый контур →
Посчитать окупаемость →Что увидит модель и что из этого следует
Внутренние заявки, согласования, доступы к рабочим системам.
Режим: персональные данные и коммерческая тайна. Модель увидит и персональные данные, и коммерческую тайну. Это тот случай, когда закрытый контур обсуждают первым, а не последним.
Мы не знаем ваших договоров и не говорим, что способ запрещён. Мы говорим, где окажутся данные: у 2 способа из 3 они покидают ваш периметр, и для них условия обработки придётся выбирать под режим, а не под цену. Право и сроки →
Насколько полны эти данные
Это меньше рынка, и мы пишем это здесь, а не молчим. Каждое число выше снято с прайса продавца и едет с датой. Чего не наблюдали — помечено «не наблюдали», а не заменено оценкой. Список источников растёт; заявление «сравниваем всех» появится тогда, когда станет правдой.
Чего в разборе нет вовсе: сколько токенов в секунду выдаёт карта на этой модели, какова задержка ответа и насколько модель хороша именно на ваших документах. Это измеряется на стенде, а не выводится из прайсов. Пока замеров нет, мы о них молчим, а не подставляем правдоподобное.