Вопросы к данным на естественном языке: где запускать и сколько это стоит
Отчёт вместо заявки аналитику. Ниже — 3 способа запуска, доведённые до денег, и что из них оставляет режим данных этой задачи. Разбор типовой: допущения по нагрузке и модели зафиксированы на этой странице и под конкретную организацию не подстраиваются. Закрытый контур в ряд способов не входит: это не способ выполнения модели, а режим данных поверх своего железа.
Режим данных этой задачи — коммерческая тайна, и он делит способы до всякого счёта. Данные не покидают ваш периметр только у одного из посчитанных способов — Свой сервер в своей стойке. У остальных двух они уходят к поставщику модели либо лежат в дата-центре площадки. ⚠️ Если договорный режим такую передачу запрещает, эти способы отпадают по условию — и считать их цену незачем. Допускает ли её ваш договор с контрагентом, мы не знаем: это вопрос к договору, а не к цене. При заданных допущениях у API плюс обычный сервер разовых вложений нет и запуск занимает дни — но при нём сведения уходят публичному ИИ-сервису, а это именно третье лицо — договоры с контрагентами часто прямо запрещают такую передачу. Аренда карты начинает сравниваться по деньгам где-то между 231 млн и 35 млрд выходных токенов в месяц — это сравнение с моделями того же семейства. ⚠️ Это нижняя граница, а не точка выгоды: ниже неё аренда точно не дешевле, выше — ещё не значит дешевле. В делении «месячная аренда ÷ цена выходного токена» нет входных токенов, за которые у API платят отдельно, нет скорости и задержки — карта может такой объём и не выдать, — и нет загрузки: карта берёт деньги и в простое. Покупать ли карту вместо аренды — отдельный вопрос с другим ответом: он решается сроком загрузки, а не объёмом токенов.
Под типовую нагрузку этой задачи модели нужно 130,2 ГБ видеопамяти — считалось по Qwen2.5-72B-Instruct при контексте 16 384 токенов и 8 одновременных запросах.
Варианты исполнения рядом
| Способ | Разовые вложения | Ежемесячно | Чем подтверждено |
|---|---|---|---|
| API плюс обычный сервер | нет | — | наблюдаемые цены |
| Аренда GPU в российском облаке | нет | 415 800 ₽ | наблюдаемые цены |
| Свой сервер в своей стойке | от 898 608 ₽ только карты, без обвязки | — | часть цен наблюдаема |
Прочерк в колонке «ежемесячно» — не пропуск, а отказ выдумывать: сумма зависит от вашего объёма работы либо от статей, которых мы не наблюдаем. Причина названа в каждом разделе.
Граница между первой и второй ступенью
токенов в месяц — столько должна прогонять модель, чтобы аренда H200 у Selectel (415 800 ₽ в месяц) сравнялась с оплатой API. Это граница между первым способом и вторым, а не между арендой и покупкой: покупка сравнивается с арендой по сроку загрузки и считается отдельно.
Той же модели у наблюдаемых поставщиков API нет, поэтому сравнение идёт с моделями того же семейства (205 тарифов): от Qwen 3 Max по 1 800 ₽ до Qwen2.5 7B Instruct по 12 ₽ за миллион. Это сравнение слабее: внутри семейства модели различаются размером, а качество на вашем материале мы не измеряли.
Считается делением двух наблюдаемых чисел — оценки производительности здесь нет: сколько токенов карта успевает выдать, мы не измеряли и потому не утверждаем. В расчёт берётся цена генерации, а не чтения: карта заменяет собой выработку токенов. Пакетные тарифы исключены — там ответ приходит из очереди.
API плюс обычный сервер
Рассуждения модели приходят из чужого API по сети, а на своём недорогом сервере живут поиск по документам, векторная база, права доступа и сама логика работы. Видеокарта не нужна вовсе.
| Что | Сколько | Как получено | На какое число |
|---|---|---|---|
| Токены модели Qwen2.5 7B Instruct (обычный режим) | 12 ₽ за 1 млн | наблюдение | 02.09.2026 |
| Токены модели Qwen 3 Max (обычный режим) | 1 800 ₽ за 1 млн | наблюдение | 02.09.2026 |
| Сервер под обвязку — AdminVPS, start-3-6ghz-m8 | 1 289 ₽ в месяц | наблюдение | 02.09.2026 |
| Конфигурация сервера | 4 vCPU · 8 ГБ RAM · 80 ГБ | наблюдение | 02.09.2026 |
Итог складывается из платы за сервер и объёма прогнанных токенов, а объём знаете только вы. Придумывать его за вас мы не будем — вместо этого ниже посчитана требуемая выработка: сколько выходных токенов в месяц должна выдать арендованная карта, чтобы сравняться с оплатой генерации у API. Это нижняя граница, а не точка выгоды.
За
- Запускается за дни, а не за месяцы: ни закупки, ни размещения, ни наладки.
- Разовых вложений нет. Ошибиться с выбором дёшево — переключиться на другую модель стоит правки одной строки.
- Модель обновляет поставщик. Вам не нужен инженер, который умеет её поднимать.
Против
- Документы уходят к поставщику API. Для персональных данных и коммерческой тайны это решается договором и выбором площадки, а не молчанием — см. правовой режим задачи ниже.
- Цена растёт вместе с объёмом: чем лучше работает, тем дороже обходится.
- Между младшей и старшей моделью одного поставщика разница в цене — десятикратная. Какая из них справится с вашим материалом, показывает только проверка на нём: качество моделей мы не измеряли.
- Вы зависите от чужой доступности и чужой цены.
Аренда GPU в российском облаке
Карта арендуется у площадки вместе с сервером. Модель работает на ней, данные лежат в её дата-центре. Промежуточный шаг: железо уже ваше по управлению, но ещё не по владению.
| Что | Сколько | Как получено | На какое число |
|---|---|---|---|
| H200 у Selectel | 415 800 ₽ в месяц | наблюдение | 02.09.2026 |
| Памяти на карте | 141 ГБ при требуемых 130,2 ГБ | наблюдение | 02.09.2026 |
За
- Данные не покидают российскую площадку, и с ней подписывается договор.
- Модель и её настройки полностью ваши: можно дообучать, менять, держать закрытой.
- Отказаться можно в конце месяца — вложений, которые пропадут, нет.
Против
- Платится всё время, пока карта закреплена, а не только пока она считает.
- Нужен человек, который умеет поднять и держать инференс-сервер.
- При постоянной круглосуточной загрузке за год набегает больше, чем стоит своя карта.
Свой сервер в своей стойке
Карты покупаются и ставятся в собственный сервер. Дальше — только электричество и обслуживание. Имеет смысл там, где нагрузка постоянная и предсказуемая.
| Что | Сколько | Как получено | На какое число |
|---|---|---|---|
| A16 64 ГБ — ServerMall | 299 536 ₽ за карту | наблюдение | 02.09.2026 |
| Карт под требуемую память | 3 шт. — 898 608 ₽ | пересчёт | 02.09.2026 |
| Обвязка: шасси, процессоры, память, питание, охлаждение | считается по конкретной платформе | не наблюдали | — |
Ежемесячных платежей за само железо нет, но есть электричество, охлаждение и труд обслуживающего человека. Наблюдаемых чисел по ним у нас нет, поэтому месячную сумму мы не называем.
За
- При постоянной загрузке дешевле аренды: считается точкой окупаемости, а не на глаз.
- Данные не покидают периметр вообще. Для части регуляторных требований это единственный проходящий вариант.
- Железо остаётся активом и переживает смену модели.
Против
- Цена карт — не цена сервера. У наблюдаемых нами платформ обвязка занимает от пятой части до двух третей стоимости.
- Разовые вложения возвращаются месяцами, и всё это время деньги не работают.
- Нужны стойка, питание, охлаждение и человек, который всё это держит.
РЕЖИМ ДАННЫХ ПОВЕРХ Полностью закрытый контур — не отдельный способ запуска, а режим данных поверх этого: отключение от внешней сети, разграничение доступа, журналирование и, где требуется, аттестация. Цену определяют не карты, а требования режима — помещение, персонал, средства защиты; наблюдаемых чисел по ним у нас нет, и называть сумму значило бы её выдумать. Что такое закрытый контур →
Посчитать окупаемость →Что увидит модель и что из этого следует
Учётные системы, продажи, склад, финансы.
Режим: коммерческая тайна. Модель увидит сведения, составляющие коммерческую тайну. Договоры с контрагентами часто прямо запрещают передавать их третьим лицам — а публичный ИИ-сервис это именно третье лицо.
Мы не знаем ваших договоров и не говорим, что способ запрещён. Мы говорим, где окажутся данные: у 2 способа из 3 они покидают ваш периметр, и для них условия обработки придётся выбирать под режим, а не под цену. Право и сроки →
Насколько полны эти данные
Это меньше рынка, и мы пишем это здесь, а не молчим. Каждое число выше снято с прайса продавца и едет с датой. Чего не наблюдали — помечено «не наблюдали», а не заменено оценкой. Список источников растёт; заявление «сравниваем всех» появится тогда, когда станет правдой.
Чего в разборе нет вовсе: сколько токенов в секунду выдаёт карта на этой модели, какова задержка ответа и насколько модель хороша именно на ваших документах. Это измеряется на стенде, а не выводится из прайсов. Пока замеров нет, мы о них молчим, а не подставляем правдоподобное.