Главная/Цены GPU/Цена токена
ЦЕНЫ / ЦЕНА ТОКЕНА

Сколько стоит миллион токенов

Третья цена рядом с ценой карты и ставкой аренды — и единственная, которая отвечает на вопрос «сколько стоит работа модели». Здесь тарифы российских API из официальной документации и честный расчёт точки, где аренда карты сравнивается с ними.

Коротко

Наблюдаем 3453 ставки у 8 поставщиков API, данные на 02.09.2026: 885 моделей, от российских до зарубежных с оплатой в рублях. Главное здесь — одну и ту же модель поставщики продают по разной цене: у 366 моделей мы видим два и больше ценника, и разница доходит до 17,1 раза. По публичному названию поставщики заявляют одну модель; различия версии, маршрута и режима мы проверяем отдельно. Цена токена на своей карте считается из опубликованных замеров, а не из числа параметров. При полной загрузке карта обгоняет самый дешёвый тариф не всегда: из 84 замеров дешевле выходят 57, дороже — 27. И вся соль в словах «при полной»: карта берёт деньги за всё время, API — только за работу.

Кто продаёт токены и по какой цене

Снято с прайсов поставщиков. Диапазон считается по цене генерации: карта, которую вы арендуете, заменяет собой выработку токенов, а не чтение запроса, и смешивать две стороны тарифа в одном «от … до» значило бы описывать не рынок, а состав выборки. Пакетные тарифы в диапазон не идут — там ответ приходит из очереди.

ПоставщикМоделейДешевле всегоДороже всегоБазаПроверено
RouterAPI 484 0,12 ₽Krea 2 Large 77 957 ₽o1-pro НДС не указан 02.09.2026
RouterAI 335 3,37 ₽Mistral Nemo 67 376 ₽o1-pro НДС не указан 02.09.2026
Polza AI 311 5,94 ₽Llama 3 8B Lunaris 71 332 ₽o1-pro НДС не указан 02.09.2026
AITunnel 179 6 ₽Mistral Nemo 120 000 ₽O1 Pro НДС не указан 02.09.2026
GPTunneL 121 30 ₽Qwen 3 8B 50 400 ₽GPT 5.2 Pro НДС не указан 02.09.2026
GenAPI 90 10 ₽gpt-4.1-nano 45 000 ₽gpt-5.5-pro НДС не указан 02.09.2026
Cloud.ru Foundation Models 85 0,0061 ₽whisper-large-v3 30 744 ₽GPT 5.4 Pro НДС не указан 02.09.2026
GigaChat (Сбер) 3 65 ₽GigaChat Lite 650 ₽GigaChat Max с НДС 02.09.2026

Методология Как мы считаем эти числа: откуда данные, что входит в цену и чего мы не знаем. Что исправляли

Цена по каждой модели отдельно, со всеми поставщиками рядом, — в разделе API нейросетей. Оплата в рублях по договору с российским юрлицом — это то, что даёт поставщик. Место расчёта он не меняет: если модель зарубежная, обращение к ней остаётся трансграничной передачей, как только в задаче появляются персональные данные. Что из этого следует — на странице о правовых требованиях. У тарифа Сбера, кроме того, есть минимальный платёж 600 ₽ в месяц: пока расчёт по токенам меньше этой суммы, платится он.

Открытые модели: чужой API или своя карта

Модели из нашего каталога, чьи веса доступны, — те самые, которые поднимают на арендованной карте. У них вопрос «API или своё» имеет точный смысл: модель одна и та же, отличается только способ её запустить, и допущений о качестве в сравнении нет вовсе.

МодельДешевле всегоДороже всегоПредложений
Qwen3-8B8,2 млрд параметров 30 ₽GPTunneL 57 ₽ RouterAPI 4
Qwen3-32B32,8 млрд параметров 31 ₽RouterAI 148 ₽ Cloud.ru Foundation Models 4
Llama 3.3 70B Instruct70,6 млрд параметров 36 ₽RouterAI 143 ₽ Polza AI 5
Qwen2.5-72B-Instruct72,7 млрд параметров 45 ₽RouterAI 143 ₽ Polza AI 3
DeepSeek-V3684,5 млрд параметров 100 ₽RouterAI 1 000 ₽ GenAPI 5

Методология Как мы считаем эти числа: откуда данные, что входит в цену и чего мы не знаем. Что исправляли

Цена генерации за миллион токенов. Модель каталога, которой в этой таблице нет, у наблюдаемых поставщиков токенами не продаётся — её запускают у себя.

Одна модель — разные ценники

У 366 моделей мы видим больше одного ценника. По публичному названию поставщики заявляют одну и ту же модель — но одинаковое имя не доказывает одинаковую сущность: различаться могут версия, дата релиза, квантование, маршрутизация, режим и лимиты. Поэтому разрыв в цене мы показываем как факт рынка, а не как доказанную наценку: он повод проверить, что именно продаёт каждый, а не готовый вывод. Ниже — 20 строк с самым большим разрывом.

МодельДешевлеДорожеРазница
R14 поставщика 281 ₽RouterAI 4 800 ₽GPTunneL 17,1×
o3-mini6 поставщиков 494 ₽RouterAI 6 600 ₽GenAPI 13,4×
GPT-4.1 Nano7 поставщиков 10 ₽GenAPI 120 ₽GPTunneL 12,0×
gpt-5.6-luna-pro5 поставщиков 135 ₽RouterAI 1 500 ₽GenAPI 11,1×
gpt-5.6-luna6 поставщиков 135 ₽RouterAI 1 500 ₽GenAPI 11,1×
Mistral Nemo3 поставщика 3,37 ₽RouterAI 36 ₽Polza AI 10,6×
Kimi K2.57 поставщиков 238 ₽Polza AI 2 400 ₽GPTunneL 10,1×
deepseek-v35 поставщиков 100 ₽RouterAI 1 000 ₽GenAPI 10,0×
Qwen2.5 Coder 32B Instruct3 поставщика 13 ₽Polza AI 125 ₽RouterAPI 9,6×
deepseek-v3.25 поставщиков 35 ₽RouterAI 330 ₽Cloud.ru Foundation Models 9,5×
MiniMax-M35 поставщиков 108 ₽RouterAI 1 009 ₽Cloud.ru Foundation Models 9,4×
Qwen3 30B A3B Thinking 25073 поставщика 36 ₽Polza AI 301 ₽RouterAPI 8,4×
GPT OSS 120B6 поставщиков 19 ₽RouterAI 150 ₽GPTunneL 7,9×
R1 Distill Llama 70B3 поставщика 13 ₽Polza AI 100 ₽RouterAPI 7,7×
Ministral 8B2 поставщика 14 ₽RouterAPI 100 ₽GPTunneL 7,3×
GPT 4o Mini6 поставщиков 67 ₽RouterAI 480 ₽GPTunneL 7,1×
MythoMax 13B3 поставщика 6,74 ₽RouterAI 48 ₽Polza AI 7,1×
GPT 5.27 поставщиков 524 ₽Polza AI 3 500 ₽GPTunneL 6,7×
GLM-5.26 поставщиков 175 ₽RouterAI 1 100 ₽GenAPI 6,3×
deepseek-v3.2-speciale2 поставщика 54 ₽RouterAPI 330 ₽Cloud.ru Foundation Models 6,1×

Методология Как мы считаем эти числа: откуда данные, что входит в цену и чего мы не знаем. Что исправляли

Разрыв в разы — не всегда переплата: поставщики различаются очередью, лимитами и тем, какой договор готовы подписать. Но начинать разговор о цене стоит зная, что за один и тот же миллион токенов на рынке просят по-разному.

Когда аренда карты сравнивается с API

Считается делением: месячная стоимость аренды ÷ цена миллиона выходных токенов. Результат — объём, который карта обязана выдать за месяц, чтобы плата за неё сравнялась с оплатой генерации у API. ⚠️ Это нижняя граница, а не точка выгоды: ниже неё аренда точно не дешевле, выше — ещё не значит дешевле. В делении нет входных токенов, за которые у API платят отдельно; нет скорости и задержки — карта может такой объём и не выдать; нет загрузки — карта берёт деньги и в простое. Ни одного предположения о производительности здесь нет, и в этом же предел числа: делятся два наблюдаемых числа, а работает не деление, а сервис.

Аренда₽/мес Qwen 3 8BGPTunneLQwen3 32BRouterAILlama 3.3 70B InstructRouterAIQwen2.5 72B InstructRouterAI
L40S FirstVDS 9 095 ₽ из ₽/сутки · НДС не указан 303 млн289 млн253 млн202 млн
RTX 309024 ГБ HOSTKEY 20 000 ₽ наблюдение · НДС не указан 667 млн636 млн557 млн445 млн
RTX 3090 Интелион Облако 24 988 ₽ из 34.23 ₽/час · с НДС 833 млн795 млн695 млн556 млн
RTX 409024 ГБ HOSTKEY 27 000 ₽ наблюдение · НДС не указан 900 млн859 млн751 млн601 млн
L424 ГБ mClouds 32 490 ₽ наблюдение · НДС не указан 1,1 млрд1 млрд904 млн723 млн
RTX 509032 ГБ HOSTKEY 45 900 ₽ наблюдение · НДС не указан 1,5 млрд1,5 млрд1,3 млрд1 млрд

Методология Как мы считаем эти числа: откуда данные, что входит в цену и чего мы не знаем. Что исправляли

Почасовые ставки приведены к месяцу умножением на 730 часов — это допущение о непрерывной загрузке. Карта, взятая на два часа в день, столько не стоит; но и API платится по факту работы, поэтому для сравнения допущение уместное. В таблице видно, откуда получена каждая месячная сумма.

Базы НДС в таблице разные. Тарифы API опубликованы с НДС, часть ставок аренды — без него или без пометки. Домножать на 20 % там, где режим не назван, мы не будем: это была бы догадка. Смещение при этом известно по направлению — реальный порог для аренды выше показанного, то есть API выгоднее, чем выглядит в таблице.

Взяты самые дешёвые из наблюдаемых вариантов аренды среди карт от 24 ГБ памяти — ниже этого объёма языковая модель рабочего размера не помещается, и сравнивать её порог с тарифом было бы бессмысленно, пусть арифметика и сходится. Они дают нижнюю границу требуемого объёма: на карте подороже порог только выше.

Сколько стоит миллион токенов на арендованной карте

Считается из двух наблюдаемых чисел: ставки аренды в час и опубликованной пропускной способности. Свой стенд мы не строили — взяли уже измеренное, и это возможно ровно потому, что публикация приводит условия: модель, длину входа и выхода, число одновременных запросов и фреймворк. Токенов в секунду не бывает «вообще»: на одной карте разброс достигает разов, поэтому каждая строка — это цена при этих условиях, а не свойство карты.

⚠️ Часть замеров сделана на узлах из нескольких карт. Пропускная способность в публикации — это итог всей конфигурации, а ставка аренды — цена одной карты, поэтому стоимость считается за всю конфигурацию целиком. Смешать эти два числа значило бы занизить цену токена во столько раз, сколько карт в узле, — и получить правдоподобный, но неверный вывод.

Здесь карта арендована. Если её купить, счёт устроен иначе: расход разовый, токен — поток, и связать их можно только сроком владения и загрузкой. Этот расчёт — на отдельной странице: миллион токенов на своём железе, при трёх значениях загрузки и рядом с ценой API.

Карта и модельПропускнаяПервый токен СтавкаЗа миллионПротив API
RTX 4090DeepSeek-R1-Distill-Qwen-1.5B 300 запросов · вход 100 / выход 600 · vLLM 9 696 ток./с 34,9 млн/час не приводится 37 ₽/часHOSTKEY 1,06 ₽ дешевле в 28,3×
RTX 4090DeepSeek-R1-Distill-Qwen-1.5B 300 запросов · вход 100 / выход 600 · vLLM 8 266 ток./с 29,8 млн/час не приводится 37 ₽/часHOSTKEY 1,24 ₽ дешевле в 24,1×
RTX 4090Qwen2.5-3B-Instruct 300 запросов · вход 100 / выход 600 · vLLM 7 214 ток./с 26 млн/час не приводится 37 ₽/часHOSTKEY 1,42 ₽ дешевле в 21,1×
RTX 4090Qwen2.5-3B-Instruct 300 запросов · вход 100 / выход 600 · vLLM 6 980 ток./с 25,1 млн/час не приводится 37 ₽/часHOSTKEY 1,47 ₽ дешевле в 20,4×
RTX 4090DeepSeek-R1-Distill-Qwen-7B 300 запросов · вход 100 / выход 600 · vLLM 4 173 ток./с 15 млн/час не приводится 37 ₽/часHOSTKEY 2,46 ₽ дешевле в 12,2×
RTX 4090Qwen2.5-VL-7B-Instruct 300 запросов · вход 100 / выход 600 · vLLM 4 055 ток./с 14,6 млн/час не приводится 37 ₽/часHOSTKEY 2,53 ₽ дешевле в 11,8×
RTX 4090Qwen2.5-VL-7B-Instruct 300 запросов · вход 100 / выход 600 · vLLM 4 009 ток./с 14,4 млн/час не приводится 37 ₽/часHOSTKEY 2,56 ₽ дешевле в 11,7×
RTX 4090DeepSeek-R1-Distill-Qwen-7B 300 запросов · вход 100 / выход 600 · vLLM 3 965 ток./с 14,3 млн/час не приводится 37 ₽/часHOSTKEY 2,59 ₽ дешевле в 11,6×
RTX PRO 2000DeepSeek-R1-Distill-Qwen-1.5B 50 запросов · вход 100 / выход 600 · vLLM 1 988 ток./с 7,2 млн/час 0,15 с 25 ₽/часHOSTKEY 3,54 ₽ дешевле в 8,5×
RTX PRO 2000Qwen2.5-1.5B-Instruct 50 запросов · вход 100 / выход 600 · vLLM 1 927 ток./с 6,9 млн/час 0,46 с 25 ₽/часHOSTKEY 3,65 ₽ дешевле в 8,2×
RTX 4090DeepSeek-R1-Distill-Llama-8B 300 запросов · вход 100 / выход 600 · vLLM 2 769 ток./с 10 млн/час не приводится 37 ₽/часHOSTKEY 3,71 ₽ дешевле в 8,1×
RTX 4090DeepSeek-R1-Distill-Llama-8B 300 запросов · вход 100 / выход 600 · vLLM 2 700 ток./с 9,7 млн/час не приводится 37 ₽/часHOSTKEY 3,81 ₽ дешевле в 7,9×
RTX 5090Qwen3-Coder-30B-A3B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM 4 570 ток./с 16,5 млн/час не приводится 63 ₽/часHOSTKEY 3,82 ₽ дешевле в 7,8×
RTX PRO 2000Qwen3-VL-2B-Instruct 50 запросов · вход 100 / выход 600 · vLLM 1 630 ток./с 5,9 млн/час 0,16 с 25 ₽/часHOSTKEY 4,32 ₽ дешевле в 6,9×
RTX PRO 6000 BlackwellQwen3-Coder-30B-A3B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM 8 425 ток./с 30,3 млн/час не приводится 133 ₽/часCloud4Y 4,39 ₽ дешевле в 6,8×
RTX 4090Qwen3-Coder-30B-A3B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM 2 259 ток./с 8,1 млн/час не приводится 37 ₽/часHOSTKEY 4,55 ₽ дешевле в 6,6×
RTX 4090Qwen3-Coder-30B-A3B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM 8 903 ток./с на 4 картах · 32,1 млн/час не приводится 148 ₽/часHOSTKEY · за 4 карты 4,62 ₽ дешевле в 6,5×
RTX 5090Qwen3-Coder-30B-A3B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM 12 744 ток./с на 4 картах · 45,9 млн/час не приводится 252 ₽/часHOSTKEY · за 4 карты 5,48 ₽ дешевле в 5,5×
A100DeepSeek-R1-Distill-Qwen-7B 300 запросов · вход 100 / выход 600 · vLLM 8 031 ток./с 28,9 млн/час 1,54 с 164 ₽/часHOSTKEY 5,69 ₽ дешевле в 5,3×
RTX 4090gemma-2-9b-it 300 запросов · вход 100 / выход 600 · vLLM 1 663 ток./с 6 млн/час не приводится 37 ₽/часHOSTKEY 6,18 ₽ дешевле в 4,9×
RTX PRO 2000Qwen3-4B 50 запросов · вход 100 / выход 600 · vLLM 1 094 ток./с 3,9 млн/час 0,24 с 25 ₽/часHOSTKEY 6,43 ₽ дешевле в 4,7×
A100DeepSeek-R1-Distill-Llama-8B 300 запросов · вход 100 / выход 600 · vLLM 6 842 ток./с 24,6 млн/час 1,66 с 164 ₽/часHOSTKEY 6,67 ₽ дешевле в 4,5×
H100DeepSeek-R1-Distill-Qwen-7B 300 запросов · вход 100 / выход 600 · vLLM 7 315 ток./с 26,3 млн/час не приводится 199 ₽/часHOSTKEY 7,54 ₽ дешевле в 4,0×
RTX A6000DeepSeek-R1-Distill-Llama-8B 100 запросов · вход 100 / выход 600 · vLLM 2 865 ток./с 10,3 млн/час 0,59 с 79 ₽/часHOSTKEY 7,7 ₽ дешевле в 3,9×
H100DeepSeek-R1-Distill-Qwen-7B 300 запросов · вход 100 / выход 600 · vLLM 6 882 ток./с 24,8 млн/час не приводится 199 ₽/часHOSTKEY 8,02 ₽ дешевле в 3,7×
RTX A6000Qwen2.5-7B-Instruct 100 запросов · вход 100 / выход 600 · vLLM 2 662 ток./с 9,6 млн/час 0,41 с 79 ₽/часHOSTKEY 8,29 ₽ дешевле в 3,6×
RTX A6000Llama-3.1-8B-Instruct 100 запросов · вход 100 / выход 600 · vLLM 2 659 ток./с 9,6 млн/час 0,54 с 79 ₽/часHOSTKEY 8,3 ₽ дешевле в 3,6×
H100DeepSeek-R1-Distill-Llama-8B 300 запросов · вход 100 / выход 600 · vLLM 6 488 ток./с 23,4 млн/час не приводится 199 ₽/часHOSTKEY 8,5 ₽ дешевле в 3,5×
H100DeepSeek-R1-Distill-Llama-8B 300 запросов · вход 100 / выход 600 · vLLM 5 934 ток./с 21,4 млн/час не приводится 199 ₽/часHOSTKEY 9,3 ₽ дешевле в 3,2×
RTX PRO 2000gemma-3-4b-it 50 запросов · вход 100 / выход 600 · vLLM 730 ток./с 2,6 млн/час 2,9 с 25 ₽/часHOSTKEY 9,64 ₽ дешевле в 3,1×
A100DeepSeek-R1-Distill-Qwen-14B 300 запросов · вход 100 / выход 600 · vLLM 4 187 ток./с 15,1 млн/час 2,57 с 164 ₽/часHOSTKEY 11 ₽ дешевле в 2,8×
H100DeepSeek-R1-Distill-Qwen-14B 300 запросов · вход 100 / выход 600 · vLLM 4 821 ток./с 17,4 млн/час не приводится 199 ₽/часHOSTKEY 11 ₽ дешевле в 2,6×
RTX PRO 6000 BlackwellDeepSeek-R1-Distill-Llama-8B 50 запросов · вход 100 / выход 600 · vLLM 3 210 ток./с 11,6 млн/час 0,28 с 133 ₽/часCloud4Y 12 ₽ дешевле в 2,6×
RTX PRO 6000 BlackwellLlama-3.1-8B 50 запросов · вход 100 / выход 600 · vLLM 3 196 ток./с 11,5 млн/час 0,33 с 133 ₽/часCloud4Y 12 ₽ дешевле в 2,6×
RTX PRO 6000 BlackwellGLM-4.5-Air число запросов не названо · вход 1000 / выход 1000 · vLLM 3 169 ток./с 11,4 млн/час не приводится 133 ₽/часCloud4Y 12 ₽ дешевле в 2,6×
RTX PRO 6000 BlackwellQwen3-8B 50 запросов · вход 100 / выход 600 · vLLM 3 101 ток./с 11,2 млн/час 0,32 с 133 ₽/часCloud4Y 12 ₽ дешевле в 2,5×
H100DeepSeek-R1-Distill-Qwen-14B 300 запросов · вход 100 / выход 600 · vLLM 4 304 ток./с 15,5 млн/час не приводится 199 ₽/часHOSTKEY 13 ₽ дешевле в 2,3×
H100gemma-2-9b-it 300 запросов · вход 100 / выход 600 · vLLM 4 193 ток./с 15,1 млн/час не приводится 199 ₽/часHOSTKEY 13 ₽ дешевле в 2,3×
RTX A6000DeepSeek-R1-Distill-Llama-8B 50 запросов · вход 100 / выход 600 · vLLM 1 644 ток./с 5,9 млн/час 0,65 с 79 ₽/часHOSTKEY 13 ₽ дешевле в 2,2×
A100DeepSeek-R1-Distill-Qwen-7B 50 запросов · вход 100 / выход 600 · vLLM 3 363 ток./с 12,1 млн/час 0,31 с 164 ₽/часHOSTKEY 14 ₽ дешевле в 2,2×
RTX A6000Qwen2.5-7B-Instruct 50 запросов · вход 100 / выход 600 · vLLM 1 618 ток./с 5,8 млн/час 0,58 с 79 ₽/часHOSTKEY 14 ₽ дешевле в 2,2×
RTX A6000Llama-3.1-8B-Instruct 50 запросов · вход 100 / выход 600 · vLLM 1 493 ток./с 5,4 млн/час 0,59 с 79 ₽/часHOSTKEY 15 ₽ дешевле в 2,0×
RTX 5090GLM-4.5-Air число запросов не названо · вход 1000 / выход 1000 · vLLM 4 622 ток./с на 4 картах · 16,6 млн/час не приводится 252 ₽/часHOSTKEY · за 4 карты 15 ₽ дешевле в 2,0×
A100DeepSeek-R1-Distill-Llama-8B 50 запросов · вход 100 / выход 600 · vLLM 3 004 ток./с 10,8 млн/час 0,33 с 164 ₽/часHOSTKEY 15 ₽ дешевле в 2,0×
H100gemma-2-9b-it 300 запросов · вход 100 / выход 600 · vLLM 3 270 ток./с 11,8 млн/час не приводится 199 ₽/часHOSTKEY 17 ₽ дешевле в 1,8×
A100gemma-2-9b-it 300 запросов · вход 100 / выход 600 · vLLM 2 698 ток./с 9,7 млн/час 1,74 с 164 ₽/часHOSTKEY 17 ₽ дешевле в 1,8×
RTX A6000DeepSeek-R1-Distill-Qwen-14B 100 запросов · вход 100 / выход 600 · vLLM 1 294 ток./с 4,7 млн/час 1,67 с 79 ₽/часHOSTKEY 17 ₽ дешевле в 1,8×
RTX A6000Qwen2.5-14B-Instruct 100 запросов · вход 100 / выход 600 · vLLM 1 238 ток./с 4,5 млн/час 0,8 с 79 ₽/часHOSTKEY 18 ₽ дешевле в 1,7×
RTX PRO 6000 BlackwellQwen3-14B 50 запросов · вход 100 / выход 600 · vLLM 2 034 ток./с 7,3 млн/час 0,51 с 133 ₽/часCloud4Y 18 ₽ дешевле в 1,6×
RTX PRO 6000 BlackwellDeepSeek-R1-Distill-Qwen-14B 50 запросов · вход 100 / выход 600 · vLLM 1 873 ток./с 6,7 млн/час 0,51 с 133 ₽/часCloud4Y 20 ₽ дешевле в 1,5×
RTX PRO 6000 Blackwellgemma-3-12b-it 50 запросов · вход 100 / выход 600 · vLLM 1 817 ток./с 6,5 млн/час 0,44 с 133 ₽/часCloud4Y 20 ₽ дешевле в 1,5×
RTX 4090gemma-2-9b-it 300 запросов · вход 100 / выход 600 · vLLM 473 ток./с 1,7 млн/час не приводится 37 ₽/часHOSTKEY 22 ₽ дешевле в 1,4×
RTX 4090GLM-4.5-Air число запросов не названо · вход 1000 / выход 1000 · vLLM 1 731 ток./с на 4 картах · 6,2 млн/час не приводится 148 ₽/часHOSTKEY · за 4 карты 24 ₽ дешевле в 1,3×
H100gemma-2-27b-it 300 запросов · вход 100 / выход 600 · vLLM 2 271 ток./с 8,2 млн/час не приводится 199 ₽/часHOSTKEY 24 ₽ дешевле в 1,2×
A100gemma-2-9b-it 50 запросов · вход 100 / выход 600 · vLLM 1 868 ток./с 6,7 млн/час 0,41 с 164 ₽/часHOSTKEY 24 ₽ дешевле в 1,2×
RTX A6000Qwen2.5-14B-Instruct 50 запросов · вход 100 / выход 600 · vLLM 833 ток./с 3 млн/час 1,1 с 79 ₽/часHOSTKEY 26 ₽ дешевле в 1,1×
RTX 5090Llama-3.3-70B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM 1 230 ток./с на 2 картах · 4,4 млн/час не приводится 126 ₽/часHOSTKEY · за 2 карты 28 ₽ дешевле в 1,1×
H100gemma-2-27b-it 300 запросов · вход 100 / выход 600 · vLLM 1 837 ток./с 6,6 млн/час не приводится 199 ₽/часHOSTKEY 30 ₽ дороже в 1,0×
A100gemma-2-27b-it 300 запросов · вход 100 / выход 600 · vLLM 1 509 ток./с 5,4 млн/час 4,31 с 164 ₽/часHOSTKEY 30 ₽ дороже в 1,0×
RTX A6000DeepSeek-R1-Distill-Qwen-14B 50 запросов · вход 100 / выход 600 · vLLM 727 ток./с 2,6 млн/час 0,47 с 79 ₽/часHOSTKEY 30 ₽ дороже в 1,0×
A100DeepSeek-R1-Distill-Qwen-14B 50 запросов · вход 100 / выход 600 · vLLM 1 450 ток./с 5,2 млн/час 0,58 с 164 ₽/часHOSTKEY 31 ₽ дороже в 1,0×
RTX PRO 6000 BlackwellLlama-3.3-70B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM 1 031 ток./с 3,7 млн/час не приводится 133 ₽/часCloud4Y 36 ₽ дороже в 1,2×
H100DeepSeek-R1-Distill-Qwen-32B 300 запросов · вход 100 / выход 600 · vLLM 1 482 ток./с 5,3 млн/час не приводится 199 ₽/часHOSTKEY 37 ₽ дороже в 1,2×
RTX PRO 6000 BlackwellDeepSeek-R1-Distill-Qwen-32B 50 запросов · вход 100 / выход 600 · vLLM 966 ток./с 3,5 млн/час 1 с 133 ₽/часCloud4Y 38 ₽ дороже в 1,3×
H100DeepSeek-R1-Distill-Qwen-32B 300 запросов · вход 100 / выход 600 · vLLM 1 391 ток./с 5 млн/час не приводится 199 ₽/часHOSTKEY 40 ₽ дороже в 1,3×
RTX PRO 6000 BlackwellQwen3-VL-32B-Instruct 50 запросов · вход 100 / выход 600 · vLLM 929 ток./с 3,3 млн/час 1,05 с 133 ₽/часCloud4Y 40 ₽ дороже в 1,3×
RTX 4090Llama-3.3-70B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM 467 ток./с на 2 картах · 1,7 млн/час не приводится 74 ₽/часHOSTKEY · за 2 карты 44 ₽ дороже в 1,5×
A100DeepSeek-R1-Distill-Qwen-32B 300 запросов · вход 100 / выход 600 · vLLM 721 ток./с 2,6 млн/час 67 с 164 ₽/часHOSTKEY 63 ₽ дороже в 2,1×
A100QwQ-32B 300 запросов · вход 100 / выход 600 · vLLM 703 ток./с 2,5 млн/час 94 с 164 ₽/часHOSTKEY 65 ₽ дороже в 2,2×
A100QwQ-32B 50 запросов · вход 100 / выход 600 · vLLM 615 ток./с 2,2 млн/час 1,3 с 164 ₽/часHOSTKEY 74 ₽ дороже в 2,5×
A100DeepSeek-R1-Distill-Qwen-32B 50 запросов · вход 100 / выход 600 · vLLM 577 ток./с 2,1 млн/час 1,3 с 164 ₽/часHOSTKEY 79 ₽ дороже в 2,6×
A100gemma-2-27b-it 50 запросов · вход 100 / выход 600 · vLLM 496 ток./с 1,8 млн/час 1,11 с 164 ₽/часHOSTKEY 92 ₽ дороже в 3,1×
RTX PRO 6000 BlackwellGLM-4.5-Air число запросов не названо · вход 8000 / выход 8000 · vLLM 2 291 ток./с на 8 картах · 8,2 млн/час не приводится 1 066 ₽/часCloud4Y · за 8 карты 129 ₽ дороже в 4,3×
H100GLM-4.6 число запросов не названо · вход 8000 / выход 8000 · vLLM 2 834 ток./с на 8 картах · 10,2 млн/час не приводится 1 589 ₽/часHOSTKEY · за 8 карты 156 ₽ дороже в 5,2×
H100GLM-4.5-Air число запросов не названо · вход 8000 / выход 8000 · vLLM 2 556 ток./с на 8 картах · 9,2 млн/час не приводится 1 589 ₽/часHOSTKEY · за 8 карты 173 ₽ дороже в 5,8×
RTX PRO 6000 BlackwellGLM-4.6 число запросов не названо · вход 8000 / выход 8000 · vLLM 1 652 ток./с на 8 картах · 5,9 млн/час не приводится 1 066 ₽/часCloud4Y · за 8 карты 179 ₽ дороже в 6,0×
RTX PRO 6000 BlackwellQwen3-Coder-480B-A35B число запросов не названо · вход 8000 / выход 8000 · vLLM 1 603 ток./с на 8 картах · 5,8 млн/час не приводится 1 066 ₽/часCloud4Y · за 8 карты 185 ₽ дороже в 6,2×
H100Qwen3-Coder-480B-A35B число запросов не названо · вход 8000 / выход 8000 · vLLM 2 329 ток./с на 8 картах · 8,4 млн/час не приводится 1 589 ₽/часHOSTKEY · за 8 карты 190 ₽ дороже в 6,3×
H200GLM-4.6 число запросов не названо · вход 8000 / выход 8000 · vLLM 5 588 ток./с на 8 картах · 20,1 млн/час не приводится 4 557 ₽/часSelectel · за 8 карты 227 ₽ дороже в 7,6×
H200GLM-4.5-Air число запросов не названо · вход 8000 / выход 8000 · vLLM 5 463 ток./с на 8 картах · 19,7 млн/час не приводится 4 557 ₽/часSelectel · за 8 карты 232 ₽ дороже в 7,7×
B200GLM-4.5-Air число запросов не названо · вход 8000 / выход 8000 · vLLM 9 675 ток./с на 8 картах · 34,8 млн/час не приводится 8 984 ₽/часCloud4Y · за 8 карты 258 ₽ дороже в 8,6×
H200Qwen3-Coder-480B-A35B число запросов не названо · вход 8000 / выход 8000 · vLLM 4 263 ток./с на 8 картах · 15,3 млн/час не приводится 4 557 ₽/часSelectel · за 8 карты 297 ₽ дороже в 9,9×
B200GLM-4.6 число запросов не названо · вход 8000 / выход 8000 · vLLM 8 037 ток./с на 8 картах · 28,9 млн/час не приводится 8 984 ₽/часCloud4Y · за 8 карты 311 ₽ дороже в 10,4×
B200Qwen3-Coder-480B-A35B число запросов не названо · вход 8000 / выход 8000 · vLLM 6 438 ток./с на 8 картах · 23,2 млн/час не приводится 8 984 ₽/часCloud4Y · за 8 карты 388 ₽ дороже в 12,9×

Методология Как мы считаем эти числа: откуда данные, что входит в цену и чего мы не знаем. Что исправляли

Строки, отмеченные полосой, — про ловушку. Пропускная способность там выше, чем при меньшей нагрузке, а время до первого токена вырастает до десятков секунд. Для пакетной обработки такой режим годится, для живого диалога — нет. Считать по нему цену токена можно, обещать по нему сервис — нельзя.

Сравнение «против API» идёт с самым дешёвым тарифом — Qwen 3 8B, 30 ₽ за миллион. Это самая тяжёлая планка для своего железа: против дорогих моделей поставщика карта выигрывает заметно легче.

Замеры чужие, и мы их не усредняем. Сложить публикации с разными условиями и вывести «среднее по рынку» означало бы придумать число, которого никто не измерял. Источник и дата — у каждой строки ниже.

Откуда взяты замеры (84 запуска, 2 публикации)

Что из этого следует

Всё решает загрузка, а не цена карты. Даже без простоя карта бьёт самый дешёвый тариф не всегда: из 84 замеров дешевле выходят 57, дороже — 27. Порог из таблицы выше переводится в часы просто: сотни миллионов токенов в месяц набираются примерно за сутки непрерывной работы под полной нагрузкой. Не наберёте такую загрузку — платите за простой, и выигрывает API уже без вариантов; наберёте — считайте по своей связке карты и модели, потому что выигрыш есть не у всякой.
Цена токена — не цена качества. В таблице замеров рядом стоят модель на три миллиарда параметров и тариф поставщика, за которым модель другого класса. Сравнивать их по рублю за миллион можно, делать вывод «то же самое, только дешевле» — нельзя. Сначала проверяется, решает ли модель вашу задачу, и только потом считается её цена.
Своё железо выбирают не по цене токена. Его выбирают, когда данные нельзя отдавать наружу, когда нужно дообучение на своих документах или работа без интернета. Для государственных учреждений это вообще не вопрос экономики: требования ФСТЭК с 1 марта 2026 года запрещают передавать разработчику модели сведения ограниченного доступа.
Проверять сценарий дешевле на арендованной карте. Загрузку заранее не знает никто: она выясняется на живом сервисе за пару недель. Взять карту в аренду, померить свой реальный поток и уже потом решать про покупку — это на порядок дешевле, чем купить и обнаружить, что она простаивает.
Пропускная способность — не то же самое, что работоспособность. В замерах ниже есть случай, где триста одновременных запросов дают больше токенов в секунду, чем пятьдесят, — а первого слова приходится ждать больше минуты. Число выросло, сервис умер. Поэтому время до первого токена показано рядом с пропускной способностью и в выводах не теряется.

Частые вопросы

Из опубликованных замеров сторонних лабораторий и площадок. Своего стенда мы не строили осознанно: чужие измерения годятся ровно тогда, когда публикация приводит условия — модель, длину входа и выхода, число одновременных запросов и фреймворк. Без условий число токенов в секунду пустое: на одной карте разброс достигает разов. Источник и дата стоят у каждой строки, а усреднять замеры с разными условиями мы не будем — это означало бы придумать число, которого никто не измерял.