Сколько стоит миллион токенов
Третья цена рядом с ценой карты и ставкой аренды — и единственная, которая отвечает на вопрос «сколько стоит работа модели». Здесь тарифы российских API из официальной документации и честный расчёт точки, где аренда карты сравнивается с ними.
Наблюдаем 3453 ставки у 8 поставщиков API, данные на 02.09.2026: 885 моделей, от российских до зарубежных с оплатой в рублях. Главное здесь — одну и ту же модель поставщики продают по разной цене: у 366 моделей мы видим два и больше ценника, и разница доходит до 17,1 раза. По публичному названию поставщики заявляют одну модель; различия версии, маршрута и режима мы проверяем отдельно. Цена токена на своей карте считается из опубликованных замеров, а не из числа параметров. При полной загрузке карта обгоняет самый дешёвый тариф не всегда: из 84 замеров дешевле выходят 57, дороже — 27. И вся соль в словах «при полной»: карта берёт деньги за всё время, API — только за работу.
Кто продаёт токены и по какой цене
Снято с прайсов поставщиков. Диапазон считается по цене генерации: карта, которую вы арендуете, заменяет собой выработку токенов, а не чтение запроса, и смешивать две стороны тарифа в одном «от … до» значило бы описывать не рынок, а состав выборки. Пакетные тарифы в диапазон не идут — там ответ приходит из очереди.
| Поставщик | Моделей | Дешевле всего | Дороже всего | База | Проверено |
|---|---|---|---|---|---|
| RouterAPI | 484 | 0,12 ₽Krea 2 Large | 77 957 ₽o1-pro | НДС не указан | 02.09.2026 |
| RouterAI | 335 | 3,37 ₽Mistral Nemo | 67 376 ₽o1-pro | НДС не указан | 02.09.2026 |
| Polza AI | 311 | 5,94 ₽Llama 3 8B Lunaris | 71 332 ₽o1-pro | НДС не указан | 02.09.2026 |
| AITunnel | 179 | 6 ₽Mistral Nemo | 120 000 ₽O1 Pro | НДС не указан | 02.09.2026 |
| GPTunneL | 121 | 30 ₽Qwen 3 8B | 50 400 ₽GPT 5.2 Pro | НДС не указан | 02.09.2026 |
| GenAPI | 90 | 10 ₽gpt-4.1-nano | 45 000 ₽gpt-5.5-pro | НДС не указан | 02.09.2026 |
| Cloud.ru Foundation Models | 85 | 0,0061 ₽whisper-large-v3 | 30 744 ₽GPT 5.4 Pro | НДС не указан | 02.09.2026 |
| GigaChat (Сбер) | 3 | 65 ₽GigaChat Lite | 650 ₽GigaChat Max | с НДС | 02.09.2026 |
Методология Как мы считаем эти числа: откуда данные, что входит в цену и чего мы не знаем. Что исправляли
Цена по каждой модели отдельно, со всеми поставщиками рядом, — в разделе API нейросетей. Оплата в рублях по договору с российским юрлицом — это то, что даёт поставщик. Место расчёта он не меняет: если модель зарубежная, обращение к ней остаётся трансграничной передачей, как только в задаче появляются персональные данные. Что из этого следует — на странице о правовых требованиях. У тарифа Сбера, кроме того, есть минимальный платёж 600 ₽ в месяц: пока расчёт по токенам меньше этой суммы, платится он.
Открытые модели: чужой API или своя карта
Модели из нашего каталога, чьи веса доступны, — те самые, которые поднимают на арендованной карте. У них вопрос «API или своё» имеет точный смысл: модель одна и та же, отличается только способ её запустить, и допущений о качестве в сравнении нет вовсе.
| Модель | Дешевле всего | Дороже всего | Предложений |
|---|---|---|---|
| Qwen3-8B8,2 млрд параметров | 30 ₽GPTunneL | 57 ₽ RouterAPI | 4 |
| Qwen3-32B32,8 млрд параметров | 31 ₽RouterAI | 148 ₽ Cloud.ru Foundation Models | 4 |
| Llama 3.3 70B Instruct70,6 млрд параметров | 36 ₽RouterAI | 143 ₽ Polza AI | 5 |
| Qwen2.5-72B-Instruct72,7 млрд параметров | 45 ₽RouterAI | 143 ₽ Polza AI | 3 |
| DeepSeek-V3684,5 млрд параметров | 100 ₽RouterAI | 1 000 ₽ GenAPI | 5 |
Методология Как мы считаем эти числа: откуда данные, что входит в цену и чего мы не знаем. Что исправляли
Цена генерации за миллион токенов. Модель каталога, которой в этой таблице нет, у наблюдаемых поставщиков токенами не продаётся — её запускают у себя.
Одна модель — разные ценники
У 366 моделей мы видим больше одного ценника. По публичному названию поставщики заявляют одну и ту же модель — но одинаковое имя не доказывает одинаковую сущность: различаться могут версия, дата релиза, квантование, маршрутизация, режим и лимиты. Поэтому разрыв в цене мы показываем как факт рынка, а не как доказанную наценку: он повод проверить, что именно продаёт каждый, а не готовый вывод. Ниже — 20 строк с самым большим разрывом.
| Модель | Дешевле | Дороже | Разница |
|---|---|---|---|
| R14 поставщика | 281 ₽RouterAI | 4 800 ₽GPTunneL | 17,1× |
| o3-mini6 поставщиков | 494 ₽RouterAI | 6 600 ₽GenAPI | 13,4× |
| GPT-4.1 Nano7 поставщиков | 10 ₽GenAPI | 120 ₽GPTunneL | 12,0× |
| gpt-5.6-luna-pro5 поставщиков | 135 ₽RouterAI | 1 500 ₽GenAPI | 11,1× |
| gpt-5.6-luna6 поставщиков | 135 ₽RouterAI | 1 500 ₽GenAPI | 11,1× |
| Mistral Nemo3 поставщика | 3,37 ₽RouterAI | 36 ₽Polza AI | 10,6× |
| Kimi K2.57 поставщиков | 238 ₽Polza AI | 2 400 ₽GPTunneL | 10,1× |
| deepseek-v35 поставщиков | 100 ₽RouterAI | 1 000 ₽GenAPI | 10,0× |
| Qwen2.5 Coder 32B Instruct3 поставщика | 13 ₽Polza AI | 125 ₽RouterAPI | 9,6× |
| deepseek-v3.25 поставщиков | 35 ₽RouterAI | 330 ₽Cloud.ru Foundation Models | 9,5× |
| MiniMax-M35 поставщиков | 108 ₽RouterAI | 1 009 ₽Cloud.ru Foundation Models | 9,4× |
| Qwen3 30B A3B Thinking 25073 поставщика | 36 ₽Polza AI | 301 ₽RouterAPI | 8,4× |
| GPT OSS 120B6 поставщиков | 19 ₽RouterAI | 150 ₽GPTunneL | 7,9× |
| R1 Distill Llama 70B3 поставщика | 13 ₽Polza AI | 100 ₽RouterAPI | 7,7× |
| Ministral 8B2 поставщика | 14 ₽RouterAPI | 100 ₽GPTunneL | 7,3× |
| GPT 4o Mini6 поставщиков | 67 ₽RouterAI | 480 ₽GPTunneL | 7,1× |
| MythoMax 13B3 поставщика | 6,74 ₽RouterAI | 48 ₽Polza AI | 7,1× |
| GPT 5.27 поставщиков | 524 ₽Polza AI | 3 500 ₽GPTunneL | 6,7× |
| GLM-5.26 поставщиков | 175 ₽RouterAI | 1 100 ₽GenAPI | 6,3× |
| deepseek-v3.2-speciale2 поставщика | 54 ₽RouterAPI | 330 ₽Cloud.ru Foundation Models | 6,1× |
Методология Как мы считаем эти числа: откуда данные, что входит в цену и чего мы не знаем. Что исправляли
Разрыв в разы — не всегда переплата: поставщики различаются очередью, лимитами и тем, какой договор готовы подписать. Но начинать разговор о цене стоит зная, что за один и тот же миллион токенов на рынке просят по-разному.
Когда аренда карты сравнивается с API
Считается делением: месячная стоимость аренды ÷ цена миллиона выходных токенов. Результат — объём, который карта обязана выдать за месяц, чтобы плата за неё сравнялась с оплатой генерации у API. ⚠️ Это нижняя граница, а не точка выгоды: ниже неё аренда точно не дешевле, выше — ещё не значит дешевле. В делении нет входных токенов, за которые у API платят отдельно; нет скорости и задержки — карта может такой объём и не выдать; нет загрузки — карта берёт деньги и в простое. Ни одного предположения о производительности здесь нет, и в этом же предел числа: делятся два наблюдаемых числа, а работает не деление, а сервис.
| Аренда | ₽/мес | Qwen 3 8BGPTunneL | Qwen3 32BRouterAI | Llama 3.3 70B InstructRouterAI | Qwen2.5 72B InstructRouterAI |
|---|---|---|---|---|---|
| L40S FirstVDS | 9 095 ₽ из ₽/сутки · НДС не указан | 303 млн | 289 млн | 253 млн | 202 млн |
| RTX 309024 ГБ HOSTKEY | 20 000 ₽ наблюдение · НДС не указан | 667 млн | 636 млн | 557 млн | 445 млн |
| RTX 3090 Интелион Облако | 24 988 ₽ из 34.23 ₽/час · с НДС | 833 млн | 795 млн | 695 млн | 556 млн |
| RTX 409024 ГБ HOSTKEY | 27 000 ₽ наблюдение · НДС не указан | 900 млн | 859 млн | 751 млн | 601 млн |
| L424 ГБ mClouds | 32 490 ₽ наблюдение · НДС не указан | 1,1 млрд | 1 млрд | 904 млн | 723 млн |
| RTX 509032 ГБ HOSTKEY | 45 900 ₽ наблюдение · НДС не указан | 1,5 млрд | 1,5 млрд | 1,3 млрд | 1 млрд |
Методология Как мы считаем эти числа: откуда данные, что входит в цену и чего мы не знаем. Что исправляли
Почасовые ставки приведены к месяцу умножением на 730 часов — это допущение о непрерывной загрузке. Карта, взятая на два часа в день, столько не стоит; но и API платится по факту работы, поэтому для сравнения допущение уместное. В таблице видно, откуда получена каждая месячная сумма.
Базы НДС в таблице разные. Тарифы API опубликованы с НДС, часть ставок аренды — без него или без пометки. Домножать на 20 % там, где режим не назван, мы не будем: это была бы догадка. Смещение при этом известно по направлению — реальный порог для аренды выше показанного, то есть API выгоднее, чем выглядит в таблице.
Взяты самые дешёвые из наблюдаемых вариантов аренды среди карт от 24 ГБ памяти — ниже этого объёма языковая модель рабочего размера не помещается, и сравнивать её порог с тарифом было бы бессмысленно, пусть арифметика и сходится. Они дают нижнюю границу требуемого объёма: на карте подороже порог только выше.
Сколько стоит миллион токенов на арендованной карте
Считается из двух наблюдаемых чисел: ставки аренды в час и опубликованной пропускной способности. Свой стенд мы не строили — взяли уже измеренное, и это возможно ровно потому, что публикация приводит условия: модель, длину входа и выхода, число одновременных запросов и фреймворк. Токенов в секунду не бывает «вообще»: на одной карте разброс достигает разов, поэтому каждая строка — это цена при этих условиях, а не свойство карты.
⚠️ Часть замеров сделана на узлах из нескольких карт. Пропускная способность в публикации — это итог всей конфигурации, а ставка аренды — цена одной карты, поэтому стоимость считается за всю конфигурацию целиком. Смешать эти два числа значило бы занизить цену токена во столько раз, сколько карт в узле, — и получить правдоподобный, но неверный вывод.
Здесь карта арендована. Если её купить, счёт устроен иначе: расход разовый, токен — поток, и связать их можно только сроком владения и загрузкой. Этот расчёт — на отдельной странице: миллион токенов на своём железе, при трёх значениях загрузки и рядом с ценой API.
| Карта и модель | Пропускная | Первый токен | Ставка | За миллион | Против API |
|---|---|---|---|---|---|
| RTX 4090DeepSeek-R1-Distill-Qwen-1.5B 300 запросов · вход 100 / выход 600 · vLLM | 9 696 ток./с 34,9 млн/час | не приводится | 37 ₽/часHOSTKEY | 1,06 ₽ | дешевле в 28,3× |
| RTX 4090DeepSeek-R1-Distill-Qwen-1.5B 300 запросов · вход 100 / выход 600 · vLLM | 8 266 ток./с 29,8 млн/час | не приводится | 37 ₽/часHOSTKEY | 1,24 ₽ | дешевле в 24,1× |
| RTX 4090Qwen2.5-3B-Instruct 300 запросов · вход 100 / выход 600 · vLLM | 7 214 ток./с 26 млн/час | не приводится | 37 ₽/часHOSTKEY | 1,42 ₽ | дешевле в 21,1× |
| RTX 4090Qwen2.5-3B-Instruct 300 запросов · вход 100 / выход 600 · vLLM | 6 980 ток./с 25,1 млн/час | не приводится | 37 ₽/часHOSTKEY | 1,47 ₽ | дешевле в 20,4× |
| RTX 4090DeepSeek-R1-Distill-Qwen-7B 300 запросов · вход 100 / выход 600 · vLLM | 4 173 ток./с 15 млн/час | не приводится | 37 ₽/часHOSTKEY | 2,46 ₽ | дешевле в 12,2× |
| RTX 4090Qwen2.5-VL-7B-Instruct 300 запросов · вход 100 / выход 600 · vLLM | 4 055 ток./с 14,6 млн/час | не приводится | 37 ₽/часHOSTKEY | 2,53 ₽ | дешевле в 11,8× |
| RTX 4090Qwen2.5-VL-7B-Instruct 300 запросов · вход 100 / выход 600 · vLLM | 4 009 ток./с 14,4 млн/час | не приводится | 37 ₽/часHOSTKEY | 2,56 ₽ | дешевле в 11,7× |
| RTX 4090DeepSeek-R1-Distill-Qwen-7B 300 запросов · вход 100 / выход 600 · vLLM | 3 965 ток./с 14,3 млн/час | не приводится | 37 ₽/часHOSTKEY | 2,59 ₽ | дешевле в 11,6× |
| RTX PRO 2000DeepSeek-R1-Distill-Qwen-1.5B 50 запросов · вход 100 / выход 600 · vLLM | 1 988 ток./с 7,2 млн/час | 0,15 с | 25 ₽/часHOSTKEY | 3,54 ₽ | дешевле в 8,5× |
| RTX PRO 2000Qwen2.5-1.5B-Instruct 50 запросов · вход 100 / выход 600 · vLLM | 1 927 ток./с 6,9 млн/час | 0,46 с | 25 ₽/часHOSTKEY | 3,65 ₽ | дешевле в 8,2× |
| RTX 4090DeepSeek-R1-Distill-Llama-8B 300 запросов · вход 100 / выход 600 · vLLM | 2 769 ток./с 10 млн/час | не приводится | 37 ₽/часHOSTKEY | 3,71 ₽ | дешевле в 8,1× |
| RTX 4090DeepSeek-R1-Distill-Llama-8B 300 запросов · вход 100 / выход 600 · vLLM | 2 700 ток./с 9,7 млн/час | не приводится | 37 ₽/часHOSTKEY | 3,81 ₽ | дешевле в 7,9× |
| RTX 5090Qwen3-Coder-30B-A3B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM | 4 570 ток./с 16,5 млн/час | не приводится | 63 ₽/часHOSTKEY | 3,82 ₽ | дешевле в 7,8× |
| RTX PRO 2000Qwen3-VL-2B-Instruct 50 запросов · вход 100 / выход 600 · vLLM | 1 630 ток./с 5,9 млн/час | 0,16 с | 25 ₽/часHOSTKEY | 4,32 ₽ | дешевле в 6,9× |
| RTX PRO 6000 BlackwellQwen3-Coder-30B-A3B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM | 8 425 ток./с 30,3 млн/час | не приводится | 133 ₽/часCloud4Y | 4,39 ₽ | дешевле в 6,8× |
| RTX 4090Qwen3-Coder-30B-A3B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM | 2 259 ток./с 8,1 млн/час | не приводится | 37 ₽/часHOSTKEY | 4,55 ₽ | дешевле в 6,6× |
| RTX 4090Qwen3-Coder-30B-A3B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM | 8 903 ток./с на 4 картах · 32,1 млн/час | не приводится | 148 ₽/часHOSTKEY · за 4 карты | 4,62 ₽ | дешевле в 6,5× |
| RTX 5090Qwen3-Coder-30B-A3B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM | 12 744 ток./с на 4 картах · 45,9 млн/час | не приводится | 252 ₽/часHOSTKEY · за 4 карты | 5,48 ₽ | дешевле в 5,5× |
| A100DeepSeek-R1-Distill-Qwen-7B 300 запросов · вход 100 / выход 600 · vLLM | 8 031 ток./с 28,9 млн/час | 1,54 с | 164 ₽/часHOSTKEY | 5,69 ₽ | дешевле в 5,3× |
| RTX 4090gemma-2-9b-it 300 запросов · вход 100 / выход 600 · vLLM | 1 663 ток./с 6 млн/час | не приводится | 37 ₽/часHOSTKEY | 6,18 ₽ | дешевле в 4,9× |
| RTX PRO 2000Qwen3-4B 50 запросов · вход 100 / выход 600 · vLLM | 1 094 ток./с 3,9 млн/час | 0,24 с | 25 ₽/часHOSTKEY | 6,43 ₽ | дешевле в 4,7× |
| A100DeepSeek-R1-Distill-Llama-8B 300 запросов · вход 100 / выход 600 · vLLM | 6 842 ток./с 24,6 млн/час | 1,66 с | 164 ₽/часHOSTKEY | 6,67 ₽ | дешевле в 4,5× |
| H100DeepSeek-R1-Distill-Qwen-7B 300 запросов · вход 100 / выход 600 · vLLM | 7 315 ток./с 26,3 млн/час | не приводится | 199 ₽/часHOSTKEY | 7,54 ₽ | дешевле в 4,0× |
| RTX A6000DeepSeek-R1-Distill-Llama-8B 100 запросов · вход 100 / выход 600 · vLLM | 2 865 ток./с 10,3 млн/час | 0,59 с | 79 ₽/часHOSTKEY | 7,7 ₽ | дешевле в 3,9× |
| H100DeepSeek-R1-Distill-Qwen-7B 300 запросов · вход 100 / выход 600 · vLLM | 6 882 ток./с 24,8 млн/час | не приводится | 199 ₽/часHOSTKEY | 8,02 ₽ | дешевле в 3,7× |
| RTX A6000Qwen2.5-7B-Instruct 100 запросов · вход 100 / выход 600 · vLLM | 2 662 ток./с 9,6 млн/час | 0,41 с | 79 ₽/часHOSTKEY | 8,29 ₽ | дешевле в 3,6× |
| RTX A6000Llama-3.1-8B-Instruct 100 запросов · вход 100 / выход 600 · vLLM | 2 659 ток./с 9,6 млн/час | 0,54 с | 79 ₽/часHOSTKEY | 8,3 ₽ | дешевле в 3,6× |
| H100DeepSeek-R1-Distill-Llama-8B 300 запросов · вход 100 / выход 600 · vLLM | 6 488 ток./с 23,4 млн/час | не приводится | 199 ₽/часHOSTKEY | 8,5 ₽ | дешевле в 3,5× |
| H100DeepSeek-R1-Distill-Llama-8B 300 запросов · вход 100 / выход 600 · vLLM | 5 934 ток./с 21,4 млн/час | не приводится | 199 ₽/часHOSTKEY | 9,3 ₽ | дешевле в 3,2× |
| RTX PRO 2000gemma-3-4b-it 50 запросов · вход 100 / выход 600 · vLLM | 730 ток./с 2,6 млн/час | 2,9 с | 25 ₽/часHOSTKEY | 9,64 ₽ | дешевле в 3,1× |
| A100DeepSeek-R1-Distill-Qwen-14B 300 запросов · вход 100 / выход 600 · vLLM | 4 187 ток./с 15,1 млн/час | 2,57 с | 164 ₽/часHOSTKEY | 11 ₽ | дешевле в 2,8× |
| H100DeepSeek-R1-Distill-Qwen-14B 300 запросов · вход 100 / выход 600 · vLLM | 4 821 ток./с 17,4 млн/час | не приводится | 199 ₽/часHOSTKEY | 11 ₽ | дешевле в 2,6× |
| RTX PRO 6000 BlackwellDeepSeek-R1-Distill-Llama-8B 50 запросов · вход 100 / выход 600 · vLLM | 3 210 ток./с 11,6 млн/час | 0,28 с | 133 ₽/часCloud4Y | 12 ₽ | дешевле в 2,6× |
| RTX PRO 6000 BlackwellLlama-3.1-8B 50 запросов · вход 100 / выход 600 · vLLM | 3 196 ток./с 11,5 млн/час | 0,33 с | 133 ₽/часCloud4Y | 12 ₽ | дешевле в 2,6× |
| RTX PRO 6000 BlackwellGLM-4.5-Air число запросов не названо · вход 1000 / выход 1000 · vLLM | 3 169 ток./с 11,4 млн/час | не приводится | 133 ₽/часCloud4Y | 12 ₽ | дешевле в 2,6× |
| RTX PRO 6000 BlackwellQwen3-8B 50 запросов · вход 100 / выход 600 · vLLM | 3 101 ток./с 11,2 млн/час | 0,32 с | 133 ₽/часCloud4Y | 12 ₽ | дешевле в 2,5× |
| H100DeepSeek-R1-Distill-Qwen-14B 300 запросов · вход 100 / выход 600 · vLLM | 4 304 ток./с 15,5 млн/час | не приводится | 199 ₽/часHOSTKEY | 13 ₽ | дешевле в 2,3× |
| H100gemma-2-9b-it 300 запросов · вход 100 / выход 600 · vLLM | 4 193 ток./с 15,1 млн/час | не приводится | 199 ₽/часHOSTKEY | 13 ₽ | дешевле в 2,3× |
| RTX A6000DeepSeek-R1-Distill-Llama-8B 50 запросов · вход 100 / выход 600 · vLLM | 1 644 ток./с 5,9 млн/час | 0,65 с | 79 ₽/часHOSTKEY | 13 ₽ | дешевле в 2,2× |
| A100DeepSeek-R1-Distill-Qwen-7B 50 запросов · вход 100 / выход 600 · vLLM | 3 363 ток./с 12,1 млн/час | 0,31 с | 164 ₽/часHOSTKEY | 14 ₽ | дешевле в 2,2× |
| RTX A6000Qwen2.5-7B-Instruct 50 запросов · вход 100 / выход 600 · vLLM | 1 618 ток./с 5,8 млн/час | 0,58 с | 79 ₽/часHOSTKEY | 14 ₽ | дешевле в 2,2× |
| RTX A6000Llama-3.1-8B-Instruct 50 запросов · вход 100 / выход 600 · vLLM | 1 493 ток./с 5,4 млн/час | 0,59 с | 79 ₽/часHOSTKEY | 15 ₽ | дешевле в 2,0× |
| RTX 5090GLM-4.5-Air число запросов не названо · вход 1000 / выход 1000 · vLLM | 4 622 ток./с на 4 картах · 16,6 млн/час | не приводится | 252 ₽/часHOSTKEY · за 4 карты | 15 ₽ | дешевле в 2,0× |
| A100DeepSeek-R1-Distill-Llama-8B 50 запросов · вход 100 / выход 600 · vLLM | 3 004 ток./с 10,8 млн/час | 0,33 с | 164 ₽/часHOSTKEY | 15 ₽ | дешевле в 2,0× |
| H100gemma-2-9b-it 300 запросов · вход 100 / выход 600 · vLLM | 3 270 ток./с 11,8 млн/час | не приводится | 199 ₽/часHOSTKEY | 17 ₽ | дешевле в 1,8× |
| A100gemma-2-9b-it 300 запросов · вход 100 / выход 600 · vLLM | 2 698 ток./с 9,7 млн/час | 1,74 с | 164 ₽/часHOSTKEY | 17 ₽ | дешевле в 1,8× |
| RTX A6000DeepSeek-R1-Distill-Qwen-14B 100 запросов · вход 100 / выход 600 · vLLM | 1 294 ток./с 4,7 млн/час | 1,67 с | 79 ₽/часHOSTKEY | 17 ₽ | дешевле в 1,8× |
| RTX A6000Qwen2.5-14B-Instruct 100 запросов · вход 100 / выход 600 · vLLM | 1 238 ток./с 4,5 млн/час | 0,8 с | 79 ₽/часHOSTKEY | 18 ₽ | дешевле в 1,7× |
| RTX PRO 6000 BlackwellQwen3-14B 50 запросов · вход 100 / выход 600 · vLLM | 2 034 ток./с 7,3 млн/час | 0,51 с | 133 ₽/часCloud4Y | 18 ₽ | дешевле в 1,6× |
| RTX PRO 6000 BlackwellDeepSeek-R1-Distill-Qwen-14B 50 запросов · вход 100 / выход 600 · vLLM | 1 873 ток./с 6,7 млн/час | 0,51 с | 133 ₽/часCloud4Y | 20 ₽ | дешевле в 1,5× |
| RTX PRO 6000 Blackwellgemma-3-12b-it 50 запросов · вход 100 / выход 600 · vLLM | 1 817 ток./с 6,5 млн/час | 0,44 с | 133 ₽/часCloud4Y | 20 ₽ | дешевле в 1,5× |
| RTX 4090gemma-2-9b-it 300 запросов · вход 100 / выход 600 · vLLM | 473 ток./с 1,7 млн/час | не приводится | 37 ₽/часHOSTKEY | 22 ₽ | дешевле в 1,4× |
| RTX 4090GLM-4.5-Air число запросов не названо · вход 1000 / выход 1000 · vLLM | 1 731 ток./с на 4 картах · 6,2 млн/час | не приводится | 148 ₽/часHOSTKEY · за 4 карты | 24 ₽ | дешевле в 1,3× |
| H100gemma-2-27b-it 300 запросов · вход 100 / выход 600 · vLLM | 2 271 ток./с 8,2 млн/час | не приводится | 199 ₽/часHOSTKEY | 24 ₽ | дешевле в 1,2× |
| A100gemma-2-9b-it 50 запросов · вход 100 / выход 600 · vLLM | 1 868 ток./с 6,7 млн/час | 0,41 с | 164 ₽/часHOSTKEY | 24 ₽ | дешевле в 1,2× |
| RTX A6000Qwen2.5-14B-Instruct 50 запросов · вход 100 / выход 600 · vLLM | 833 ток./с 3 млн/час | 1,1 с | 79 ₽/часHOSTKEY | 26 ₽ | дешевле в 1,1× |
| RTX 5090Llama-3.3-70B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM | 1 230 ток./с на 2 картах · 4,4 млн/час | не приводится | 126 ₽/часHOSTKEY · за 2 карты | 28 ₽ | дешевле в 1,1× |
| H100gemma-2-27b-it 300 запросов · вход 100 / выход 600 · vLLM | 1 837 ток./с 6,6 млн/час | не приводится | 199 ₽/часHOSTKEY | 30 ₽ | дороже в 1,0× |
| A100gemma-2-27b-it 300 запросов · вход 100 / выход 600 · vLLM | 1 509 ток./с 5,4 млн/час | 4,31 с | 164 ₽/часHOSTKEY | 30 ₽ | дороже в 1,0× |
| RTX A6000DeepSeek-R1-Distill-Qwen-14B 50 запросов · вход 100 / выход 600 · vLLM | 727 ток./с 2,6 млн/час | 0,47 с | 79 ₽/часHOSTKEY | 30 ₽ | дороже в 1,0× |
| A100DeepSeek-R1-Distill-Qwen-14B 50 запросов · вход 100 / выход 600 · vLLM | 1 450 ток./с 5,2 млн/час | 0,58 с | 164 ₽/часHOSTKEY | 31 ₽ | дороже в 1,0× |
| RTX PRO 6000 BlackwellLlama-3.3-70B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM | 1 031 ток./с 3,7 млн/час | не приводится | 133 ₽/часCloud4Y | 36 ₽ | дороже в 1,2× |
| H100DeepSeek-R1-Distill-Qwen-32B 300 запросов · вход 100 / выход 600 · vLLM | 1 482 ток./с 5,3 млн/час | не приводится | 199 ₽/часHOSTKEY | 37 ₽ | дороже в 1,2× |
| RTX PRO 6000 BlackwellDeepSeek-R1-Distill-Qwen-32B 50 запросов · вход 100 / выход 600 · vLLM | 966 ток./с 3,5 млн/час | 1 с | 133 ₽/часCloud4Y | 38 ₽ | дороже в 1,3× |
| H100DeepSeek-R1-Distill-Qwen-32B 300 запросов · вход 100 / выход 600 · vLLM | 1 391 ток./с 5 млн/час | не приводится | 199 ₽/часHOSTKEY | 40 ₽ | дороже в 1,3× |
| RTX PRO 6000 BlackwellQwen3-VL-32B-Instruct 50 запросов · вход 100 / выход 600 · vLLM | 929 ток./с 3,3 млн/час | 1,05 с | 133 ₽/часCloud4Y | 40 ₽ | дороже в 1,3× |
| RTX 4090Llama-3.3-70B-Instruct число запросов не названо · вход 1000 / выход 1000 · vLLM | 467 ток./с на 2 картах · 1,7 млн/час | не приводится | 74 ₽/часHOSTKEY · за 2 карты | 44 ₽ | дороже в 1,5× |
| A100DeepSeek-R1-Distill-Qwen-32B 300 запросов · вход 100 / выход 600 · vLLM | 721 ток./с 2,6 млн/час | 67 с | 164 ₽/часHOSTKEY | 63 ₽ | дороже в 2,1× |
| A100QwQ-32B 300 запросов · вход 100 / выход 600 · vLLM | 703 ток./с 2,5 млн/час | 94 с | 164 ₽/часHOSTKEY | 65 ₽ | дороже в 2,2× |
| A100QwQ-32B 50 запросов · вход 100 / выход 600 · vLLM | 615 ток./с 2,2 млн/час | 1,3 с | 164 ₽/часHOSTKEY | 74 ₽ | дороже в 2,5× |
| A100DeepSeek-R1-Distill-Qwen-32B 50 запросов · вход 100 / выход 600 · vLLM | 577 ток./с 2,1 млн/час | 1,3 с | 164 ₽/часHOSTKEY | 79 ₽ | дороже в 2,6× |
| A100gemma-2-27b-it 50 запросов · вход 100 / выход 600 · vLLM | 496 ток./с 1,8 млн/час | 1,11 с | 164 ₽/часHOSTKEY | 92 ₽ | дороже в 3,1× |
| RTX PRO 6000 BlackwellGLM-4.5-Air число запросов не названо · вход 8000 / выход 8000 · vLLM | 2 291 ток./с на 8 картах · 8,2 млн/час | не приводится | 1 066 ₽/часCloud4Y · за 8 карты | 129 ₽ | дороже в 4,3× |
| H100GLM-4.6 число запросов не названо · вход 8000 / выход 8000 · vLLM | 2 834 ток./с на 8 картах · 10,2 млн/час | не приводится | 1 589 ₽/часHOSTKEY · за 8 карты | 156 ₽ | дороже в 5,2× |
| H100GLM-4.5-Air число запросов не названо · вход 8000 / выход 8000 · vLLM | 2 556 ток./с на 8 картах · 9,2 млн/час | не приводится | 1 589 ₽/часHOSTKEY · за 8 карты | 173 ₽ | дороже в 5,8× |
| RTX PRO 6000 BlackwellGLM-4.6 число запросов не названо · вход 8000 / выход 8000 · vLLM | 1 652 ток./с на 8 картах · 5,9 млн/час | не приводится | 1 066 ₽/часCloud4Y · за 8 карты | 179 ₽ | дороже в 6,0× |
| RTX PRO 6000 BlackwellQwen3-Coder-480B-A35B число запросов не названо · вход 8000 / выход 8000 · vLLM | 1 603 ток./с на 8 картах · 5,8 млн/час | не приводится | 1 066 ₽/часCloud4Y · за 8 карты | 185 ₽ | дороже в 6,2× |
| H100Qwen3-Coder-480B-A35B число запросов не названо · вход 8000 / выход 8000 · vLLM | 2 329 ток./с на 8 картах · 8,4 млн/час | не приводится | 1 589 ₽/часHOSTKEY · за 8 карты | 190 ₽ | дороже в 6,3× |
| H200GLM-4.6 число запросов не названо · вход 8000 / выход 8000 · vLLM | 5 588 ток./с на 8 картах · 20,1 млн/час | не приводится | 4 557 ₽/часSelectel · за 8 карты | 227 ₽ | дороже в 7,6× |
| H200GLM-4.5-Air число запросов не названо · вход 8000 / выход 8000 · vLLM | 5 463 ток./с на 8 картах · 19,7 млн/час | не приводится | 4 557 ₽/часSelectel · за 8 карты | 232 ₽ | дороже в 7,7× |
| B200GLM-4.5-Air число запросов не названо · вход 8000 / выход 8000 · vLLM | 9 675 ток./с на 8 картах · 34,8 млн/час | не приводится | 8 984 ₽/часCloud4Y · за 8 карты | 258 ₽ | дороже в 8,6× |
| H200Qwen3-Coder-480B-A35B число запросов не названо · вход 8000 / выход 8000 · vLLM | 4 263 ток./с на 8 картах · 15,3 млн/час | не приводится | 4 557 ₽/часSelectel · за 8 карты | 297 ₽ | дороже в 9,9× |
| B200GLM-4.6 число запросов не названо · вход 8000 / выход 8000 · vLLM | 8 037 ток./с на 8 картах · 28,9 млн/час | не приводится | 8 984 ₽/часCloud4Y · за 8 карты | 311 ₽ | дороже в 10,4× |
| B200Qwen3-Coder-480B-A35B число запросов не названо · вход 8000 / выход 8000 · vLLM | 6 438 ток./с на 8 картах · 23,2 млн/час | не приводится | 8 984 ₽/часCloud4Y · за 8 карты | 388 ₽ | дороже в 12,9× |
Методология Как мы считаем эти числа: откуда данные, что входит в цену и чего мы не знаем. Что исправляли
Строки, отмеченные полосой, — про ловушку. Пропускная способность там выше, чем при меньшей нагрузке, а время до первого токена вырастает до десятков секунд. Для пакетной обработки такой режим годится, для живого диалога — нет. Считать по нему цену токена можно, обещать по нему сервис — нельзя.
Сравнение «против API» идёт с самым дешёвым тарифом — Qwen 3 8B, 30 ₽ за миллион. Это самая тяжёлая планка для своего железа: против дорогих моделей поставщика карта выигрывает заметно легче.
Замеры чужие, и мы их не усредняем. Сложить публикации с разными условиями и вывести «среднее по рынку» означало бы придумать число, которого никто не измерял. Источник и дата — у каждой строки ниже.
Откуда взяты замеры (84 запуска, 2 публикации)
- Database Mart, опубликовано 17.03.2025, прочитано 01.09.2026 — https://www.databasemart.com/blog/vllm-gpu-benchmark-rtx4090
- Database Mart, опубликовано 09.02.2026, прочитано 01.09.2026 — https://www.databasemart.com/blog/vllm-gpu-benchmark-pro2000
- CloudRift, опубликовано 09.10.2025, прочитано 01.09.2026 — https://www.cloudrift.ai/blog/benchmarking-rtx-gpus-for-llm-inference
- Database Mart, опубликовано 21.03.2025, прочитано 01.09.2026 — https://www.databasemart.com/blog/vllm-gpu-benchmark-a100-80gb
- Database Mart, опубликовано 13.03.2025, прочитано 01.09.2026 — https://www.databasemart.com/blog/vllm-gpu-benchmark-h100
- Database Mart, опубликовано 09.04.2025, прочитано 01.09.2026 — https://www.databasemart.com/blog/vllm-gpu-benchmark-a6000
- Database Mart, опубликовано 13.01.2026, прочитано 01.09.2026 — https://www.databasemart.com/blog/vllm-gpu-benchmark-pro6000
- CloudRift, опубликовано 21.01.2026, прочитано 01.09.2026 — https://www.cloudrift.ai/blog/benchmarking-b200