Запуск LLM в России подорожал в 2,8 раза: что стоит за этим числом
MWS Cloud оценила минимальный набор ускорителей NVIDIA под развёртывание одной языковой модели: 13,7 млн ₽ в 2025 году против 38,8 млн ₽ в 2026-м. Сообщение компании от 19 августа 2026 года уже разошлось по изданиям. Условия замера в нём решают всё: считался минимум карт под один запрос максимального заявленного размера.
Что именно посчитано. Выборка — открытые модели, вышедшие весной и летом соответствующего года: за 2025-й Kimi K2, gpt-oss-120b, Gemma 3 27B, GLM-4.5V, Qwen3 235B и Cotype Pro 2; за 2026-й — Kimi K3, Qwen3.5 397B, DeepSeek-V4-Pro, DeepSeek-V4-Flash, GLM-5.2, Gemma 4 и Cotype Pro 3. В смету вошли серверы с ускорителями и коммутаторы к ним. Общих позиций у двух выборок нет ни одной.
Отсюда первое, что стоит держать в голове: в одном числе сложены два разных движения — модели стали крупнее и требовательнее к памяти, и одновременно подорожали сами карты. Компания называет оба фактора, но разделить их внутри «2,8 раза» нельзя: это разница между двумя наборами моделей, а не ряд цен на одну и ту же позицию.
Второе — «один запрос максимального заявленного размера». Это нижняя граница, а не стоимость работающего внедрения: память под контекст растёт от произведения длины на число одновременных запросов. Тридцать две тысячи токенов у десяти сотрудников стоят столько же памяти, сколько триста двадцать тысяч у одного — мы считали это по десяти моделям каталога. Смета на один запрос отвечает на вопрос «влезет ли», а не «сколько человек смогут работать».
Третье, российское: в том же замере отдельно оценены китайские Ascend 910B. Запуск подтверждён не для всех моделей выборки — три из шести в 2025-м и пять из семи в 2026-м, — а официальной цены на эти ускорители нет вовсе. Это ровно то, о чём мы пишем в разборе аналогов: барьер у китайских карт стоит не в характеристиках, а в софте и в канале поставки.
И то, чего мы сегодня сделать не можем, — говорим прямо. Разложить рост на «модели выросли» и «карты подорожали» способен только ряд наблюдаемых цен на карты с датами. Свой ряд мы ведём с 15 августа 2026 года: три продавца, двенадцать дней. За год такого ряда у нас нет, и подставлять вместо него оценку мы не будем.
Память под модель мы считаем по снятой архитектуре, а не по числу параметров: «один запрос максимального размера» и «отдел из десяти человек» дают разные карты при одной и той же модели. Смета, посчитанная на один запрос, — нижняя граница.
Замер сделан продавцом облачных мощностей и опубликован только через издания — своей публикации с методикой мы не нашли. Поэтому называем условия замера и состав выборки: число можно применить, только зная, что в нём посчитано.
ПЕРВОИСТОЧНИКОценка MWS Cloud, опубликована CNews 19.08.2026 →
Прежде чем закладывать «в три раза дороже» в бюджет, спросите у сметы два условия: какие модели в неё вошли и на сколько одновременных запросов она посчитана.
Материал — экспертный разбор ЗероКвант на основе открытых данных; характеристики и суммы — ориентир, не юридическая консультация. Точный расчёт и статус — по запросу.