Своя LLM на предприятии — без выхода данных наружу
Когда данные нельзя отдавать в чужое облако, модель ставят у себя. Мы разбираем задачу, подбираем модель и конфигурацию железа под неё, считаем требуемую память и число карт, сравниваем со сценарием аренды — и собираем под задачу команду исполнителей, которая развернёт контур. Собственный монтаж и гарантию не заявляем. Закрытый контур — четвёртая и самый дорогой вариант исполнения: если режим данных его не требует, дешевле начать с другого, и разбор задачи покажет, с какой именно.
Закрытый ИИ-контур — это языковая модель с открытыми весами, развёрнутая на оборудовании предприятия: данные не покидают периметр, работа не зависит от внешнего сервиса. ЗероКвант подбирает модель и конфигурацию железа под задачу, считает требуемую память и число карт, сравнивает со сценарием аренды GPU и собирает под проект команду исполнителей: поставка, монтаж, инженерия модели, защита информации — это разные компетенции и разные люди. Развёртывание и гарантию выполняют они — собственные работы мы не заявляем, а ведём проект как куратор. Масштаб бывает от одной карты для отдела до узла на несколько GPU. Что при этом требует закон и с какой даты — правовой навигатор.
Когда публичного ИИ-сервиса недостаточно
Причина почти всегда одна из четырёх — и это вопрос допустимости, а не удобства. Если ни одна не про вас, честнее начать с аренды GPU: дешевле и быстрее.
Персональные данные
Обработка ПДн на своих мощностях снимает вопрос трансграничной передачи и упрощает разговор с проверяющим: данные физически не покидают ваш контур.
Коммерческая тайна и NDA
Договоры, исходный код, конструкторская документация, переписка с клиентами. Условия NDA часто прямо запрещают передачу третьим лицам — а публичный ИИ-сервис это именно третье лицо.
Отраслевые и внутренние требования
Банки, медицина, промышленность: внутренние политики часто закрывают внешние сервисы раньше закона. А в госсекторе с 1 марта 2026 года это уже прямая норма — требования ФСТЭК запрещают передавать разработчику модели сведения ограниченного доступа.
Автономность и предсказуемость
Контур работает без интернета и не зависит от того, поднимет ли зарубежный поставщик цены, сменит ли лицензию или отключит доступ. Модель у вас — значит, она у вас.
Из чего состоит контур
Шесть слоёв. Пропущенный слой обычно и становится тем местом, где проект встаёт после закупки железа.
Какая LLM и на каких условиях
Открытые веса с лицензией, допускающей коммерческое использование в закрытом контуре, — это первый вопрос, а не последний. Размер модели определяет всё железо ниже.
GPU, память, узел
Карты подбираются под размер модели, длину контекста и число одновременных пользователей. Избыточная память — деньги на полке, недостаточная — модель просто не запустится.
Инференс-сервер и оркестрация
Слой, который превращает веса в сервис: пакетная обработка запросов, работа с контекстом, очереди, отказоустойчивость. От него зависит, сколько людей обслужит одна карта.
Корпоративная база знаний и RAG
Модель без ваших данных отвечает как публичная. Поиск по документам, векторная база и конвейер обновления — то, ради чего контур обычно и строится.
Сеть, доступ, журналирование
Контур без выхода наружу, разграничение прав, журнал обращений к модели. Это же и есть предмет проверки, когда придёт служба безопасности или аудит.
Питание, охлаждение, обновление
GPU-узел греется и потребляет заметно больше обычного сервера. Мощность ввода, охлаждение и порядок обновления моделей считаются заранее, а не после монтажа.
Три типовых масштаба
Объёмы памяти в таблице посчитаны тем же калькулятором, что стоит на /tools/podbor-gpu, — из размера модели, разрядности, длины контекста и числа одновременных запросов. Это ориентир под конфигурацию, а не замена расчёту под вашу задачу.
Рабочая группа
Отдел или проектная команда: помощник по внутренним документам, черновики, поиск по базе знаний.
- Модель
- 8 млрд параметров, INT8 / FP8
- Контекст
- 8 192 токенов
- Одновременных запросов
- 4
- Нужно видеопамяти
- ≈ 12 ГБ
- из них веса модели
- 8 ГБ
- Масштаб
- Достаточно одной карты — например, 1× NVIDIA A16
Одна рабочая станция или сервер в существующей серверной. Отдельная стойка не нужна.
Отдел или филиал
Десятки пользователей, поиск по корпоративному архиву (RAG), разбор обращений, помощь разработчикам.
- Модель
- 32 млрд параметров, INT8 / FP8
- Контекст
- 16 384 токенов
- Одновременных запросов
- 8
- Нужно видеопамяти
- ≈ 63,8 ГБ
- из них веса модели
- 32 ГБ
- Масштаб
- Достаточно одной карты — например, 1× Huawei Ascend 910C
Один GPU-сервер в стойке. Обычно вписывается в имеющееся охлаждение и питание.
Предприятие
Модель уровня публичных сервисов на своих данных: длинные документы, много одновременных пользователей, дообучение под отрасль.
- Модель
- 70 млрд параметров, FP16
- Контекст
- 32 768 токенов
- Одновременных запросов
- 16
- Нужно видеопамяти
- ≈ 337 ГБ
- из них веса модели
- 140 ГБ
- Масштаб
- Один узел (сервер) на 2× GPU — например, 2× NVIDIA B200
Выделенный узел или несколько; здесь уже считается питание и охлаждение стойки.
Карта в строке «масштаб» — самая экономная из тех, что закрывают объём наименьшим числом штук; это не единственный вариант и не рекомендация к покупке. Подбор идёт по объёму памяти и не учитывает программный стек, а он в закрытом контуре решает не меньше: под ускорители Huawei и AMD инференс-сервер другой, чем под NVIDIA, и переносимость готовых решений там ниже. Это отдельный вопрос проекта, и мы разбираем его на первом шаге, а не после закупки. Подобрать под наличие и бюджет можно из каталога ускорителей, а проверить цену аренды тех же карт — в портале аренды.
Свой контур или аренда GPU
Это два разных вопроса, и путать их дорого: один про деньги, другой про допустимость. Мы считаем оба до того, как вы вложитесь в железо.
- Нагрузка непостоянная: пики, эксперименты, разовое дообучение.
- Нужно проверить гипотезу быстро и без капитальных затрат.
- Данные допускают обработку у стороннего провайдера в РФ.
- Нет своей серверной, питания и людей, кто будет это обслуживать.
- Данные нельзя выпускать за периметр ни при каких условиях.
- Загрузка постоянная — тогда своё железо со временем окупается.
- Нужна работа без интернета и независимость от внешнего поставщика.
- Требования безопасности или отраслевые правила прямо запрещают внешние сервисы.
Как мы работаем
Разбор задачи и класса данных
Что должна делать модель, кто ею пользуется, какие данные она увидит и какие ограничения на них лежат. Здесь же честно проверяем, нужен ли вообще закрытый контур: части задач хватает арендованной GPU в РФ.
Конфигурация и спецификация
Считаем требуемую память под выбранную модель, контекст и нагрузку, подбираем карты и узел, проверяем совместимость и статус легальности ввоза 2026, запрашиваем у поставщиков-партнёров ориентир цены и срока.
Команда под задачу
Собираем исполнителей под конкретный проект: поставщик оборудования, монтаж и пусконаладка, инженер по языковым моделям, специалист по защите информации. Не одна универсальная компания «на всё», а те, кто силён именно в нужном. Договор, оплата и гарантия — напрямую между вами и каждым исполнителем.
Ведём проект
Остаёмся на связи как куратор: следим, чтобы собранное железо соответствовало расчёту, а результат — задаче, с которой всё начиналось. Роль куратора — это ответственность за подбор и стыковку участников, а не за монтаж: работы выполняет и гарантирует тот, кто их делает.
Кто что делает
Роли названы здесь, а не мелким шрифтом в договоре. Под каждую часть работы — своя компетенция и свой человек: так задача закрывается сильными, а вы видите, с кем имеете дело на каждом шаге.
- ЗероКвант. Разбираем задачу, считаем конфигурацию, собираем спецификацию, подбираем исполнителей и ведём проект как куратор.
- Поставщик. Поставляет оборудование. Договор, оплата и гарантия — напрямую между вами и им.
- Монтажник. Выполняет монтаж и пусконаладку и отвечает за них по договору с вами.
- Инженер по моделям. Разворачивает модель, настраивает инференс-сервер и поиск по вашим документам.
- Лицензиат ФСТЭК и ФСБ. Проводит аттестацию, когда задача касается защиты гостайны. Если дело в этом, скажем сразу и назовём, кого искать.
Частые вопросы
Расскажите, что должна делать модель
Опишите задачу, число пользователей и какие данные модель увидит — соберём черновую конфигурацию, посчитаем память и число карт, сравним со сценарием аренды и скажем, кого нужно позвать в проект. Ответим по существу.