Закрытый ИИ-контур на предприятии: с чего начать
«Поставить нейросеть внутрь компании» звучит как задача про железо, а на деле упирается в четыре решения, из которых железо — третье. Разбираем порядок: кому закрытый контур действительно нужен, с какой модели начинается проект, сколько памяти она потребует и что кроме карт входит в рабочий контур.
Закрытый ИИ-контур — языковая модель с открытыми весами, развёрнутая на оборудовании компании: данные не покидают периметр. Нужен он не всем: если данные допускают обработку у российского провайдера, дешевле и быстрее начать с аренды GPU, а контур строить под доказанную нагрузку. Порядок решений: задача → модель и её лицензия → железо → стек и данные → периметр. Память под веса считается точно (параметры × байт на параметр), запас под контекст — калькулятором. Масштаб бывает от одной карты для отдела до узла на несколько GPU — разбор конфигураций на странице закрытого ИИ-контура.
Кому он нужен, а кому хватит аренды
Закрытый контур строят не потому, что так дешевле или быстрее — почти всегда наоборот. Его строят, когда внешняя обработка данных недопустима. Это вопрос допустимости, а не цены, и путать эти два вопроса дорого: под видом «безопасности» легко купить железо там, где хватило бы арендованной карты, а под видом «экономии» — отправить наружу то, что отправлять нельзя.
Честный отсев занимает один разговор. Если данные, которые увидит модель, допускают обработку у российского провайдера по договору — начинайте с аренды GPU: дешевле, быстрее и без капитальных затрат. Контур имеет смысл строить под нагрузку, которая уже доказана на арендованном железе, а не под гипотезу.
Причина «нельзя наружу» обычно одна из четырёх, и стоит назвать её вслух до первой закупки — от неё зависит, что именно придётся доказывать проверяющему или службе безопасности:
- Персональные данные. Обработка на своих мощностях снимает вопрос передачи третьим лицам и трансграничной передачи. Обязанности оператора ПДн это не отменяет — режим обработки, доступы и документы остаются на вашей стороне.
- Коммерческая тайна и NDA. Договоры, исходный код, конструкторская документация, переписка с клиентами. Условия NDA часто прямо запрещают передачу третьим лицам, а публичный ИИ-сервис — это именно третье лицо.
- Отраслевые и внутренние требования. Банки, медицина, промышленность, госсектор: внутренние политики нередко запрещают внешние сервисы раньше и жёстче, чем это делает закон.
- Автономность. Контур работает без интернета и не зависит от того, поднимет ли зарубежный поставщик цены, сменит ли условия лицензии или закроет доступ. Веса модели у вас — значит, сервис у вас.
Проект начинается с модели, а не с карты
Самая частая ошибка порядка: сначала покупают сервер, потом выбирают модель. Получается наоборот — размер модели задаёт объём памяти, объём памяти задаёт карты, карты задают питание и охлаждение. Выбор модели это первое решение проекта, и оно же самое обратимое: сменить модель на том же железе можно, сменить железо под модель — нет.
«Открытые веса» и «открытый исходный код» — разные вещи, и в корпоративном проекте разница стоит денег. Веса бывают выложены под лицензией, которая ограничивает коммерческое использование, число пользователей или отрасль применения. Три ловушки встречаются чаще прочих: лицензия зависит от размера модели, а не от семейства (Qwen2.5-7B под Apache 2.0, а 72B — под собственным соглашением); лицензия кода в репозитории не равна лицензии весов (случай DeepSeek); и порог активности иногда достижим — у YandexGPT 5 Lite это 10 млн выходных токенов в месяц. Мы разобрали условия по официальным файлам с дословными цитатами: лицензии открытых моделей. Читают это юристы, а не инженеры, и до закупки, а не после.
Практический ориентир по выбору размера: модель на 7–8 млрд параметров решает задачи внутреннего помощника по документам и черновиков; 30–35 млрд заметно лучше держит длинный контекст и рассуждение; 70 млрд и выше берут, когда нужен уровень публичных сервисов на своих данных. Прыгать сразу на верхнюю ступень редко разумно: разница в качестве заметна не на всех задачах, а разница в железе — в разы.
Сколько памяти и сколько карт
Память под веса считается точно и проверяется в уме: число параметров × число байт на параметр. В FP16 это 2 байта, в INT8 или FP8 — 1 байт, в INT4 — половина. Отсюда вся таблица ниже; никакой магии в ней нет.
Квантование — не бесплатный обед, но и не катастрофа: переход с FP16 на INT8 обычно почти не заметен на прикладных задачах и вдвое сокращает требования к памяти. INT4 экономит ещё вдвое, но качество на сложных рассуждениях уже проседает заметно, и это стоит проверять на своих данных, а не принимать на веру.
| Размер модели | INT4 (0,5 байта) | INT8 / FP8 (1 байт) | FP16 (2 байта) |
|---|---|---|---|
| 8 млрд параметров | 4 ГБ | 8 ГБ | 16 ГБ |
| 32 млрд | 16 ГБ | 32 ГБ | 64 ГБ |
| 70 млрд | 35 ГБ | 70 ГБ | 140 ГБ |
| 175 млрд | 87,5 ГБ | 175 ГБ | 350 ГБ |
Что кроме железа: стек и данные
Веса модели — это файл. Сервисом его делает инференс-сервер: он держит модель в памяти, собирает запросы пользователей в пакеты, управляет очередью и контекстом. Именно от этого слоя зависит, обслужит одна карта трёх человек или тридцать, — и именно его чаще всего забывают в расчёте, потому что он ничего не стоит на закупке.
Здесь же прячется ограничение, о котором стоит знать до выбора карт: подбор по объёму памяти не равен подбору по совместимости. Под ускорители Huawei и AMD инференс-стек другой, чем под NVIDIA, готовых решений под них меньше, и перенос рабочего контура с одного на другой — отдельный проект, а не смена детали.
Второй слой, без которого контур бесполезен, — ваши данные. Модель без них отвечает ровно как публичная, только медленнее и за ваши деньги. Поиск по корпоративным документам (RAG), векторная база и конвейер обновления — обычно и есть та ценность, ради которой всё затевалось. Планируйте их вместе с железом: под индекс и документы нужно быстрое хранилище, а под обновление — регламент, кто и когда переиндексирует базу.
Периметр: изоляция, доступ, границы
Контур без выхода наружу, разграничение прав и журнал обращений к модели — это не «безопасность вообще», а конкретный предмет проверки, когда придёт служба безопасности или аудит. Журналирование стоит закладывать сразу: восстановить, кто и что спрашивал у модели полгода назад, задним числом невозможно.
И граница, которую честнее назвать заранее: развёртывание в закрытом контуре не равно аттестации по требованиям защиты информации. Если задача требует аттестата соответствия — это работа лицензиатов ФСТЭК и ФСБ, отдельный процесс со своими сроками и документами. Подбор железа и конфигурации его не заменяет и не ускоряет.
Наконец, эксплуатация. GPU-узел потребляет и греется заметно сильнее обычного сервера: мощность ввода, охлаждение и место в стойке считаются до закупки, а не после. Это тот же расчёт, что и для ЦОД под ключ, просто в масштабе одной-двух стоек.
Ошибки, которые дороже всего
Пять из них встречаются чаще остальных, и все пять — про порядок действий, а не про технику.
- Купить железо до выбора модели. Дальше проект подгоняется под то, что уже стоит в стойке, — и обычно это значит меньшую модель, чем нужно, либо переплату за память, которая не пригодилась.
- Считать память по устаревшей формуле. Запас под контекст у современных моделей заметно меньше, чем даёт наивный расчёт: они используют GQA, где ключи и значения общие на группу голов внимания. Расчёт по старой схеме завышает требования в разы — и в разы же завышает закупку.
- Забыть про питание и охлаждение. Сервер помещается в стойку по габаритам и не помещается по киловаттам. Выясняется это после доставки.
- Оставить модель без своих данных. Контур построен, ответы общие. Без RAG и регламента обновления вы получили дорогую копию публичного сервиса внутри периметра.
- Не заложить обновление моделей. Открытые модели обновляются несколько раз в год. Если в проекте нет ответа, кто и когда меняет веса, через год контур работает на устаревшей модели, а бюджет уже закрыт.