Открытые LLM, которые можно поставить у себя
Каталог моделей с открытыми весами и расчётом железа под каждую. Мы не пересказываем характеристики, а снимаем их из файла конфигурации автора модели — поэтому память под контекст здесь считается по настоящей архитектуре, а не по прикидке от числа параметров.
В каталоге 22 модели четырёх классов: языковых — 12, для поиска по документам — 2, для распознавания речи — 4, для компьютерного зрения — 4. Российских — 5, с архитектурой MoE — 2. У 2 веса выдаются только после принятия условий, и это меняет процедуру закупки. Характеристики сняты из первоисточников 03.09.2026; лицензии разобраны отдельно — что разрешает лицензия. Расчёт памяти под свою нагрузку — подбор GPU, где всё это можно арендовать — площадки РФ.
Что здесь считается не так, как везде
Память под контекст считается по архитектуре
У модели может быть 8 KV-голов, а может 128 — разница в памяти на контекст десятикратная, и по числу параметров её не угадать. Мы берём настоящие числа из конфигурации: слои, KV-головы, размер головы. У DeepSeek внимание устроено ещё иначе (MLA, сжатое представление ключей), и обычная формула завышает память под контекст в 25 раз — здесь для него считается своя.
У MoE в памяти лежат все веса
«Активных 3 млрд из 20» — это про скорость. В память обязаны поместиться все двадцать, иначе модель не запустится. Мы считаем по полному размеру и говорим об этом прямо: на этом просчёте покупают сервер, на котором модель не заведётся.
Закрытость весов — это факт о модели
Часть моделей выдаётся только после принятия условий и одобрения автором. Мы не заводим технический аккаунт, чтобы обойти этот шаг: для предприятия он реален — доступ выдаёт третья сторона, и она может его не выдать.
Языковые модели
Колонка «нужно памяти» посчитана для одного профиля нагрузки, одинакового у всех строк: разрядность INT8, контекст 8 192 токенов, 8 одновременных запросов. Свой профиль можно задать на странице модели.
| Модель | Размер | Внимание | Контекст | Нужно памяти | Карты | Доступ к весам |
|---|---|---|---|---|---|---|
| T-pro-it-1.0 Т-Технологии РФ отдел или филиал | 32,8 млрд | GQA | 32 768 | 56,5 ГБ | 1× Huawei Ascend 910C | свободно |
| GigaChat-20B-A3B-instruct Сбер (ai-sage) РФ отдел или филиал | 20,6 млрд MoE: активных 6 из 64 | GQA | 131 072 | 32,2 ГБ | 1× NVIDIA L40S | свободно |
| Vikhr-Nemo-12B-Instruct-R Vikhrmodels РФ рабочая группа | 12,2 млрд | GQA | 1 024 000 | 25,4 ГБ | 1× NVIDIA RTX 5090 | свободно |
| YandexGPT 5 Lite 8B Pretrain Яндекс РФ рабочая группа | 8 млрд | GQA | 32 768 | 18,2 ГБ | 1× NVIDIA L4 | свободно |
| T-lite-it-1.0 Т-Технологии РФ рабочая группа | 7,6 млрд | GQA | 32 768 | 12,9 ГБ | 1× NVIDIA A16 | свободно |
| DeepSeek-V3 DeepSeek предприятие | 684,5 млрд MoE: активных 8 из 256 | MLA | 163 840 | 826 ГБ | 3× NVIDIA B300 | свободно |
| Qwen2.5-72B-Instruct Alibaba предприятие | 72,7 млрд | GQA | 32 768 | 108,7 ГБ | 1× NVIDIA H200 | свободно |
| Llama 3.3 70B Instruct Meta предприятие | 70,6 млрд | — | — | нет данных | — | под воротами |
| Qwen3-32B Alibaba отдел или филиал | 32,8 млрд | GQA | 40 960 | 56,5 ГБ | 1× Huawei Ascend 910C | свободно |
| Gemma 3 27B Instruct Google отдел или филиал | 27,4 млрд | — | — | нет данных | — | под воротами |
| Mistral Small 3.1 24B Instruct Mistral AI отдел или филиал | 24 млрд | GQA | 131 072 | 39,6 ГБ | 1× NVIDIA L40S | свободно |
| Qwen3-8B Alibaba рабочая группа | 8,2 млрд | GQA | 40 960 | 19,5 ГБ | 1× NVIDIA L4 | свободно |
«Карты» — самая экономная сборка из нашего справочника ускорителей под этот профиль: минимум карт, при равенстве — карта с меньшей памятью, чтобы не платить за излишек. Это оценка сверху по памяти, а не проектное решение: скорость ответа, охлаждение и питание считаются отдельно. Подбор идёт по объёму памяти и не учитывает программный стек: Ascend и AMD требуют другого инференс-сервера, чем NVIDIA, и это отдельный разговор при проектировании.
Модели для поиска по документам
Контур с ответами по вашей базе знаний (RAG) начинается не с языковой модели, а с модели эмбеддингов: она превращает документы в векторы, по которым идёт поиск. В каталогах о ней обычно забывают, а без неё контур не работает.
| Модель | Размер | Контекст | Лицензия | Зачем |
|---|---|---|---|---|
| multilingual-e5-large intfloat | 0,6 млрд | 514 | в карточке заявлено «mit», нашего разбора ещё нет | Вторая рабочая модель эмбеддингов с поддержкой русского. Нужна для сравнения: выбор одной без альтернативы — не выбор. |
| BGE-M3 BAAI | не опубликовано | 8 194 | в карточке заявлено «mit», нашего разбора ещё нет | Поиск по корпоративной базе знаний начинается не с языковой модели, а с модели эмбеддингов. Без неё RAG-контур не строится, а в каталогах о ней обычно забывают. |
Распознавание речи
Нужны там, где ИИ работает со звуком: расшифровка совещаний, речевая аналитика звонков, голосовые обращения. Числа памяти здесь не приводим намеренно — у речи нет «контекста в токенах», нагрузку задаёт длина записи и число параллельных потоков, и честный ответ на вопрос «сколько потянет одна карта» даёт замер, а не формула.
| Модель | Размер | Лицензия | Доступ к весам | Зачем в каталоге |
|---|---|---|---|---|
| Whisper large-v3 OpenAI | 1,5 млрд | в карточке заявлено «apache-2.0», нашего разбора ещё нет | свободно | Опорная модель распознавания речи: с неё начинают и с ней сравнивают. Под Apache 2.0, тогда как её же ускоренная версия turbo выложена под MIT — лицензия снова зависит от модели, а не от семейства. |
| Whisper large-v3-turbo OpenAI | 0,8 млрд | в карточке заявлено «mit», нашего разбора ещё нет | свободно | Вдвое меньше старшей версии и заметно быстрее — рабочий выбор, когда расшифровывать надо потоком, а не пакетом. |
| wav2vec2-large-ru-golos bond005 | не опубликовано | в карточке заявлено «apache-2.0», нашего разбора ещё нет | свободно | Модель под русскую речь, обученная на открытом корпусе Golos. Нужна для сравнения: универсальная модель и специально дообученная под язык ведут себя по-разному на телефонном качестве. |
| Parakeet TDT 0.6B NVIDIA | не опубликовано | в карточке заявлено «cc-by-4.0», нашего разбора ещё нет | свободно | Быстрая модель распознавания от NVIDIA. Лицензия CC-BY-4.0 требует указания авторства — условие мягкое, но его надо выполнить, а в корпоративных внедрениях об этом забывают. |
Компьютерное зрение
Контроль качества, поиск дефектов, видеоаналитика безопасности. Память под веса здесь невелика, а определяет всё другое: разрешение кадра, частота съёмки и число камер на одну карту. Это тоже измеряется, а не выводится из конфигурации.
| Модель | Размер | Лицензия | Доступ к весам | Зачем в каталоге |
|---|---|---|---|---|
| Segment Anything (SAM) Meta | 0,6 млрд | в карточке заявлено «apache-2.0», нашего разбора ещё нет | свободно | Выделяет границы объектов на изображении. В контроле качества нужна там, где важен не факт наличия детали, а её форма и размер. |
| Grounding DINO base IDEA Research | 0,2 млрд | в карточке заявлено «apache-2.0», нашего разбора ещё нет | свободно | Находит объекты по текстовому описанию, без обучения под каждый новый класс. Экономит самый дорогой этап проекта — разметку. |
| RT-DETR R50 PekingU | 0 млрд | в карточке заявлено «apache-2.0», нашего разбора ещё нет | свободно | Детектор реального времени под Apache 2.0 — прямая альтернатива YOLO там, где лицензия YOLO неприемлема. |
| YOLOv8 (Ultralytics) Ultralytics | не опубликовано | в карточке заявлено «agpl-3.0», нашего разбора ещё нет | свободно | Самый распространённый детектор — и главная лицензионная ловушка в компьютерном зрении: выложен под AGPL-3.0. Держим в каталоге именно поэтому: чтобы условие увидели до внедрения, а не после. |
⚠️ Отдельно про YOLO: самый распространённый детектор выложен под AGPL-3.0. Эта лицензия требует открыть исходный код продукта, доступного пользователям по сети, — то есть внутренний сервис на YOLO формально обязывает раскрыть свои наработки. Для предприятия это чаще всего неприемлемо, а узнают об этом обычно после внедрения. Альтернативы под Apache 2.0 стоят в той же таблице выше.