Главная/Запуск ИИ/Каталог моделей
КАТАЛОГ / ОТКРЫТЫЕ МОДЕЛИ

Открытые LLM, которые можно поставить у себя

Каталог моделей с открытыми весами и расчётом железа под каждую. Мы не пересказываем характеристики, а снимаем их из файла конфигурации автора модели — поэтому память под контекст здесь считается по настоящей архитектуре, а не по прикидке от числа параметров.

Коротко

В каталоге 22 модели четырёх классов: языковых — 12, для поиска по документам — 2, для распознавания речи — 4, для компьютерного зрения — 4. Российских — 5, с архитектурой MoE — 2. У 2 веса выдаются только после принятия условий, и это меняет процедуру закупки. Характеристики сняты из первоисточников 03.09.2026; лицензии разобраны отдельно — что разрешает лицензия. Расчёт памяти под свою нагрузку — подбор GPU, где всё это можно арендовать — площадки РФ.

Что здесь считается не так, как везде

Память под контекст считается по архитектуре

У модели может быть 8 KV-голов, а может 128 — разница в памяти на контекст десятикратная, и по числу параметров её не угадать. Мы берём настоящие числа из конфигурации: слои, KV-головы, размер головы. У DeepSeek внимание устроено ещё иначе (MLA, сжатое представление ключей), и обычная формула завышает память под контекст в 25 раз — здесь для него считается своя.

У MoE в памяти лежат все веса

«Активных 3 млрд из 20» — это про скорость. В память обязаны поместиться все двадцать, иначе модель не запустится. Мы считаем по полному размеру и говорим об этом прямо: на этом просчёте покупают сервер, на котором модель не заведётся.

Закрытость весов — это факт о модели

Часть моделей выдаётся только после принятия условий и одобрения автором. Мы не заводим технический аккаунт, чтобы обойти этот шаг: для предприятия он реален — доступ выдаёт третья сторона, и она может его не выдать.

Языковые модели

Колонка «нужно памяти» посчитана для одного профиля нагрузки, одинакового у всех строк: разрядность INT8, контекст 8 192 токенов, 8 одновременных запросов. Свой профиль можно задать на странице модели.

Модель Размер Внимание Контекст Нужно памяти Карты Доступ к весам
T-pro-it-1.0
Т-Технологии РФ отдел или филиал
32,8 млрд GQA 32 768 56,5 ГБ 1× Huawei Ascend 910C свободно
GigaChat-20B-A3B-instruct
Сбер (ai-sage) РФ отдел или филиал
20,6 млрд
MoE: активных 6 из 64
GQA 131 072 32,2 ГБ 1× NVIDIA L40S свободно
Vikhr-Nemo-12B-Instruct-R
Vikhrmodels РФ рабочая группа
12,2 млрд GQA 1 024 000 25,4 ГБ 1× NVIDIA RTX 5090 свободно
YandexGPT 5 Lite 8B Pretrain
Яндекс РФ рабочая группа
8 млрд GQA 32 768 18,2 ГБ 1× NVIDIA L4 свободно
T-lite-it-1.0
Т-Технологии РФ рабочая группа
7,6 млрд GQA 32 768 12,9 ГБ 1× NVIDIA A16 свободно
DeepSeek-V3
DeepSeek предприятие
684,5 млрд
MoE: активных 8 из 256
MLA 163 840 826 ГБ 3× NVIDIA B300 свободно
Qwen2.5-72B-Instruct
Alibaba предприятие
72,7 млрд GQA 32 768 108,7 ГБ 1× NVIDIA H200 свободно
Llama 3.3 70B Instruct
Meta предприятие
70,6 млрд нет данных под воротами
Qwen3-32B
Alibaba отдел или филиал
32,8 млрд GQA 40 960 56,5 ГБ 1× Huawei Ascend 910C свободно
Gemma 3 27B Instruct
Google отдел или филиал
27,4 млрд нет данных под воротами
Mistral Small 3.1 24B Instruct
Mistral AI отдел или филиал
24 млрд GQA 131 072 39,6 ГБ 1× NVIDIA L40S свободно
Qwen3-8B
Alibaba рабочая группа
8,2 млрд GQA 40 960 19,5 ГБ 1× NVIDIA L4 свободно

«Карты» — самая экономная сборка из нашего справочника ускорителей под этот профиль: минимум карт, при равенстве — карта с меньшей памятью, чтобы не платить за излишек. Это оценка сверху по памяти, а не проектное решение: скорость ответа, охлаждение и питание считаются отдельно. Подбор идёт по объёму памяти и не учитывает программный стек: Ascend и AMD требуют другого инференс-сервера, чем NVIDIA, и это отдельный разговор при проектировании.

Модели для поиска по документам

Контур с ответами по вашей базе знаний (RAG) начинается не с языковой модели, а с модели эмбеддингов: она превращает документы в векторы, по которым идёт поиск. В каталогах о ней обычно забывают, а без неё контур не работает.

Модель Размер Контекст Лицензия Зачем
multilingual-e5-large
intfloat
0,6 млрд 514 в карточке заявлено «mit», нашего разбора ещё нет Вторая рабочая модель эмбеддингов с поддержкой русского. Нужна для сравнения: выбор одной без альтернативы — не выбор.
BGE-M3
BAAI
не опубликовано 8 194 в карточке заявлено «mit», нашего разбора ещё нет Поиск по корпоративной базе знаний начинается не с языковой модели, а с модели эмбеддингов. Без неё RAG-контур не строится, а в каталогах о ней обычно забывают.

Распознавание речи

Нужны там, где ИИ работает со звуком: расшифровка совещаний, речевая аналитика звонков, голосовые обращения. Числа памяти здесь не приводим намеренно — у речи нет «контекста в токенах», нагрузку задаёт длина записи и число параллельных потоков, и честный ответ на вопрос «сколько потянет одна карта» даёт замер, а не формула.

Модель Размер Лицензия Доступ к весам Зачем в каталоге
Whisper large-v3
OpenAI
1,5 млрд в карточке заявлено «apache-2.0», нашего разбора ещё нет свободно Опорная модель распознавания речи: с неё начинают и с ней сравнивают. Под Apache 2.0, тогда как её же ускоренная версия turbo выложена под MIT — лицензия снова зависит от модели, а не от семейства.
Whisper large-v3-turbo
OpenAI
0,8 млрд в карточке заявлено «mit», нашего разбора ещё нет свободно Вдвое меньше старшей версии и заметно быстрее — рабочий выбор, когда расшифровывать надо потоком, а не пакетом.
wav2vec2-large-ru-golos
bond005
не опубликовано в карточке заявлено «apache-2.0», нашего разбора ещё нет свободно Модель под русскую речь, обученная на открытом корпусе Golos. Нужна для сравнения: универсальная модель и специально дообученная под язык ведут себя по-разному на телефонном качестве.
Parakeet TDT 0.6B
NVIDIA
не опубликовано в карточке заявлено «cc-by-4.0», нашего разбора ещё нет свободно Быстрая модель распознавания от NVIDIA. Лицензия CC-BY-4.0 требует указания авторства — условие мягкое, но его надо выполнить, а в корпоративных внедрениях об этом забывают.

Компьютерное зрение

Контроль качества, поиск дефектов, видеоаналитика безопасности. Память под веса здесь невелика, а определяет всё другое: разрешение кадра, частота съёмки и число камер на одну карту. Это тоже измеряется, а не выводится из конфигурации.

Модель Размер Лицензия Доступ к весам Зачем в каталоге
Segment Anything (SAM)
Meta
0,6 млрд в карточке заявлено «apache-2.0», нашего разбора ещё нет свободно Выделяет границы объектов на изображении. В контроле качества нужна там, где важен не факт наличия детали, а её форма и размер.
Grounding DINO base
IDEA Research
0,2 млрд в карточке заявлено «apache-2.0», нашего разбора ещё нет свободно Находит объекты по текстовому описанию, без обучения под каждый новый класс. Экономит самый дорогой этап проекта — разметку.
RT-DETR R50
PekingU
0 млрд в карточке заявлено «apache-2.0», нашего разбора ещё нет свободно Детектор реального времени под Apache 2.0 — прямая альтернатива YOLO там, где лицензия YOLO неприемлема.
YOLOv8 (Ultralytics)
Ultralytics
не опубликовано в карточке заявлено «agpl-3.0», нашего разбора ещё нет свободно Самый распространённый детектор — и главная лицензионная ловушка в компьютерном зрении: выложен под AGPL-3.0. Держим в каталоге именно поэтому: чтобы условие увидели до внедрения, а не после.

⚠️ Отдельно про YOLO: самый распространённый детектор выложен под AGPL-3.0. Эта лицензия требует открыть исходный код продукта, доступного пользователям по сети, — то есть внутренний сервис на YOLO формально обязывает раскрыть свои наработки. Для предприятия это чаще всего неприемлемо, а узнают об этом обычно после внедрения. Альтернативы под Apache 2.0 стоят в той же таблице выше.

Частые вопросы

Считается из двух частей, и вторую обычно забывают. Первая — веса: число параметров, умноженное на разрядность (в INT4 это половина байта на параметр). Вторая — KV-кэш, память под контекст, и она растёт вместе с длиной контекста и числом одновременных запросов. На длинном контексте кэш обгоняет веса: у модели на 8 млрд параметров веса в INT4 занимают около 4 ГБ, а контекст 32 тысячи токенов на 8 одновременных пользователей — почти 39 ГБ. Именно поэтому «модель на 8B влезет в карту 24 ГБ» верно для одного пользователя и неверно для отдела.