МОДЕЛЬ / META

Llama 3.3 70B Instruct

Самое известное семейство открытых моделей. Веса выдаются только после принятия условий — это факт, который меняет процедуру закупки в организации.

зарубежная под воротами
Коротко

Модель на 70,6 млрд параметров: в INT8 это около 70,6 ГБ под одни только веса. Полную потребность в памяти посчитать не можем — не снята архитектура модели: веса выдаются только после принятия условий и входа в аккаунт, а вместе с ними закрыт и файл конфигурации. Без числа слоёв и KV-голов память под контекст не считается, а складывать одни веса и называть это ответом — значит занизить его молча. Общий расчёт по числу параметров, с оговоркой что архитектура в нём предполагается, — калькулятор подбора GPU.

Характеристики

Сняты роботом из карточки модели и файла конфигурации, которые публикует сам автор. Ревизия 6f6073b42301. Проверено 02.09.2026.

РазработчикMeta
Параметры70,6 млрд
Разрядность весовBF16
Доступ к весамвеса выдаются после принятия условий и одобрения автором
Первоисточник карточка модели

Во что обходится миллион токенов

Сколько просят за токены этой модели наблюдаемые поставщики. Цена снята с прайса, у неё есть дата и источник.

ЧУЖОЙ API
36 ₽
за миллион токенов генерации — самое дешёвое из 5 предложений, у RouterAI. Проверено 02.09.2026. Та же модель у Polza AI — 143 ₽, дороже в 4 раза.

Вторая половина счёта пустая: полную потребность в памяти по этой модели мы не считаем, а без неё нечего умножать на ставку. Вся картина по токенам — на странице цены миллиона.

Что разрешает лицензия

Llama 3.3 Community License Да, с условием своя лицензия вендора
If, on the Llama 3.3 version release date, the monthly active users of the products or services made available by or for Licensee, or Licensee’s affiliates, is greater than 700 million monthly active users in the preceding calendar month, you must request a license from Meta, which Meta may grant to you in its sole discretion

Порог: 700 млн активных пользователей в месяц у продукта лицензиата или его аффилированных лиц

Обязательства по указанию: «Built with Llama» на сайте, в интерфейсе или документации продукта; производная модель должна начинаться со слова «Llama»

Переносится дальше: ограничения по применению вы обязаны включить в собственные договоры с теми, кому передаёте модель или продукт на её основе.

Порог заведомо недостижим для корпоративного контура — практически лицензия разрешает коммерческое использование. Но к ней приложена политика допустимого использования (AUP), и её ограничения переносятся на всех, кому вы передаёте модель.

Первоисточник: файл лицензии, прочитан 15.08.2026. Полный разбор всех лицензий — на отдельной странице.

10-я по размеру из 12 моделей класса «языковая модель»

Размер решает, на чём модель поедет: 70,6 млрд параметров — это легче 2 моделей класса и тяжелее 9 моделей. Ряд ниже — модели того же класса по числу параметров; расчёт памяти у каждой свой.

1 T-lite-it-1.0 7,6 млрд
3 Qwen3-8B 8,2 млрд
4 Vikhr-Nemo-12B-Instruct-R 12,2 млрд
5 GigaChat-20B-A3B-instruct 20,6 млрд
7 Gemma 3 27B Instruct 27,4 млрд
8 T-pro-it-1.0 32,8 млрд
9 Qwen3-32B 32,8 млрд
10 Llama 3.3 70B Instruct — эта страница 70,6 млрд
11 Qwen2.5-72B-Instruct 72,7 млрд
12 DeepSeek-V3 684,5 млрд

Что дальше

Сколько памяти нужно этой модели

Расчёт под ваш контекст и число одновременных запросов: сколько видеопамяти займут веса и кэш и на скольких картах это поместится.

Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.

Требуемая VRAM ≈ 169 ГБ
Память под веса140 ГБ
KV-кэш (инференс)1,3 ГБ
Достаточно одной карты
Сколько карт нужно
NVIDIA H100 80 ГБ
NVIDIA H200 141 ГБ
NVIDIA B200 192 ГБ
NVIDIA B300 288 ГБ
NVIDIA A100 80 ГБ
NVIDIA L40S 48 ГБ
RTX PRO 6000 96 ГБ
RTX 6000 Ada 48 ГБ
AMD Instinct MI300X 192 ГБ
Huawei Ascend 910C 64 ГБ
NVIDIA A16 16 ГБ 11×
NVIDIA L4 24 ГБ
NVIDIA RTX 5090 32 ГБ
NVIDIA RTX 4090 24 ГБ
NVIDIA RTX 3090 24 ГБ
NVIDIA RTX A4000 16 ГБ 11×

Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.

Важно. Расчёт ориентировочный (rule-of-thumb) и не является офертой. Реальная потребность в VRAM зависит от архитектуры модели, движка инференса, длины контекста, метода дообучения (полное / LoRA / QLoRA) и параллелизма. Данные карт (память, TDP) — ориентир, требуют выверки по datasheet. Точный подбор под вашу модель эксперт подтверждает по запросу.