Главная/Глоссарий
ГЛОССАРИЙ

Термины вычислительного железа простыми словами

Коротко

Короткий словарь терминов, которые встречаются в каталоге, гайдах и сравнениях: от памяти HBM и форматов FP8/FP4 до параллельного импорта и техсбора-2026. Каждое определение — не длиннее двух предложений, чтобы быстро понять суть, и ведёт на разбор, где тема раскрыта глубже.

Большая фундаментальная модель

Термин российского закона об искусственном интеллекте, а не разговорное слово. Под определение попадает модель, которая одновременно служит основой для разного программного обеспечения, применяется для большого количества разных задач и содержит не менее 1 миллиарда параметров. Размер — единственный признак, выраженный числом, и его видно в характеристиках до развёртывания.

Внимание: MHA, GQA, MLA

Три схемы устройства внимания, от которых зависит размер KV-кэша при равном числе параметров. MHA — классическая и самая прожорливая; GQA экономит память, объединяя головы в группы; MLA сжимает кэш и даёт разницу с наивным расчётом в десятки раз. Практический вывод: память под контекст нельзя прикинуть по числу параметров, её считают по архитектуре конкретной модели.

Галлюцинация

Уверенный и правдоподобный ответ, который не соответствует действительности. Не сбой, а свойство: модель предсказывает продолжение текста, а не проверяет факты. Отсюда два рабочих приёма — отвечать по приложенным документам со ссылкой на источник и ограничивать область решений, которые система принимает по ответу модели. Требования ФСТЭК к государственным системам прямо предписывают вырабатывать критерии выявления недостоверных ответов.

Дообучение (fine-tuning)

Настройка готовой модели на своих данных, чтобы она говорила вашим языком и знала вашу предметную область. Отличается от RAG принципиально: RAG подкладывает документы в контекст и ничего не меняет в модели, дообучение меняет саму модель. ⚠️ По российскому закону об искусственном интеллекте модификация модели попадает под определение разработки — со всем, что закон дальше адресует разработчику.

Инференс (inference)

Инференс — эксплуатация уже обученной модели: она отвечает на запросы. Здесь важнее объём памяти под модель и KV-кэш, задержка и стоимость запроса, чем пиковые вычисления.

Инференс-сервер

Программа, которая превращает файл с весами в работающий сервис: принимает запросы, складывает их в пакеты, ведёт очередь и отдаёт ответы. От него зависит, сколько человек обслужит одна карта, — разница между «запустил модель» и «выдержал сотню пользователей» лежит именно здесь, а не в железе.

Квантование

Перевод весов модели в более грубые числа: из 16 бит в 8 или 4. Память под веса падает вдвое или вчетверо, скорость растёт, качество снижается — насколько, зависит от модели и задачи. Приём, который чаще всего решает вопрос «влезет ли модель в имеющуюся карту». Важно: KV-кэш при этом обычно остаётся 16-битным и не сжимается вместе с весами.

Контекст (контекстное окно)

Сколько токенов модель удерживает в поле зрения за один раз — вопрос, ваши документы и её собственный ответ вместе. Всё, что не поместилось, для модели не существует. Длина контекста напрямую определяет требуемую видеопамять: чем длиннее окно, тем больше KV-кэш, и растёт он линейно, а не «немного».

Обучение (training)

Обучение — процесс, в котором модель прогоняет данные, считает градиенты и обновляет веса. Вычислительно тяжёлый режим, хорошо масштабируемый на много карт и узлов при быстрых межсоединениях.

Открытые веса

Модель, файлы которой можно скачать и запустить у себя. ⚠️ «Открытые веса» не равно «свободная лицензия»: условия задаёт конкретная лицензия конкретной модели, и она бывает с порогом по числу пользователей, с обязательной атрибуцией или запретом на коммерческое применение. Лицензия кода при этом не равна лицензии весов, а лицензия семейства — лицензии отдельной модели.

Параллельный импорт

Параллельный импорт — ввоз оригинального товара без разрешения правообладателя, легализованный в РФ перечнем Минпромторга. Позволяет законно ввозить брендовую технику под санкциями США; это не контрафакт, товар подлинный.

Суверенная и национальная модель

Два статуса из российского закона об ИИ. Общее у них: разработчик — российское юрлицо, а ответы пользователям и хранение данных обеспечиваются в центрах обработки данных на территории России, принадлежащих российским компаниям. Национальная требует вдобавок, чтобы заимствованные компоненты распространялись под открытой лицензией. Случаи, когда допускаются только такие модели, устанавливает Правительство.

Техсбор (технологический сбор)

Технологический сбор — новый платёж на электронику в РФ: 3–5% (до 5000 ₽/ед.) с 01.09.2026, с 01.12.2026 — и на готовую технику. Добавляется к стоимости ввоза; ставка демонстрационная и уточняется.

ТН ВЭД

ТН ВЭД — товарная номенклатура внешнеэкономической деятельности: код, по которому классифицируют товар на таможне. От кода зависят пошлина, требования и статус ввоза (например, серверы — 8471 49 000 0).

Токен

Кусок текста, которым модель измеряет работу: примерно 3–4 символа русского текста, то есть слово обычно занимает от одного до трёх токенов. Токенами считают и то, что вы отправили, и то, что модель ответила, — по ним же начисляется плата у поставщиков API. Отсюда практическое следствие: страница договора это тысячи токенов, а не «один запрос».

Утильсбор

Утилизационный сбор — платёж за будущую утилизацию ввозимого товара. В контексте вычислительной техники его нередко путают с новым технологическим сбором 2026 года; конкретная применимость по позиции уточняется.

Эмбеддинг

Представление текста числовым вектором так, что близкие по смыслу тексты оказываются рядом. На этом стоит поиск по документам: запрос и фрагменты архива переводятся в векторы, и система находит совпадения по смыслу, а не по буквам. Модели-эмбеддеры обычно на порядок меньше языковых и работают даже на скромной карте.

DGX

DGX — заводская ИИ-система NVIDIA с фиксированной конфигурацией и готовым программным стеком. Выбирают за предсказуемость и эталонную совместимость; гибче и дешевле — сборка на платформе HGX.

FP8 / FP4

FP8 и FP4 — форматы вычислений пониженной точности (8 и 4 бита). Чем ниже точность, тем быстрее и экономичнее считает ускоритель на подходящих задачах: FP8 появился в Hopper (H100), FP4 — в Blackwell (B200).

GGUF

Формат файла, в котором модель раздают для локального запуска: один файл со всеми весами и метаданными, который читают llama.cpp и надстройки над ним — Ollama и LM Studio. От того, как модель лежит на Hugging Face, отличается устройством: там веса хранятся в исходной разрядности и разложены по нескольким файлам рядом с конфигурацией и токенизатором, а GGUF собирает всё в один файл и почти всегда несёт уже квантованную копию — ради этого его и собирают. Отсюда суффиксы в имени файла (Q8, Q4_K_M и родственные): они называют разрядность и способ сжатия, а не качество — качество ответа мы не измеряем.

HBM / HBM3e

HBM (High Bandwidth Memory) — сверхбыстрая память, размещённая прямо в корпусе ускорителя, а не на плате. HBM3e — её актуальное поколение с наибольшей пропускной способностью; именно объём и скорость HBM определяют, какая модель поместится на карту.

HGX

HGX — эталонная плата-платформа NVIDIA на 4 или 8 GPU с NVLink/NVSwitch, на основе которой OEM-производители собирают GPU-серверы. Даёт гибкость по CPU, памяти и дискам и обычно выгоднее готовой DGX по цене.

InfiniBand

InfiniBand — сетевая технология с низкими задержками для связи узлов в ИИ-кластере (400G, 800G). При обучении на многих узлах именно она чаще всего становится узким местом, а не сами GPU.

KV-кэш

Память, в которой модель держит уже прочитанную часть диалога, чтобы не считать её заново. Главная причина, по которой «модель на 7 млрд параметров» не помещается в карту, где хватало места её весам: кэш растёт от длины контекста и числа одновременных запросов и легко превосходит сами веса. Считается по архитектуре модели, а не по числу параметров, и у разных схем внимания формулы отличаются в разы.

LoRA

Способ дообучить модель, не трогая её основные веса: рядом обучается небольшая надстройка, которая и хранит всё новое. Требует в разы меньше памяти и времени, чем полное дообучение, и позволяет держать несколько специализаций на одной базовой модели, переключая надстройки.

MoE (смесь экспертов)

Архитектура, где модель состоит из множества частей-экспертов, а на каждый токен работает лишь несколько из них. Скорость такая, будто модель маленькая, качество — будто большая. ⚠️ Ловушка при подборе железа: в памяти держатся ВСЕ веса, а не только активные. Модель «активных 3 млрд из 30» требует памяти под все тридцать.

RAG (поиск по своим документам)

Схема, при которой модель отвечает не по памяти, а по вашим документам: сначала поиск находит нужные фрагменты, затем они подкладываются модели в контекст. Так корпоративная база знаний начинает работать без дообучения модели, а ответ можно проверить по источнику. Самый частый первый сценарий внедрения — материал уже есть, а ценность видна на второй день.

TDP

TDP (Thermal Design Power) — расчётная тепловая мощность, которую должна отвести система охлаждения. У современных ускорителей это 400–1400 Вт на карту; TDP задаёт требования к питанию и охлаждению узла и ЦОД.

TFLOPS

TFLOPS — триллион операций с плавающей точкой в секунду, мера пиковой вычислительной мощности. Сравнивать TFLOPS корректно только в одном формате точности: FP8 и FP4 несопоставимы напрямую.

TTFT (время до первого токена)

Сколько человек ждёт, прежде чем увидит первое слово ответа. Величина, которую забывают рядом с пропускной способностью, — и напрасно: под высокой нагрузкой токенов в секунду становится больше, а ждать первого слова приходится десятки секунд. Формально быстрее, практически неработоспособно. Для живого диалога TTFT важнее общей пропускной способности.

VRAM

VRAM (Video RAM) — видеопамять ускорителя, куда загружаются модель и промежуточные данные. В ИИ-ускорителях роль VRAM играет HBM; её объём (80–288 ГБ) напрямую ограничивает размер модели, помещающейся на одну карту.

Термин раскрыт глубже в наших материалах: экспертные гайды, сравнения ускорителей и каталог железа.