Термины вычислительного железа простыми словами
Короткий словарь терминов, которые встречаются в каталоге, гайдах и сравнениях: от памяти HBM и форматов FP8/FP4 до параллельного импорта и техсбора-2026. Каждое определение — не длиннее двух предложений, чтобы быстро понять суть, и ведёт на разбор, где тема раскрыта глубже.
- Большая фундаментальная модель
-
Термин российского закона об искусственном интеллекте, а не разговорное слово. Под определение попадает модель, которая одновременно служит основой для разного программного обеспечения, применяется для большого количества разных задач и содержит не менее 1 миллиарда параметров. Размер — единственный признак, выраженный числом, и его видно в характеристиках до развёртывания.
- Внимание: MHA, GQA, MLA
-
Три схемы устройства внимания, от которых зависит размер KV-кэша при равном числе параметров. MHA — классическая и самая прожорливая; GQA экономит память, объединяя головы в группы; MLA сжимает кэш и даёт разницу с наивным расчётом в десятки раз. Практический вывод: память под контекст нельзя прикинуть по числу параметров, её считают по архитектуре конкретной модели.
- Галлюцинация
-
Уверенный и правдоподобный ответ, который не соответствует действительности. Не сбой, а свойство: модель предсказывает продолжение текста, а не проверяет факты. Отсюда два рабочих приёма — отвечать по приложенным документам со ссылкой на источник и ограничивать область решений, которые система принимает по ответу модели. Требования ФСТЭК к государственным системам прямо предписывают вырабатывать критерии выявления недостоверных ответов.
- Дообучение (fine-tuning)
-
Настройка готовой модели на своих данных, чтобы она говорила вашим языком и знала вашу предметную область. Отличается от RAG принципиально: RAG подкладывает документы в контекст и ничего не меняет в модели, дообучение меняет саму модель. ⚠️ По российскому закону об искусственном интеллекте модификация модели попадает под определение разработки — со всем, что закон дальше адресует разработчику.
- Инференс (inference)
-
Инференс — эксплуатация уже обученной модели: она отвечает на запросы. Здесь важнее объём памяти под модель и KV-кэш, задержка и стоимость запроса, чем пиковые вычисления.
- Инференс-сервер
-
Программа, которая превращает файл с весами в работающий сервис: принимает запросы, складывает их в пакеты, ведёт очередь и отдаёт ответы. От него зависит, сколько человек обслужит одна карта, — разница между «запустил модель» и «выдержал сотню пользователей» лежит именно здесь, а не в железе.
- Квантование
-
Перевод весов модели в более грубые числа: из 16 бит в 8 или 4. Память под веса падает вдвое или вчетверо, скорость растёт, качество снижается — насколько, зависит от модели и задачи. Приём, который чаще всего решает вопрос «влезет ли модель в имеющуюся карту». Важно: KV-кэш при этом обычно остаётся 16-битным и не сжимается вместе с весами.
- Контекст (контекстное окно)
-
Сколько токенов модель удерживает в поле зрения за один раз — вопрос, ваши документы и её собственный ответ вместе. Всё, что не поместилось, для модели не существует. Длина контекста напрямую определяет требуемую видеопамять: чем длиннее окно, тем больше KV-кэш, и растёт он линейно, а не «немного».
- Обучение (training)
-
Обучение — процесс, в котором модель прогоняет данные, считает градиенты и обновляет веса. Вычислительно тяжёлый режим, хорошо масштабируемый на много карт и узлов при быстрых межсоединениях.
- Открытые веса
-
Модель, файлы которой можно скачать и запустить у себя. ⚠️ «Открытые веса» не равно «свободная лицензия»: условия задаёт конкретная лицензия конкретной модели, и она бывает с порогом по числу пользователей, с обязательной атрибуцией или запретом на коммерческое применение. Лицензия кода при этом не равна лицензии весов, а лицензия семейства — лицензии отдельной модели.
- Параллельный импорт
-
Параллельный импорт — ввоз оригинального товара без разрешения правообладателя, легализованный в РФ перечнем Минпромторга. Позволяет законно ввозить брендовую технику под санкциями США; это не контрафакт, товар подлинный.
- Суверенная и национальная модель
-
Два статуса из российского закона об ИИ. Общее у них: разработчик — российское юрлицо, а ответы пользователям и хранение данных обеспечиваются в центрах обработки данных на территории России, принадлежащих российским компаниям. Национальная требует вдобавок, чтобы заимствованные компоненты распространялись под открытой лицензией. Случаи, когда допускаются только такие модели, устанавливает Правительство.
- Техсбор (технологический сбор)
-
Технологический сбор — новый платёж на электронику в РФ: 3–5% (до 5000 ₽/ед.) с 01.09.2026, с 01.12.2026 — и на готовую технику. Добавляется к стоимости ввоза; ставка демонстрационная и уточняется.
- ТН ВЭД
-
ТН ВЭД — товарная номенклатура внешнеэкономической деятельности: код, по которому классифицируют товар на таможне. От кода зависят пошлина, требования и статус ввоза (например, серверы — 8471 49 000 0).
- Токен
-
Кусок текста, которым модель измеряет работу: примерно 3–4 символа русского текста, то есть слово обычно занимает от одного до трёх токенов. Токенами считают и то, что вы отправили, и то, что модель ответила, — по ним же начисляется плата у поставщиков API. Отсюда практическое следствие: страница договора это тысячи токенов, а не «один запрос».
- Утильсбор
-
Утилизационный сбор — платёж за будущую утилизацию ввозимого товара. В контексте вычислительной техники его нередко путают с новым технологическим сбором 2026 года; конкретная применимость по позиции уточняется.
- Эмбеддинг
-
Представление текста числовым вектором так, что близкие по смыслу тексты оказываются рядом. На этом стоит поиск по документам: запрос и фрагменты архива переводятся в векторы, и система находит совпадения по смыслу, а не по буквам. Модели-эмбеддеры обычно на порядок меньше языковых и работают даже на скромной карте.
- DGX
-
DGX — заводская ИИ-система NVIDIA с фиксированной конфигурацией и готовым программным стеком. Выбирают за предсказуемость и эталонную совместимость; гибче и дешевле — сборка на платформе HGX.
- FP8 / FP4
-
FP8 и FP4 — форматы вычислений пониженной точности (8 и 4 бита). Чем ниже точность, тем быстрее и экономичнее считает ускоритель на подходящих задачах: FP8 появился в Hopper (H100), FP4 — в Blackwell (B200).
- GGUF
-
Формат файла, в котором модель раздают для локального запуска: один файл со всеми весами и метаданными, который читают llama.cpp и надстройки над ним — Ollama и LM Studio. От того, как модель лежит на Hugging Face, отличается устройством: там веса хранятся в исходной разрядности и разложены по нескольким файлам рядом с конфигурацией и токенизатором, а GGUF собирает всё в один файл и почти всегда несёт уже квантованную копию — ради этого его и собирают. Отсюда суффиксы в имени файла (Q8, Q4_K_M и родственные): они называют разрядность и способ сжатия, а не качество — качество ответа мы не измеряем.
- HBM / HBM3e
-
HBM (High Bandwidth Memory) — сверхбыстрая память, размещённая прямо в корпусе ускорителя, а не на плате. HBM3e — её актуальное поколение с наибольшей пропускной способностью; именно объём и скорость HBM определяют, какая модель поместится на карту.
- HGX
-
HGX — эталонная плата-платформа NVIDIA на 4 или 8 GPU с NVLink/NVSwitch, на основе которой OEM-производители собирают GPU-серверы. Даёт гибкость по CPU, памяти и дискам и обычно выгоднее готовой DGX по цене.
- InfiniBand
-
InfiniBand — сетевая технология с низкими задержками для связи узлов в ИИ-кластере (400G, 800G). При обучении на многих узлах именно она чаще всего становится узким местом, а не сами GPU.
- KV-кэш
-
Память, в которой модель держит уже прочитанную часть диалога, чтобы не считать её заново. Главная причина, по которой «модель на 7 млрд параметров» не помещается в карту, где хватало места её весам: кэш растёт от длины контекста и числа одновременных запросов и легко превосходит сами веса. Считается по архитектуре модели, а не по числу параметров, и у разных схем внимания формулы отличаются в разы.
- LoRA
-
Способ дообучить модель, не трогая её основные веса: рядом обучается небольшая надстройка, которая и хранит всё новое. Требует в разы меньше памяти и времени, чем полное дообучение, и позволяет держать несколько специализаций на одной базовой модели, переключая надстройки.
- MoE (смесь экспертов)
-
Архитектура, где модель состоит из множества частей-экспертов, а на каждый токен работает лишь несколько из них. Скорость такая, будто модель маленькая, качество — будто большая. ⚠️ Ловушка при подборе железа: в памяти держатся ВСЕ веса, а не только активные. Модель «активных 3 млрд из 30» требует памяти под все тридцать.
- NVLink
-
NVLink — скоростное межсоединение NVIDIA для прямого обмена данными между GPU внутри узла (до сотен ГБ/с). Вместе с NVSwitch объединяет карты в единый домен, что критично для обучения крупных моделей.
- RAG (поиск по своим документам)
-
Схема, при которой модель отвечает не по памяти, а по вашим документам: сначала поиск находит нужные фрагменты, затем они подкладываются модели в контекст. Так корпоративная база знаний начинает работать без дообучения модели, а ответ можно проверить по источнику. Самый частый первый сценарий внедрения — материал уже есть, а ценность видна на второй день.
- TDP
-
TDP (Thermal Design Power) — расчётная тепловая мощность, которую должна отвести система охлаждения. У современных ускорителей это 400–1400 Вт на карту; TDP задаёт требования к питанию и охлаждению узла и ЦОД.
- TFLOPS
-
TFLOPS — триллион операций с плавающей точкой в секунду, мера пиковой вычислительной мощности. Сравнивать TFLOPS корректно только в одном формате точности: FP8 и FP4 несопоставимы напрямую.
- TTFT (время до первого токена)
-
Сколько человек ждёт, прежде чем увидит первое слово ответа. Величина, которую забывают рядом с пропускной способностью, — и напрасно: под высокой нагрузкой токенов в секунду становится больше, а ждать первого слова приходится десятки секунд. Формально быстрее, практически неработоспособно. Для живого диалога TTFT важнее общей пропускной способности.
- VRAM
-
VRAM (Video RAM) — видеопамять ускорителя, куда загружаются модель и промежуточные данные. В ИИ-ускорителях роль VRAM играет HBM; её объём (80–288 ГБ) напрямую ограничивает размер модели, помещающейся на одну карту.