4-битная модель обошла полноразмерную: что это меняет в смете на железо
Multiverse Computing опубликовала 25 августа 2026 года метод Quantization-Aware Healing: сжатая до 4 бит модель по их замерам обходит собственный полноразмерный оригинал. Для расчёта железа отсюда следует одно: 4 бита против 16 — это вчетверо меньше памяти под веса, но не вчетверо меньше памяти вообще.
Что предложено. Обычный конвейер выглядит так: сначала режут архитектуру, убирая слои, головы или нейроны, потом квантуют остаток до 4 бит, а затем «лечат» — доучивают, чтобы вернуть потерянное в рассуждении, математике и генерации кода. Авторы утверждают, что их вариант лечения выводит сжатую модель выше исходной полноразмерной; тем же способом, по их словам, собраны gpt-oss, семейство Nemotron и их собственная Hypernova 60B.
Что это значит в гигабайтах — считаем по нашему каталогу. Веса 32-миллиардной модели в 16 битах занимают около 65,5 ГБ, в 4 битах — 16,4 ГБ. Разница решает, влезет ли модель в одну карту. Но KV-кэш почти никогда не квантуется вместе с весами: у той же модели при контексте в 32 тысячи токенов кэш добавляет 8,6 ГБ, и сжатие весов эти гигабайты не трогает.
Отсюда правило, которого из громких заголовков не видно: чем сильнее сжаты веса, тем большую долю памяти занимает то, что не сжалось. У восьмимиллиардных моделей каталога при 32 тысячах токенов кэш уже больше весов — расчёт по десяти моделям. Квантование переносит границу «нужен сервер / хватит карты», а не отменяет её.
И оговорка, которой в англоязычных замерах не бывает: потери от 4 бит распределяются неравномерно, и на длинном контексте и на русском языке они заметнее, чем в исходных тестах. Механику сжатия и её влияние на выбор карты мы разбирали отдельно.
Переводим «4 бита вместо 16» в гигабайты и в карты по снятой архитектуре моделей каталога, а не по числу параметров. Видно и то, что квантование экономит, и то, чего оно не трогает, — память под контекст.
Характеристики моделей каталога снимает робот: слои, KV-головы, длина контекста. Отсюда доля памяти, на которую сжатие весов не влияет, считается, а не оценивается на глаз.
ПЕРВОИСТОЧНИКMultiverse Computing, блог Hugging Face, 25.08.2026 →
Экономию от 4 бит считайте только по весам, а память под контекст добавляйте отдельно — иначе смета занижена ровно на ту часть, которая растёт с числом пользователей.
Материал — экспертный разбор ЗероКвант на основе открытых данных; характеристики и суммы — ориентир, не юридическая консультация. Точный расчёт и статус — по запросу.