Сервер под ИИ без GPU: когда видеокарта не нужна
Половина задач корпоративного ИИ живёт без ускорителя вовсе, а вторая половина без него не живёт никак — и граница между ними проходит там, где её обычно не ищут. Разбираем, что упирается в железо на самом деле, и считаем, где именно процессор перестаёт справляться.
Генерация текста на процессоре упирается не в вычисления, а в пропускную способность памяти: чтобы выдать один токен, надо прочитать все веса модели. Отсюда потолок — ПСП ÷ размер модели, и он объясняет всё остальное: маленькая модель на процессоре работает, большая не работает нигде, а число ядер решает куда меньше, чем число заполненных каналов памяти. Без GPU уверенно живут векторный поиск, эмбеддинги, классификация и фоновая обработка документов. Нужен ускоритель для диалога с моделью от 30 млрд параметров, для нескольких пользователей сразу, для длинного контекста и для дообучения. Числа в таблице ниже считаются из физики, а не из обещаний. Данные нельзя наружу — закрытый ИИ-контур; нужна карта — аренда GPU.
Правило, из которого следует всё остальное
Языковая модель генерирует по одному токену за раз, и для каждого читает свои веса целиком. Значит, скорость ограничена тем, как быстро память отдаёт данные, — а не тем, как быстро процессор считает. Это не эвристика: так устроена авторегрессионная генерация.
Из этого правила сразу следуют три вывода, которые обычно узнают уже после покупки: память важнее ядер; квантование модели ускоряет её ровно во столько же раз, во сколько уменьшает; а сервер с недозаполненными каналами памяти работает кратно медленнее своей спецификации.
Где проходит граница
Скорость генерации в один поток, токенов в секунду. Модели в INT4 — самом выгодном для процессора режиме. Расчёт: пропускная способность × 60% (реально достижимая доля от пиковой) ÷ размер весов. Это оценка порядка величины, а не обещание: конкретный движок, версия и настройка дадут отклонение в обе стороны.
| Платформа памяти | ПСП | 1,5 млрдпараметров | 8 млрдпараметров | 32 млрдпараметров | 70 млрдпараметров |
|---|---|---|---|---|---|
| Рабочая станция, DDR5-5600, 2 канала Обычный компьютер или младший сервер начального уровня. | 90 ГБ/с | >60 упрётся в вычисления | 13,4 Годится для диалога | 3,4 Только пакетные задачи | 1,5 Непригодно |
| Сервер, DDR5-4800, 8 каналов Односокетная серверная платформа с полностью заполненными каналами. | 307 ГБ/с | >60 упрётся в вычисления | 46,1 Годится для диалога | 11,5 Годится для диалога | 5,3 Терпимо в фоне |
| Сервер, DDR5-4800, 12 каналов Старшая серверная платформа — предел того, что даёт обычная оперативная память. | 461 ГБ/с | >60 упрётся в вычисления | >60 упрётся в вычисления | 17,3 Годится для диалога | 7,9 Терпимо в фоне |
Размер весов в INT4: 1,5 млрд — 0.75 ГБ, 8 млрд — 4 ГБ, 32 млрд — 16 ГБ, 70 млрд — 35 ГБ. У самых маленьких моделей узкое место переезжает с памяти на вычисления, и формула по пропускной способности даёт недостижимое число — такие клетки помечены отдельно. Числа приведены для одного потока генерации. Второй пользователь не получает вторую такую же скорость: память у них общая.
Работает без GPU
Векторный поиск и база знаний
Хранилище эмбеддингов и поиск по нему — чистая работа процессора, памяти и NVMe. Именно этот слой обычно и составляет половину пользы корпоративного ИИ, а видеокарта ему не нужна вовсе.
Построение эмбеддингов
Модели векторизации на два-три порядка меньше языковых, и обрабатывают документы пачками в фоне. Индексация архива на процессоре — вопрос терпения, а не возможности.
Классификация и маршрутизация
Разметка обращений, определение темы и языка, отсев спама, выбор ветки сценария. Модели небольшие, ответ нужен короткий — процессор справляется.
Фоновая обработка документов
Извлечение полей, нормализация, краткие пересказы по расписанию. Никто не ждёт ответа на экране, поэтому две минуты на документ — приемлемо.
Пилот на малой модели
Проверить сценарий и качество ответов на модели до 8 млрд параметров можно и без ускорителя — а уже под доказанную нагрузку считать GPU.
Нужен ускоритель
Диалог с большой моделью
От 30 млрд параметров и выше интерактивная работа на процессоре превращается в ожидание: таблица ниже показывает это без слов.
Несколько пользователей сразу
Память одна на всех, и потоки генерации делят её между собой. На процессоре пакетная обработка помогает куда слабее, чем на GPU, поэтому десять человек — это не «чуть медленнее», а кратно медленнее.
Длинный контекст в RAG
Обработка присланного запроса упирается уже не в память, а в вычисления — и вот здесь процессор отстаёт от ускорителя особенно сильно. Подкладывая в контекст десятки страниц документов, вы платите именно этим.
Обучение и дообучение
Даже экономные методы вроде LoRA на процессоре считаются днями вместо часов. Практического смысла нет.
На что смотреть в конфигурации
Сначала объём, потом всё остальное
Модель обязана поместиться в оперативную память целиком, плюс запас на контекст, векторную базу и саму систему. Не поместилась — начинается подкачка с диска, и скорость падает не на проценты, а в разы.
Заполненные каналы, а не заявленные
Это самая дорогая ошибка в конфигурации. Сервер поддерживает восемь каналов памяти, а поставили в него две планки — и он работает как двухканальный, вчетверо медленнее спецификации. В накладной всё в порядке, на инференсе видно сразу. Спрашивайте не «сколько памяти», а «сколько планок и в скольких каналах».
Их нужно меньше, чем кажется
За пределами примерно 8–16 потоков память насыщается, и добавленные ядра перестают давать скорость. Процессор с вдвое большим числом ядер при той же памяти почти не ускорит генерацию — деньги уйдут туда, где узкого места нет.
NVMe под индекс и документы
Векторная база и архив документов живут на диске, и от него зависит скорость поиска, а не генерации. Обычный SATA-SSD здесь становится заметен, жёсткий диск — неприемлем.
Без CUDA — другой инструмент
На процессоре работают свои движки инференса, и готовых решений под них меньше, чем под ускорители NVIDIA. Это стоит проверить до аренды: часть корпоративных сборок просто не рассчитана на запуск без видеокарты.
Что дальше
- Видеокарта не нужна — сравнение серверов под первый ИИ-агент: тарифы отсортированы по памяти, а не по цене.
- Модель не помещается или диалог тормозит — посчитайте, какая карта нужна, и смотрите аренду GPU в РФ.
- Данные нельзя выпускать за периметр — закрытый ИИ-контур на своём оборудовании.
- Разбираетесь с порядком действий — гайд «с чего начать» и «как запустить LLM локально».
- Выбираете модель — что разрешают их лицензии.