Поддержка клиентов и обработка обращений
Модель отвечает на типовые обращения по базе знаний компании, а спорное и эмоциональное передаёт оператору вместе с готовым разбором ситуации. Ключ здесь не в красноречии модели, а в том, чтобы она честно понимала границу своей компетенции.
Что получаете: Первая линия разгружена, а ответы одинаково точны в три часа ночи и в час пик. Что нужно: модель уровня T-pro-it-1.0 при контексте 8 192 токенов и 32 одновременных запросах — это 108 ГБ памяти, то есть 1× NVIDIA H200. Модель увидит персональные данные. Значит включаются требования 152-ФЗ: обработка на своих мощностях снимает вопрос передачи третьему лицу, а при облачном сервисе понадобится поручение на обработку. Проверить сценарий до закупки дешевле на арендованной карте.
Что нужно, чтобы это заработало
- Правило передачи человеку и журнал всех ответов модели
- Много одновременных запросов: память под контекст растёт вместе с ними
- База знаний, которая обновляется, иначе модель отвечает по позапрошлому регламенту
Это не список покупок, а список решений. Дешевле всего они принимаются до закупки железа: конфигурация зависит от них сильнее, чем от выбора вендора карты.
Сколько железа
Посчитано по характеристикам модели T-pro-it-1.0 под типовую нагрузку этой задачи. Меняются контекст и число одновременных запросов — меняется и требование к железу, поэтому оба числа названы явно.
Доступ к весам модели: веса скачиваются свободно. Подбор карт — оценка сверху по памяти из нашего справочника ускорителей; скорость ответа, питание и охлаждение считаются отдельно, а программный стек под Ascend и AMD отличается от NVIDIA.
Данные и правовой режим
Что увидит модель: Обращения клиентов, история заказов, персональные данные.
Модель увидит персональные данные. Значит включаются требования 152-ФЗ: обработка на своих мощностях снимает вопрос передачи третьему лицу, а при облачном сервисе понадобится поручение на обработку.
Это информирование, а не юридическая консультация: решение о допустимости конкретного сценария принимает ваш юрист. Разбор лицензий самих моделей — на отдельной странице, устройство закрытого контура целиком — здесь.
Кого звать в проект
Инженер по диалоговым системам и специалист по клиентским процессам.
Мы называем профиль компетенции, а не список подрядчиков: под эту задачу нужен специалист именно этого профиля, и подбираем мы его под вашу задачу, а не по удобству. Разбор задачи, расчёт конфигурации и сборка команды — наша часть работы; сами работы выполняет и гарантирует тот, кто их делает, по договору с вами.
Рядом в семействе «клиенты и общение»
Сколько памяти нужно модели под эту задачу
Расчёт под ваш контекст и число одновременных запросов: сколько видеопамяти займут веса и кэш и на скольких картах это поместится.
Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.
- Все площадки с B300 (3) →
- Все площадки с H100 (18) →
- Все площадки с H200 (12) →
- Все площадки с A100 (22) →
- Все площадки с L40S (9) →
- Все площадки с RTX PRO 6000 Blackwell (5) →
- Все площадки с L4 (8) →
- Все площадки с RTX 5090 (5) →
- Все площадки с RTX 4090 (10) →
- Все площадки с RTX 3090 (3) →
- Все площадки с RTX A4000 (7) →
Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.
Разобрать задачу «поддержка клиентов и обработка обращений»
Опишите, как это устроено у вас: объём, число пользователей и какие данные увидит модель. Посчитаем конфигурацию, сравним со сценарием аренды и скажем, какой специалист нужен в проект.