Parakeet TDT 0.6B
Быстрая модель распознавания от NVIDIA. Лицензия CC-BY-4.0 требует указания авторства — условие мягкое, но его надо выполнить, а в корпоративных внедрениях об этом забывают.
Полную потребность в памяти посчитать не можем — не снята архитектура модели. Без числа слоёв и KV-голов память под контекст не считается, а складывать одни веса и называть это ответом — значит занизить его молча. Общий расчёт по числу параметров, с оговоркой что архитектура в нём предполагается, — калькулятор подбора GPU.
Характеристики
Сняты роботом из карточки модели и файла конфигурации, которые публикует сам автор.
Ревизия ae9ad07059c7. Проверено 02.09.2026.
Что разрешает лицензия
Нашего разбора этой лицензии по первоисточнику пока нет. В карточке модели заявлено «cc-by-4.0» — это метаданные, а не прочитанный нами текст лицензии, и на них нельзя опираться в корпоративном решении. Разобранные лицензии — здесь.
Что дальше
Сколько памяти нужно этой модели
Расчёт под ваш контекст и число одновременных запросов: сколько видеопамяти займут веса и кэш и на скольких картах это поместится.
Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.
- Все площадки с B300 (3) →
- Все площадки с H100 (18) →
- Все площадки с H200 (12) →
- Все площадки с A100 (22) →
- Все площадки с L40S (9) →
- Все площадки с RTX PRO 6000 Blackwell (5) →
- Все площадки с L4 (8) →
- Все площадки с RTX 5090 (5) →
- Все площадки с RTX 4090 (10) →
- Все площадки с RTX 3090 (3) →
- Все площадки с RTX A4000 (7) →
Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.