6 мин чтения
Сколько видеопамяти нужно для LLM: таблица и правило расчёта
Как посчитать память под веса модели в fp16, int8 и int4, сколько нужно для 8B, 14B, 32B и 70B моделей и почему контекст тоже занимает память.
Главное правило: веса модели целиком должны лежать в видеопамяти. Если их не хватает, часть слоёв уходит в оперативку, и генерация становится в разы медленнее.
Формула
Память под веса примерно равна числу параметров, умноженному на байты на параметр: 2 байта в fp16, 1 байт в int8, 0,5 байта в int4. Сверху нужен запас примерно 20% на KV-кэш, активации и служебные буферы.
память ≈ параметры (млрд) × байт/параметр × 1,2
пример: 14B в fp16 = 14 × 2 × 1,2 ≈ 34 ГБ
14B в int4 = 14 × 0,5 × 1,2 ≈ 8,4 ГБТаблица для популярных размеров
- 8B: fp16 ≈ 19 ГБ, int8 ≈ 10 ГБ, int4 ≈ 5 ГБ. На 24 ГБ — fp16 или int8 с запасом.
- 14B: fp16 ≈ 34 ГБ (не влезет в 24), int8 ≈ 17 ГБ, int4 ≈ 8 ГБ.
- 32B: int8 ≈ 38 ГБ, int4 ≈ 19 ГБ. На 24 ГБ — только int4.
- 70B: int4 ≈ 42 ГБ, int8 ≈ 84 ГБ. На одной карте 80 ГБ — int4; int8 нужна вторая карта.
Контекст тоже занимает память
Длинный чат или документ растят KV-кэш. Для 8B модели на контексте в несколько тысяч токенов это гигабайт-два, при контексте в десятки тысяч — заметно больше. Поэтому оставляйте запас и не доводите веса до предела карты.
Что выбрать
- Для чата и кода с моделями 7–8B: карта на 24 ГБ.
- Для моделей 32–34B с хорошим качеством: 24 ГБ в int4 или 48 ГБ и больше.
- Для 70B: 80 ГБ с int4 или две карты.
Все цифры — ориентиры для короткого контекста. Точное значение зависит от фреймворка, формата квантизации и настроек. Проверьте запуском на арендованном сервере: почасовая оплата позволяет протестировать модель за несколько минут.