Запуск LLM на аренду GPU: Llama, Qwen, DeepSeek, Mistral
Большие языковые модели упираются в видеопамять: веса модели должны целиком лежать в GPU, иначе скорость падает в десятки раз. Арендуйте сервер под нужный размер модели, поднимите её одной командой и платите только за минуты работы.
Коротко
Языковые модели работают на видеокарте, когда веса целиком помещаются в её память: для большинства моделей нужно от 24 ГБ на GPU. На gpu.nz такие серверы стоят от 21 ₽ в час; шаблон Ollama с Open WebUI или vLLM запускается обычно за 1–5 минут.
Для моделей 8–14 млрд параметров нужно 24 ГБ: 14B помещается в int8, 8B в полной точности. Модели 32–34B влезают в 24 ГБ только в int4. Для 70B нужно 80 ГБ и квантизация в int4 либо две карты.
Видеопамять
24 ГБ+
Шаблоны
Ollama + Open WebUI
Как запустить
Выберите видеокарту с 24 ГБ и больше в каталоге и арендуйте сервер с шаблоном Ollama + Open WebUI.
Откройте веб-интерфейс чата из карточки сервера и скачайте модель, например qwen2.5:7b или llama3.1:8b.
Для API подключите сервер по SSH и вызывайте http://localhost:11434 (Ollama) или поднимите vLLM командой vllm serve.
Ollama + Open WebUI: Свой ChatGPT: Llama, Qwen, DeepSeek, Gemma. Чат в браузере и API.
Цена аренды
Вопросы и ответы
Какой видеокарты хватит для Llama 8B?
Модели 8B комфортно работают на 24 ГБ в полной точности или на 8–12 ГБ в int4. Для длинного контекста закладывайте запас памяти.
Можно ли поднять DeepSeek или Qwen 32B?
Да, на 24 ГБ модель 32–34B работает в int4, на 48 ГБ и больше — с более высоким качеством квантизации.
Нужен ли свой API-ключ модели?
Нет. Веса открытых моделей скачиваются с их публичных репозиториев, оплата идёт только за GPU-сервер.
Что будет с моделью, если остановить сервер?
Файлы остаются на диске, пока сервер существует. Диск тарифицируется и когда сервер остановлен, поэтому удалите лишнее или сохраняйте результаты заранее.