Qwen 3.8 27B локально: где скачать GGUF и сколько нужно памяти
Qwen3.8-27B на GPU с 16 GB и RTX 5080: размеры GGUF, короткий контекст, размещение на CPU и диагностика без путаницы между файлом и VRAM.
Исходные веса Qwen3.8-27B опубликованы Qwen по лицензии Apache 2.0. GGUF — отдельные конвертированные файлы. Сначала проверьте автора сборки и точное имя файла, затем рассчитайте память для запуска. Размер загрузки не равен требуемому объёму VRAM.
Хватит ли 16 GB и RTX 5080 для Qwen3.8-27B?
Видеокарта с 16 GB — ограниченная отправная точка, а не безусловное «да» или «нет». NVIDIA указывает 16 GB GDDR7 для RTX 5080. Рассмотрите более компактную квантизацию, короткий контекст и при необходимости размещение части весов на CPU. Одно имя Q4 не обещает запуск целиком на GPU. Ниже — варианты для проверки, а не протестированные нами конфигурации.
| Исходные условия | Что проверить сначала | Что ещё нужно измерить |
|---|---|---|
| GPU с 16 GB / RTX 5080, только текст | UD-Q3_K_XL; контекст 4096; один слот; автоматическое размещение на GPU в совместимой сборке | Свободную VRAM, фактическое число слоёв на GPU, RAM и пиковое потребление памяти |
| GPU с 16 GB и файл UD-Q4_K_M | Учесть, что 16,46 GB файла — около 15,33 GiB; оставить запас или разместить часть на CPU | Запас мал; размер файла сам по себе не доказывает ни успех, ни невозможность |
| GPU с 24–32 GB | Оценить 4-битный файл при контексте 4096, затем увеличивать контекст | Кеш, рабочие буферы, другие процессы и параллельные запросы |
| Mac с объединённой памятью 16 GB | Оставить память для macOS и приложений; проверить меньший файл и короткий контекст | ОС и модель делят общий пул, это не выделенные 16 GB VRAM |
| Изображения на любой системе | Добавить совместимый projector после успешного текста | Projector и обработка изображений требуют дополнительной памяти |
Карточка модели указывает нативный контекст 262 144 токена, но не обещает такую длину на вашем компьютере. Начальные 4K — диагностический выбор, не предел модели. Увеличивайте контекст после успешного типичного запроса и измерения свободной памяти.
Где скачать GGUF и сколько памяти оставить
Архитектуру, лицензию и рекомендации по запуску смотрите в официальной карточке Qwen. Таблица отражает список файлов Unsloth GGUF на 16 сентября 2026 года. Это конвертация сообщества, а не GGUF, выпущенный Qwen. Здесь GB — десятичная единица: 1 GB = 1 000 000 000 байт; 1 GiB = 1 073 741 824 байта. Проверенная ревизия конвертации: 4ca720788d1e01f1bff70c033e0d0028fd02e502.
| Файл | Размер GB | Размер GiB |
|---|---|---|
Qwen3.8-27B-UD-IQ2_XXS.gguf | 7,27 | 6,77 |
Qwen3.8-27B-UD-Q3_K_XL.gguf | 13,15 | 12,24 |
Qwen3.8-27B-UD-Q4_K_M.gguf | 16,46 | 15,33 |
Qwen3.8-27B-UD-Q4_K_XL.gguf | 17,56 | 16,35 |
Qwen3.8-27B-UD-Q6_K.gguf | 21,98 | 20,47 |
mmproj-F16.gguf | 0,93 | 0,86 |
Оставьте память для выполнения
Кроме весов нужны KV-кеш, вычислительные буферы, среда выполнения и память ОС. Выделенная VRAM, системная RAM и объединённая память Apple — разные ресурсы. Сумма RAM и VRAM не становится единым объёмом памяти GPU. Размещение на CPU требует достаточной RAM и меняет скорость. Использование swap не подтверждает достаточность физической памяти.
Для каждой попытки считайте веса на GPU + кеш и состояние + вычислительные буферы + projector и обработку изображений, если нужны + другие выделения GPU. Файл — лишь исходный ориентир для весов. Смотрите фактическое размещение и выделения в логе запуска, а не просто вычитайте загрузку из числа на коробке видеокарты.
На GPU с 24–32 GB начните с оценки 4-битного файла и короткого контекста. Для GPU с 16 GB может понадобиться более сильная квантизация или выгрузка части слоёв на CPU. На Mac с 16 GB оставьте память для macOS и приложений. Низкая битность может снизить качество: проверяйте её на своих задачах.
Скачайте модель и запустите llama.cpp
Установите свежую сборку llama.cpp с поддержкой модели, проверьте llama-server --version и локальную справку --help. Дата старой сборки сама по себе не доказывает совместимость. Пример ниже использует UD-Q3_K_XL размером 13,15 GB и контекст 4K. Это пример настройки, а не новый тест оборудования. Справочник сервера описывает контекст, параллельные слоты и слои на GPU; инструкция сборки — GPU-бэкенды. Для RTX используйте совместимые CUDA-сборку и драйвер, затем проверьте обнаруженное устройство, прежде чем связывать ошибку с квантизацией.
llama-server --version
llama-server --list-devices
curl --fail --location -o qwen38-27b.gguf \
"https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/resolve/4ca720788d1e01f1bff70c033e0d0028fd02e502/Qwen3.8-27B-UD-Q3_K_XL.gguf"
llama-server -m qwen38-27b.gguf -c 4096 --parallel 1 --n-gpu-layers auto --port 8080
auto позволяет поддерживаемому движку выбрать размещение; это не утверждение, что все слои останутся на GPU. Если параметр отклонён, проверьте версию и справку. Не считайте запрошенную конфигурацию применённой без подтверждения. Запишите фактическое размещение и контекст из лога запуска.
Для изображений нужен projector
Скачайте совместимый projector из того же репозитория конвертации и добавьте --mmproj mmproj.gguf к команде сервера. Текущий F16 projector Unsloth занимает около 0,93 GB дополнительно к основным весам. Успешная загрузка языковой части ещё не подтверждает работу изображений.
curl --fail --location -o mmproj.gguf \
"https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/resolve/4ca720788d1e01f1bff70c033e0d0028fd02e502/mmproj-F16.gguf"
llama-server -m qwen38-27b.gguf --mmproj mmproj.gguf -c 4096 --parallel 1 --n-gpu-layers auto --port 8080
Измеряйте свою нагрузку
Запишите ревизию репозитория, имя файла, сборку llama.cpp, оборудование, выгрузку слоёв и длину контекста. Измеряйте обработку входа отдельно от генерации, используя реальные размеры запросов. Короткий синтетический тест не описывает длительный сеанс агента.
Раньше статья приводила размеры файлов и результаты M2 Pro от 16 августа. Состав репозитория изменился: например, UD-IQ2_XXS теперь занимает 7,27 GB вместо указанных ранее 9,01 GB. Старую скорость нельзя переносить на новые файлы без повторного теста. В этом обновлении новый тест генерации не проводился.
Если запуск или ответ не удался
Сохраните первую полную ошибку и журнал выделений при запуске. Меняйте одну переменную за раз: тогда успешный повтор поможет понять причину.
| Симптом | Первая проверка | Следующий диагностический шаг |
|---|---|---|
| Неизвестная архитектура, тензор или параметр | Версия движка, выбранный GGUF и поддерживаемые флаги | Установить совместимую сборку; переименование тензоров или файла не исправляет поддержку |
| GPU не обнаружен, ошибка CUDA или ядра | Устройство, драйвер, совместимость CUDA-сборки | Следовать инструкции сборки; уменьшение контекста не добавит отсутствующий бэкенд |
| Память не выделяется при загрузке | Свободная VRAM/RAM, квантизация, размещение | Меньший файл или меньше слоёв на GPU при достаточной RAM |
| Запуск успешен, длинный запрос или изображение вызывает сбой | Контекст, параллельность, длина входа, projector | Снова проверить только текст, один слот и короткий контекст, затем наращивать нагрузку |
| Неожиданно низкая скорость | Размещение CPU/GPU, swap, время обработки входа отдельно от генерации | Посмотреть логи размещения до сравнения характеристик видеокарт |
| Ответ обрывается или финальный текст пуст | Причина завершения, бюджет рассуждений/вывода, chat template | Отделить лимит вывода от загрузки и памяти |
Низкоуровневая ошибка decode сама по себе не устанавливает конкретную причину нехватки памяти. Для отчёта сохраните файл и ревизию, сборку, команду, доступную память и минимальный проблемный вход. В этом обновлении не было нового инференса или измерения скорости RTX 5080.
Частые вопросы
Файл Q4 размером 16,46 GB заведомо больше памяти GPU на 16 GB?
Нельзя сравнивать подписи без единиц. Файл занимает около 15,33 GiB, но при запуске нужны кеш и рабочая память, а часть VRAM может занимать вывод изображения на монитор. Размер файла не доказывает ни успешную загрузку целиком на GPU, ни невозможность любого запуска.
Что уменьшать первым: контекст или размер квантизации?
Если веса не загружаются, сначала проверьте файл и размещение. Если загрузка проходит, но длинный запрос падает, изолируйте контекст и параллельность. Оба фактора влияют на память; стадия ошибки помогает выбрать проверку.
4096 — максимальный контекст модели?
Нет. Это небольшой диагностический контекст для примеров. Более высокий предел в карточке не подтверждает, что ваше оборудование сможет его выделить.
Локальный запуск или API
Локальная модель полезна для работы без сети и контроля данных. Для редких или больших задач сравните её с API, проверив актуальные ID, контекст и тарифы. Открытые веса 27B и Qwen3.8-Max — разные продукты; подробности в обзоре семейства Qwen.


