Qwen 3.8 27B локально: где скачать GGUF и сколько нужно памяти

Qwen3.8-27B на GPU с 16 GB и RTX 5080: размеры GGUF, короткий контекст, размещение на CPU и диагностика без путаницы между файлом и VRAM.

Плоская изометрическая иллюстрация: настольная рабочая станция рядом со ступенчатой стопкой блоков памяти, яркая оранжевая линия отмечает жёсткий потолок посередине стопки, блоки выше неё обесцвечены.

Исходные веса Qwen3.8-27B опубликованы Qwen по лицензии Apache 2.0. GGUF — отдельные конвертированные файлы. Сначала проверьте автора сборки и точное имя файла, затем рассчитайте память для запуска. Размер загрузки не равен требуемому объёму VRAM.

Хватит ли 16 GB и RTX 5080 для Qwen3.8-27B?

Видеокарта с 16 GB — ограниченная отправная точка, а не безусловное «да» или «нет». NVIDIA указывает 16 GB GDDR7 для RTX 5080. Рассмотрите более компактную квантизацию, короткий контекст и при необходимости размещение части весов на CPU. Одно имя Q4 не обещает запуск целиком на GPU. Ниже — варианты для проверки, а не протестированные нами конфигурации.

Исходные условияЧто проверить сначалаЧто ещё нужно измерить
GPU с 16 GB / RTX 5080, только текстUD-Q3_K_XL; контекст 4096; один слот; автоматическое размещение на GPU в совместимой сборкеСвободную VRAM, фактическое число слоёв на GPU, RAM и пиковое потребление памяти
GPU с 16 GB и файл UD-Q4_K_MУчесть, что 16,46 GB файла — около 15,33 GiB; оставить запас или разместить часть на CPUЗапас мал; размер файла сам по себе не доказывает ни успех, ни невозможность
GPU с 24–32 GBОценить 4-битный файл при контексте 4096, затем увеличивать контекстКеш, рабочие буферы, другие процессы и параллельные запросы
Mac с объединённой памятью 16 GBОставить память для macOS и приложений; проверить меньший файл и короткий контекстОС и модель делят общий пул, это не выделенные 16 GB VRAM
Изображения на любой системеДобавить совместимый projector после успешного текстаProjector и обработка изображений требуют дополнительной памяти

Карточка модели указывает нативный контекст 262 144 токена, но не обещает такую длину на вашем компьютере. Начальные 4K — диагностический выбор, не предел модели. Увеличивайте контекст после успешного типичного запроса и измерения свободной памяти.

Где скачать GGUF и сколько памяти оставить

Архитектуру, лицензию и рекомендации по запуску смотрите в официальной карточке Qwen. Таблица отражает список файлов Unsloth GGUF на 16 сентября 2026 года. Это конвертация сообщества, а не GGUF, выпущенный Qwen. Здесь GB — десятичная единица: 1 GB = 1 000 000 000 байт; 1 GiB = 1 073 741 824 байта. Проверенная ревизия конвертации: 4ca720788d1e01f1bff70c033e0d0028fd02e502.

ФайлРазмер GBРазмер GiB
Qwen3.8-27B-UD-IQ2_XXS.gguf7,276,77
Qwen3.8-27B-UD-Q3_K_XL.gguf13,1512,24
Qwen3.8-27B-UD-Q4_K_M.gguf16,4615,33
Qwen3.8-27B-UD-Q4_K_XL.gguf17,5616,35
Qwen3.8-27B-UD-Q6_K.gguf21,9820,47
mmproj-F16.gguf0,930,86

Оставьте память для выполнения

Кроме весов нужны KV-кеш, вычислительные буферы, среда выполнения и память ОС. Выделенная VRAM, системная RAM и объединённая память Apple — разные ресурсы. Сумма RAM и VRAM не становится единым объёмом памяти GPU. Размещение на CPU требует достаточной RAM и меняет скорость. Использование swap не подтверждает достаточность физической памяти.

Для каждой попытки считайте веса на GPU + кеш и состояние + вычислительные буферы + projector и обработку изображений, если нужны + другие выделения GPU. Файл — лишь исходный ориентир для весов. Смотрите фактическое размещение и выделения в логе запуска, а не просто вычитайте загрузку из числа на коробке видеокарты.

На GPU с 24–32 GB начните с оценки 4-битного файла и короткого контекста. Для GPU с 16 GB может понадобиться более сильная квантизация или выгрузка части слоёв на CPU. На Mac с 16 GB оставьте память для macOS и приложений. Низкая битность может снизить качество: проверяйте её на своих задачах.

Скачайте модель и запустите llama.cpp

Установите свежую сборку llama.cpp с поддержкой модели, проверьте llama-server --version и локальную справку --help. Дата старой сборки сама по себе не доказывает совместимость. Пример ниже использует UD-Q3_K_XL размером 13,15 GB и контекст 4K. Это пример настройки, а не новый тест оборудования. Справочник сервера описывает контекст, параллельные слоты и слои на GPU; инструкция сборки — GPU-бэкенды. Для RTX используйте совместимые CUDA-сборку и драйвер, затем проверьте обнаруженное устройство, прежде чем связывать ошибку с квантизацией.

llama-server --version
llama-server --list-devices

curl --fail --location -o qwen38-27b.gguf \
  "https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/resolve/4ca720788d1e01f1bff70c033e0d0028fd02e502/Qwen3.8-27B-UD-Q3_K_XL.gguf"
llama-server -m qwen38-27b.gguf -c 4096 --parallel 1 --n-gpu-layers auto --port 8080

auto позволяет поддерживаемому движку выбрать размещение; это не утверждение, что все слои останутся на GPU. Если параметр отклонён, проверьте версию и справку. Не считайте запрошенную конфигурацию применённой без подтверждения. Запишите фактическое размещение и контекст из лога запуска.

Для изображений нужен projector

Скачайте совместимый projector из того же репозитория конвертации и добавьте --mmproj mmproj.gguf к команде сервера. Текущий F16 projector Unsloth занимает около 0,93 GB дополнительно к основным весам. Успешная загрузка языковой части ещё не подтверждает работу изображений.

curl --fail --location -o mmproj.gguf \
  "https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/resolve/4ca720788d1e01f1bff70c033e0d0028fd02e502/mmproj-F16.gguf"
llama-server -m qwen38-27b.gguf --mmproj mmproj.gguf -c 4096 --parallel 1 --n-gpu-layers auto --port 8080

Измеряйте свою нагрузку

Запишите ревизию репозитория, имя файла, сборку llama.cpp, оборудование, выгрузку слоёв и длину контекста. Измеряйте обработку входа отдельно от генерации, используя реальные размеры запросов. Короткий синтетический тест не описывает длительный сеанс агента.

Раньше статья приводила размеры файлов и результаты M2 Pro от 16 августа. Состав репозитория изменился: например, UD-IQ2_XXS теперь занимает 7,27 GB вместо указанных ранее 9,01 GB. Старую скорость нельзя переносить на новые файлы без повторного теста. В этом обновлении новый тест генерации не проводился.

Если запуск или ответ не удался

Сохраните первую полную ошибку и журнал выделений при запуске. Меняйте одну переменную за раз: тогда успешный повтор поможет понять причину.

СимптомПервая проверкаСледующий диагностический шаг
Неизвестная архитектура, тензор или параметрВерсия движка, выбранный GGUF и поддерживаемые флагиУстановить совместимую сборку; переименование тензоров или файла не исправляет поддержку
GPU не обнаружен, ошибка CUDA или ядраУстройство, драйвер, совместимость CUDA-сборкиСледовать инструкции сборки; уменьшение контекста не добавит отсутствующий бэкенд
Память не выделяется при загрузкеСвободная VRAM/RAM, квантизация, размещениеМеньший файл или меньше слоёв на GPU при достаточной RAM
Запуск успешен, длинный запрос или изображение вызывает сбойКонтекст, параллельность, длина входа, projectorСнова проверить только текст, один слот и короткий контекст, затем наращивать нагрузку
Неожиданно низкая скоростьРазмещение CPU/GPU, swap, время обработки входа отдельно от генерацииПосмотреть логи размещения до сравнения характеристик видеокарт
Ответ обрывается или финальный текст пустПричина завершения, бюджет рассуждений/вывода, chat templateОтделить лимит вывода от загрузки и памяти

Низкоуровневая ошибка decode сама по себе не устанавливает конкретную причину нехватки памяти. Для отчёта сохраните файл и ревизию, сборку, команду, доступную память и минимальный проблемный вход. В этом обновлении не было нового инференса или измерения скорости RTX 5080.

Частые вопросы

Файл Q4 размером 16,46 GB заведомо больше памяти GPU на 16 GB?

Нельзя сравнивать подписи без единиц. Файл занимает около 15,33 GiB, но при запуске нужны кеш и рабочая память, а часть VRAM может занимать вывод изображения на монитор. Размер файла не доказывает ни успешную загрузку целиком на GPU, ни невозможность любого запуска.

Что уменьшать первым: контекст или размер квантизации?

Если веса не загружаются, сначала проверьте файл и размещение. Если загрузка проходит, но длинный запрос падает, изолируйте контекст и параллельность. Оба фактора влияют на память; стадия ошибки помогает выбрать проверку.

4096 — максимальный контекст модели?

Нет. Это небольшой диагностический контекст для примеров. Более высокий предел в карточке не подтверждает, что ваше оборудование сможет его выделить.

Локальный запуск или API

Локальная модель полезна для работы без сети и контроля данных. Для редких или больших задач сравните её с API, проверив актуальные ID, контекст и тарифы. Открытые веса 27B и Qwen3.8-Max — разные продукты; подробности в обзоре семейства Qwen.