Вышла новая модель: Qwen 3.8 27B
https://huggingface.co/Qwen/Qwen3.8-27B
Кратко:
-
Размер модели относительно небольшой, довольно быстро работает на карточках с 24+ GB VRAM.
-
«Понимает» изображения и видео
-
по некоторым бенчмаркам — лучше чем Opus 4.6
-
контекст: 262K, с помощью YARN можно увеличить до 1M
Так как большинство используют llama.cpp для запуска, то кванты можно взять вот тут:
https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
Поддерживается MTP (спекулятивное предсказание)
Я тестировал на RTX 5090 (32GB VRAM).
Квант UD-Q6_K_XL:
-
помещается контекст только 48k
-
скорость генерации: 100 т/с
Квант UD-Q5_K_XL:
-
помещается контекст только 125k
-
скорость генерации: 120 т/с
Команда для запуска:
llama-server -hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K_XL —host 0.0.0.0 —port 8080 —fit off —gpu-layers all —gpu-layers-draft all —ctx-size 48000 —top-p 0.95 —top-k 20 —temp 1.0 —min-p 0.00 —repeat-penalty 1.0 —spec-type draft-mtp
Если вы запускаете на RTX 3090 / RTX 4090 (24GB VRAM), то вам надо будет брать квант поменьше и / или квантовать контекст и / или частично выгружать в обычную память.
Вот тут выложили специальный квант для запуска на карточках с 16GB VRAM:
https://huggingface.co/cHunter789/Qwen3.8-27B-i1-IQ4_KS_KT-GGUF
Я этот квант не пробовал. Если кто попробует — отпишитесь к комментариях.
Что можно сделать, чтобы поместить побольше контекста на GPU?
-
квантизировать KV cache: —cache-type-k, —cache-type-v
Народ пишет что это может делать модель «тупее», особенно в кодинге. Я не пробовал. -
не использовать MTP
Если убрать опцию –-spec-type draft-mtp, то при кванте UD-Q5_K_XL, помещается на 46k больше контекста.
При этом скорость генерации токенов становится в ~2 раза медленнее. -
не использовать слой для работы с изображением. Его можно вообще не грузить: —no-mmproj, или грузить в обычную память вместо VRAM: —no-mmproj-offload.
При кванте UD-Q5_K_XL, помещается на 19k больше контекста.
В обычной памяти обработка изображений в 5 раз медленнее на процессоре с 16 ядрами и в 10 раз медленнее на процессоре в 8 ядрами. На скорость работы с текстом эти опции не влияют, — только на работу с изображениями. Например запрос с одним изображением обрабатывается 13 секунд на GPU, но 76 секунд на 16-ядерном AMD 9950x3d.
На RTX 5090 (32GB VRAM), при кванте UD-Q5_K_XL, без слоя для работы с изображениям, без MTP, помещается контекст 190k.
По личным ощущениям, качество модели очень хорошее, — модель стала заметно «умнее». Думаю, что на сегодня, это лучшая модель, которую с адекватной скоростью можно запустить у себя на компьютере.
В Docker можно запустить вот так:
services: llama: image: ghcr.io/ggml-org/llama.cpp:server-cuda12-b10423 container_name: llama devices: — «nvidia.com/gpu=all» ports: — «8080:8080» environment: — NVIDIA_VISIBLE_DEVICES=all — NVIDIA_DRIVER_CAPABILITIES=compute,utility volumes: — ~/.cache:/root/.cache entrypoint: [«./llama-server»] command: > —host 0.0.0.0 —port 8080 —ctx-size 125000 —fit off —gpu-layers all —gpu-layers-draft all -hf unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL —spec-type draft-mtp —top-p 0.95 —top-k 20 —temp 1.0 —min-p 0.00 —repeat-penalty 1.0
Цена
Интересно, что у самой Qwen это модель пока недоступна по API:
https://modelstudio.console.alibabacloud.com/ap-southeast-1
OpenRouter предлагает эту модель по довольно немаленькой цене: $0.45 / $3.20 per 1M:
https://openrouter.ai/qwen/qwen3.8-27b

Источник: habr.com
Похожие записи
- Стартап Andon Labs передал Claude управление розничным магазином в Сан-Франциско — нейросеть игнорировала опоздания одного из сотрудников, но согласилась уволить его после «наводящего вопроса»
- Сокращение затрат на вывод RAG в 6 раз начинается с решения того, что никогда не доходит до LLM.
- 13 августа вышла Gemini 3.7 Flash. Забавно, что с релиза…
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
