Архив рубрики ~Лента новостей~

Вышла новая модель: Qwen 3.8 27B

Вышла новая модель: Qwen 3.8 27B
Вышла новая модель: Qwen 3.8 27B

https://huggingface.co/Qwen/Qwen3.8-27B

Кратко:

  • Размер модели относительно небольшой, довольно быстро работает на карточках с 24+ GB VRAM.

  • «Понимает» изображения и видео

  • по некоторым бенчмаркам — лучше чем Opus 4.6

  • контекст: 262K, с помощью YARN можно увеличить до 1M

Так как большинство используют llama.cpp для запуска, то кванты можно взять вот тут:

https://huggingface.co/unsloth/Qwen3.8-27B-GGUF

Поддерживается MTP (спекулятивное предсказание)

Я тестировал на RTX 5090 (32GB VRAM).

Квант UD-Q6_K_XL:

  • помещается контекст только 48k

  • скорость генерации: 100 т/с

Квант UD-Q5_K_XL:

  • помещается контекст только 125k

  • скорость генерации: 120 т/с

Команда для запуска:

llama-server -hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K_XL —host 0.0.0.0 —port 8080 —fit off —gpu-layers all —gpu-layers-draft all —ctx-size 48000 —top-p 0.95 —top-k 20 —temp 1.0 —min-p 0.00 —repeat-penalty 1.0 —spec-type draft-mtp9ec4d74670ca9cd0bf2d60c2d940c058

Если вы запускаете на RTX 3090 / RTX 4090 (24GB VRAM), то вам надо будет брать квант поменьше и / или квантовать контекст и / или частично выгружать в обычную память.

Вот тут выложили специальный квант для запуска на карточках с 16GB VRAM:
https://huggingface.co/cHunter789/Qwen3.8-27B-i1-IQ4_KS_KT-GGUF
Я этот квант не пробовал. Если кто попробует — отпишитесь к комментариях.

Что можно сделать, чтобы поместить побольше контекста на GPU?

  • квантизировать KV cache: —cache-type-k, —cache-type-v
    Народ пишет что это может делать модель «тупее», особенно в кодинге. Я не пробовал.

  • не использовать MTP
    Если убрать опцию –-spec-type draft-mtp, то при кванте UD-Q5_K_XL, помещается на 46k больше контекста.
    При этом скорость генерации токенов становится в ~2 раза медленнее.

  • не использовать слой для работы с изображением. Его можно вообще не грузить: —no-mmproj, или грузить в обычную память вместо VRAM: —no-mmproj-offload.
    При кванте UD-Q5_K_XL, помещается на 19k больше контекста.
    В обычной памяти обработка изображений в 5 раз медленнее на процессоре с 16 ядрами и в 10 раз медленнее на процессоре в 8 ядрами. На скорость работы с текстом эти опции не влияют, — только на работу с изображениями. Например запрос с одним изображением обрабатывается 13 секунд на GPU, но 76 секунд на 16-ядерном AMD 9950x3d.

На RTX 5090 (32GB VRAM), при кванте UD-Q5_K_XL, без слоя для работы с изображениям, без MTP, помещается контекст 190k.

По личным ощущениям, качество модели очень хорошее, — модель стала заметно «умнее». Думаю, что на сегодня, это лучшая модель, которую с адекватной скоростью можно запустить у себя на компьютере.

В Docker можно запустить вот так:

services: llama: image: ghcr.io/ggml-org/llama.cpp:server-cuda12-b10423 container_name: llama devices: — «nvidia.com/gpu=all» ports: — «8080:8080» environment: — NVIDIA_VISIBLE_DEVICES=all — NVIDIA_DRIVER_CAPABILITIES=compute,utility volumes: — ~/.cache:/root/.cache entrypoint: [«./llama-server»] command: > —host 0.0.0.0 —port 8080 —ctx-size 125000 —fit off —gpu-layers all —gpu-layers-draft all -hf unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL —spec-type draft-mtp —top-p 0.95 —top-k 20 —temp 1.0 —min-p 0.00 —repeat-penalty 1.0

Цена

Интересно, что у самой Qwen это модель пока недоступна по API:
https://modelstudio.console.alibabacloud.com/ap-southeast-1

OpenRouter предлагает эту модель по довольно немаленькой цене: $0.45 / $3.20 per 1M:
https://openrouter.ai/qwen/qwen3.8-27b

Вот на этой одно-киловатной грелке работает у меня Qwen 3.8 27B на RTX 5090. Комната нагревается прям очень заметно.
Вот на этой одно-киловатной грелке работает у меня Qwen 3.8 27B на RTX 5090. Комната нагревается прям очень заметно.

Источник: habr.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ 13 августа вышла Gemini 3.7 Flash. Забавно, что с релиза… Архив рубрики ~Коротко из Telegram~ Руцентр проводит исследование кибербезопасности доменной инфраструктуры Домены — критический актив… Архив рубрики ~Коротко из Telegram~ 📞 736,4 млн звонков совершили злоумышленники с начала года Такие… Архив рубрики ~Коротко из Telegram~ Фитнес-приложение раскрыло позиции американских военных, по которым позже ударил Иран…. Архив рубрики ~Коротко из Telegram~ Из спасения одной собачки с помощью ИИ вырос стартап по… Архив рубрики ~Коротко из Telegram~ Создаём свою ИИ-модель с нуля Разработчик выпустил бесплатное приложение, которое… Архив рубрики ~Коротко из Telegram~ Pixar выпустят Disney — лампа реагирует на движения рук Похоже, культовая… Архив рубрики ~Коротко из Telegram~ Почти 4 из 10 обращений сотрудников российских компаний к публичным… Архив рубрики ~Коротко из Telegram~ Пользователь Reddit собрал солнечный электромобиль и открыл чертежи На Reddit… Архив рубрики ~Коротко из Telegram~ КАМАЗ отчитался о масштабной замене зарубежного ПО на отечественные решения…. Архив рубрики ~Коротко из Telegram~ LFM2.5-VL-3B Очередная компактная модель от Liquid AI Мультимодальная зрительно-языковая, работает… Архив рубрики ~Коротко из Telegram~ DeepSeek официально выпустили V4-Pro — и она приближается по мощи… Архив рубрики ~Коротко из Telegram~ В Х хайпит промпт, который превращает любой репозиторий в интерактивную… Архив рубрики ~Коротко из Telegram~ Ваш личный локальный Claude Code существует — разрабы выкатили опенсорсного… Архив рубрики ~Коротко из Telegram~ 13 августа вышла Gemini 3.7 Flash. Забавно, что с релиза… Архив рубрики ~Коротко из Telegram~ Руцентр проводит исследование кибербезопасности доменной инфраструктуры Домены — критический актив… Архив рубрики ~Коротко из Telegram~ 📞 736,4 млн звонков совершили злоумышленники с начала года Такие… Архив рубрики ~Коротко из Telegram~ Фитнес-приложение раскрыло позиции американских военных, по которым позже ударил Иран…. Архив рубрики ~Коротко из Telegram~ Из спасения одной собачки с помощью ИИ вырос стартап по… Архив рубрики ~Коротко из Telegram~ Создаём свою ИИ-модель с нуля Разработчик выпустил бесплатное приложение, которое… Архив рубрики ~Коротко из Telegram~ Pixar выпустят Disney — лампа реагирует на движения рук Похоже, культовая… Архив рубрики ~Коротко из Telegram~ Почти 4 из 10 обращений сотрудников российских компаний к публичным… Архив рубрики ~Коротко из Telegram~ Пользователь Reddit собрал солнечный электромобиль и открыл чертежи На Reddit… Архив рубрики ~Коротко из Telegram~ КАМАЗ отчитался о масштабной замене зарубежного ПО на отечественные решения…. Архив рубрики ~Коротко из Telegram~ LFM2.5-VL-3B Очередная компактная модель от Liquid AI Мультимодальная зрительно-языковая, работает… Архив рубрики ~Коротко из Telegram~ DeepSeek официально выпустили V4-Pro — и она приближается по мощи… Архив рубрики ~Коротко из Telegram~ В Х хайпит промпт, который превращает любой репозиторий в интерактивную… Архив рубрики ~Коротко из Telegram~ Ваш личный локальный Claude Code существует — разрабы выкатили опенсорсного…

Оставить комментарий