Qwen3.8-27B уместили в 6 ГБ. Вопрос — сколько качества осталось…
Qwen3.8-27B уместили в 6 ГБ. Вопрос — сколько качества осталось
Стартап PrismML выпустил Ternary Bonsai 2 27B — сжатую версию Qwen3.8-27B, которая весит не 54 ГБ, а всего 6 ГБ.
Такую модель уже можно запускать на видеокарте с 10–12 ГБ VRAM или на Mac с 16 ГБ единой памяти. Для локальных LLM это звучит почти как чит-код.
Обычно маленькие модели делают через дистилляцию: берут меньше параметров и обучают их на ответах большой модели. Минус очевидный — параметров меньше, знаний тоже меньше.
У PrismML подход другой: все 27 млрд параметров остаются на месте, но каждый записан не 16 битами, а одним из трёх значений: −1, 0 или +1. Как именно они этого добились, компания не раскрывает.
Сжимать модели, конечно, умеют давно. Та же Qwen в 4-битном варианте занимает около 18 ГБ и влезает в одну карту на 24 ГБ. Но при попытке ужать модель до 6–7 ГБ обычными методами качество обычно начинает рассыпаться.
PrismML утверждает, что Bonsai 2 сохраняет 98% качества оригинала на 54 ГБ.
В бытовом тесте модель действительно удивила. Её сравнили с обычным «двухбитным» квантом Qwen, маленькой Qwen3.5 9B в 4 битах и контрольной Qwen3.8 в 5 битах на 20 ГБ.
Задачи были простые, но показательные: рассказ, деловое письмо, объяснение школьнику, пересказ и склонение числительных. Смотрели в первую очередь на русский язык и грамматику — потому что кванты часто ещё держатся на английском, но начинают страдать в других языках.
Обычный квант посыпался ожидаемо: ошибки вроде «Северный полюб», «вернулся с девяно книгами», а рассказ вообще зациклился на фразе «Ты — Алекс» и оборвался.
Qwen3.5 9B писала чище всех, но запуталась в физике при объяснении времён года. А Bonsai 2 27B по грамотности оказалась примерно на уровне контрольной модели, которая весит втрое больше: около 3 ошибок на 4 текста.
Это не полноценный бенчмарк, но для задач уровня чат-бота результат очень бодрый. Цифра 98% качества уже не выглядит фантастикой.
Но есть важный нюанс: эти 98% собраны по тестам, где есть проверяемый ответ — знания, математика, код, tool use. В обычном режиме результат ниже — около 96%, а на самых сложных задачах уже 86–90%.
И главное: в красивую цифру не включили два агентских бенчмарка — работу в терминале и исправление багов в чужих репозиториях. Там Bonsai набирает 53 против 70 и 61 против 81 у оригинала. То есть уже не 98%, а примерно три четверти качества.
Причина понятная: агентные задачи состоят из длинной цепочки шагов. Если модель ошиблась в начале, дальше ошибка разрастается, как снежный ком с доступом к терминалу.
В чате всё проще: пользователь может поймать ошибку, уточнить запрос или попросить перепроверить. Главный риск там другой — маленькое контекстное окно. Оно забьётся, и модель начнёт забывать начало разговора.
Но как демо прогресса локальных LLM Ternary Bonsai 2 27B выглядит очень впечатляюще. На системе с 10–16 ГБ памяти её уже можно держать для коротких задач: суммаризации, перевода, быстрых ответов и переписывания текстов.
Для мощных конфигураций вроде RTX 3090 появляется интересный выбор: взять модель тяжелее и умнее, но с меньшим контекстом, или поставить Bonsai 2 и получить более длинный диалог при адекватном качестве.
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
