Архив рубрики ~Коротко из Telegram~

Qwen3.8-27B уместили в 6 ГБ. Вопрос — сколько качества осталось…

Qwen3.8-27B уместили в 6 ГБ. Вопрос — сколько качества осталось…
Qwen3.8-27B уместили в 6 ГБ. Вопрос — сколько качества осталось…

Qwen3.8-27B уместили в 6 ГБ. Вопрос — сколько качества осталось

Стартап PrismML выпустил Ternary Bonsai 2 27B — сжатую версию Qwen3.8-27B, которая весит не 54 ГБ, а всего 6 ГБ.

Такую модель уже можно запускать на видеокарте с 10–12 ГБ VRAM или на Mac с 16 ГБ единой памяти. Для локальных LLM это звучит почти как чит-код.

Обычно маленькие модели делают через дистилляцию: берут меньше параметров и обучают их на ответах большой модели. Минус очевидный — параметров меньше, знаний тоже меньше.

У PrismML подход другой: все 27 млрд параметров остаются на месте, но каждый записан не 16 битами, а одним из трёх значений: −1, 0 или +1. Как именно они этого добились, компания не раскрывает.

Сжимать модели, конечно, умеют давно. Та же Qwen в 4-битном варианте занимает около 18 ГБ и влезает в одну карту на 24 ГБ. Но при попытке ужать модель до 6–7 ГБ обычными методами качество обычно начинает рассыпаться.

PrismML утверждает, что Bonsai 2 сохраняет 98% качества оригинала на 54 ГБ.

В бытовом тесте модель действительно удивила. Её сравнили с обычным «двухбитным» квантом Qwen, маленькой Qwen3.5 9B в 4 битах и контрольной Qwen3.8 в 5 битах на 20 ГБ.

Задачи были простые, но показательные: рассказ, деловое письмо, объяснение школьнику, пересказ и склонение числительных. Смотрели в первую очередь на русский язык и грамматику — потому что кванты часто ещё держатся на английском, но начинают страдать в других языках.

Обычный квант посыпался ожидаемо: ошибки вроде «Северный полюб», «вернулся с девяно книгами», а рассказ вообще зациклился на фразе «Ты — Алекс» и оборвался.

Qwen3.5 9B писала чище всех, но запуталась в физике при объяснении времён года. А Bonsai 2 27B по грамотности оказалась примерно на уровне контрольной модели, которая весит втрое больше: около 3 ошибок на 4 текста.

Это не полноценный бенчмарк, но для задач уровня чат-бота результат очень бодрый. Цифра 98% качества уже не выглядит фантастикой.

Но есть важный нюанс: эти 98% собраны по тестам, где есть проверяемый ответ — знания, математика, код, tool use. В обычном режиме результат ниже — около 96%, а на самых сложных задачах уже 86–90%.

И главное: в красивую цифру не включили два агентских бенчмарка — работу в терминале и исправление багов в чужих репозиториях. Там Bonsai набирает 53 против 70 и 61 против 81 у оригинала. То есть уже не 98%, а примерно три четверти качества.

Причина понятная: агентные задачи состоят из длинной цепочки шагов. Если модель ошиблась в начале, дальше ошибка разрастается, как снежный ком с доступом к терминалу.

В чате всё проще: пользователь может поймать ошибку, уточнить запрос или попросить перепроверить. Главный риск там другой — маленькое контекстное окно. Оно забьётся, и модель начнёт забывать начало разговора.

Но как демо прогресса локальных LLM Ternary Bonsai 2 27B выглядит очень впечатляюще. На системе с 10–16 ГБ памяти её уже можно держать для коротких задач: суммаризации, перевода, быстрых ответов и переписывания текстов.

Для мощных конфигураций вроде RTX 3090 появляется интересный выбор: взять модель тяжелее и умнее, но с меньшим контекстом, или поставить Bonsai 2 и получить более длинный диалог при адекватном качестве.

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Лента новостей~ Anthropic выпустила Claude Opus 5.5: разбор новой флагманской модели для кода и ИИ-агентов Новости робототехники Новые роботы уже на подходе — Сбер покажет их в… Архив рубрики ~Лента новостей~ Кодирование ускорилось в разы, а проекты – нет. Куда пропал выигрыш? Архив рубрики ~Лента новостей~ Все, что вы не знали о киберпанке — как появился, что с ним стало и наконец — что он такое на самом деле. Часть 1 Архив рубрики ~Лента новостей~ Живодеров, Кощеев и Поганкин. Как появились неблагозвучные и обидные фамилии Архив рубрики ~Лента новостей~ Как Google Authenticator работает без интернета? Новости робототехники «Старлинк не нужен» – враг использует Авито, ВК и Мах для ударов по России Новости робототехники Новая стратегия расширения Waymo: подростки Архив рубрики ~Лента новостей~ Консультативная группа по математике и искусственному интеллекту | OpenAI Архив рубрики ~Лента новостей~ «Ростелеком Контакт-центр» внедрил ITFB EasyDoc для автоматизации массового найма Архив рубрики ~Лента новостей~ Компания Apheris объявила результаты своей инициативы по совместному обучению в рамках программы федеративного верстки — теперь четыре крупные фармацевтические компании делают ставку на более крупные проекты. Новости робототехники Компания Gartner выделяет четыре уровня искусственного интеллекта в автоматизации складских операций. Архив рубрики ~Лента новостей~ Три задачи руководителя, которые можно делегировать ИИ Архив рубрики ~Лента новостей~ Как за один Хакатон мы вживили ICQ в Битрикс24 Архив рубрики ~Лента новостей~ Anthropic выпустила Claude Opus 5.5: разбор новой флагманской модели для кода и ИИ-агентов Новости робототехники Новые роботы уже на подходе — Сбер покажет их в… Архив рубрики ~Лента новостей~ Кодирование ускорилось в разы, а проекты – нет. Куда пропал выигрыш? Архив рубрики ~Лента новостей~ Все, что вы не знали о киберпанке — как появился, что с ним стало и наконец — что он такое на самом деле. Часть 1 Архив рубрики ~Лента новостей~ Живодеров, Кощеев и Поганкин. Как появились неблагозвучные и обидные фамилии Архив рубрики ~Лента новостей~ Как Google Authenticator работает без интернета? Новости робототехники «Старлинк не нужен» – враг использует Авито, ВК и Мах для ударов по России Новости робототехники Новая стратегия расширения Waymo: подростки Архив рубрики ~Лента новостей~ Консультативная группа по математике и искусственному интеллекту | OpenAI Архив рубрики ~Лента новостей~ «Ростелеком Контакт-центр» внедрил ITFB EasyDoc для автоматизации массового найма Архив рубрики ~Лента новостей~ Компания Apheris объявила результаты своей инициативы по совместному обучению в рамках программы федеративного верстки — теперь четыре крупные фармацевтические компании делают ставку на более крупные проекты. Новости робототехники Компания Gartner выделяет четыре уровня искусственного интеллекта в автоматизации складских операций. Архив рубрики ~Лента новостей~ Три задачи руководителя, которые можно делегировать ИИ Архив рубрики ~Лента новостей~ Как за один Хакатон мы вживили ICQ в Битрикс24

Оставить комментарий