Длинные цепочки рассуждений раздувают KV-кеш модели, съедая память. Все…
➡️ Длинные цепочки рассуждений раздувают KV-кеш модели, съедая память. Все существующие методы сжатия оценивают важность каждого токена и оставляют самые «ценные» — авторы показывают, что этот сигнал важности почти ничего не даёт.
Random Attention сохраняет исходный промпт, а всё остальное выбрасывает случайным образом, без всяких оценок важности. На четырёх моделях и шести задачах метод сравнялся по качеству с лучшим предыдущим подходом, но дал на 32-43% больше пропускной способности.
🖼️ Объяснение простое: промпт — самая хрупкая часть кеша, а разница между методами сводится к тому, повезло ли им его сохранить. Сама цепочка рассуждений защищает себя избыточностью — модель постоянно переформулирует нужное прямо в тексте, а разные attention-головы хранят свои копии независимо. Промпт в безопасности — и случайная выборка сохраняет достаточно нужного без всякой оценки.
Оцените материал:
Похожие записи
Liberté, égalité, fraternité… majorité numérique Президент Франции Эммануэль Макрон призвал…
11.09.2026
Обратный квантовый скачок Компания NEC, стоявшая у истоков сверхпроводниковых квантовых…
11.09.2026
Смартфоны ждёт беспамятство Смартфоны по всему миру подорожали в среднем…
11.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
