Архив рубрики ~Лента новостей~

Компания Nvidia обнаружила, что простая линейная математика может заменить дорогостоящие процессы передачи моделей искусственного интеллекта между пользователями.

Компания Nvidia обнаружила, что простая линейная математика может заменить дорогостоящие процессы передачи моделей искусственного интеллекта между пользователями.
Компания Nvidia обнаружила, что простая линейная математика может заменить дорогостоящие процессы передачи моделей искусственного интеллекта между пользователями.

Бен Диксон

Когда агентная система искусственного интеллекта передает задачу от небольшой модели к более крупной — или обратно — она несет значительные издержки: принимающей модели приходится заново пересчитывать весь диалог, что увеличивает вычислительные затраты и задержку. Это является серьезным узким местом для предприятий, создающих долгосрочные рабочие процессы с использованием нескольких моделей LLM.

Для решения этой задачи исследователи из Nvidia разработали метод переноса кэша ключ-значение между моделями, который напрямую отображает предварительно заполненный кэш ключ-значение из исходной модели в целевую модель. Этот метод соответствует реальным задачам агентного моделирования, где большие контексты накапливаются на протяжении многих ходов.

В реальных приложениях ИИ передача данных из кэша ключ-значение между моделями может снизить вычислительные затраты и задержку в длительных рабочих процессах с несколькими моделями глубокого обучения — и это достигается с помощью простой линейной математики, а не дорогостоящей модели глубокого обучения.

Эксперименты показывают, что на совместимых парах моделей этот линейный процесс сопоставления выполняется в 2,7–25 раз быстрее, чем пересчет диалога, при этом сохраняя до 98% точности целевой модели в автономном режиме.

Почему смена моделей в середине сессии обходится так дорого

Изучение того, как LLM-ы обрабатывают память, помогает понять, почему многомодельные рабочие процессы сталкиваются с проблемой низкой производительности в производственной среде. Когда LLM-машина получает запрос, она должна сначала выполнить этап «предварительного заполнения», который представляет собой начальный проход, вычисляющий ключи и значения для всех входных токенов и заполняющий кэш «ключ-значение» (KV).

После этого модель переходит в фазу «декодирования», где вычисляет и генерирует следующие токены в последовательности. На этом этапе модель считывает данные из кэша ключ-значение для прогнозирования новых токенов по одному, минуя необходимость повторной оценки всей истории разговора для каждого нового токена.

В многоходовых диалогах или длительных агентских сессиях контекст постепенно увеличивается. Поскольку вычислительные затраты на этапе предварительного заполнения напрямую зависят как от размера модели, так и от длины входных данных, обработка таких длительных сессий становится все более дорогостоящей и приводит к значительной задержке, если кэш ключ-значение становится недействительным.

Эта ошибка возникает всякий раз, когда система ИИ пытается заменить модель в середине сессии, например, перенаправляя сложный этап рассуждения на более крупную модель или переключаясь на меньшую модель для экономии средств. Поскольку разные LLM имеют разную архитектуру, они ожидают входные данные в кэш в разных форматах.

В результате любое переключение модели заставляет принимающую модель заново оплачивать все затраты на предварительное заполнение для пересчета кэша ключ-значение для накопленного контекста.

Сопоставление памяти между моделями без начала работы с нуля.

Исследователи Nvidia изучили передачу данных из кэша ключ-значение между моделями, чтобы выяснить, как разработчики могут преобразовать кэш ключ-значение одной модели в ожидаемый формат другой без повторного запуска этапа предварительного заполнения.

При решении этой задачи перенос кэша ключ-значение между моделями приносит пользу в обоих направлениях. Перенос модели с небольшого размера на большой повышает качество выходных данных. Например, недорогая, небольшая модель справляется с рутинными задачами в агентном рабочем процессе, но испытывает трудности со сложной задачей рассуждения, и вы сопоставляете кэш ключ-значение с более крупной моделью и продолжаете процесс без проблем.

С другой стороны, перенос модели из большого размера в меньший снижает вычислительные затраты. Высокопроизводительная, большая модель может использоваться для обработки массивного, сложного системного запроса или синтеза плотного PDF-файла в начале сеанса. После выполнения основной работы кэш ключ-значение сеанса сопоставляется с меньшей, более экономичной моделью для обработки быстрых, последовательных диалогов.

Ранее предпринимались попытки решить проблему переноса данных в кэше ключ-значение, но они страдают от ряда ключевых ограничений. К ним относятся необходимость дорогостоящего обучения на основе градиента или очень строгие архитектурные ограничения.

кросс-модельная передача kv-кэша

В рамках этого первоначального исследования авторы ограничили свое внимание переносами внутри семейств, такими как переходы между моделями разного размера в семействах Qwen, Llama или Ministral. Эти модели используют общие токенизаторы, ДНК обучающих данных и основные архитектурные стили, но различаются по размеру и глубине. Однако эта структура оставляет много места для будущих экспериментов. Исследователи отмечают, что в конечном итоге этот метод может быть расширен для переносов между семействами, несовпадающих ковариационных данных или гибридных архитектур, сочетающих стандартное внимание с другими механизмами памяти.

Ключевой вывод исследования Nvidia заключается в том, что кросс-модельный KV-кэш имеет значительно линейную структуру. Это означает, что отображение можно выполнить с помощью простых алгебраических приемов и без необходимости сложного обучения нейронных сетей. Например, при экспериментах по переносу KV-кэша из модели Qwen3 с 14 миллиардами параметров в версию с 32 миллиардами параметров авторы обнаружили, что простое линейное регрессионное отображение от одного исходного слоя к целевому слою может восстановить 56% дисперсии ключей целевого слоя и 32% дисперсии его значений. При объединении нескольких исходных слоев эти показатели выросли до 79% и 65% соответственно.

изображение2

Для преобразования этой линейной зависимости в практическую систему исследователи разработали замкнутую систему картирования гребней, состоящую из трех ключевых компонентов:

  • Регрессия гребневой регрессии для каждого элемента: вместо использования сложного глубокого обучения для тренировки системы, они применили простую линейную регрессию, используя небольшой калибровочный набор из нескольких сотен текстовых последовательностей. Этот метод решает классическую задачу поиска линии наилучшего соответствия независимо для каждого элемента внимания.

  • Выбор источника данных между слоями: Поскольку исходная и целевая модели имеют разное количество слоев, маппер оценивает и выбирает наиболее прогностические исходные слои для подачи в каждый конкретный целевой слой. Таким образом, система выбирает только наиболее полезные фрагменты памяти из старой модели для построения памяти новой модели.

  • Сопоставление контентного пространства: Перед преобразованием данных маппер удаляет кодировки RoPE. RoPE, или Rotary Position Embedding (встраивание вращающегося положения), — это стандартный механизм, который применяет математическое, зависящее от положения вращение к данным, чтобы модель понимала порядок токенов в последовательности. Удаление значений RoPE позволяет мапперу обобщать данные на последовательности большей длины, чем обучающие данные.

Проверка линейного картографа на практике

Чтобы проверить работоспособность метода, исследователи оценили конвейер переноса данных для шести семейств моделей с «совпадающими ключами KV». «Совпадающие ключи KV» означают, что исходная и целевая модели имеют одинаковое количество ключей KV и размеры каждого ключа, что типично для моделей разного размера в рамках одного семейства.

В число семейств моделей входили Qwen3, Llama 3.1 и Ministral 3, с тестами передачи данных в кэш-память типа «ключ-значение» для различных размеров, от 3 миллиардов до 70 миллиардов параметров. В ходе экспериментов наблюдался колоссальный скачок в количестве параметров в 8,8 раз при переходе от Llama 3.1 (8 миллиардов) к 70 миллиардам.

Для охвата широкого спектра задач они оценивали модели на пяти основных эталонных наборах данных по точности (ARC-Challenge, HellaSwag, WinoGrande, MMLU и GSM8K), а также на перплексии языкового моделирования на WikiText-2 и в задаче многоходового диалога под названием CoQA. Для обучения линейного преобразователя перевода они использовали небольшой калибровочный набор данных, состоящий всего из 500 текстовых последовательностей по 1024 токена в каждой.

Исследователи сравнили разработанную систему с базовым пределом точности, при котором целевая модель выполняет полное, традиционное предварительное заполнение. Они также сравнили свою полную систему с конфигурациями, включающими уменьшение количества выбранных слоев или деактивацию различных компонентов. Кроме того, они сравнили свой простой метод с глубокой нейронной сетью, обученной с помощью обратного распространения ошибки, чтобы выяснить, сможет ли более ресурсоемкое глубокое обучение восстановить точность в тех случаях, когда линейный метод показал неудовлетворительные результаты.

Для четырех из шести протестированных пар быстрый линейный алгоритм сопоставления гребней в замкнутой форме сохранил от 73% до 98% точности предварительного заполнения целевого объекта, включая значительный скачок от Llama 3.1 8B до 70B, который сохранил 72,8% точности целевого объекта.

Кроме того, маппер работает в 2,7–25 раз быстрее, чем при повторном заполнении. Например, при преобразовании кэша KV с 32 768 токенами из модели Qwen3 14B в модель 32B передача заняла всего 278 миллисекунд, по сравнению с почти 7 секундами для стандартного повторного заполнения.

Система также продемонстрировала высокую стабильность при выполнении задач, занимающих множество этапов. При тестировании в многоходовых диалогах дрейф, или потеря точности, между целевым базовым уровнем и переданным кэшем оставался невероятно малым на протяжении 10 ходов, что доказывает, что это не приведет к сбоям во время длительных сеансов работы агентов.

Однако прямолинейный линейный подход столкнулся с ограничениями при работе с определенными парами моделей. Для двух конфигураций Ministral линейный преобразователь показал резкое ухудшение результатов, поскольку простая линейная аппроксимация не смогла экстраполировать данные за пределы калибровочной выборки. Чтобы исправить это, исследователи заменили линейный преобразователь на нелинейный многослойный перцептрон (MLP) с двумя скрытыми слоями по 1024 нейрона, обученный на тех же данных. Это добавило сложности и затрат на обучение, но позволило восстановить точность до уровня выше 90%.

Проблема в отрасли гораздо масштабнее, чем можно решить с помощью одной статьи.

Внедрение межмодельной передачи является частью более широкой отраслевой инициативы по решению проблемы узкого места в кэше ключ-значение, которая стала одним из ключевых препятствий для масштабирования корпоративного ИИ. Поскольку разработчики используют линейные модели обработки данных для обработки огромных объемов документов или кодовых баз и выполнения длительных задач рассуждения, управление этим уровнем памяти становится столь же важным, как и сами модели.

За последний год исследователи решали эту проблему вычислительных ресурсов и памяти с разных сторон. Например, компания Nvidia недавно представила динамическое разреживание памяти (DMS), метод, который интеллектуально удаляет менее важные токены из кэша ключ-значение, что позволяет сократить затраты на рассуждения до 8 раз.

Другие подходы сосредоточены на агрессивном сжатии данных. Исследователи из MIT разработали алгебраический метод сжатия, называемый Attention Matching, который сжимает кэш ключ-значение в 50 раз без ухудшения качества. Аналогичным образом, Nvidia представила KVCache Transform Coding (KVTC), которая заимствует концепции сжатия мультимедиа для уменьшения объема памяти в 20 раз без изменения весов базовой модели.

Помимо сжатия, исследователи также борются с вычислительными затратами на извлечение данных из памяти. Оптимизаторы, такие как IndexCache, удаляют избыточные вычисления на уровне слоев, обеспечивая значительно более быстрое время до первого токена в приложениях с длинным контекстом. А модели, такие как DeepSeek и серия GLM, оптимизируют кэш ключ-значение за счет архитектурных инноваций.

Поскольку системы искусственного интеллекта берутся за задачи с более длительным горизонтом планирования и более сложными архитектурами, базовая инфраструктура памяти становится столь же важной, как и сами модели. Передача данных в кэш ключ-значение между моделями предоставляет разработчикам еще один инструмент для снижения затрат на вывод при масштабировании многомодельных агентных систем.

Источник: venturebeat.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ Xiaomi показала локальный AI-компьютер в стиле NVIDIA DGX Spark Xiaomi… Архив рубрики ~Коротко из Telegram~ Релизнулся не убийца GPT-5.6 и Fable 5 (не слушайте клоунов… Архив рубрики ~Коротко из Telegram~ OpenAI показали первые тесты собственного inference-чипа Jalapeño. Он оказался в… Архив рубрики ~Коротко из Telegram~ 📹Apple представили новое поколение компьютеров для локального ИИ. Mac mini… Архив рубрики ~Коротко из Telegram~ Apple выпустила новую Mac Studio с M5 Ultra Пропускную способность… Новости робототехники NVIDIA Jetson Orin Nano 2 внедряет физический искусственный интеллект в дроны и роботов. Архив рубрики ~Коротко из Telegram~ Добрался до свежего отчета Hugging Face о том, как обстоят… Архив рубрики ~Коротко из Telegram~ Claude запоминает контекст между чатом и Cowork Anthropic наконец-то внедрила… Архив рубрики ~Коротко из Telegram~ Загадочная модель Ox Alpha вызвала ажиотаж в сети В сообществе… Архив рубрики ~Полезное~ Перекидываем файлы между любыми устройствами: сервис LocalSend работает как аналог… Архив рубрики ~Коротко из Telegram~ Сбер выпустил новое поколение эмбеддинг-моделей GigaEmbeddings — они помогают быстро… Новости робототехники Учимся собирать роботов дома — на GitHub выложили все курсы… Архив рубрики ~Коротко из Telegram~ Harness Engineer — полный курс на русском Как сделать так,… Архив рубрики ~Коротко из Telegram~ DeepSeek добавила в API экспериментальную мультимодальную модель DeepSeek-V4-Flash-Vision-Exp. По качеству… Архив рубрики ~Коротко из Telegram~ Xiaomi показала локальный AI-компьютер в стиле NVIDIA DGX Spark Xiaomi… Архив рубрики ~Коротко из Telegram~ Релизнулся не убийца GPT-5.6 и Fable 5 (не слушайте клоунов… Архив рубрики ~Коротко из Telegram~ OpenAI показали первые тесты собственного inference-чипа Jalapeño. Он оказался в… Архив рубрики ~Коротко из Telegram~ 📹Apple представили новое поколение компьютеров для локального ИИ. Mac mini… Архив рубрики ~Коротко из Telegram~ Apple выпустила новую Mac Studio с M5 Ultra Пропускную способность… Новости робототехники NVIDIA Jetson Orin Nano 2 внедряет физический искусственный интеллект в дроны и роботов. Архив рубрики ~Коротко из Telegram~ Добрался до свежего отчета Hugging Face о том, как обстоят… Архив рубрики ~Коротко из Telegram~ Claude запоминает контекст между чатом и Cowork Anthropic наконец-то внедрила… Архив рубрики ~Коротко из Telegram~ Загадочная модель Ox Alpha вызвала ажиотаж в сети В сообществе… Архив рубрики ~Полезное~ Перекидываем файлы между любыми устройствами: сервис LocalSend работает как аналог… Архив рубрики ~Коротко из Telegram~ Сбер выпустил новое поколение эмбеддинг-моделей GigaEmbeddings — они помогают быстро… Новости робототехники Учимся собирать роботов дома — на GitHub выложили все курсы… Архив рубрики ~Коротко из Telegram~ Harness Engineer — полный курс на русском Как сделать так,… Архив рубрики ~Коротко из Telegram~ DeepSeek добавила в API экспериментальную мультимодальную модель DeepSeek-V4-Flash-Vision-Exp. По качеству…

Оставить комментарий