Бесплатная система сжатия от Тencent, сокращает расход токенов для ИИ на 61%
Длинные переписки в рабочих сессиях ИИ-агентов — это не просто дорого, это ещё и неэффективно. Каждый новый вызов инструмента, каждая страница результата поиска «съедает» контекстное окно, и агент начинает «забывать», что делал пять шагов назад.
Система — здесь
Проблема: контекстное окно как «чёрная дыра» для токенов
Когда ИИ-агент выполняет длительную задачу, он последовательно вызывает десятки инструментов: читает файлы, ищет в интернете, анализирует логи, пишет код.
Каждый шаг генерирует данные, и все они по умолчанию остаются в контекстном окне.
Это приводит к трём последствиям:
1. Token-инфляция. Контекстное окно быстро заполняется, и вы платите за поддержание в памяти тысяч строк информации, которая уже не нужна.
2. Потеря контекста. Агент «забывает» общую цель, утопая в деталях отдельных шагов.
3. Снижение качества. Модель начинает «галлюцинировать» или принимать неверные решения, потому что шум в контексте перевешивает сигнал.
Традиционные подходы — просто расширять окно или сжимать историю в краткое резюме — не решают проблему, а лишь откладывают её.
Решение Tencent: Mermaid-карта + внешнее хранилище
Система — здесь
Вместо того чтобы хранить всё в контексте, Tencent предлагает технологию «контекстной выгрузки» (Context Offloading). Работает она так:
1. Mermaid-карта вместо линейной истории
Вместо линейного лога агент ведёт структурированную карту задач в формате Mermaid. Это не просто «список того, что было сделано», а полноценная схема с ветвлениями, зависимостями и статусами выполнения.
Почему это работает: Mermaid — это текстовый формат, который легко читают и люди, и модели. Агент может быстро понять, где он находится и что делать дальше, не перечитывая всю историю.
2. Контекстная выгрузка: данные снаружи, индексы внутри
Сама информация (логи, результаты поиска, код) больше не хранится в контексте. Она выгружается во внешнее файловое хранилище. В контексте остаётся только короткая ссылка-индекс и однострочное резюме.
Четыре уровня хранения:
Level 3 Текущая цель и статус задачи В контексте
Level 2 Mermaid-карта с узлами и связями. В контексте (сжато)
Level 1 Краткое резюме каждого вызова. Внешний (JSONL)
Level 0 Полный raw-вывод инструментов. Внешние .md-файлы
Агент работает только с верхними уровнями (2–3). Если ему понадобятся детали, он запрашивает их по индексу, как книгу по оглавлению.
Результаты: цифры, которые говорят сами за себя
Система прошла испытания в реальных сценариях и показала стабильные результаты:
Веб-поиск 61% +52%
Исправление кода 33% +10%
Работа с длинными документами 31% +8%
В тестах на сверхдлинных сессиях (более 20 вызовов инструментов) выросла с 33% до 50%. При этом токены сократились на 61.38%.
Важно: система не теряет данные. Любая информация может быть восстановлена по индексу на 100%. Это не «чёрный ящик», а прозрачная структура.
Ключевое преимущество: удержание личности агента
Отдельный модуль долгосрочной памяти позволяет агенту запоминать предпочтения пользователя между разными сессиями.
В бенчмарке PersonaMem точность удержания личности агента выросла с 48% до 76%. Агент перестаёт быть «безликим исполнителем» и начинает понимать, как вы работаете, что вам нравится, а что — нет.
Открытый код и лёгкая интеграция
Tencent сделала систему полностью открытой. Исходный код доступен на GitHub под названием TencentDB Agent Memory.
Установка занимает одну команду и не требует настройки внешней базы данных. Система уже адаптирована для OpenClaw и Hermes — двух самых популярных open-source фреймворков для ИИ-агентов.
Вывод Vectra
Tencent решила проблему, которая стояла перед каждым, кто использует ИИ-агентов для реальной работы: как не платить за «воздух» и не терять качество.
Вместо того чтобы бороться с ограничениями контекстного окна, система переосмысливает, как агент хранит и использует информацию. Результат — экономия токенов, рост качества и полная прозрачность. И всё это — с открытым кодом, доступным для любого разработчика.
Что важно запомнить:
· 61% экономии токенов в веб-поиске
· 52% рост успешности длительных задач
· Удержание личности агента выросло с 48% до 76%
· Открытый код и интеграция с OpenClaw/Hermes
· Полное восстановление данных по индексу
Система — здесь
Источник: vc.ru
Похожие записи
- США возводят барьеры против беспилотников и роботов, но Китай обладает достаточными масштабами, чтобы их обойти.
- Технологии обычно создают рабочие места для молодых, квалифицированных специалистов. Сможет ли искусственный интеллект сделать то же самое?
- ❗️ Web-прокси для Телеграма появилось в Android-версии — это полный…
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
