Архив рубрики ~Лента новостей~

ToolGrad: Эффективное создание наборов данных об использовании инструментов с помощью текстовых «градиентов».

ToolGrad: Эффективное создание наборов данных об использовании инструментов с помощью текстовых «градиентов».
ToolGrad: Эффективное создание наборов данных об использовании инструментов с помощью текстовых «градиентов».

ToolGrad — это фреймворк для генерации данных, который переворачивает традиционную парадигму, сначала генерируя ответы об использовании инструментов, а затем — запросы пользователей. Мы показываем, что такая конструкция позволяет LLM-системам достигать лучших результатов в использовании инструментов.

Быстрые ссылки

ИИ-агенты продемонстрировали большой потенциал в автоматизации реальных задач, таких как поиск в Google, чтение локальных файлов на компьютере или выполнение сгенерированных скриптов Python. Для достижения таких агентных рабочих процессов языковым моделям необходимо научиться правильно и эффективно использовать инструменты. Для обучения больших языковых моделей использованию инструментов нам необходимы наборы данных цепочек использования инструментов и соответствующих им пользовательских запросов. В нашей предыдущей работе, представленной в InstructPipe, мы вручную аннотировали данные для оценки, но масштабирование ручной аннотации для сложных задач тонкой настройки языковых моделей нецелесообразно. Для оптимизации потока данных в предыдущих работах, например, ToolBench и ToolACE, исследовалось использование агента для автоматического поиска пути использования инструмента методом проб и ошибок. Этот репрезентативный подход к аннотированию включает два шага: (1) генерация гипотетической пользовательской инструкции из выбранного пула API и (2) использование агента поиска в глубину (DFS) для нахождения решения по использованию инструмента. Этот подход по своей сути неэффективен , поскольку его основная концепция заключается в извлечении ценных траекторий из сложного исследования агента для обучения LLM.

В докладе «ToolGrad: Эффективная генерация наборов данных об использовании инструментов с помощью текстовых «градиентов»», представленном на ACL 2026, мы предлагаем альтернативную парадигму решения. ToolGrad сначала генерирует эталонную цепочку использования инструментов, а затем аннотирует соответствующий запрос пользователя. Интуитивно понятно, что явное решение об использовании инструмента предоставляет более однозначную информацию, чем запрос, что значительно упрощает аннотирование, от использования инструмента до запроса на использование, и требует всего одного шага LLM. Наши результаты показывают, что наш подход, основанный на поиске ответов, позволяет генерировать более сложные (долгосрочные) данные об использовании инструментов с меньшими затратами. LLM, обученные на сгенерированных нами данных, также превосходят LLM, обученные на базовых методах, и даже соответствуют лучшим проприетарным LLM на наборах данных, не содержащих инструментов, ранее не встречавшихся в дистрибутивах.

В то время как существующие методы генерируют наборы данных об использовании инструментов путем поиска решений пользовательских запросов с низким процентом успешных результатов, ToolGrad генерирует успешные цепочки использования инструментов до генерации подсказок, что обеспечивает высокий процент успешных результатов.

Итеративное создание цепочек использования инструментов с текстовыми «градиентами»

Стандартные системы машинного обучения (МО) улучшаются за счет вычисления численных градиентов функции потерь по мини-пакетам обучающих выборок, которые затем используются алгоритмом оптимизации для обновления весов модели. Недавно TextGrad адаптировал эту парадигму для разработки подсказок, используя критик LLM для предоставления подробной описательной обратной связи в виде простого текста — обратной связи, называемой «текстовыми градиентами». Эти текстовые градиенты затем направляют уточнения данной подсказки в новый черновик, который может лучше решить целевую задачу.

ToolGrad адаптирует концепцию текстовых градиентов из оптимизации подсказок для генерации синтетических наборов данных. Вместо оптимизации статической текстовой подсказки ToolGrad использует эти градиенты для итеративного построения сложных, валидных рабочих процессов API на основе больших библиотек инструментов.

В таблице приведено сравнение компонентов оптимизации Machine Learning, TextGrad и ToolGrad по четырем ключевым параметрам.

Сравнение компонентов оптимизации ToolGrad с традиционными методами машинного обучения и TextGrad.

Фреймворк ToolGrad

ToolGrad включает четыре основных модуля, которые последовательно предлагают, выполняют, выбирают и обновляют необходимые функции.

  1. Модуль «Предложение API»: на каждой итерации этот модуль сужает выборку API до нескольких перспективных кандидатов для расширения текущего рабочего процесса.
  2. Исполнители API: Эти инструменты тестируют выбранные API параллельно и генерируют подробные отчеты о выполнении.
  3. Селектор API: Этот модуль анализирует отчеты о выполнении и выбирает единственный наиболее эффективный вызов API — выступая в качестве текстового индикатора, предоставляющего обратную связь для улучшения — и добавляет его в рабочий процесс.
  4. Обновление LLM: Наконец, этот модуль пересматривает синтетический запрос пользователя и ответ ИИ в соответствии с новым набором API.

Повторение этого итеративного процесса приводит к получению выборки данных, состоящей из запроса пользователя, проверенного рабочего процесса API и окончательного ответа ИИ.

Блок-схема, иллюстрирующая рабочий процесс ToolGrad, в котором API-интерфейсы предлагаются, оцениваются и последовательно интегрируются для обновления запроса и рабочего процесса.

ToolGrad генерирует последовательности успешного использования инструментов перед появлением подсказок, что обеспечивает высокий процент успешного прохождения теста.

Эксперименты

эффективность генерации данных

Сначала мы оцениваем стоимость и качество генерации данных. В качестве базы данных API мы используем ToolBench, содержащую более 16 000 реальных API, для генерации набора данных об использовании инструментов. Мы сравниваем исходный подход к генерации данных с помощью запроса в ToolBench, использующий поиск в глубину (DFS), с нашим подходом, основанным на ответе, ToolGrad. Результаты показывают, что ToolGrad может генерировать более сложные данные об использовании инструментов с более высоким процентом успешных результатов при меньших затратах на генерацию.

В таблице показано, что ToolGrad превосходит ToolBench, достигая 99,8-процентного показателя успешности при меньшем количестве этапов оптимизации.

Сравнение эффективности генерации между подходом, основанным на запросе (базовый вариант), и подходом, основанным на ответе (наш вариант).

Таблица лидеров по вызову функций в Беркли

Мы создали небольшие наборы данных об использовании инструментов, названные ToolGrad-500, используя базы данных API из ToolBench. Затем мы доработали модели Gemma-3 (1B, 4B и 12B) с помощью ToolGrad-500 и назвали эти доработанные модели ToolGrad-1B, ToolGrad-4B и ToolGrad-12B. Мы оценили производительность этих моделей в отношении использования инструментов на Berkeley Function Calling Leaderboard (BFCL), бенчмарке использования инструментов с другим набором инструментов, отличным от ToolBench. Мы сравниваем наши доработанные модели с (1) базовыми моделями без доработки, (2) лучшими проприетарными моделями (Gemini, GPT и Claude) и (3) лучшими специализированными моделями для использования инструментов (ToolACE, Hammer-2.1-7B).

Ниже приведено краткое изложение наших выводов.

  • Последовательное улучшение по сравнению с базовыми показателями : постобучение моделей Gemma-3 на ToolGrad-500 позволяет заметно повысить эффективность использования инструмента при всех протестированных значениях параметров.
  • Превосходя по характеристикам запатентованные LLM-системы : модель ToolGrad-12B демонстрирует исключительные возможности, получив оценку 83,1, что делает ее весьма конкурентоспособной по сравнению с самыми передовыми запатентованными моделями отрасли на момент публикации: gemini-2.5-pro (83,2), claude-4.5 Opus (82,8), а также gpt-5 (74,4).
  • Саморазвивающийся: набор данных ToolGrad-500 сгенерирован с использованием gemini-2.5-flash-lite. Интересно, что модель Gemma-3-12B, дообученная на данных, сгенерированных gemini-2.5-flash-lite, может превзойти свою исходную «модель-учителя».
  • Превосходя другие модели с открытым исходным кодом: ToolGrad-12B явно опережает другие специализированные модели инструментов с открытым исходным кодом, включая ToolACE, которая была доработана на основе более продвинутой базы данных API.
Гистограмма, демонстрирующая стабильное улучшение показателей ToolGrad в тестах на выбор инструментов для базовых моделей 1B, 4B и 12B.

Результаты оценки BFCL на моделях Gemma-3, ToolGrad, Gemini 2.5 серии, GPT-5, Claude-4.5, ToolACE и Hammer-2.1-7B.

Заключение и дальнейшие направления

ToolGrad демонстрирует, что высококачественные наборы данных об использовании инструментов могут генерироваться более эффективно и надежно с помощью парадигмы «сначала ответ». Разработав агентную структуру, которая итеративно связывает API с помощью текстовых градиентов, ToolGrad решает давние проблемы стоимости и масштабируемости при создании эталонных данных. Наша разработка обеспечивает почти 100% успешность генерации данных, позволяет относительно компактным моделям демонстрировать исключительно высокие результаты и показывает, что студенты-магистранты могут даже превзойти своих преподавателей.

В перспективе это исследование может быть расширено до более широкого круга реальных приложений за счет масштабирования фреймворка для работы с все более динамичными и обширными экосистемами API. В будущих работах также будет рассмотрено расширение этой возможности саморазвития для поддержки непрерывного обучения в режиме реального времени для персонализации. Поскольку агентные рабочие процессы все больше интегрируются в корпоративные и повседневные задачи, такие фреймворки, как ToolGrad, закладывают необходимую основу для обучения цифровых агентов, которые являются одновременно высокоэффективными и экономически масштабируемыми для развертывания.

Благодарности

Данное исследование было проведено главным образом Чжунъи Чжоу во время его работы в качестве приглашенного исследователя в Google. Мы выражаем искреннюю благодарность ключевым участникам: Кохею Уэхаре, Хаою Чжану, Цзинтао Чжоу, Линь Гу, Чжэн Сюй, Тацуе Хараде за их поддержку, а также Адаршу Коудле и Шахраму Изади за их стратегическое руководство и вдумчивые рецензии.

Источник: research.google

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Простая конструкция робота превосходит человеческую руку в некоторых ключевых движениях. Новости робототехники Керамические микросвитки, созданные по образцу бабочек, разворачиваются с помощью магнитов, приводя в движение крошечных роботов. Архив рубрики ~Коротко из Telegram~ ИИ может больше. Просто попросите его правильно Вы используете ИИ… Архив рубрики ~Коротко из Telegram~ Пять неочевидных привычек, которые отличают уверенных пользователей ИИ от новичков… Архив рубрики ~Коротко из Telegram~ ChatGPT серьезно ударил по индустрии заказных студенческих работ в Кении…. Архив рубрики ~Коротко из Telegram~ Российские операторы ЦОДов предложили создавать межрегиональные хабы, где один крупный… Новости робототехники JD.com расширяет применение физического искусственного интеллекта в логистике, используя 3 миллиона роботов. Архив рубрики ~Обо всем~ Дождь — это микромолния: ученые выяснили, как капли пробивают защиту автомобилей Новости робототехники Чем кладка кирпича научилась монументальной роботе в строительстве Архив рубрики ~Обо всем~ Инструмент глубокого обучения использует секвенирование длинных прочтений для обнаружения мутаций в раковых клетках. Архив рубрики ~Коротко из Telegram~ Сильнее всех складной iPhone Duo ждёт… Samsung. — Они уверены,… Архив рубрики ~Полезное~ Один ИИ-агент — одна точка контроля. Добавьте второй — появляется… Архив рубрики ~Коротко из Telegram~ Голосовой режим ChatGPT теперь может использовать GPT‑5.6 Sol и GPT‑6… Архив рубрики ~Коротко из Telegram~ DeepSeek объявила на своей API-платформе, что: После официального запуска V4.1… Новости робототехники Простая конструкция робота превосходит человеческую руку в некоторых ключевых движениях. Новости робототехники Керамические микросвитки, созданные по образцу бабочек, разворачиваются с помощью магнитов, приводя в движение крошечных роботов. Архив рубрики ~Коротко из Telegram~ ИИ может больше. Просто попросите его правильно Вы используете ИИ… Архив рубрики ~Коротко из Telegram~ Пять неочевидных привычек, которые отличают уверенных пользователей ИИ от новичков… Архив рубрики ~Коротко из Telegram~ ChatGPT серьезно ударил по индустрии заказных студенческих работ в Кении…. Архив рубрики ~Коротко из Telegram~ Российские операторы ЦОДов предложили создавать межрегиональные хабы, где один крупный… Новости робототехники JD.com расширяет применение физического искусственного интеллекта в логистике, используя 3 миллиона роботов. Архив рубрики ~Обо всем~ Дождь — это микромолния: ученые выяснили, как капли пробивают защиту автомобилей Новости робототехники Чем кладка кирпича научилась монументальной роботе в строительстве Архив рубрики ~Обо всем~ Инструмент глубокого обучения использует секвенирование длинных прочтений для обнаружения мутаций в раковых клетках. Архив рубрики ~Коротко из Telegram~ Сильнее всех складной iPhone Duo ждёт… Samsung. — Они уверены,… Архив рубрики ~Полезное~ Один ИИ-агент — одна точка контроля. Добавьте второй — появляется… Архив рубрики ~Коротко из Telegram~ Голосовой режим ChatGPT теперь может использовать GPT‑5.6 Sol и GPT‑6… Архив рубрики ~Коротко из Telegram~ DeepSeek объявила на своей API-платформе, что: После официального запуска V4.1…

Оставить комментарий