⚠️ Кэмерон Вулф (Netflix) разбирает исследования, объединённые одной идеей: агентов…
⚠️ Кэмерон Вулф (Netflix) разбирает исследования, объединённые одной идеей: агентов обычно тренируют только на успехах — за целую цепочку действий одна оценка «справился/нет», и если задача сложная, обучающий сигнал получается крайне разреженным. При этом каждый шаг агента содержит гораздо больше — реакцию среды на действие (вывод терминала, ошибку, результат поиска), которую раньше просто выбрасывали как «неважный контекст».
Новые методы (ECHO, PaW, Qwen-AgentWorld) учат агента параллельно ещё и предсказывать реакцию среды — тогда даже провальная попытка приносит пользу, без лишних вычислений. Результат: удвоение доли успешных решений на бенчмарке Terminal-Bench, обучение в 1.5–2.3 раза быстрее. Подвох — если перебрать с этим режимом, модель начинает зазубривать детали среды вместо общей логики, особенно на задачах с поиском в интернете.
‼️ Красиво тем, что не нужна отдельная инфраструктура — просто перестать выбрасывать то, что агент и так уже увидел.
❓ Реальный шаг вперёд, или ещё один инкремент в гонке за десятые процента на бенчмарках?
Похожие записи
- Компания Nimble утверждает, что ее новые специализированные агенты веб-поиска снижают стоимость токенов вдвое, одновременно повышая точность поиска.
- Наличие домашних животных связали со снижением субъективной оценки здоровья. И риском нездорового поведения
- 🚨 Крупные американские ИИ-компании давят на безопасность и интеллектуальную собственность…
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
