⚠️ Кэмерон Вулф (Netflix) разбирает исследования, объединённые одной идеей: агентов…
⚠️ Кэмерон Вулф (Netflix) разбирает исследования, объединённые одной идеей: агентов обычно тренируют только на успехах — за целую цепочку действий одна оценка «справился/нет», и если задача сложная, обучающий сигнал получается крайне разреженным. При этом каждый шаг агента содержит гораздо больше — реакцию среды на действие (вывод терминала, ошибку, результат поиска), которую раньше просто выбрасывали как «неважный контекст».
Новые методы (ECHO, PaW, Qwen-AgentWorld) учат агента параллельно ещё и предсказывать реакцию среды — тогда даже провальная попытка приносит пользу, без лишних вычислений. Результат: удвоение доли успешных решений на бенчмарке Terminal-Bench, обучение в 1.5–2.3 раза быстрее. Подвох — если перебрать с этим режимом, модель начинает зазубривать детали среды вместо общей логики, особенно на задачах с поиском в интернете.
‼️ Красиво тем, что не нужна отдельная инфраструктура — просто перестать выбрасывать то, что агент и так уже увидел.
❓ Реальный шаг вперёд, или ещё один инкремент в гонке за десятые процента на бенчмарках?
Похожие записи
Оцените материал:
Похожие записи
Анонсировали, что в Яндекс Картах появится нейросеть для решения городских…
02.11.2025
Meta выкатила Muse Image — свой первый AI-фотошоп с агентными…
09.07.2026
Microsoft запускает линейку MAI: сразу три модели под продакшен Microsoft…
07.04.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
