⚠️ Кэмерон Вулф (Netflix) разбирает исследования, объединённые одной идеей: агентов…
⚠️ Кэмерон Вулф (Netflix) разбирает исследования, объединённые одной идеей: агентов обычно тренируют только на успехах — за целую цепочку действий одна оценка «справился/нет», и если задача сложная, обучающий сигнал получается крайне разреженным. При этом каждый шаг агента содержит гораздо больше — реакцию среды на действие (вывод терминала, ошибку, результат поиска), которую раньше просто выбрасывали как «неважный контекст».
Новые методы (ECHO, PaW, Qwen-AgentWorld) учат агента параллельно ещё и предсказывать реакцию среды — тогда даже провальная попытка приносит пользу, без лишних вычислений. Результат: удвоение доли успешных решений на бенчмарке Terminal-Bench, обучение в 1.5–2.3 раза быстрее. Подвох — если перебрать с этим режимом, модель начинает зазубривать детали среды вместо общей логики, особенно на задачах с поиском в интернете.
‼️ Красиво тем, что не нужна отдельная инфраструктура — просто перестать выбрасывать то, что агент и так уже увидел.
❓ Реальный шаг вперёд, или ещё один инкремент в гонке за десятые процента на бенчмарках?
Похожие записи
Оцените материал:
Похожие записи
Маркетолог написал подробный гайд в X на 15 тысяч знаков,…
23.07.2026
В Казани открылся новый ИТ-хаб — третье пространство Т-Технологий в…
04.12.2025
Обучать Grok 5 будет 19-ЛЕТНИЙ ЗУМЕР Илон Маск уволил сотни…
02.10.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
