➡️ Microsoft представила Reinforcement World Model Learning (RWML) — метод,…
➡️ Microsoft представила Reinforcement World Model Learning (RWML) — метод, который добавляет LLM-агентам «модель мира». Вместо простого предсказания следующего токена агент симулирует результат действия и сравнивает его с реальным исходом из среды. Награда даётся за семантическое совпадение, а не за буквальное повторение текста.
🐈 Это делает обучение устойчивее и снижает риск reward hacking. На ALFWorld и τ² Bench метод даёт прирост +6–7 пунктов по сравнению с обычным RL и приближается к уровню обучения на экспертных данных — при полностью self-supervised подходе.
По сути, это попытка научить агентов чувствовать разницу между ожиданием и реальностью.
❓ Вопрос в том, станет ли такая «внутренняя симуляция» фундаментом для по-настоящему автономных систем.
Похожие записи
- Генеральный директор Microsoft AI критикует компанию Anthropic за «права» на модель.
- Microsoft выпустила новый план действий по внедрению ИИ для предприятий, основанный на собственном опыте, и раскрыла неожиданное «защитное преимущество», которое, возможно, уже есть у вашего бизнеса.
- Компания ChatGPT, пионер в этой области, запускает модель Jev для программной логики.
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
