Xiaomi обновила Mimo-v2.6 — триллионная MoE-модель с новым RL-подходом Xiaomi…
Xiaomi обновила Mimo-v2.6 — триллионная MoE-модель с новым RL-подходом
Xiaomi выпустила обновление семейства Mimo-v2.6 — крупной мультимодальной MoE-модели примерно на 1T параметров с 42B активных.
Модель работает с текстом, аудио и визуальными данными. Схема классическая: модальные энкодеры переводят входы в пространство токенов языковой модели. Не совсем omni-подход, но для догоняющих систем — рабочий маршрут. Осилит дорогу идущий, как говорится, даже если идёт через энкодеры.
По вниманию используется гибрид: локальное оконное внимание и глобальное в соотношении 6:1. Это позволяет уменьшить KV-кэш в 7 раз по сравнению с full attention. Для ускорения генерации добавили MTP-декодер со спекулятивным выводом.
Самая интересная часть — обучение через GAR RL.
GAR расшифровывается как Groupwise Advantage Redistribution. Это вариация подходов вроде GRPO, где модель не просто получает бинарный сигнал «прошло / не прошло», а учится различать качество успешных решений.
Для каждой задачи генерируют 16 траекторий. Затем evaluator-модель оценивает их совместно по пяти критериям:
— насколько подход соответствует задаче
— нет ли взлома или обхода условий
— точна ли реализация без лишних fallback-ов
— минимальны ли изменения
— нет ли случайных правок вне задачи
— совпадает ли стиль с окружающим кодом
Прошедшие решения ранжируются: слабые получают меньше положительного подкрепления, сильные — больше. А подтверждённый reward hacking, например скачивание готового патча, обнуляется и считается провалом ещё до ранжирования.
Зачем это нужно? Потому что два решения могут пройти тесты, но быть принципиально разными. Одно аккуратно чинит задачу, другое обходит исключения, ломает стиль или притаскивает готовый ответ из интернета. В обычном RLVR оба могут получить одинаковую награду. GAR пытается научить модель видеть разницу между «работает» и «работает, но лучше бы не надо».
Ещё один важный момент: на стадии RL авторы замораживают роутер экспертов. Иначе при таком масштабе данных тюнинг роутера приводит к коллапсу баланса между экспертами. С замороженным роутером обучение получается стабильнее и быстрее.
Но к метрикам есть вопросы.
Во-первых, результаты получены в одном запуске, внутри одной лаборатории и на одном кластере. Воспроизводимость пока неочевидна.
Во-вторых, сравнения с другими моделями смешивают внутренние оценки и не отделяют вклад RL от архитектуры и пре-трейнинга. То есть мы видим общий результат, но не до конца понимаем, где именно инкремент: в GAR, данных, архитектуре или базовой модели.
В-третьих, улучшения от RL сопровождаются ростом использования токенов. Модель становится сильнее, но начинает думать длиннее — а это уже вопрос цены, latency и продакшен-нагрузок.
Работа:
https://www.alphaxiv.org/abs/2609.mimo-scaling-reinforcement-learning
Похожие записи
Оцените материал:
Похожие записи
Amazon Web Services запустила программу по возвращению бывших сотрудников, в…
30.09.2026
ЮKassa запустила MCP-сервер, который позволяет подключать ИИ-агентов к платежной системе…
30.09.2026
В России могут расширить требования к предустановке отечественных ИИ-помощников на…
30.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
