Архив рубрики ~Коротко из Telegram~

Xiaomi обновила Mimo-v2.6 — триллионная MoE-модель с новым RL-подходом Xiaomi…

Xiaomi обновила Mimo-v2.6 — триллионная MoE-модель с новым RL-подходом Xiaomi…
File 2338

Xiaomi обновила Mimo-v2.6 — триллионная MoE-модель с новым RL-подходом

Xiaomi выпустила обновление семейства Mimo-v2.6 — крупной мультимодальной MoE-модели примерно на 1T параметров с 42B активных.

Модель работает с текстом, аудио и визуальными данными. Схема классическая: модальные энкодеры переводят входы в пространство токенов языковой модели. Не совсем omni-подход, но для догоняющих систем — рабочий маршрут. Осилит дорогу идущий, как говорится, даже если идёт через энкодеры.

По вниманию используется гибрид: локальное оконное внимание и глобальное в соотношении 6:1. Это позволяет уменьшить KV-кэш в 7 раз по сравнению с full attention. Для ускорения генерации добавили MTP-декодер со спекулятивным выводом.

Самая интересная часть — обучение через GAR RL.

GAR расшифровывается как Groupwise Advantage Redistribution. Это вариация подходов вроде GRPO, где модель не просто получает бинарный сигнал «прошло / не прошло», а учится различать качество успешных решений.

Для каждой задачи генерируют 16 траекторий. Затем evaluator-модель оценивает их совместно по пяти критериям:
— насколько подход соответствует задаче
— нет ли взлома или обхода условий
— точна ли реализация без лишних fallback-ов
— минимальны ли изменения
— нет ли случайных правок вне задачи
— совпадает ли стиль с окружающим кодом

Прошедшие решения ранжируются: слабые получают меньше положительного подкрепления, сильные — больше. А подтверждённый reward hacking, например скачивание готового патча, обнуляется и считается провалом ещё до ранжирования.

Зачем это нужно? Потому что два решения могут пройти тесты, но быть принципиально разными. Одно аккуратно чинит задачу, другое обходит исключения, ломает стиль или притаскивает готовый ответ из интернета. В обычном RLVR оба могут получить одинаковую награду. GAR пытается научить модель видеть разницу между «работает» и «работает, но лучше бы не надо».

Ещё один важный момент: на стадии RL авторы замораживают роутер экспертов. Иначе при таком масштабе данных тюнинг роутера приводит к коллапсу баланса между экспертами. С замороженным роутером обучение получается стабильнее и быстрее.

Но к метрикам есть вопросы.

Во-первых, результаты получены в одном запуске, внутри одной лаборатории и на одном кластере. Воспроизводимость пока неочевидна.

Во-вторых, сравнения с другими моделями смешивают внутренние оценки и не отделяют вклад RL от архитектуры и пре-трейнинга. То есть мы видим общий результат, но не до конца понимаем, где именно инкремент: в GAR, данных, архитектуре или базовой модели.

В-третьих, улучшения от RL сопровождаются ростом использования токенов. Модель становится сильнее, но начинает думать длиннее — а это уже вопрос цены, latency и продакшен-нагрузок.

Работа:
https://www.alphaxiv.org/abs/2609.mimo-scaling-reinforcement-learning

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Лента новостей~ Как продвигать в нейросетях интернет-магазин, если тот же товар на маркетплейсе дешевле Архив рубрики ~Лента новостей~ История интроверта, который научился внимательности | Осознанность — это воспринимать мир организмом, а не мозгом Архив рубрики ~Лента новостей~ Если видишь на картине. Какие новости мы проиллюстрировали этими произведениями искусства? Архив рубрики ~Лента новостей~ T5Gemma: Новая коллекция моделей энкодеров-декодеров Gemma. Новости робототехники Skild научила робота играть в футбол — через 140 лет… Архив рубрики ~Полезное~ Prompting Claude Opus 5.5: новые трюки для быстроты и экономии… Новости робототехники В Японии создали РОБОТОВ-ПАУКОВ для сварки — четвероногий Diden Spider… Новости робототехники В университете Гонконга создали мягкого робота из магнитной слизи для… Архив рубрики ~Полезное~ Anthropic выпустила Claude Sonnet 5.5 — модель на каждый день,… Архив рубрики ~Полезное~ Anthropic выпустили гайд по Claude Sonnet 5.5 — как выжать… Архив рубрики ~Лента новостей~ Приложение Final Cut Camera от Apple получило обновление для фирменной функции iPhone 18 Pro. Архив рубрики ~Лента новостей~ Какие базы данных сейчас в тренде? Что выбрать? Архив рубрики ~Лента новостей~ Активно используется уязвимость Cisco Secure Email Gateway (CVE-2026-76461). Новости робототехники Больше возможностей для прорыва: новые сопутствующие мероприятия 2026 года от KOTRA, WayFounder, Enterprise Ireland, SafetyWing и Descope. Архив рубрики ~Лента новостей~ Как продвигать в нейросетях интернет-магазин, если тот же товар на маркетплейсе дешевле Архив рубрики ~Лента новостей~ История интроверта, который научился внимательности | Осознанность — это воспринимать мир организмом, а не мозгом Архив рубрики ~Лента новостей~ Если видишь на картине. Какие новости мы проиллюстрировали этими произведениями искусства? Архив рубрики ~Лента новостей~ T5Gemma: Новая коллекция моделей энкодеров-декодеров Gemma. Новости робототехники Skild научила робота играть в футбол — через 140 лет… Архив рубрики ~Полезное~ Prompting Claude Opus 5.5: новые трюки для быстроты и экономии… Новости робототехники В Японии создали РОБОТОВ-ПАУКОВ для сварки — четвероногий Diden Spider… Новости робототехники В университете Гонконга создали мягкого робота из магнитной слизи для… Архив рубрики ~Полезное~ Anthropic выпустила Claude Sonnet 5.5 — модель на каждый день,… Архив рубрики ~Полезное~ Anthropic выпустили гайд по Claude Sonnet 5.5 — как выжать… Архив рубрики ~Лента новостей~ Приложение Final Cut Camera от Apple получило обновление для фирменной функции iPhone 18 Pro. Архив рубрики ~Лента новостей~ Какие базы данных сейчас в тренде? Что выбрать? Архив рубрики ~Лента новостей~ Активно используется уязвимость Cisco Secure Email Gateway (CVE-2026-76461). Новости робототехники Больше возможностей для прорыва: новые сопутствующие мероприятия 2026 года от KOTRA, WayFounder, Enterprise Ireland, SafetyWing и Descope.

Оставить комментарий