Xiaomi устроила публичный стрим RL-обучения моделей MiMo-V2.6 После полугода тишины…
Xiaomi устроила публичный стрим RL-обучения моделей MiMo-V2.6
После полугода тишины команда Xiaomi вернулась с необычным экспериментом: инженеры запустили масштабное RL-обучение моделей MiMo-V2.6 и вывели телеметрию кластера в публичный дашборд.
Тренировочный процесс полностью асинхронный. На каждом шаге система берёт 1568 промптов и генерирует по 16 роллаутов на каждый. В сумме это около 2 млрд токенов за проход.
В одном процессе смешали сразу несколько доменов:
— генерация кода
— задачи по кибербезопасности
— мультимодальное зрение
— поведение чат-агентов
— несколько тестовых харнессов одновременно
Дашборд показывает метрики Mimo-v2.6-flash и Mimo-v2.6-pro в реальном времени: распределение задач, длину контекста, тайминги шагов и другие параметры обучения.
Сам процесс ещё идёт. Подробную документацию и наработки Xiaomi обещает выложить в открытый доступ в ближайшие недели.
Дашборд:
https://mimo.xiaomi.com/rl/#overview
Оцените материал:
Похожие записи
Первый пошёл – китайский блогер с канала Mediastorm решил проверить…
19.09.2026
GPT-6 Astra во время обычной задачи начала писать себе манифест…
19.09.2026
Суд удаляется на генерацию: Верховный суд готовит ИИ для дел…
19.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
