Пока все спорили о закрытых моделях, Xiaomi молча довела свою серию MiMo до триллиона параметров и выложила веса под лицензией MIT. Разбираем, что внутри.

Это семейство, а не одна модель

MiMo — общий бренд, под которым вышло несколько разных моделей. Среди них рассуждающая MiMo-7B (май 2025), визуальная MiMo-VL, аудио MiMo-Audio, модель для роботов и автомобилей MiMo-Embodied, а также разреженные MoE поколений V2 и V2.5. Связывает их только команда и название, архитектуры у всех разные. Хронология растянулась на полтора года:

  • май 2025 — MiMo-7B: обучение с нуля на 25 трлн токенов для задач рассуждения;
  • июнь 2025 — MiMo-VL-7B: изображения, видео, OCR, работа с интерфейсами;
  • декабрь 2025 — MiMo-V2-Flash: 309 млрд параметров всего, 15 млрд активных;
  • апрель 2026 — V2.5 и V2.5-Pro уже под MIT;
  • июнь 2026 — UltraSpeed с генерацией свыше тысячи токенов в секунду.

Работает не только с текстом

MiMo-V2.5 умеет принимать несколько модальностей сразу. В ней 310 млрд параметров всего, 15 млрд активных, плюс визуальный энкодер на 729 млн и аудиоэнкодер на 261 млн. На вход идут текст, изображения, видео и звук, на выходе — текст и вызовы инструментов. Отдельно живут MiMo-V2.5-ASR для распознавания речи под Apache 2.0 и семейство TTS: синтез голоса, голос по описанию и клонирование по короткой записи.

Триллион параметров и четыре процента активных

Флагман MiMo-V2.5-Pro построен как разреженная смесь экспертов. Всего в модели 1.02 трлн параметров, но на каждый токен активируются только 42 млрд. Внутри — 70 слоёв и 384 эксперта, для каждого токена подключаются восемь из них. Контекст достигает 1 048 576 токенов, веса открыты под MIT.

Внимание через окно на 128 токенов

Главная инженерная находка — способ удешевить длинный контекст. Из 70 слоёв только 10 просматривают всю последовательность, остальные 60 работают с окном на 128 предыдущих токенов. Чтобы короткое окно не разрушало качество, в модель добавили обучаемый «сток внимания»: голова может не расходовать вероятность на ненужные соседние токены, а сбрасывать её в пустоту.

Одна ученица и несколько учителей

Пост-тренировка строится на методе MOPD. Несколько специализированных моделей — математика, программирование, терминал, поиск, безопасность — дают подсказки по токенам одной ученице. Важно, что учат её на её же траекториях, а не на чужих ответах. Параллельно работает R3: маршруты экспертов, зафиксированные при инференсе, воспроизводятся на этапе обучения. Без этого MoE начинает разъезжаться.

Больше тысячи токенов в секунду

Конфигурация UltraSpeed сжимает веса экспертов в MXFP4, добавляет спекулятивное декодирование DFlash и «живучие» ядра TileRT. Один узел с восемью GPU выдаёт более тысячи токенов в секунду. Триллион весов в четырёхбитном формате весит около 510 ГБ — и всё это нужно где-то размещать.

Что в итоге

Xiaomi показала, что открытые веса больше не ограничиваются семимиллиардными моделями. При этом точнее говорить «open-weight», а не «open source»: сами веса доступны, но данные и полный обучающий пайплайн — нет. Миллион токенов в спецификации тоже не гарантирует равномерного качества по всей длине: в GraphWalks модель удерживала ненулевой результат на миллионе, тогда как прошлое поколение в этой зоне резко проседало. Хостинг V2 компания отключила 30 июня 2026 года, предложив клиентам переехать на V2.5, но уже скачанные веса продолжают работать.

Модель и карточка: mimo.xiaomi.com. Код и веса: github.com/XiaomiMiMo.

Полная версия: https://habr.com/ru/articles/1082686/