1. VEGA
  2. Блог
22 сентября 2026 г.

Xiaomi MiMo-V2.6: открытые омнимодальные модели с масштабированием RL

Xiaomi MiMo-V2.6: открытые омнимодальные модели с масштабированием RL

22 сентября 2026 года компания Xiaomi представила и открыла в открытом доступе серию моделей MiMo-V2.6. Релиз развивает направление рекурсивного самосовершенствования (RSI): масштабирование обучения с подкреплением (RL) на проверяемых сложных задачах, где модель расширяет возможности через исследовательский поиск и обратную связь.

В семейство вошли две базовые омнимодальные модели: флагманская MiMo-V2.6-Pro и оптимизированная по скорости и эффективности MiMo-V2.6-Flash. Также представлена модификация MiMo-V2.6-Pro-UltraSpeed, обеспечивающая ускорение генерации до 20 раз при сохранении качества ответов.

Позиция в бенчмарках

В сводном рейтинге Artificial Analysis Intelligence Index v4.3 модель MiMo-V2.6-Pro набрала 46.32 балла. Это лучший результат среди открытых моделей, превосходящий показатели Kimi K3 и Qwen3.8 Max.

Рейтинг моделей Artificial Analysis Intelligence Index

Открытое обучение с подкреплением (Scaling RL)

Процесс производственного обучения транслировался в прямом эфире. Менее чем за шесть дней MiMo-V2.6-Flash и MiMo-V2.6-Pro выполнили по 30 шагов RL на выборке около 750 тысяч траекторий.

Средняя доля решенных задач из обучающего набора выросла на 25% у Flash и на 12% у Pro. На отложенном тесте программирования DeepSWE v1.1 результаты выросли на 17 пунктов (с 48.8 до 65.68) у Flash и на 14 пунктов (с 58.4 до 72.57) у Pro.

Вычисления при обучении масштабировали по трем направлениям:

  1. Асинхронная архитектура и крупные пакеты: 1 568 сэмплов на каждое обновление, длина контекста до 1 миллиона токенов, от 3.5 до 3.7 миллиарда токенов на шаг.
  2. Разнородные среды задач: многозадачный набор, объединяющий программирование, работу автономных агентов, визуальные интерфейсы и сценарии кибербезопасности.
  3. Вычисления на стороне оценщиков: групповое относительное сравнение дает точный сигнал награды на длинных цепочках шагов и направляет модель к коротким траекториям с меньшим расходом токенов.

Для стабильности инженеры заморозили роутер и внедрили защиту от искажения наград (reward hacking), включающую состязательное тестирование, выявление аномалий и перекрестную проверку между верификаторами. Все материалы, включая технический отчет, код RL и тестовые среды, опубликованы в открытом доступе.

От написания кода к интерактивным мирам (Vibe World)

Модель MiMo-V2.6 сочетает пространственное мышление в 3D, мультимодальное восприятие и возможности управления компьютером (Computer-Use Agent). Программирование на естественном языке распространяется за пределы текстового кода: к созданию интерактивных сред, трехмерных объектов и робототехнике.

Разработка 3D-игр

По текстовому описанию или изображению MiMo-V2.6 разбивает задачу на этапы, координирует субагентов для сборки 3D-сцены, пишет логику взаимодействия и выполняет визуальную проверку рендеров.

Генерация интерактивной 3D-игры Создание трехмерной сцены, шейдеров и логики управления по текстовому описанию

3D-моделирование в Blender

Модель создает трехмерные объекты и пространственные сцены в Blender по текстовому запросу или референсному кадру, подготавливая ассеты для анимации, трехмерной печати и игровых движков.

Процедурное 3D-моделирование в Blender Генерация геометрии, материалов и анимации трехмерных объектов по текстовому описанию

Робототехника и сенсорная симуляция

В виртуальных средах с физикой модель принимает потоки с нескольких камер, непрерывно принимает решения и управляет манипулятором Franka Panda в замкнутом контуре с визуальной обратной связью: захватывает предметы, сортирует объекты по цветам и позиционирует детали.

Управление манипулятором Franka Panda Замкнутый контур визуальной обратной связи при захвате и сортировке объектов

Визуальный дизайн и видео

MiMo-V2.6 создает готовые веб-интерфейсы и презентационные слайды со структурированной версткой, анимацией и рабочими компонентами. Модель взаимодействует с Figma и графическими инструментами, подбирая шрифты, палитру и расположение элементов.

В создании видео модель берет на себя сценарий, визуальный ряд, анимацию, сочинение фоновой музыки и синхронизацию переходов под ритм. Для обучающих роликов абстрактные понятия (например, преобразование Фурье) переводятся в последовательную визуальную схему с закадровым голосом, синтезированным моделью MiMo-V2.5-TTS.

Анимация преобразования Фурье Полный цикл генерации обучающего ролика с анимацией и синтезом поясняющей речи

Музыкальная композиция

В MiMo-V2.6 включены механизмы понимания теории музыки, гармонии и инструментовки. Модель способна сочинять законченные музыкальные фрагменты и генерировать MIDI-файлы.

Флагманской модели MiMo-V2.6-Pro поставили задачу написать оркестровую партитуру для десяти инструментов: струнной группы, гобоя, кларнета, трубы, тромбона, валторны, колокольчиков и литавр. Модель составила нотный текст и самостоятельно преобразовала его в формат MIDI.

Оркестровая пьеса «Night Road» Сочинение MiMo-V2.6-Pro для десяти инструментов, воспроизведение из MIDI в цифровой рабочей станции (DAW)

Также представлены две фортепианные пьесы в тональности ля минор, демонстрирующие управление фактурой, динамикой и темпом:

Медленная пьеса для фортепиано в ля миноре
Медленная пьеса для фортепиано в ля миноре
«Fading Light» (сочинение MiMo-V2.6-Pro)
0:00 --:--
Умеренная пьеса для фортепиано в ля миноре
Умеренная пьеса для фортепиано в ля миноре
«Quiet Soliloquy» (сочинение MiMo-V2.6-Pro)
0:00 --:--

Научные расчеты и формализация доказательств

Без предварительного специализированного обучения под научные задачи MiMo-V2.6 показала практические результаты в двух независимых исследованиях:

  • Проектирование материалов: материаловеды Xiaomi поручили модели разработать металлоорганический каркас (MOF) типа UiO-67 на основе циркония для фильтрации перфторалкильных веществ (PFAS). Модель провела поиск по литературе и патентам, сформулировала гипотезы, подключила расчетные пакеты, автоматически настроила расчетную среду и вычислила энергию связывания между каркасом и молекулами PFAS.
  • Формализация теоремы Ли-Йорка: MiMo-V2.6-Pro помогла математикам формализовать на языке Lean 4 классическую теорему «Период три влечет хаос» (Li-Yorke, 1975). Команда субагентов сгенерировала формулировки лемм и шаги доказательства. Итоговый проект составил более 6 000 строк кода на Lean 4 и был полностью проверен верификатором ядра без недоказанных мест (sorry).

Сводные результаты бенчмарков

НаправлениеБенчмаркMiMo-V2.6-ProMiMo-V2.6-FlashMiMo-V2.5-ProDeepSeek V4.1 FlashClaude Opus 5
ПрограммированиеDeepSWE v1.171.967.919.074.274.0
ПрограммированиеProgramBench26.526.012.520.337.0
ПрограммированиеMiMo Code Bench63.261.240.460.268.6
Общие агентыGDPVal 2.1 (AA Elo)1673-110716001708
Общие агентыToolathlon-verified76.973.649.1-80.6
Общие агентыAutomation Bench v1.0.653.152.316.054.850.3
Общие агентыAgents' Last Exam31.627.613.231.831.6
Визуальный кодMiMo Visual Coding72.371.5-70.670.0
БезопасностьCyberGym94.095.140.088.1-

Где доступна модель

Модели семейства доступны:

  • Веб-интерфейсы: Xiaomi AI Studio и MiMo Code.
  • Приложение MiMo Desktop: вышел официальный релиз версии 1.0 с поддержкой режима UltraSpeed.
  • Разработчикам: открытая платформа Xiaomi MiMo API, агрегатор OpenRouter и веса в коллекции HuggingFace.
  • В экосистеме VEGA AI: модели будут интегрированы в каталог чата и API для российских пользователей.

Комментарии

Проверка авторизации...
Загрузка комментариев...

Похожие статьи

  • 21 сентября 2026 г.Grok 4.7 в ВЕГА — новый флагман xAI для кода и агентовФлагман xAI для кода и агентов: 2,1 трлн параметров, контекст 500 тыс. токенов, четыре уровня рассуждения, цена без изменений. Уже работает в ВЕГА.
  • 21 сентября 2026 г.Qwen 3.8 Omni Flash — омнимодальная модель Alibaba уже в ВЕГАОмнимодальная Qwen3.8-Omni-Flash: аудио, видео и изображения на входе, контекст 1 млн токенов, аудиовход дешевле на 98%. Уже в веб-поиске vega.chat и в API.
  • 11 сентября 2026 г.Suno V6 уже доступен на VEGASuno выпустил V6, новое поколение музыкальных моделей, разработанное вместе с Warner Music Group, BMG и Believe. Три модели, редактирование обычным текстом, мэшапы из нескольких источников и создание из текста, аудио, изображений и видео. Уже доступно на vega.chat и через api.vega.chat.
VEGA - создано в getmyai
ОфертаПолитика обработки ПДПолитика рассылки