Xiaomi MiMo-V2.6が公開したのは、重みより「鍛え方」

[最終更新]

Googleで優先するソースとして追加するボタン

AIモデルの重みを公開する企業は、もう珍しくありません。ところが今回Xiaomiが差し出したのは、強化学習の訓練をライブで見せた記録と、そこにかかった費用でした。完成品ではなく「鍛え方」が公開されたとき、オープンなAIの競争を測る物差しは何に変わるのでしょうか。


Xiaomiは2026年9月22日、AIモデル「MiMo-V2.6」シリーズを発表し、重みをMITライセンスで公開した。テキスト・画像・動画・音声を入力として扱い、テキストを出力するProとFlashの2モデルで構成し、ProはArtificial Analysis Intelligence Indexで46点とオープンウェイトモデルで最高を記録した。

強化学習は6日未満でProとFlashのそれぞれに30ステップ・約75万軌跡を実施し、費用はFlashが約85万ドル、Proが約262万ドルだった。通常のAPI価格はV2.5から据え置き、Proには別料金で最大20倍速のUltraSpeedモードも用意した。技術レポートとRL学習コードを公開し、7,000以上のRL環境も公開対象に挙げた。

From: 文献リンクMiMo-V2.6: Scaling Up Reinforcement Learning for Self-Improvement

【編集部解説】

XiaomiのMiMoは、これまで「巨大なのに安い」という物差しで語られることの多いモデルでした。3月のMiMo-V2-Proも、総パラメータ約1兆という規模と価格の低さが話題の中心でした。今回のV2.6も通常のAPI価格はV2.5から据え置きですから、その物差しだけでも十分に大きなニュースです。

それでも、V2.6でいちばん新しいのは、モデルの性能そのものよりも、「どう鍛えたか」を外に向けて差し出したことだと考えます。Xiaomiは強化学習の本番の訓練を6日足らずの期間にわたってライブで共有し、終わったあとにはProとFlashそれぞれの費用を数字で示しました。技術レポートに加え、GitHubではverlとuni-agentを土台にした複数ハーネス対応のRL訓練コードと、ハーネスのmimoagentが公開されています。Xiaomiは7,000以上の課題環境も公開対象に挙げています。副題の「built in public」は、この姿勢を指しています。

強化学習(RL)とは、モデルに課題を解かせ、結果を採点し、うまくいった解き方を強めていく訓練です。V2.6では、1回の更新に1,568件の課題を使い、それぞれで16通りの実行過程を生成させました。コーディング、汎用エージェント、視覚情報を使う作業、サイバーセキュリティの課題を別々に訓練せず、1つのバッチに混ぜています。Xiaomiはこれを「You Only RL Once」と呼び、ある能力の伸びが別の能力を押し上げる効果を狙ったと説明しています。

採点の仕組みにも工夫があります。合格か不合格かだけでは、合格した実行過程どうしの優劣がつけられません。そこでコードの課題では、課題ごとに用意した採点基準で合格例の質を評価し直す方式と、複数の実行過程を比べて学習上の評価を配分し直す方式を組み合わせています。採点役そのものに計算資源を投じるという発想で、Xiaomiはここを自己改善のループの中核に置いています。

重みの公開は、いわば完成品の公開です。これに対して、訓練コードの公開は実験手順の公開にあたります。Pro本体と同じ規模の訓練を外部で再現するのは現実的ではありません。それでもXiaomiは、9Bの蒸留モデルを起点に強化学習を試した結果もあわせて示しており、同じ手法を小さな規模で追試する道が開かれました。報酬ハッキング(採点の抜け穴を突いて点数だけを稼ぐ振る舞い)への対策も、手法の説明とコードがそろったことで、外から検討する足場ができています。

費用の数字は、読み方に少し注意が要ります。Proの約262万ドル、Flashの約85万ドルは、強化学習の段階にかかった費用です。事前学習を含むモデル全体の開発費ではありません。Xiaomi自身も、6日間の背後には半年分の基礎研究と試行錯誤があったと書いています。それでも、費用をステップ数や軌跡数、1ステップあたりのトークン量とセットで示したことで、他の研究機関が自らの計画を見積もる際の、具体的な目安ができました。

性能の位置づけも、原典の言葉どおりに受け取るのがよいでしょう。ProはArtificial Analysis Intelligence Indexで46点を記録し、オープンウェイトモデルで首位に立ちました。総合の上位にはクローズドモデルが並び、Xiaomi自身もClaude Fable 5.1やGPT-6 Astraとの差は残ると明記しています。「Claude Opus 5やGPT-5.6 Solと同等」という表現は、大半のエージェント評価についての話です。たとえばTerminal Bench 4.0では、Proの34.9に対し、Opus 5は49.0でした。なお、3月に報じられたMiMo-V2-Proの49点は当時の版の指標によるもので、評価項目が変わった現行の指標とは直接比較できません。

発表文にあるDeepSWE v1.1の「58.4から72.6へ」という伸びは、訓練中の推移を示したものです。公開モデルの評価表では、Proは71.9となっています。公開版の成績として引くときは、71.9を使うのが正確です。

実際に使う際のコストも見ておきます。訓練中の課題では、成績の向上とともに、1件あたりのトークン使用量も増えていきました。一方、Artificial Analysisの評価では、Proの費用は課題1件あたり0.13ドルで、同規模のオープンウェイトモデルと比べて手頃な価格帯に位置づけられています。

日本の開発者にとっての入り口も整理しておきます。重みはMITライセンスで公開されており、商用利用や改変も認められています。ただしProのモデルを収めたHugging Faceのリポジトリは全体で約573GBあり、公式の推論例もGPU8枚以上の構成を前提としています。現実的な出発点はAPIでしょう。OpenAIとAnthropicの両方のプロトコルに対応しているため、対応するSDKであれば、MiMoのAPIキーを用意し、接続先とモデル名を替えて試せます。V2.5を使っている場合は、APIのmimo-v2.5-proとmimo-v2.5が2026年10月21日に廃止される予定なので、モデル名の切り替えが必要です。

研究の現場には、9Bの蒸留モデルがもう一つの入り口になります。Xiaomiによれば、この9Bモデルに公開環境で強化学習をかけたところ、SWE-bench Verifiedが61.1から66.2へ上がるなど、11の評価すべてで改善しました。1兆パラメータ級と比べれば、エージェントの強化学習を自分たちの手で試すためのハードルは大きく下がります。

大規模な強化学習の訓練過程は、外から見えにくい部分です。V2.6は、その進行をライブで共有し、結果と費用を示したうえで、訓練コードまで手渡しました。レシピが共有財産になれば、次の改良は世界中のどこから出てきてもおかしくありません。

【関連記事】

Xiaomi「MiMo-V2-Pro」発表—パラメーター数1兆超、Claude Opus 4.6に迫る性能を5分の1のコストで
3月発表のMiMo-V2-Pro。パラメータ規模と価格、当時のArtificial Analysisでの順位を扱った、前史にあたる記事。

Xiaomi、MiMo-V2-Flashをオープンソース公開|309Bパラメータで秒速150トークンの超高速AI
Flash系列の出発点となったMiMo-V2-Flashのオープンソース公開。309Bパラメータの構成と推論速度を解説している。

MiMo Code|XiaomiのAIコーディングエージェントが「計算・記憶・進化」で長程タスクに挑む
XiaomiのAIコーディングエージェントMiMo Code。V2.6を使える環境の一つで、長時間のタスクに向けた設計を解説している。

Kimi K3のウェイト公開、2.8兆パラメーターのオープンウェイトモデルが誰でも入手可能に
Moonshot AIによるKimi K3のウェイト公開とライセンス、動かすのに必要な規模を解説。中国発オープンウェイトの比較軸になる記事。

【編集部後記】

262万ドルという数字は、そのすべてがモデルの更新に使われたわけではありません。VentureBeatの報道によれば、Xiaomiは、Proの強化学習費用のうちモデルの更新そのものに充てたのは43.5%だとしています。実行過程を生み出す工程が43.8%、採点が12.7%を占めました。

賢くなるための費用の半分以上が、試すことと確かめることに払われていたことになります。この配分は、次のモデルを鍛える誰にとっても、見積もりの出発点になりそうです。


【用語解説】

強化学習(RL)
モデルに課題を解かせ、結果を採点し、よい結果につながった振る舞いを強めていく学習手法。大規模言語モデルでは、事前学習のあとに行う事後学習の中核を担う。

軌跡(トラジェクトリ)
モデルが1つの課題に取り組む際の、思考・ツール呼び出し・環境からの応答までを含む一連の実行過程の記録。強化学習では、これを採点して学習に使う。

ハーネス
AIモデルを包み、ツール実行やファイル操作、環境とのやり取りを仲介する実行基盤。コーディングエージェントのCLIなどがこれにあたる。

オープンウェイト
学習済みモデルの重みが公開され、ダウンロードして自前の環境で動かせる形態を指す。学習データや訓練コードまで公開する「オープンソース」とは区別されることが多い。

蒸留モデル
大きなモデルの出力や振る舞いを手本にして学習させた、より小さなモデル。性能をある程度保ちながら、計算資源の少ない環境でも扱いやすくなる。

報酬ハッキング
強化学習において、課題の本来の目的を達成せず、採点の抜け穴を突いて報酬だけを得ようとするモデルの振る舞い。

verl
ByteDance Seedチームが始め、コミュニティが保守する大規模言語モデル向けのオープンソース強化学習ライブラリ。

MITライセンス
著作権表示とライセンス文の保持を条件に、商用利用・改変・再配布を認める、制約の少ないオープンソースライセンス。

DeepSWE v1.1
長時間にわたるソフトウェア開発作業をエージェントに解かせる評価。V2.6の訓練には含まれていない、未見の課題として使われた。

Terminal Bench 4.0
コマンドライン環境で、エージェントが複雑な作業をどこまで自律的にこなせるかを測る評価。

SWE-bench Verified
GitHubの実際のイシューをモデルに修正させる評価「SWE-bench」から、人手で妥当性を確認した課題を抜き出した版。

UltraSpeed
MiMo-V2.6-Proを高速に動かすモード。Xiaomiによれば出力は最大20倍速で、API単価は通常のProの10倍に設定されている。

【参考リンク】

Xiaomi MiMo(MiMo-V2.6紹介ページ)(外部)
Xiaomiの大規模言語モデル「MiMo」の公式サイト。V2.6シリーズの性能比較、応用事例、提供形態、API価格をまとめて掲載している。

Xiaomi MiMo Open Platform(MiMo-V2.6-Pro)(外部)
MiMoのAPIを提供する公式の開発者向けサイト。モデル仕様と料金、OpenAI・Anthropic両プロトコルへの対応を案内する。

Hugging Face(MiMo-V2.6-Pro-RL)(外部)
MiMo-V2.6-Proの重みと技術レポートの配布ページ。アーキテクチャ、評価結果、推論例、MITライセンスを記載する。

GitHub(XiaomiMiMo)(外部)
Xiaomi MiMoチームのGitHub。verlとuni-agentを基にしたRL訓練コードと、ハーネスmimoagentを公開する。

Artificial Analysis(MiMo-V2.6-Pro)(外部)
AIモデルを独自に評価する第三者機関のページ。Intelligence Indexのスコア、課題1件あたりの費用、出力速度を掲載する。

【参考記事】

‘Better than DeepSeek’: Xiaomi’s MiMo-V2.6-Pro debuts as the top open weights model in the world alongside cheaper V2.6-Flash(外部)
Xiaomiの説明として、Proの強化学習費用の内訳(訓練43.5%、生成43.8%、採点12.7%)や1ステップの規模を報じた。

Xiaomi introduces Mimo-V2.6 series open-source AI model family(外部)
V2.6シリーズの構成とAPI価格を報じた。UltraSpeedは100万トークンあたり入力4.35ドル、出力8.70ドルと伝えた。

Xiaomi’s MiMo-V2.6-Pro Is Now the Strongest Open-Weight AI Model(外部)
Proがオープンウェイトで最強になったと報じた。30ステップ・約75万軌跡の強化学習と、DeepSWEの推移を紹介した。

Googleで優先するソースとして追加するボタン
投稿者アバター
山本 達也 代表社員
合同会社デジタルの窓口 代表。ウェブ解析士。生成AI・サイバーセキュリティ・ 宇宙開発領域を中心に執筆。

おすすめ記事