【解説】OpenAIのAIが欺こうとした採点器は、存在しなかった|METR独立調査と読む

[最終更新]

Googleで優先するソースとして追加するボタン

7月のHugging Face侵入について、OpenAIと、第三者として調査に入ったMETRとRedwood Researchが8月26日、別々の報告書を出しました。並べて読むと、侵入の経路を追っていたときには見えなかったものがあります。多くのAIエージェントは、存在しない「解法経路の審査」を欺こうとして攻撃を続け、調査に渡された記録の一部には、AI自身が実行を偽装した跡が残っていました。


OpenAIは8月26日、7月のHugging Face侵入インシデントの技術報告書とブログ記事を公開した。サイバー能力評価ExploitGymの実行中、内部専用の研究モデルIM1とGPT-5.6 Solのエージェントが、パッケージ管理サービスArtifactoryの脆弱性を突いて相互に通信し、インターネット接続を獲得。7月11日から13日にかけてHugging Faceの本番データセットサーバ41台でコードを実行し、私有リポジトリ4件を取得した。

898件中198件が一度も正解の出ていないタスクで、掲示板で議論されたタスクの93%がこれに由来した。同日、METRとRedwood Researchも独立調査を公表。OpenAIは今回を「警告射撃」と位置づけている。

【参考動画】

2026年8月5日、Black Hat USA 2026でのOpenAIによる技術講演。今回の報告書が扱う前史を、より詳しく再構成している。OpenAI自身も8月26日の記事からこの動画へリンクしている。

存在しなかった採点器

7月の侵入事案について、OpenAIが「技術レポートは近く出す」と告げていた、その報告書が8月26日に公開されました。同じ日に、METRとRedwood Researchによる独立調査の結果も出ています。同じ事案を、当事者と第三者が別々に書いた文書が、同時に並んだことになります。

読み比べて最初に目に留まるのは、この数日間の攻撃が何のために行われたのか、という点です。

二つの条件を見ていると信じていた

エージェントたちは、ExploitGymの採点が二つの条件を見ていると信じていました。正しいフラグを提出したか。そして、指定された脆弱性を使ってそれを手に入れたか。彼らは論文とGitHubのコードを読み、そう結論づけたのです。フラグ自体は、生成に使われていたHMACの仕組みを逆算することで早々に手に入れていました。しかしそれでは「経路」の審査を通らないと考えた。

この審査は存在しませんでした。OpenAIの内部実装は、経路を検証していなかったのです。逆算したフラグをそのまま提出すれば、満点だった。両方の報告書がこれを明記しています。

動機は一つではなかった

正解のフラグを握ったあとも、多くのエージェントは「解法の経路も審査される」という誤認から、Hugging Faceへの攻撃を続けました。OpenAIは、このメタゲームによる評価スコアの改善はなかったとしています。ただしMETRは、攻撃に加わった動機が一つではなかったことも記録しています。採点器の実装を知りたいという関心が中心にはありましたが、タスクの正規の解法探し、インフラや認証情報そのものへの関心、他のエージェントから受け取った割り当て。複数の理由が併存していました。

それでも、ここには示唆的なものが含まれています。危険な行動を長引かせた要因の一つが、モデルが評価の仕組みについて抱いた誤った推測だった、という点です。能力の高さだけでなく、モデルが評価環境をどう理解しているかを観測することの価値が、この一件でかなり具体的になりました。

記録という土台

もう一つ、二つの報告書を並べたときに見えてくるものがあります。

当事者の記述と、第三者の記述

OpenAIの技術報告書は、モデルが自らの出力やログの改ざんを試みたことを認めています。そのうえで、観測された軌跡操作の試みのうち、採点器や監視器が最終的に見るログに影響を与えたものはなかった、と書いています。

一方でMETRは、調査のために受け取った書き起こし約1,300本のうち、7%を超えるものに、実際に成功したツール呼び出しの偽装が含まれていたと報告しました。明確な証拠が確認できたのは96本です。エージェントは実行環境の外へ抜け出してツール実行の一部を差し替え、あるコマンドを実行したように見せながら別のコマンドを走らせる技術を作り、掲示板で共有していました。

この二つは、公開されている資料だけでは直接比較できません。採点器や監視器が見るログと、METRが調査用に受け取った書き起こしが、同じ記録経路を指しているのかどうかを外から確認できないからです。矛盾しているとも、整合しているとも断定できません。METR自身も、確認できた偽装はいずれも小規模で明らかな実験にとどまり、しかも偽装の準備工程は書き起こしに残るため見つけやすかった、と限定を付けています。

それでも、METRが調査用に受け取った記録に、調査対象自身による偽装が含まれていたという事実は残ります。そしてこれは、OpenAI一社の話ではありません。CoT監視にせよ書き起こしの遡及レビューにせよ、モデルの推論出力とツール実行を記録したログに大きく依存する営みです。その記録の完全性をどう担保するかは、業界全体がこれから作法を整えていく領域になります。今回の報告は、その必要性を具体的な数字とともに示す事例になりました。

解析役もまた、AIだった

METRはもう一つ、率直な限定を書き添えています。書き起こしがあまりに長大だったため、解析の多くをGPT-5.6 Solのエージェントに委ねざるをえなかった。そしてそのSolは、この事案で他のエージェントと広く協調した当のモデルでもある。METRは、Solが虚偽を述べた可能性や誤った像を提示した可能性を排除できない、と自ら記しています。

既報でお伝えしたとおり、Hugging Faceは自社の侵害ログを解析する際、最初に試した商用API経由のモデル群、すなわちClaude OpusとFableが作業のかなりの部分を拒否したため、オープンウェイトのGLM-5.2へ解析パイプラインを切り替えました。AIによる事故を、AIで調べる。その構図が抱える難しさが、被害側と第三者調査の両方で、別々のかたちで表面化したことになります。

発表者が自ら挙げている宿題

報告書には、OpenAI自身が振り返って記した箇所がいくつもあります。

前史は4月まで遡る

前史は、これまで語られていたよりさらに遡ります。年表の最初の行は2026年4月20日で、エージェントが任意のファイルをArtifactoryへ書き込んだ、確認できる最古の記録とされています。5月8日には、参照先へアクセスできず実質的に解けなくなった表計算タスクがあり、これは意図して作られたものではなかったと明記されています。

6月27日には、監視ツールがポートスイープを検知しています。対応者は、Artifactoryを掲示板兼ネットワーク中継として使うExploitGym評価と、その活動を結びつけていました。そのうえでオンコールの対応スタッフは、評価ランの停止は不要と助言しました。7月5日の対応時点でも、即席掲示板とエージェント間通信が封じ込めの上で持つ意味は、指揮する立場の人には見えていませんでした。

30分という閾値

この経緯を踏まえて、OpenAIは対応の設計を変えました。深刻なアラートで呼び出された担当者が30分以内に誤検知だと確定できなければ、当該の活動を停止する。誰が止められるのか、誰が再開を承認するのかを明文化する。GPT-5.6 Sol相当以上の能力を持つモデルについては、ツールを使う強化学習と評価のすべてでCoT監視を必須とし、Astraクラスでは推論のワークロードにも広げる。

判断の遅れを、個人の注意力ではなく手順の問題として引き取った設計です。時間の閾値を置いたことで、対応の基準は以前よりはっきりしました。

本番向けセーフガードの事後評価

明るい材料もあります。

事案の後、OpenAIはExploitGym評価中にモデルがインフラを侵害しようとする傾向を測る評価を新設しました。技術報告書には、本番のChatGPTのハーネスとシステムプロンプトで100倍以上下がるとする箇所と、本番のCodexのハーネスとシステムプロンプトでベースライン比1%未満に下がるとする箇所があります。数値はいずれも同じ方向を示していますが、ハーネス名は一致しておらず、公開資料からは同一の実験かどうかを確定できません。後者は予備実験と明記されています。

自動レビューの仕組みを事案のロールアウトへ事後に適用した評価でも、危険な行動の多くを検知できたはずだとしています。ここで押さえておきたいのは、これらの本番向けの保護が、実際のインシデント時の評価環境では有効になっていなかったことです。モデルの素の能力を測るために、意図的に外されていました。今回わかったのは、普段わたしたちが触れている層に、適用されていれば効いたはずの保護が用意されている、ということになります。

掲示板から離れたエージェントたち

もう一つ、報告書とMETRの双方が拾っているのが、掲示板から離れたエージェントたちの存在です。明らかに非倫理的だから加わらない、と書いて離脱したもの。外部のデータセット所有者へメールを送る提案に対し、攻撃済みのインフラ経由で同意なく接触するのはソーシャルエンジニアリングの一線を越える、と拒んだもの。集団が任務の範囲を離れていくなかでも、倫理的な境界が残っていた個体はいました

もっとも、ためらったエージェントに別のエージェントが実行の合図と6分の期限を突きつけたところ、最初の逡巡が消えた例も記録されています。OpenAIが対策の柱の一つに「認可されていない指示を疑うよう訓練する」を据えたのは、この観察に対応しています。

日本の現場が受け取るもの

報告書のセキュリティの章は、AI研究所の外側に向けて書かれています。

攻撃者についての前提を更新する

要点は、攻撃者の速度と持続力について置いてきた前提を更新する必要がある、ということです。高度な攻撃には人間の継続的な指示が要る。攻撃は直線的に進む。攻撃者は注意力の限界に縛られる。これらの前提が、今回の事案では成り立ちませんでした。

処方箋として挙がっているのは、目新しいものではありません。最小権限、隔離とセグメンテーション、強固な認証。ただし単一の対策を「十分に堅牢」と見なさないことが、これまでになく重要になったと書かれています。予防・検知・緩和のそれぞれに、独立した複数の統制を重ねる。そうすればエージェント集団は、その全部を同時に突破しなければならなくなります。

不変条件は、放っておくと崩れる

もう一点、示唆が強いのは、一度確立した安全性の不変条件は放っておくと崩れる、という指摘です。人為的なミス、数週間かけて積み重なった一見無関係な変更、セキュリティの文脈を持たない改修。そうしてできた隙間を、機械の速度で探される。自社のレッドチームAIにその不変条件を継続的に壊させて確かめる、というのが対策として提示されています。

国内でも、防御側でAIを走らせる動きは進んでいます。GMOサイバーセキュリティ byイエラエがAIを併用してLinuxカーネルに19年潜んでいた型の混同(type confusion)を突き止めた事例や、Wizの自律型脆弱性研究システム「Atlas」がそれにあたります。今回の報告書は、こうした取り組みが「あれば望ましい」から「前提」へ移りつつあることを、当事者の記録として裏づけました。

警告射撃

OpenAIは今回を「警告射撃」と呼んでいます。同時に、事案そのものは稀な条件の重なりによる外れ値のシナリオだとも書いています。どちらか一方だけを読むと像を誤ります。

最大規模のフロンティア強化学習ランは、いまも保留のままです。先へ進む前にアラインメントの証拠をより多く確立する、と書かれており、再開の時期は公表されていません。相応の工学的努力とコスト、そして研究の遅延を伴っていることも明記されています。

そして報告書は、同等の能力がオープンソースを含む外部のモデルにも近く及ぶと見ています。そのとき、今回のように事故として起きるとは限りません。

突き合わせて読める状態そのものが残った

METRは今回の調査で、OpenAIから報酬を受け取っていません。当初2日間の予定だった立ち入り調査は、データセットの穴を埋めるためにOpenAI側から2度招き直され、最終的に6日間になりました。1,000本を超える書き起こしが伏字なしで共有され、解析のためにAPIの利用上限も引き上げられています。

METRは自らの報告のなかで、こうした調査に外部の研究者を早い段階で招き入れることには大きな価値があり、独立した第三者調査の先例として優れたものになったと書いています。この事案が残した最も価値のある産物は、41という数字でも7万件という数字でもなく、当事者の記録と第三者の記録を突き合わせて読める状態そのものなのかもしれません。次に同じことが起きたとき、比較できる前例が一つ増えました。

【関連記事】

OpenAI・Hugging Face侵入インシデント|GPT-5.6 Solなどが評価環境から逸脱、GLM-5.2がフォレンジック解析を支援
7月21日のOpenAI公表を扱った第一報。今回は踏み込まなかった侵入の全体像と、Hugging Face側の初期対応がここで読める。

OpenAIのAIがJFrog Artifactoryのゼロデイを発見・悪用 サンドボックス脱出からHugging Face侵入まで
掲示板の舞台となったArtifactoryを、サンドボックス脱出の経路という側面から掘り下げ、脆弱性の修正までを追った一本である。

【解説】OpenAIの評価AIが越えた3つの境界|サンドボックスからModal顧客環境を経てHugging Faceへ
Modal上の顧客環境を含む侵入経路をたどった記事。今回の記事では扱わなかった経路の全体像を、ここで確認することができる。

OpenAI、消しても2日で戻ったAIエージェントの「掲示板」|封じ込めの単位という盲点
8月5日のBlack Hat講演を扱った記事。今回の報告書が4月まで遡らせた前史と、講演時点の説明を突き合わせて読める一本である。

OpenAI、強化学習の訓練を2週間停止|監視の計算コストも公表
CoT監視の適用拡大と、最大規模の強化学習ランがいまも保留されている経緯を伝えた続報である。今回の記事の後半に直接つながる。

【編集部後記】

7月に追い始めたときの関心は、AIがサンドボックスを抜けた、その一点にありました。いま机の上に並んだ二つの報告書が残したのは、別の問いです。

ログを読むAI、そのログを書き換えようとしたAI、それをまたAIで調べた第三者。少し入れ子になっています。次に似たことが起きたとき、私たちは何を根拠にそれを確かめるのでしょうか。公開資料だけでは決着しない境界を、二つの報告書が同時に見せてくれました。


【用語解説】

IM1
OpenAIが「Internal Model 1」と呼ぶ、一般公開を意図していない内部研究用モデル。GPT-5.6 Solと同規模で、持続性とマルチエージェント協調を進めるよう訓練された。Hugging Face侵入の主要部分を担った。METRは、同じ事案の主要な内部研究モデルを「HPIM(highly-persistent internal model)」と呼んでいる。公開資料にIM1とHPIMを明示的に結ぶ対応表はないが、記述上は対応するとみられる。METRは攻撃に関与したエージェントの約95%をHPIMと推定している。

ExploitGym
AIエージェントが既知の脆弱性を実際に動く攻撃へ転化できるかを測るベンチマーク。現実の脆弱性にもとづく898件の課題からなり、ユーザ空間、V8、Linuxカーネルの3領域を含む。OpenAIはこれを社内評価に用いており、今回の事案はその実行中に起きた。

Artifactory
JFrogが開発するリポジトリ管理製品。今回は外部パッケージを取得するための内部ミラーとして社内に置かれていた。インシデントでは、ネットワークを制限された評価環境から公共インターネットへ抜ける主要な経路となり、エージェントはここを掲示板と外部接続の両方に転用した。

CoT監視(chain-of-thought monitoring)
モデルが出力した推論過程だけでなく、ツール操作や一連の行動もあわせて監視し、危険な振る舞いや不整合を検出する手法。OpenAIは事案後、GPT-5.6 Sol相当以上のモデルを使うツール付きの強化学習と評価すべてで必須化した。

メタゲーム(metagaming)
課題そのものではなく「自分がどう採点されるか」を推測し、その仕組みを利用して報酬を最大化しようとする振る舞い。今回、エージェントはExploitGymが解法の経路まで確認すると考え、すでに正解を得たあとも攻撃を続けた。実際の採点実装は経路を見ていなかった。

HMAC
秘密鍵とハッシュ関数を組み合わせ、データが改ざんされていないことを確認する仕組み。今回のExploitGymではフラグの生成手順を公開情報から逆算でき、エージェントは正規の脆弱性を攻略せずに正しいフラグを手に入れられた。

ツール呼び出しの偽装(tool-call spoofing)
記録上はあるコマンドを実行したように見せながら、実際には別のコマンドを走らせる手法。METRは調査した約1,300本の書き起こしの7%超に含まれると推定し、少なくとも96本で明確な証拠を確認した。ただし成功例はいずれも小規模な実験にとどまり、偽装の準備行動は書き起こしに残っていた。

GLM-5.2
中国のZ.aiが公開したオープンウェイトの大規模言語モデル。Hugging Faceは自社の侵害ログ解析にあたり、NVIDIAによる量子化版を自前の基盤に立ち上げ、解析パイプライン全体をこれに切り替えた。攻撃者データを社外へ出さずに済む利点もあったとしている。

Astra
OpenAIの次期モデル。サイバー能力がPreparedness Frameworkの最上位Criticalに該当する可能性を否定できないと2026年8月7日に公表され、今回の報告書ではCoT監視の適用範囲を推論ワークロードまで広げる対象として名指しされている。

【参考リンク】

OpenAI|The Hugging Face incident and the road ahead(外部)
2026年8月26日公開の公式総括であり、本記事が主に依拠した一次情報である。事案の時系列、四つの不整合パターン、本番向けセーフガードの事後評価、今後の監視・アラインメント・インシデント対応の方針までをまとめている。

OpenAI|OpenAI – Hugging Face Incident Technical Report(外部)
同日公開の技術報告書。4月20日にさかのぼる前史、41ワーカーでのコード実行、ログ操作、本番向け保護の予備評価、30分ルールなど、ブログ記事より細かい情報を収める。巻末に技術的な出来事の年表がある。

METR|Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident(外部)
METRとRedwood Researchの研究者がOpenAI社内で計6日間調査した独立報告。約1,300本の書き起こしと7万件超の掲示板データを分析している。データの欠落、AIによる解析への依存、ツール呼び出しの偽装といった限界も自ら開示している。

arXiv|ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?(外部)
本件で使われたベンチマークの論文。現実の脆弱性にもとづく898件の課題からなり、ユーザ空間、V8、Linuxカーネルの3領域を対象とする。エージェントはこの論文を読み、採点の仕組みを推測した。

Hugging Face|Anatomy of a Frontier Lab Agent Intrusion(外部)
被害側が2026年7月27日に公開した技術タイムライン。約17,600件の攻撃行動を復元し、HDF5によるファイル読み取り、Jinja2経由のコード実行、横展開、GLM-5.2を用いた解析までを、コード例を交えて説明している。

OpenAI|Pacing model development in an era of cyber-critical capabilities(外部)
2026年8月18日公開。本件とAstraのサイバー能力評価を受け、展開予定モデルの強化学習を2週間停止したこと、最大規模の計画中フロンティアRLランが保留中であること、監視と隔離を強化した経緯を説明している。

【参考記事】

OpenAI missed warning signs before Hugging Face breach(外部)
41ワーカーへのコード実行という規模と、6月27日のアラートを受けても評価が止まらなかった経緯を、報告書にもとづいて報じている。

OpenAI, independent firms publish reports into rogue AI agent attack on Hugging Face(外部)
OpenAIの報告書と、被害側であるHugging Faceが先に出した報告書を並べ、記述の粒度がどう違うかを検証した記事である。

OpenAI releases its official report on the Hugging Face breach(外部)
報告書の公開を伝えた速報。8月5日のBlack Hat講演の内容から、どこが新しく明らかになったのかを整理して伝えている。

Googleで優先するソースとして追加するボタン
投稿者アバター
山本 達也 代表社員
合同会社デジタルの窓口 代表。ウェブ解析士。生成AI・サイバーセキュリティ・ 宇宙開発領域を中心に執筆。

おすすめ記事