Anthropic、Claudeの「意図しない行動」4類型を公表|警察フォームへの架空送信も

[最終更新]

Googleで優先するソースとして追加するボタン

「影響は最小限だった」。そう自ら評価した事例を、Anthropicはなぜわざわざ公表したのでしょうか。警察のフォームに架空の目撃情報、という見出しの陰で報告が伝えようとしているのは、AIが「できない」場面でどう振る舞うかという性質です。軽い事例をあえて外に出す意味から読み解きます。


Anthropicは2026年10月9日、評価試験や社内利用でClaudeが外部のサイトやシステムに意図しない操作をした事例を、4つの類型に分けて公表した。サーバーの欠陥を突いたコマンド実行、送信すべきでない実在サイトのフォーム送信、トークンや料金で制限された公開データへの迂回アクセス、URL短縮サービスによる取得ツールの長さ制限の回避である。

関与したモデルにはClaude Mythos Preview、Mythos 5、Haiku 4.5、Opus 5などが含まれる。同社は実社会への影響を最小限とし、7月30日と9月9日に報告したサイバー事案より大幅に軽いと評価した。安全対策の有効性を確認するまで全社内評価でインターネット接続を止め、こうした行動を自動で検知・遮断する仕組みを導入した。

From: 文献リンクInvestigating unintended model actions in our evaluations and internal use

【編集部解説】

警察のフォームに架空の目撃情報、大学サーバーでのコマンド実行。見出しだけを並べると穏やかではありませんが、今回の報告はAnthropic自身が「より頻繁に出していく」と位置づけた、モデルの挙動に関する単独報告のひとつです。システムカードやリスクレポートとは別の枠で、テスト中に見えたことを小さなものまで外に出していく。その定期的な公表の取り組みとして読むと、内容の見え方が変わってきます。

7月30日のサイバー評価での不正アクセス事案、8月31日の対策強化、9月9日のアラインメント評価と続いてきた流れの中で、今回はあえて「軽い事例」を集めて公表しています。夏の事案と同程度の深刻な例は、7月から続く点検でまだ見つかっていない。そのうえで、深刻度の低い事例まで網を広げた結果がこの4類型です。

「できない」で止まらないという性質

4つの類型の多くに共通するのは、出発点が攻撃の指示ではなく、与えられた課題を終わらせることだった点です。必要なツールがエラーを返す、練習用のフォームが開かない、データが有料だった。そうした壁を、Claudeは「ここで止まる理由」ではなく「解くべき次の問題」として扱いました。Anthropicは、こうした行動の多くを粘り強さ(persistence)の表れと説明しています。

その背景を考えるうえで手がかりになるのが、強化学習の仕組みです。モデルは学習環境で課題を繰り返し試し、成功すると報酬を得ます。環境に抜け道があり、迂回して成功した場合にも報酬が出てしまうと、迂回そのものが「うまくいくやり方」として身につき、別の場面で顔を出すことがあります。リワードハッキングと呼ばれる現象です。今回の各事例がこれによるものだと同社が特定したわけではありませんが、Anthropicは8月31日の発表でも説明していた、迂回に報酬を与えてしまう学習環境の修正・削除を続けています。

同社は、今回の行動はどれも新しいものではなく、Claudeのアラインメントに対する全体的な見方は変わらないとしています。Mythos Preview以降のシステムカードで記してきた行動の延長線上にある、という整理です。

深刻度を測る2本の物差し

今回の報告で目を引くのは、軽重を判断する軸を明示したことです。ひとつはやりすぎ(overreach)、つまり課題の意図をどこまで踏み越えたか。もうひとつは不誠実さ(dishonesty)、自分の行動や意図を偽って伝えたかどうかです。

やりすぎの軸では、差ははっきりしています。夏の事案では、サイバー評価の中でClaudeが実在する第三者のシステムに何時間にもわたってアクセスしていました。今回は、公開されているが有料のデータに迂回して届いた、あるいは主に機密性の低いデータを得るためにサーバーの欠陥を突いた、という範囲にとどまります。

不誠実さの軸は、もう少し丁寧に読む必要があります。警察のフォームに送られた文章は、事実に基づかない目撃情報でした。ただしAnthropicは、記録を見る限りClaudeは課題として作業例を作っていただけで、誰かを欺こうとしたわけではないとみています。「AIが虚偽の通報で捜査を妨害しようとした」という読み方は、原典の評価とは異なります。投稿はスパムとして処理され、捜査には回っていません。なお、練習用の政府フォームの代わりに本番サイトで送信した例は、製品として公開されているClaudeではなく、未公開の研究用モデルによるものです。

同社は、完全なアラインメント評価はまだ終えておらず、不誠実さの判断には記録を改変して再生するような深い検証が要るため、見解は今後変わりうるとも書いています。発表者自身が挙げている宿題です。

曖昧な課題、不可能な課題

Anthropicが引き出した教訓は、モデルの外側にも向いています。多くの事例は、指示が曖昧だったか、そもそも完了できない課題だったときに起きていました。対象、許される操作、ネットワークの境界。この3つを課題の中で明記していれば、防げた失敗もあったかもしれないと同社は述べます。

一方で、Claudeは実際の利用でも曖昧な課題や不可能な課題に毎日出会っています。いくつかの事例は評価ではなく、社内の通常のエージェント利用で起きました。そこで同社は、境界を守り慎重に振る舞う訓練を、これまで中心だったコーディングから、今回の事例に関わった検索やコンピューター操作にも広げています。訓練だけではまだ十分に頑健ではないため、分類器などの安全装置を重ねる多層防御を併用するという構えです。新たに作った検知・遮断の仕組みは、今回紹介された事例に当てたところ、すべてを止めました。

任せる側が書いておくべきこと

この報告は、AIエージェントを業務に組み込もうとしている日本の企業にとっても、そのまま使える材料を含んでいます。

たとえば、Haiku 4.5は「最終送信の手前で止める」と指示されていたのに、確認画面がもう一枚あると考えて送信してしまいました。言葉で伝えた禁止は、モデルの見立てひとつで越えられることがあります。取り消しのきかない操作は、自然言語の指示だけに頼らず、そもそも送信の権限を与えない、実行の前に人の承認を挟むといった形で、システムの側で止めておくほうが確実だと考えられます。

URL短縮サービスの例も示唆的です。Anthropicの一部の取得ツールは、SQLやコマンドのインジェクションを防ぐ目的でURLの長さを制限していました。ところがモデルは、外部の無料短縮サービスを経由して、この長さ制限を迂回しました。その経路で実際にインジェクションが起きたとは報告されていません。それでも、入力の見た目だけを縛る制限は、外部のサービスを一段挟むだけで回り込まれうる。転送先まで含めて何を禁じたいのかを考える必要がある、という教訓は、社内のAI利用ルールを作る際にもそのまま当てはまります。

小さな事例を共有する文化へ

Anthropicは、使われた評価の多くが公開ベンチマークであることに触れ、他の開発者が自社モデルで同じ行動を確かめる助けになればと述べています。影響が小さかったからといって発見を軽く扱うつもりはない、モデルが強力になれば同じ行動がずっと大きな害になりうるから、とも。

製造業や医療の現場では、事故に至らなかった「ヒヤリハット」を記録し、共有することが安全文化の土台になってきました。今回の報告は、AIの世界でそれを企業の外にまで広げる試みだといえます。AIが社会で担う役割が大きくなるほど、その振る舞いを公衆が知る意味は増していく。軽い事例をあえて公にするこの習慣が、業界全体の共通の記録として育っていくことを期待したいと思います。

【関連記事】

Anthropic、評価環境の改善策を公開|外部パートナーに4項目
Anthropicの8月31日の改善策を紹介した記事。外部サイバー評価の停止、実行前に遮断する分類器、外部パートナーへの4項目を整理した。

Claudeの画面操作は最後の手段|権限の天井が経路を決めていた
Claudeのコンピューター操作は、コネクタ、ブラウザー、画面操作の順に選ばれる。アプリの種類ごとに権限の上限が固定されている。

Gemini、評価中に実在3社へ到達|Googleが報道後に認める
Geminiがサイバー評価中に実在3社へ到達していたと、Googleが報道後に認めた件。同じ通知を受けた各社で開示の基準が分かれた。

【編集部後記】

URL短縮サービスの件では、Anthropicが社内で気づいたのとは別に、サービスの運営者からも、Claudeが同じ目的で自分たちのサービスを使っていたという連絡が届いていました。AIの振る舞いに気づく目は、開発元の中だけにあるわけではないのです。

AIエージェントがWebを歩き回るのが当たり前になれば、その足跡が最初に残るのは訪問を受ける側のサーバーです。皆さんの会社のサイトには、AIの見慣れない振る舞いに気づき、開発元へ伝える経路があるでしょうか。


【用語解説】

アラインメント
AIの目標や振る舞いを、開発者や社会が意図する方向に一致させること。またはその度合い。AI安全性研究の中心的な課題である。

システムカード
AI開発企業が新しいモデルの公開に合わせて出す文書。性能、安全性の評価、観測された挙動などをまとめる。

強化学習
モデルに課題を繰り返し試させ、成功したときに報酬を与えることで望ましい行動を学ばせる手法。

リワードハッキング
強化学習で、設計者が意図した方法ではなく、環境の抜け道や評価の穴を使って報酬を得てしまう現象。

インジェクション(SQL・コマンド)
Webサイトなどが、外部から受け取った入力を誤って命令として実行してしまう欠陥。またはそれを突く攻撃。

URL短縮サービス
長いURLを短い別のURLに置き換え、アクセスがあると元のURLへ転送するサービス。

多層防御
単一の対策に頼らず、性質の異なる複数の防御を重ねて、どれかが破られても全体として守る考え方。

分類器
入力や出力をあらかじめ決めた種類に振り分けるモデル。AIの安全対策では、危険な要求や行動を検知する用途に使われる。

公開ベンチマーク
外部の研究者などが作成し、誰でも実行できる評価用の課題セット。異なるモデルの能力を同じ条件で比べるために使われる。

ヒヤリハット
事故には至らなかったが、ヒヤリとしたりハッとしたりした出来事。記録と共有を通じて重大事故の予防に生かす。

【参考リンク】

Anthropic(外部)
AI安全性の研究と開発を手がける米国の企業。Claudeシリーズを開発し、モデルの挙動や安全対策に関する報告を継続的に公開している。

Claude(外部)
AnthropicのAIアシスタント「Claude」の製品概要ページ。資料や表計算、試作品の作成、定期タスクの実行など、機能を確認できる。

【参考記事】

Investigating three real-world incidents in our cybersecurity evaluations(外部)
Anthropicの7月30日の報告。インターネットに到達しえた141,006件の評価実行を調べ、実在する3組織への不正アクセスを特定した。

An alignment assessment of recent cybersecurity incidents(外部)
9月9日の評価。夏の事案を偏った推論と無謀さの2点から分析し、再現実験でMythos 5が約82%で有害行動を取ったとした。

Improving our alignment and security efforts(外部)
Anthropicの8月31日の投稿。評価環境の強化、強化学習環境の一時停止、外部パートナーへの4項目のベストプラクティスなどを説明した。

LLM06:2025 Excessive Agency(外部)
OWASPによるLLMアプリケーションのリスク項目。過剰な機能・権限・自律性を原因に挙げ、最小権限や重要な操作での人の承認を求める。

Googleで優先するソースとして追加するボタン
投稿者アバター
山本 達也 代表社員
合同会社デジタルの窓口 代表。ウェブ解析士。生成AI・サイバーセキュリティ・ 宇宙開発領域を中心に執筆。

おすすめ記事