医療AI、エージェント化で性能低下|合成患者1,268人のベンチマークが示した意外な弱点

|

[最終更新]

Googleで優先するソースとして追加するボタン

医療現場へのAI活用は、単発の質問に答える段階から、電子カルテ全体を読み解いて診断や要約をこなす段階へと移りつつあります。ただし、その実力を実際の患者データを使わずに検証する手段は、これまで限られていました。カーネギーメロン大学の研究チームが公開した「Synthetic Hospital」は、実在しない1,268人の患者による電子カルテベンチマークです。医師でさえ本物のカルテと見分けがつかないほどの精度で作られたこの評価環境は、最新のAIモデルに単純な合否では測れない実力の輪郭を突きつけました。


医学教育資料のみから構築した完全合成の電子カルテベンチマーク「Synthetic Hospital」は、カーネギーメロン大学の研究チームによるものだ。1,268人の合成患者と5,602件の診療エンカウンターを含み、診断や所見はICD-10-CM、SNOMED CT、LOINCといった標準医療オントロジーにマッピングされている。10名の医師による識別実験では、実患者記録と合成記録の判別正答率は53%にとどまった。GPT 5.3やGemini 3.1、Opus 4.6など10のAIモデルを評価した結果、最高スコアはKimi 2.5 Thinkingの重症度加重F1スコア0.732、医師トップは0.89だった。

From: 文献リンクThis Fake Hospital Is Stress-Testing AI on the Work Doctors Actually Do

【編集部解説】

AIは医師に「劣る」のか——実力比較の正確な読み方

まず、数字を丁寧に見ておく必要があります。最良のAIモデル(Kimi 2.5 Thinking)が記録した重症度加重F1スコア0.732は、比較対象となった医師7名・13症例の限定サブセットの平均スコア0.664を、実は上回っています。AIが及ばなかったのは、このサブセットの中で最も成績の良かった医師1名(0.89)に対してだけです。

論文の要旨は「医師平均と同水準」という控えめな表現を使っていますが、実測値だけを見れば、AIの最高スコアは医師の「平均」を上回り、「トップ」には届いていない、という構造の方が実態に近いといえそうです。ただし医師側のサンプルは13症例と小さく、個人差も0.21から0.89まで非常に大きいため、研究チーム自身も「AIが医師より優れているという証拠ではない」と釘を刺しています。ここは「AIが人間を超えたか否か」という二択で語れる話ではなく、比較の前提そのものが脆いことを、まず押さえておきたいところです。

なお、この「AI優位」の構図は診断タスクに限った話である点にも触れておく必要があります。同じ論文の一覧表では、医師はエビデンス検索(P@5=0.888)ではすべてのAIモデルを上回る一方、全患者要約(0.051)や画像診断の適応判断(0.282)ではAIより明確に低いスコアとなっています。「AIが医師に勝った・負けた」という単一の物差しでは測れない、タスクごとの得意不得意がある、というのがより正確な描写です。

本当に注目すべきは、もう一つの実験結果です

Synthetic Hospitalの評価の中で、編集部が診断スコアそのものより興味を引かれたのは、AIを「エージェント化」した際の挙動です。

研究チームはGPT 5.3、Mistral Large、Llama 4 Scoutの3モデルを対象に、①必要なカルテ情報をそのまま渡す、②13種類のツールを備えたEpic風APIを介してエージェントとして動かす、③モデル自身に必要な情報を検索させる自己検索型エージェントとして動かす、という3つの構成を比較しました。

結果は、多くの人の直感に反するものでした。すでに必要な情報が手元にある状態でモデルをエージェント化すると、縦断的な診断タスクを除くほぼすべてのタスクで性能がかえって低下したのです。要約やエビデンス検索のスコアは最大で約0.19低下し、Llama 4 Scoutの画像診断スコアに至っては約0.24も下がりました。しかも、失敗したエージェント実行は平均約145,000トークンを消費しており、成功時(約60,000トークン)の2倍以上のコストをかけて、より悪い結果を出していたことになります。

一方で、縦断的な診断タスク——チャート全体に散らばった手がかりを自分で探し出すこと自体が課題の一部になっているタスク——に限っては、自己検索型エージェントが3モデルすべてで有効に機能し、重症度加重F1スコアを0.14〜0.34も改善しました。

ただし一点、留保が必要です。著者らが公開しているGitHubリポジトリの「既知の問題」欄には、この診断タスクのエージェント評価で使われたツールが正解の診断コードをそのまま返してしまう不具合があり、著者ら自身が「診断タスクのエージェントスコアは水増しされている」と明記しています。改善幅そのものを鵜呑みにせず、追試を待ちたい結果です。

「エージェント化すれば賢くなる」わけではない

この結果が示しているのは、単純な話です。エージェントという仕組みそのものに、性能を底上げする力があるわけではありません。エージェント化が効くのは情報を探しに行くこと自体がタスクの一部になっている場合であり、すでに答えに必要な材料が揃っている場面にツール呼び出しや複数ステップの計画を付け加えると、むしろ筋道を見失う機会を増やしてしまう、ということです。

この論点は、医療AIに限った話ではありません。ちょうど今、医療分野では「エージェントAI」への投資が加速しています。たとえば患者対応の音声AIエージェントを手がけるAssort Healthは、2026年に1億2000万ドルのシリーズCを調達し、評価額12億ドルのユニコーン企業になりました。ただし、こうした事例の多くは予約調整・保険資格確認・請求処理といった、手順が明確に定義された管理業務を対象にしています——つまり、情報を探し回ること自体が仕事の中身であるような領域です。

Synthetic Hospitalが突きつけているのは、その同じ「エージェント化」の発想を、すでに情報が目の前にある状態での臨床判断——チャートを読んで診断や要約をまとめる作業——にそのまま持ち込んでよいのか、という問いです。少なくともこの実験の範囲では、答えは「いいえ」でした。

まだ分かっていないこと

この知見をどこまで一般化できるかは、まだ分かりません。エージェント実験の対象は3モデル・100患者・1つのエージェント構成に限られており、Assort Healthのような管理業務系のエージェントに同じ結論が当てはまるかどうかは、この論文からは判断できません(管理業務とチャート読解では、そもそも要求される能力の質が異なる可能性があります)。また、医師比較に使われたサブセットもわずか13症例にとどまります。この研究が示しているのは「エージェント化は万能ではない」という一つの実例であって、「エージェント化は医療AIに向かない」という結論ではありません。ここは誤読しないよう注意が必要です。

【関連記事】

清華大学のAIエージェント病院:1万人の患者を数日で診療する医療革命が始動
「エージェントが医師として機能する」というビジョンは以前にも報じましたが、その実力を測る物差し自体がまだ発展途上であることを、今回の研究は示しています。

OpenAI・AIエージェント時代と新インターネット――医療は本当に変われるか?
AIエージェントに新しいインフラが必要だという指摘は以前にもありましたが、今回の研究はインフラが整った先でも、エージェント化そのものが性能を左右する変数であることを示しています。

AIが医療業務を変革|Mandolin、特殊医薬品管理自動化で4,000万ドル獲得
管理業務でのAIエージェントの成功事例を以前お伝えしましたが、今回の研究は同じ発想を臨床判断に持ち込むと逆効果になりうることを示しています。

【編集部後記】

「AIをエージェント化すれば賢くなる」という感覚は、私たちの多くが漠然と抱いているのではないでしょうか。しかしSynthetic Hospitalが示したのは、道具を増やすことと、答えにたどり着くことは別物だという事実です。医療に限らず、私たちが日々使うAIツールでも、同じ問いは成り立つのかもしれません。エージェント化する前に、その仕事の形は本当に「探索」を必要としているのか——私たちも、まだ考え続けています。

【参考リンク】

arXiv:2609.30027(論文本体)(外部)
Synthetic Hospitalの一次論文。ベンチマーク設計、全10モデルの詳細スコア、著者らによる限界の記述を含む学術論文。

GitHub(sparkcpark/synthetic_hospital)(外部)
Synthetic Hospitalのコードとデータを公開するリポジトリ。ベンチマークを実際に動かし、自分のモデルで試すための一次配布元。

HL7(医療データ標準化団体)(外部)
FHIRをはじめとする医療データ相互運用標準を策定する国際団体。Synthetic Hospitalが模した「標準的なEHRインフラ」の背景にある規格の発信元。

Assort Health(公式サイト)(外部)
患者対応向けAIエージェントを手がける企業。2026年に評価額12億ドルのユニコーンとなった、医療エージェント投資ブームの代表例。

【用語解説】

縦断的EHR(電子カルテ)
単発の受診記録ではなく、患者の複数回の受診・検査・診断にわたる時系列の医療記録全体。

重症度加重F1スコア
見落とし(再現率)と誤診断(適合率)のバランスを測る指標F1に、症状の重症度による重み付けを加えたもの。重い病態の見落としをより厳しく評価する仕組み。

ICD-10-CM/SNOMED CT/LOINC
世界の医療機関で使われる標準的な疾病分類・臨床用語・検査コードの体系。電子カルテの相互運用性を支える共通言語。

エージェント化(AIエージェント)
単発の応答にとどまらず、ツール呼び出しや情報検索を繰り返しながら、複数ステップにわたってタスクを自律的に遂行するAIの運用形態。

Epic
米国最大手の電子カルテ(EHR)ベンダー。Synthetic Hospitalは同社のシステムを模したインターフェースを採用している。

【参考記事】

Synthetic Hospital: An Open, Verifiable, Physician-Validated Longitudinal EHR Benchmark — arXiv(外部)
一次論文。ベンチマークの構成・評価手法・医師比較の統計的留保の出典。

Assort Health lands $120M to scale patient journey AI agents — MobiHealthNews(外部)
医療エージェント企業の資金調達・評価額・事業内容の出典。編集部解説の対比材料として使用。


おすすめ記事