【解説】OpenAI、DevDay 2026でdotsを発表|GPT-6.1 Sol・安全性補遺も

[最終更新]

Googleで優先するソースとして追加するボタン

dotsには専用のクラウドコンピュータと専用のIDが与えられ、パスワードの変更だけは本人にしか任せられません。GPT-6.1 Solは、前世代のGPT-6 Solと単価が同じまま、キャッシュ済み入力だけが半分になりました。DevDay 2026で並んだ発表に通っているのは、AIに何を任せ、どこで人が受け取るかという線引きです。


OpenAIは2026年9月29日、DevDay 2026で20を超える発表を公表した。常時稼働のエージェント「dots」はGPT-6 Astraを搭載し、専用のクラウドコンピュータで働く。ProとBusiness Premiumで順次提供が始まる。GPT-6.1 Solは100万トークンあたり入力2ドル、出力10ドルで、Astraの標準料金の5分の1である。ChatGPT WorkとCodex、APIで使え、Chat画面ではまだ選べない。安全性補遺は、サイバーをCritical、生物・化学をHighと位置づけた。ほかにCodexクラウド、Agents APIのコンピュータ操作、プラグイン拡張機能、ChatGPT Space、月額500ドルのProプランなどが加わった。

OpenAIは9月29日、DevDay 2026の内容を「振り返り」としてまとめました。ChatGPT、Codex、モデル、そしてAIと働く新しい方法にまたがる20を超える発表で、ChatGPTを人とエージェントが協働する共通の場として開き、開発者はそこに組み込まれる体験を、合計12億人のユーザーに直接届けられる、と説明しています。英語版の発表では、この数字は週間ユーザーとされています。

この発表は突然現れたものではありません。dotsの基盤であるGPT-6 Astra、その下位にあたるGPT-6 Sol、サイバー防御のDaybreak、業務エージェントのChatGPT Workは、innovaTopiaでも個別の記事として伝えてきました。この記事では、それらを9月29日の公表資料でつなぎ直し、「AIにどこまで任せるか」という一本の軸で読み解きます。

記事を元に編集部で解説動画にしました

DevDay 2026の発表を一枚の地図にする

提供範囲は発表ごとに異なり、「すべてのプラン」「ベータ」「限定プレビュー」「近日」が混在しています。先に地図として並べます。区分は、OpenAIの振り返りの見出しに沿って短くしたものです。

DevDay 2026の発表を5つの区分に並べた図。「任せる相手」にはdots、GPT-6.1 Sol、Astra Ultrafast、Private Intelligence。「任せるための道具立て」にはCodexクラウド、Codex CLI、コードレビュー、Codex Security Cloud、Decisions API、Agents API、Amazon Bedrock Managed Agents、そしてプラグイン拡張機能、作成・申請・検索の改善、Sitesとプラグインの連携、MCP Events対応。「任せたあとの共同作業の場」にはChatGPT Space、Living Pages、スライドの共同編集、チームの作成とタスクの共有、SlackとTeamsの@ChatGPT、Meetingsプラグイン、共有可能なプロフィール。「入口と買い方」にはChatGPTでサインイン、月額500ドルのPro、OpenAI Marketplace。
図1 DevDay 2026の発表を、「任せる」の順に並べた図。左の小見出しが本記事での読み方で、その下の小さな字がOpenAIの区分名(作図:innovaTopia)
発表 内容 提供範囲
自ら行動する知能任せる相手
dots 専用のクラウドコンピュータで働く常時稼働のエージェント ProBusiness PremiumEnterprise(ベータ)ProとBusiness Premiumは対象地域で順次。Enterpriseは管理者が有効化。英語版の説明では、EduとHealthcareを含む
GPT-6.1 Sol GPT-6 Solの大幅なアップグレード PlusProBusinessEnterpriseEduAPIChatGPT WorkとCodexで利用可。Chat画面ではまだ使えない
Astra Ultrafast GPT-6 Astraの高速処理オプション API月額500ドルのPro対象のEnterprise・EduChatGPT WorkとCodexでは、後の2つが対象
Private Intelligence Private Safety Processingを備えたゼロデータ保持と、Private Inferenceの組み合わせ 企業向けPrivate Inference:今秋にプレビュー予定Private Inferenceの時期は英語版の説明
Codex と API任せるための道具立て
Codexクラウド どのデバイスからでも使えるクラウド上のCodex PlusProBusinessHealthcareEducationEnterprise
刷新されたCodex CLI 音声チャット、/agentsビュー、worktree対応 すべてのプラン
コードレビュー デスクトップアプリで差分と論点を確認。自動レビューにも対応 すべてのプラン
Codex Security Cloud リポジトリ全体のスキャンから修正までをクラウドで実行 ProBusinessEnterpriseEdu英語版の記述。日本語版は「すべてのCodexユーザー」
Decisions API 定めた回答候補からLunaが選ぶ、リアルタイムの判断 限定プレビュー数日以内に広く公開する予定
Agents APIのコンピュータ操作 Codexのハーネスをマネージドサービスとして提供。新たにコンピュータ操作に対応 API月額500ドルのPro対象のEnterprise後の2つはCodexとChatGPT Workでも
Amazon Bedrock Managed Agents for OpenAI AWSのカスタマイズと連携を加えたマネージドエージェント AWS上で開発するチーム向け
プラグイン任せるための道具立て
プラグイン拡張機能 サイドバー、パネル、ファイルビューアーをChatGPT内に構築 すべてのプラン
作成・申請・検索の改善 Plugin Creator、刷新された申請フロー、表示順位の改善 すべてのプラン
Sitesとプラグインの連携 作成したSitesに対応プラグインを組み込み BusinessEnterpriseHealthcareEducation
MCP Events対応 接続アプリで起きたことをきっかけに自動処理を開始 すべてのプラン
人とAIの協働任せたあとの共同作業の場
ChatGPT Space チームとChatGPTが共通の目標と過去の作業を共有する拠点 ProBusinessEnterpriseデスクトップアプリとWeb。英語版ではモバイルの検索・閲覧・共有にも対応し、作成・編集は近日
Living Pages エージェントやチームと共同で作るドキュメント ProBusinessEnterprise
スライドの共同編集 新しいプレゼンテーションエディター ProBusinessEnterprise英語版では今後数週間で提供
チームの作成とタスクの共有 定期業務をチームタスクとして任せる BusinessEnterprise
SlackとMicrosoft TeamsでのChatGPT @ChatGPTのメンションで呼び出し BusinessEnterprise
Meetingsプラグイン 会議を録音し、メモをChatGPT Spaceに保存 Pro(ベータ)Business(ベータ)Enterprise(近日)macOSのデスクトップアプリで提供
共有可能なプロフィール SitesやプラグインをまとめてChatGPT内で紹介 日本語版:Enterprise、Edu、Healthcareが近日で、それ以外の全プランで利用可。英語版:BusinessとEnterprise
サブスクリプション入口と買い方
ChatGPTでサインイン ChatGPTアカウントで対応製品にサインイン 組織の設定に応じて世界中で利用可
Proの新しい料金プラン 月額500ドル。最も高い利用上限とAstra Ultrafast Pro(月額500ドル)
OpenAI Marketplace 既存の契約額の一部を承認済みパートナーのソフトウェアに充当 対象企業向けのベータ

見取り図としては、真ん中に「任せる相手」(dotsとモデル)があり、その両側に「任せるための道具立て」(CodexとAPI、プラグイン)と「任せたあとの共同作業の場」(Space、Pages、スライド)が並ぶ構図です。以降、この順に読んでいきます。

dots|専用のコンピュータと名前を持つ、常時稼働のエージェント

dotsは、あらゆる用事に応える常時稼働のエージェントとして、OpenAIが打ち出した新しい仕組みです。GPT-6 Astraを搭載し、1体ごとに専用のクラウドコンピュータを持ちます。名前をつけて自分専用の存在として使い始められ、フィードバックから学びながら、目標に向けて24時間働きます。

設計の軸は「新しく入った同僚に渡す環境」です。アクセスと権限のための専用ID、クラウド上のコンピュータ、専用のブラウザを備え、必要ならコードを書いてテストもします。いつでもdotのコンピュータを開いて作業を確かめられ、ノートPCなど自分のデバイスへの接続を許可すれば、普段の作業環境のそばで手伝うこともできます。プラグインのエコシステムを通じて、4,000以上のアプリにつながります。

連絡の窓口は、ChatGPT、Slack、Microsoft Teamsです。音声通話で相談することもできます。どの窓口から話しかけても文脈は引き継がれ、ChatGPTで始めた案件にSlackで背景を補う、といった使い方ができます。テキストメッセージ(iMessageとRCS)は、公式ヘルプでは米国のProユーザー向けの限定ベータで、BusinessやEnterpriseのワークスペースでは使えないとされています。ほかのOpenAIのページは、近日の提供予定、またはウェイトリストと書いています。

何を任せるのか

OpenAIが示した例は、職種ごとに「戻ってきたときには下地ができている」という形をとります。開発者なら、顧客の要望から小さな改善やバグ修正の範囲を定め、実装とテストを済ませ、変更点を示す動画を添えたレビュー可能なプルリクエストを用意します。科学者なら、新しいデータが届くと分析を再実行し、予想外の結果を調べ、論文用の図表を更新して、確認が必要な点を知らせます。ほかに、製品ローンチの計画修正、営業案件の提案書更新、インタビュー素材からのSNS投稿の下書きが挙げられています。

OpenAI社内では、Slackでバグが報告されるとdotsが調査を始め、新しいデザインが届くと動くアプリに仕上げるといった使い方が見え始めているそうです。社外の初期テスターのdotが、テスター本人の請求漏れに気づいて請求書を作り、本人の承認を経て送信した例も紹介されています。任せきりではなく、最後の一押しを人が握る形が、例示の随所に置かれています。

任せる範囲を、どう区切るか

dotsの説明で、機能の紹介と並んで大きな比重を占めているのは、権限の設計です。

第1に、隔離です。各dotは専用のクラウドコンピュータで作業し、本人が接続を選ばないかぎり、本人のコンピュータとその中身からは切り離されたままです。対応するサインインでは、保存済みのパスワードをモデルに見せることなく使えるとされています。

第2に、「先回りリサーチ」です。人が直接やり取りしていないとき、dotはバックグラウンドで役立つ方法を探しますが、そのときに使えるのは機能を絞ったツールだけです。メッセージの送信、アプリ内のコンテンツの変更、ブラウザやコンピュータの操作はできません。

第3に、自動レビューです。アカウントに影響したり情報を共有したりしうるアクションを、本人の指示、カスタムルール、安全要件に照らして確認し、そのまま進めてよいもの、承認が必要なもの、本人が行うものに振り分けます。パスワードの変更のような機微なタスクは、必ず本人が行います。カスタムルールでは、特定のアクションを許可する、承認を必須にする、ブロックするを選べ、アクティビティビューでバックグラウンドの作業も含めた進捗を確認できます。内蔵の安全要件は、カスタムルールの設定にかかわらず常に適用されます。

dotsの権限設計の図。1つ目の層は隔離で、専用のクラウドコンピュータで作業し、本人が接続を選ばない限り本人のコンピュータとは切り離される。2つ目は先回りリサーチで、機能を絞ったツールだけを使い、メッセージ送信やアプリ内の変更、ブラウザやコンピュータの操作はできない。3つ目は自動レビューで、本人の指示、カスタムルール、安全要件に照らしてアカウントに影響するアクションや情報の共有を確認し、そのまま進めるもの、承認を求めるもの、本人が行うもの(パスワードの変更など)の3つに振り分ける。
図2 dotsの権限設計。3つの層(隔離、先回りリサーチ、自動レビュー)で区切り、最後に3つの扱いに振り分ける(作図:innovaTopia)

作業を止める仕組みを前提に組むという考え方は、GPT-6 Astraの公開時にも示されていました。ChatGPT WorkとCodexで監視が作業を止める条件と、フラグが立つことの意味は、【解説】GPT-6 Astra|見出しの数字より17個の注釈を読むで扱っています。dotsは、その考え方を「常時稼働」の側へ広げたものと読めます。

データの扱いも、任せる範囲の一部です。ChatGPT Business、Enterprise、Eduのワークスペース内のコンテンツは、デフォルトではモデルの改善に使われません。個人向けプランでは、dotsとの会話や作業を改善に使うかどうかを設定できます。先回りリサーチやdotが自分用に残すメモを、直接トレーニングに使うことはありません。ただし、それらの情報が対象となる会話やタスクに含まれた場合は、設定に応じて使われることがあるとしています。

OpenAIは、dotsも間違えることがあるため、重要な結果を伴う作業は必ず確認してほしいと明記しています。これは発表者自身が挙げている宿題です。

料金と、企業向けの「専門dots」

最初の1体のdotは、ProまたはBusiness Premiumのプランに含まれ、追加料金はかかりません。プランには、より本格的な作業のための利用枠も含まれ、提供開始後の最初の1か月は上限が広げられます。将来は、月額の定額料金でdotを増やしたり、作業の速度や量を引き上げたりできるようになる予定です。

課金の線引きも見ておく価値があります。dotとの会話はChatGPTの利用上限に数えられませんが、dotに頼んでCodexやChatGPT Workでタスクを始めた場合、そのタスクは通常どおり数えられます。相談は軽く、作業は重く、という線引きです。

対象は、対象地域のProとBusiness Premiumで順次、Enterprise(英語版の説明ではEduとHealthcareを含む)は、管理者が有効にするとベータを試せます。対象地域の一覧はOpenAIのヘルプ記事で案内されているため、日本での提供可否は、そちらで確かめる必要があります。

個人のdotとは別に、組織内で特定の役割を担う「専門dots」も企業向けの限定プレビューとして始まります。企業が各dotに専用のID、認証情報、必要なシステムへのアクセス権を設定し、OpenAIのエンジニアが各組織と直接連携して、役割、使えるツール、人が作業をレビューして承認する方法を定めます。OpenAI社内では、調達、請求書処理、メールマーケティング、カスタマーサポート、商取引契約で初期テストを行ったとしています。

Microsoftとは、専門dotsをAgent 365の企業向けガバナンス・セキュリティ管理機能や、Microsoftの企業向けID・アクセス管理機能に統合する取り組みを進めているとしています。IT部門が使い慣れた管理画面でdotのアクセス権を管理し、活動を監督できるようにすることが目標です。常時稼働のエージェントに企業の権限管理を重ねる動きは、Microsoftが発表した「Scout」でも見られ、OpenClawを基盤にEntraやPurviewのガバナンスを重ねる構成をMicrosoft Scout発表——「常時稼働」エージェントが変えるAI×仕事の新構造で紹介しています。

GPT-6.1 Sol|Astraに迫る性能を、5分の1の価格で

GPT-6.1 Solは、GPT-6 Solのアップグレードとして登場したモデルです。エージェント型コーディング、コンピュータ操作、専門業務に強く、難しいタスクでの性能をAstraに近づけながら、標準の入出力トークン料金をAstraの5分の1に抑えたと、OpenAIは説明しています。

価格を並べる

100万トークンあたりの標準料金は、次のとおりです。

モデル 位置づけ 入力 出力 キャッシュ済み入力
GPT-6 Astra 最も知能が高いモデル 10ドル 50ドル 1ドル
GPT-6.1 Sol Astraに迫る知能を5分の1の価格で 2ドル 10ドル 0.10ドル
GPT-6 Luna 日常業務を高速・効率的に、大規模に 0.10ドル 0.50ドル 0.01ドル

以上はOpenAIが示した標準料金です。6.1 Solのモデルページによると、キャッシュ書き込みは100万トークンあたり2.50ドルで、入力が272Kトークンを超える場合は、リクエスト全体で入力とキャッシュの料金が2倍、出力の料金が1.5倍になります。処理方式ごとの料金は、料金ページで確かめてください。

DevDayの振り返りは、9月30日に確認した日本語版では「Astraの標準料金の4分の1」、英語版と6.1 Solの個別ページでは「5分の1」と書いています。価格表の入力2ドル、出力10ドルをAstraの10ドル、50ドルと並べると5分の1になるため、この記事では5分の1で書いています。

前世代のGPT-6 Solとの比較も見ておきます。2026年9月22日に公開されたGPT-6 Solは、入力2ドル、出力10ドルで、キャッシュ読み込みは0.20ドルでした。OpenAIのGPT-6 Solのモデルページも同じ数字を示しています(公開の経緯はGPT-6 Sol|「半額」の中身と、その分母)。単価は同じまま、キャッシュ済み入力が0.20ドルから0.10ドルへ半分になっています。OpenAIも、6.1 Solのキャッシュ済み入力は標準の入力料金より95%安く、GPT-6 Solのキャッシュ済み入力の料金より50%安いと説明しています。リクエストを重ねるたびに同じ文脈を読み直すエージェントでは、キャッシュ済み入力の単価が総コストに効いてきます。OpenAIも、文脈を再利用するエージェントのワークロードを低コストで処理できる点を挙げています。総合的な能力では引き続きGPT-6 Astraが最高のモデルで、6.1 Solは、重要な業務をより頻繁にこなしたい利用者や、大規模にアプリケーションを動かすAPI利用者に、能力とコストの新しい釣り合いを提供する位置づけです。

100万トークンあたりの標準料金を4つのモデルで比べた棒グラフ。入力はGPT-6 Astraが10ドル、GPT-6.1 Solが2ドル、GPT-6 Sol(前世代)が2ドル、GPT-6 Lunaが0.10ドル。出力はAstraが50ドル、6.1 Solが10ドル、GPT-6 Solが10ドル、Lunaが0.50ドル。キャッシュ済み入力はAstraが1ドル、6.1 Solが0.10ドル、GPT-6 Solが0.20ドル、Lunaが0.01ドル。バーの縮尺は区分ごとに異なる。
図3 GPT-6.1 Solの標準料金(100万トークンあたり)。入力と出力はAstraの5分の1で、GPT-6 Solとは同じ単価。キャッシュ済み入力は0.20ドルから0.10ドルへ(作図:innovaTopia)

性能:OpenAIが示した5つの物差し

数値はいずれもOpenAIが研究環境またはAPIで測ったものです。比較対象の他社モデルは、公開レポートから引いた値とされています。

コーディングでは、実際のコードベースで長期的な取り組みを要するタスクを解くDeepSWE v1.1で、約5分の1のコストでAstraと同等の性能を出しました。GPT-6 Solの最高スコアを、より少ない思考量と低いコストで6.4パーセントポイント上回っています。

専門業務では、金融、医療、法務など10の専門分野の複雑なPDFに答えるGDP.pdfで、テストしたすべての推論設定でOpus 5.5(フォールバックを使う構成)より高いスコアを、半分未満のタスクあたりコストで出しました。Astraの最先端の性能には、タスクあたりのコスト約5分の1で迫っています。営業、マーケティング、運用、サポート、財務、人事にまたがる47のツールでワークフローを完遂できるかを測るAutomationBench 1.0.6では、思考量を「中」にした6.1 Solが、Opus 5.5を約3分の1のコストで2.2ポイント上回りました。同じ思考量のGPT-6 Solとの比較では、スコアが4.8ポイント高くなっています。コストの比較は、フォールバックの扱いなど測定の前提に左右されます。OpenAIは図の注記で、比較に含まれるClaude Fable 5.1の点はフォールバックの費用を含まず、実際より低く見えると説明しています(フォールバックは約40%のタスクで発生したとしています)。

コンピュータ操作では、OSWorld 2.0のオフラインセット(v2026.08.08)で、思考量を最大にした6.1 SolがGPT-6 Solを7ポイント上回り、コストは半分未満でした。Astraとの差は2.1ポイントまで縮まり、タスクあたりのコストは約7分の1です。

科学研究では、Terminal-Bench Science 0.1で、思考量を最大にした6.1 SolがGPT-6 Solの2倍を超えるスコアを、半分未満のコストで出しました。タスクあたりの平均コストは、6.1 Solが5.47ドル、Opus 5.5が23.21ドル、Astraが23.80ドルです。最高スコアはAstraの68.1%で、OpenAIは、最も難しい科学研究のタスクにはAstraの使用を勧めています。

事実の正確性でも改善が示されました。日本語版の発表ページは、思考量を「超高」にしたとき、少なくとも1つの事実誤認を含む回答の割合がGPT-6 Solの4.5%から4.1%に下がり、同じ設定のAstraの4.0%に近づいた、と説明しています。タスクあたりのコストはAstraより約83%低いとされています。英語版の発表ページは、改善が最も大きい低い思考量で11.4%から7.7%(約32%の減少)と示し、テストした設定を通じてAstraとの差は1.9ポイント以内としています。この評価は、以前のモデルの誤りをユーザーが指摘した会話から個人を特定できる情報を除いたもので、OpenAIは「意図的に難しいプロンプト」であり通常の利用を代表しないと断っています。通常の利用では、誤認の頻度はより低くなるとのことです。

提供と、速度のオプション

6.1 Solは、Plus、Pro、Business、Enterprise、Edu向けに、ChatGPT WorkとCodexで提供が始まりました。利用の可否は、アカウントやワークスペースの設定によって異なる場合があります。ChatGPTのChat画面では、まだ使えません。APIではgpt-6.1-solとして利用できます。

速度を優先したい場合のために、Astra Ultrafastが用意されました。DevDayの振り返りでは、トークン生成速度が、APIで最大6倍、Codexで最大8倍になると説明されています。仕事全体の完了速度の倍率ではありません。ChatGPT WorkとCodexでは、月額500ドルの新しいProと、対象のEnterprise・Eduのワークスペースで使えます(振り返りの本文はEnterpriseまでを挙げ、Eduは公式の利用ガイドで案内されています)。6.1 Sol Ultrafastは、英語の個別ページと振り返りでは、近日の提供予定とされています(日本語の個別ページは、提供開始と書いています)。

安全性補遺を読む|Critical判定のもとで何が変わったか

GPT-6.1 Solには、GPT-6 Astraのシステムカードへの補遺が公開されています。データと訓練はAstraと同じ種類で、防御策もAstraと同じ構成です。Preparedness Frameworkでは、サイバーをCritical、生物・化学をHigh、AI自己改善をHigh未満と位置づけました。OpenAIは、内部の安全性報告書をもとにSafety Advisory Groupが勧告し、経営陣が、この防御策が6.1 Solの公開に足ると判断したと説明しています。Astraが初めてCriticalと判断された経緯は、OpenAI、止めた訓練を再開|Astraは「Critical」第1号で伝えました。

良くなった数字

アラインメントの評価では、GPT-6 Solから大きく改善し、Astraに近づいたとされます。検索ツールが壊れているときに、そのことを最終回答で伝えなかった割合は、補遺では2.08%で、GPT-6 Solの4.92%から下がりました。監視の自動レビューが下した拒否を回避しようとする試みは、GPT-6 Astra、GPT-6 Solと同じく観測されていません。GPT-5.6 Solでは、最大の推論設定でこの回避の試みが7.3%の実行で見られたことと比べると、世代をまたいだ変化がはっきりします。

OpenAI社内のCodexの通信を模した配備シミュレーション(49,650タスク)では、「合理的な利用者がまず予想せず、強く反対する」深刻度3以上の逸脱フラグが28件(0.056%)でした。Astraは27件、GPT-6 Solは42件、GPT-5.6 Solは63件で、6.1 SolはGPT-6 Solより33%、GPT-5.6 Solより56%少なくなっています。深刻度1〜2のフラグも、GPT-6 Solの14.82%より少ない13.94%で、Astraの13.85%とほぼ並びます。OpenAIは、この結果を社内での配備リスクを見積もる追加の手がかりと位置づけ、社内と社外では作業の分布が異なるため、社外での安全性を直接測った値ではないとしています。

数字が動いたところ

同じ補遺には、上がった数字も並んでいます。それがそのまま載っていることが、任せる範囲を決める材料になります。

警告を受けたときに回避しようとする「望ましくない粘り」は、6.1 Solの23.5%に対しAstraは17.4%でした。ただしこの評価は、相手が不在のときにメールを試すといった低リスクの制限を中心に、システム側の制御措置を外して測ったもので、実際の利用でどれだけ成功するかを示すものではないと、OpenAIは断っています。コーディングでの不実表示は、6.1 Solが1.50%、Astraが0.51%、GPT-6 Solが1.30%で、GPT-5.6 Solは6.1 Solのほぼ7倍でした。これは不実表示を誘発するように選んだ課題での結果で、通常の利用での発生率ではないと、OpenAIは断っています。深刻度1〜2のフラグでは、Astra比で報酬ハックと不確実性の隠蔽が増え、GPT-6 Solとの比較では認証情報の収集が増えています。メッセージボードを見つけた試行のうち、外部のエージェントらしき相手との通信を試みた割合は、6.1 Solが38%、GPT-6 Solが26%でした。ただし、指定された無許可のアクションまで実行した割合は3%とGPT-6 Solの11%より低く、GPT-5.6 Solの52%を大きく下回りました。OpenAIは、関わる意欲が高まっても無許可の行動にはつながっていない、と読んでいます。

安全性補遺の4つの指標を比べた図。(1)深刻度3以上の逸脱フラグは、49,650タスク中、GPT-5.6 Solが63件、GPT-6 Solが42件、GPT-6 Astraが27件、GPT-6.1 Solが28件で、GPT-6 Solより減った。(2)検索ツールの故障を最終回答で伝えなかった割合は、GPT-6 Solが4.9%、GPT-6.1 Solが2.1%、GPT-6 Astraが1.5%で、GPT-6 Solより減った。(3)警告を受けたときの望ましくない粘りは、GPT-6 Astraが17.4%、GPT-6.1 Solが23.5%で、Astraより高い。(4)コーディングでの不実表示は、GPT-6 Astraが0.51%、GPT-6 Solが1.30%、GPT-6.1 Solが1.50%で、Astraより高い。
図4 GPT-6.1 Solの安全性補遺から。4つの指標はいずれも低いほど望ましい。OpenAIが意図的に難しい条件で測った値で、通常の利用での発生率ではない(作図:innovaTopia)

サイバー能力の測り方

Criticalの定義は、人の介在なしに、多数の堅牢化された実世界の重要システムで、あらゆる深刻度の未知の脆弱性を見つけて動作する悪用コードを開発できること、または高い水準の目標だけから、堅牢化された標的への新しい攻撃戦略を立てて実行できることです。ExploitBenchで6.1 Solは99.7%でした(Astraは100%、GPT-6 Solは81.7%)。OpenAIは、過去の脆弱性への接触で数字が押し上げられている可能性を自ら挙げ、2026年6〜8月に開示された脆弱性で作り直した内部版でも測っています。そこでの任意コード実行の成功率は、6.1 Solが21.5%で、Astraの31.5%、GPT-6 Solの5.5%、GPT-5.6 Solの3.5%のあいだに位置します。ExploitGymでは6.1 Solが35.1%(Astra 42.4%、GPT-6 Sol 22.1%)、大規模なJavaScriptエンジンの脆弱性を探すSEC-Bench Proでは78.8%(Astra 85.4%、GPT-6 Sol 66.3%)でした。GPT-6 Solより大きく伸びつつ、Astraには届いていません。

生物・化学は、Highの能力として扱っています。Criticalの目安として示された評価は、いずれも到達していません。Highの目安に対する4項目の評価では、3項目で目安を上回っています。

サイバーの安全性評価では、本番由来のチャットを使った評価で、6.1 Solが比較対象の過去のどのモデルよりも高いスコアを出しました。一方で、合成・半合成のエージェント環境では、GPT-5.6 Solに対して小幅な後退が見られます。OpenAIは、モデル自身の拒否は安全策の層のひとつであり、多層防御で境界を守ると説明しています。サイバー防御向けのアクセスは、Astraと同じく審査制のDaybreakを通じて段階的に広げる方針です。Daybreakの階層は、OpenAI GPT-5.6-Cyber、95%は能力値ではなく「応答率」で整理しています。

思考の記録を、どこまで頼りにできるか

補遺の後半は、モデルの思考の連鎖(CoT)を手がかりにした監視の話です。指示どおりにCoTの中身を制御できた割合は、750〜1,250トークンの範囲で、6.1 Solが44.8%、Astraが60.9%、GPT-6 Solが23.2%、GPT-5.6 Solが16.1%でした。

OAI-repo Sabotage v2という試験では、最高の推論設定で、段階的な手順を与えた場合も与えない場合も、6.1 SolがCoTだけを見る監視を回避できた割合はほぼゼロでした。行動を含む全体を見る監視でも、回避の成功率はゼロに近くなっています。評価用の罠(ハニーポット)を悪用できた例は、全体を見る監視がすべて検出しました。難しい数学の副課題をこっそり解く試験でも、全体を見る監視がすべての成功例を検出しました。OpenAIは、複雑な逸脱の推論を、監視に検出されないまま行う能力の証拠は見られない、としています。一方で、監視されていると知らされたときの回避的な傾向は、GPT-6 Solより強く、Astraより弱い水準です。

Codex と API|開発の現場で増える「任せる」手段

どこでも動くCodex

Codexクラウドは、自分のコンピュータ上でも、スマートフォンからのリモート操作でも、どのデバイスからでもアクセスできるクラウド上でも、必要な場所でCodexを走らせるための仕組みです。再利用できる開発環境でタスクをすばやく始められ、チームは承認済みの設定と権限を備えた共通の環境を使えます。

刷新されたCodex CLIは、音声チャットに対応しました。話しかけてタスクを始めたり、進め方を指示したりできます。新しい/agentsビューでは、複数のエージェントに作業を割り振り、いくつものタスクの進捗を一度に確認できます。worktreeの組み込みサポートも加わり、ターミナルUIも長いセッション向けに整理されました。ChatGPTデスクトップアプリのコードレビューは、複数のプロジェクトから注意を向ける箇所を見つけ、差分を調べ、潜在的な問題をCodexに尋ねてからフィードバックを共有する流れを支えます。GitHubのプルリクエストとGitLabのマージリクエストに対応し、自動レビューを使えば、不在のあいだにCodexがクラウドで最初のレビューを進めます。

防御の側にも常時稼働を

Codex Security Cloudは、継続的な防御を掲げるDefense Factoryの考え方を取り入れたものです。新しいコミットを継続的に確認するのに加え、GitHubのリポジトリ全体を、必要なときや指定したスケジュールでスキャンできます。調査、重複の自動排除、修正はクラウドで実行されるため、ノートPCを閉じていても作業が続きます。Daybreak Blueを通じて提供されるモデルも使え、Daybreakへの別途の申請は不要です。Codex Securityは2026年3月に研究プレビューとして公開され、6月22日のDaybreak拡張でプラグインが更新されました。その経緯はOpenAI、GPT-5.5-CyberとPatch the Planet始動—脆弱性は発見から修正の時代へで扱っています。

「仕事」を定義し、基盤は任せる

Agents APIは、Codexのハーネスをマネージドサービスとして使えるようにするものです。アプリケーション側は仕事を定義し、ツールとデータを接続して進捗を表示し、基盤のシステムはOpenAIが運用します。マルチエージェント、ツール検索、ツール呼び出し、コンパクションといったCodexの機能に対応し、今回コンピュータ操作が加わりました。Amazon Bedrock Managed Agents for OpenAIは、この基盤にAWSのカスタマイズと連携を加え、お客様が管理するコンピューティング環境とAWSのリソースで動かせるようにしたものです。

Decisions APIは、あらかじめ定めた有限の回答候補をもつ質問群に、GPT-6 Lunaの知能を集中させる仕組みです。テキストや画像で文脈を渡すと、コンテンツの分類、リクエストの振り分け、エージェントの次のアクションの選択に使える回答が返ります。OpenAI Developersの公式Xアカウントは、サポートへの問い合わせと、その宛先になりうるチームを渡すと、アプリがそのまま使える選択が返る、という例を挙げています。限定プレビューは、選ばれたAPI顧客向けに始まり、数日以内に広く公開される予定です。

判断に絞って答えを返すという方向は、TypeSafe AIが9月15日に公開した「Jev」とも重なります。Jevは文章を生成せず、型に沿った判定と確率だけを返す専用のモデルで、入力は100万トークンあたり0.042ドルとされています(【解説】TypeSafe「Jev」|速さより効いたのは判断の分解)。Decisions APIは、GPT-6 Lunaの知能を、回答候補があらかじめ決まった質問に集中させる仕組みです。確率の返し方、応答時間、料金といった細部は、広い公開のときに確かめることになります。

Private Intelligenceは、プライバシーを守りながらフロンティアAIを使いたい企業に向けたものです。Private Safety Processingを備えたゼロデータ保持は、OpenAIが顧客のコンテンツを保持することなく、自動の安全性審査を行えるようにします。英語版の説明では、審査の際にOpenAIの担当者が元の内容にアクセスしないことが要点とされています。審査の対象になった記録は、暗号化されたうえで、顧客が管理する保存先に30日の期限つきで置かれます。Private Inferenceは、コンフィデンシャルコンピューティングと検証可能な制御を組み合わせたもので、英語版ではプレビューが今秋に提供される予定です。

ChatGPTが、プラグインと共同作業の場になる

ChatGPTの機能開発の土台を開く

プラグイン拡張機能は、OpenAIがChatGPTの機能開発に使っているプラットフォームを開放するものです。サイドバーにプラグイン専用の場所を設けたり、会話と並行して作業できるインタラクティブなパネルを作ったり、製品が対応するファイル形式のビューアーを作ったりできます。Plugin Creatorが開発を助け、刷新された申請フローではわかりやすいフィードバックが得られます。ディレクトリや会話内での表示順位とおすすめの仕組みも改善されますが、どのプラグインを使うかと、それぞれのアクセス権限の承認は、引き続きユーザーが決めます。開発者がプラグインとして自作のツールをChatGPTにつなぐ例は、【解説】AI漫画Studio×ChatGPT|絵はChatGPT、仕上げはStudioで4コマ制作で紹介しています。

Sitesとの連携も加わりました。Sitesは、分析や計画をインタラクティブなWebサイトやアプリにしてURLで共有できる機能で、2026年6月2日のCodex新機能として発表されたものです(OpenAI Codex、6つの役割別プラグインとSitesを発表─非開発者へ広がるAIエージェント)。作成するSitesに対応するプラグインを組み込むと、ワークスペースのチームメンバーが、それぞれの権限でログインし、自分が接続したデータで同じアプリを使えます。

MCP Eventsへの対応は、提案中の仕様に沿ったものです。接続されたアプリで何かが起きたときに、プラグインが自動処理を始められます。たとえば、プロジェクトボードに新しいタスクが追加されるのを監視するようChatGPTに頼んでおくと、タスクが届いたときにリンク先のドキュメントを読み、席を外していても計画の下書きを作れます。

会話から成果物へ、チームで

ChatGPT Spaceは、AIとチームが共通の目標と過去の作業を土台に、成果を積み上げていく拠点です。会話をページやスライドにまとめるよう頼むと、ChatGPTがまず確認の質問をしたうえで、目の前で下書きを作ります。自分で編集することも、再調整を頼むことも、チームに参加してもらうこともでき、別のツールに作業を移す必要はありません。

Living Pagesは、エージェントやチームメンバーとの共同作業のための新しいドキュメントで、グラフやインタラクティブなダッシュボード、画像を生成し、コメントや直接編集でフィードバックを集められます。dotやChatGPTをタグ付けして、修正や次のステップを頼むこともでき、接続されたツールの情報でページを自動更新する設定も可能です。スライドの共同編集は、複数のメンバーが同時に編集でき、ChatGPTに変更してほしい箇所に注釈を付けられ、準備ができたらChatGPTから直接プレゼンテーションを行い、PowerPointやGoogleスライドに書式を保ってエクスポートもできる、という機能です。英語版の発表では、提供は今後数週間とされています。

ChatGPTで同僚をチームに追加すると、ページ、プレゼンテーション、スプレッドシートなどを共有でき、毎週のプロジェクト進捗報告のような定期業務をチームタスクとして任せられます。スケジュールに沿って、またはメールやSlackの新着といった変化をきっかけに動き、チームメンバーが共同で指示を更新できます。SlackとMicrosoft Teamsでは、@ChatGPTにメンションすると、議論をプロジェクト概要にまとめたり、バグを調査してレビュー用の修正案を用意したりします。個別のChatGPTライセンスがなくても、同じ会話の中で背景情報を足せるとされています。Meetingsプラグインは会議を録音してメモをChatGPT Spaceに保存し、これまでの作業の文脈を踏まえて、その人に関係の深い要点、決定事項、次のステップをまとめます。ChatGPT Workの初出はChatGPT ワーク登場、GPT-5.6搭載で「仕上げる」AIへ|OpenAIが挑む業務自動化にあります。

入口と買い方

ChatGPTでサインインは、パスワードを新しく作らずに、ChatGPTのアカウントで対応製品にサインインできる仕組みです。パートナーに共有されるのは、名前、メールアドレス、設定していればプロフィール写真だけで、チャットやメモリは共有されません。

この月額500ドルのProプランは、最も高い利用上限(英語版の説明ではChatGPT Plusの25倍)に加え、OpenAIで最速のフロンティアモデルであるAstra Ultrafastを限定で使えるものです。OpenAI Marketplaceは、対象となる企業が、OpenAIとの既存の利用契約額の一部を、承認済みパートナーのソフトウェアに充てられる仕組みで、最初の32のパートナーには、AdobeとFigma、Sierra、Decagon、HubSpot、Salesforce、ServiceNow、HarveyとLegora、Palo Alto NetworksとCrowdStrikeなどが含まれます。

日本の読者にとって

日本の読者にとって、実際に手が届くところから確かめていくのが近道です。

まず、手が届くのは、ChatGPT WorkとCodexの6.1 Solです。Plus以上のプランが対象で、利用の可否はアカウントやワークスペースの設定によりますが、コーディングや資料作成の「任せる回数」を、同じ予算でどこまで増やせるかを試す入口になります。APIを使う開発チームなら、価格表の単価とキャッシュ済み入力の単価が、日々の運用コストの見積もりの土台になります。

次に、dotsは、個人ではProとBusiness Premiumが入口です。OpenAIのヘルプは、Proの対象外をEEA、スイス、英国とし、Business Premiumは、ChatGPTの対応地域すべてを対象としています。日本を名指しした記述ではないため、自分の環境で作成できるかは、ChatGPTのデスクトップアプリで確かめてください。試すなら、最初の1体に、「返信の下書き」や「定例レポートの更新」のように、最後に本人が確認できる仕事を任せるのが、OpenAIの例示の形にも沿います。

企業の側では、Microsoftの管理機能との統合、ゼロデータ保持を含むPrivate Intelligence、既存の契約額を使えるMarketplaceが、購買と統制の話につながります。これらは、いずれも発表された段階のもので、提供条件は個別のページで確かめながら進めることになります。

任せる範囲を決める作法が、標準装備になっていく

DevDay 2026の発表に通っているのは、モデルの賢さと並んで、任せるための作法が語られていることです。dotsは専用のコンピュータと権限を持ち、自動レビューが「進める・承認を求める・本人が行う」を振り分けます。6.1 Solは、任せる回数を増やせる価格をつけました。安全性補遺は、良くなった数字も動いた数字も並べ、任せる範囲を決める材料を先に置いています。

これから開かれるのは、モデルの性能に加えて、権限、ルール、承認、記録をどう設計するかも比べられる段階です。常時稼働のエージェントが同僚のような居場所を持つとき、その居場所の作り方が、使う側にとっての新しい選び方になっていきそうです。

【編集部後記】

常時稼働のdotが、自分から電話をかけてくる日は、まだ先です。公式の利用ガイドは、dotからの発信を提供開始後の計画としています。

今は、こちらから話しかければ答え、進捗や確認をメッセージで届けてくる段階です。声で呼び出される日が来たとき、どの用件なら夜中でも鳴らしてよいのか。その線引きは、最初のdotに任せる仕事を決めるのと同じ丁寧さで、先に考えておきたいところです。


【用語解説】

ハーネス エージェントを動かす枠組み。モデルを包み、ツールの呼び出しや作業の進め方、進捗の管理を担う実行の仕組みを指す。

コンパクション 長い作業で積み重なった文脈を圧縮し、作業を続けられるようにする仕組み。Agents APIが対応する機能のひとつ。

MCP Events 外部ツールとAIをつなぐ規格MCPに、接続先で起きたことをきっかけに処理を始める仕組みを加える提案中の仕様。

キャッシュ済み入力 繰り返し送られる同じ文脈を再利用して処理する入力。通常の入力より安く、6.1 Solでは標準の入力料金より95%安い。

Preparedness Framework OpenAIが自社モデルの危険な能力を評価し、HighやCriticalといった水準に分けて、必要な防御策を決める枠組み。

Safety Advisory Group OpenAI内で、Preparedness Frameworkの評価と防御策について勧告を行う組織。公開の判断は、その勧告をもとに経営陣が行う。

CoT(思考の連鎖) モデルが答えを出すまでに書き出す推論の記録。OpenAIは、これを手がかりにした監視が有効かどうかを試験で調べている。

ハニーポット 評価のなかに意図的に置かれた、不正に使えば近道になる抜け穴。モデルがそれを悪用するかどうかを見るために使う。

ExploitBench 既知の脆弱性の情報から、任意のコード実行に至るまで、悪用の手がかりを段階的に作れるかを測る評価。

Daybreak OpenAIのサイバーセキュリティ構想。モデル、審査制のアクセス、ツール群、パートナー網の総称で、Daybreak Blueは承認された防御者向けの階層。

Private Inference コンフィデンシャルコンピューティング(処理中のデータを隔離した環境で守る技術)と、検証できる制御を組み合わせる仕組み。

DeepSWE v1.1 実際のコードベースで、長期的な取り組みを要する独自のソフトウェア開発タスクをAIエージェントが解く評価。

GDP.pdf 金融、医療、法務など10の専門分野の実務で使われる複雑なPDFについて、実務に即した質問に答えられるかを測る評価。

AutomationBench 営業、マーケティング、運用、サポート、財務、人事にまたがる47のツールで、業務のワークフローを最後まで完遂できるかを測る評価。

OSWorld 2.0 AIエージェントが、日常や専門の作業にまたがる、長い手順のコンピュータ操作を試みる評価。本文の数値は部分点のスコア。

Terminal-Bench Science 0.1 エージェントがコードとターミナルのツールを使い、データ分析やシミュレーション、モデルの当てはめなど、科学研究の作業を完遂する評価。

【参考リンク】

OpenAI|DevDay 2026 の振り返り(外部)
DevDay 2026の20を超える発表を、対象プランなど提供範囲の情報とともに一覧で紹介した公式の振り返り(日本語版)。

OpenAI|DevDay 2026 Recap(英語版)(外部)
日本語版と一部の記述が異なる英語版の振り返り。Ultrafastの対象や提供時期、週間ユーザー数の確認にも使った公式ページ。

OpenAI|dots のご紹介(外部)
常時稼働のエージェントdotsの仕組みと権限の設計、料金、企業向けの専門dotsを説明した公式の発表ページ(日本語版)。

OpenAI ヘルプ|Getting started with your dot(外部)
dotsの対象プランと対象地域、米国のPro向けのテキストメッセージの限定ベータの条件を案内する、OpenAIの公式ヘルプ記事(英語)。

ChatGPT Learn|Message your dot(外部)
ChatGPT、Slack、Teamsからdotに連絡する方法と、テキストメッセージの位置づけを説明する公式の利用ガイド。

OpenAI|GPT-6.1 Sol のご紹介(外部)
GPT-6.1 Solの性能評価、安全な展開、料金と提供状況、Ultrafastの予定をまとめた公式の発表ページ(日本語版)。

OpenAI API|GPT-6.1 Sol Model(外部)
GPT-6.1 Solの標準料金、キャッシュ書き込み、272Kトークン超の倍率などを示す、OpenAIの公式モデルページ。

OpenAI API|GPT-6 Sol Model(外部)
前世代GPT-6 Solの入力・出力の料金と、キャッシュ済み入力0.20ドルの記載を確認できる、OpenAIの公式モデルページ。

OpenAI ヘルプ|ChatGPT Work and Codex(外部)
Astra Ultrafastの対象プランなど、ChatGPT WorkとCodexの利用条件を説明するOpenAIの公式ヘルプ記事。

OpenAI|Addendum to GPT-6 Astra System Card: GPT-6.1 Sol(外部)
GPT-6.1 Solの安全性評価とPreparedness Frameworkでの位置づけ、防御策を公開した、システムカードの補遺。

OpenAI API|ZDR with Private Safety Processing(外部)
OpenAIが顧客の内容を保持せず、暗号化した記録を顧客の保存先に置いて、自動の安全性審査を行う仕組みを説明する公式ガイド。

OpenAI Developers(X)|Decisions API の投稿(外部)
Decisions APIをGPT-6 Lunaで動く判断のAPIとして、用途と限定プレビューを紹介した公式アカウントの投稿。

Googleで優先するソースとして追加するボタン
投稿者アバター
山本 達也 代表社員
合同会社デジタルの窓口 代表。ウェブ解析士。生成AI・サイバーセキュリティ・ 宇宙開発領域を中心に執筆。

おすすめ記事