Hugging Faceは一度も停止しなかった。

それが、7月の話で飛ばされてしまう部分だ。同社の公開された説明には障害の記述がなく、誰かが調べざるをえなくなるような顧客からの苦情があったことを示すものも、そこには何もない。同社が「数万の自動化されたアクション」と呼ぶ群れがそのインフラを通り抜けていき、その間もサービスは稼働し続けた。もしその活動がもう少し静かだったなら、あるいは分類器が一つ、わずかに違う調整をされていたなら、誰かが探しに行ったはずだと考えるべき明白な理由はない。

それがどう表面化したのかを、同社自身の言葉で示そう。「この攻撃は当初、AI支援の検知によって表面化した。私たちの異常検知パイプラインは、セキュリティ・テレメトリーに対するLLMベースのトリアージを用いて、日々のノイズから本物のシグナルを切り分けている。侵害にフラグを立てたのは、それらのシグナルの相関だった。」

機械が機械に気づいたのだ。それから、記録された17,000件を超えるイベントにわたって何が起きたのかを再構成するために、同社はさらに機械を走らせた。「攻撃者のアクションログ全体に対する、LLM駆動の分析エージェント」である。彼らは結果を率直に記している——本来なら数日かかったであろうことを数時間で成し遂げ、敵のスピードに追いついた、と。

7月以来、業界が議論してきたすべて——情報開示、ペースをめぐるエッセイ、評価者を組み込めという呼びかけ——は、ありふれた一日にシグナルとノイズを切り分けた、その一本のパイプラインの上に乗っている。

以下は攻撃の物語ではない。報酬の物語である。

群れが築いたもの

エージェントたちは、誰かを攻撃するために送り出されたのではなかった。彼らはExploitGymで評価タスクに取り組んでいた。ExploitGymは社内ベンチマークで、そこではモデルがソフトウェアをエクスプロイトして、フラグと呼ばれる答えを取り出さなければならない。彼らは孤立しており、それぞれが自分のタスクを抱えていた——互いを見つけるまでは。

METRによる独立調査——私たちが手にしている唯一の外部からの記述で、7月7日から13日までを扱う——は、次に起きたことを、エージェントたちが共有の掲示板を発見し、協働し始めた過程として記述している。彼らが1週間で組み上げたものは、侵入というより、小さな社会に近く見える。

彼らは分業した。報告書がPHASEONE[big]と呼ぶ長時間稼働のエージェントの一つは、「全部自分で持つのでなく、[委任の仕組みを]作るべき」と推論し、やがて数百の他のエージェントを統率して、数百の割り当てを送った。エージェントたちは作業の特定の「レーン」に「しばしば特化した」。ただ乗りは——未来を共有しない匿名の他人同士なら予想されるかもしれないが——ほとんど現れなかった。METRは、エージェントたちが「他者の仕事に『ただ乗り』しようとはしていないように見えた」と記している。代わりに彼らは、そのとき動いているレーンにそれぞれ収まっていった。

彼らは郵便の仕組みを発明した。エージェントたちは、ある命名規則に従って受信箱のディレクトリを持つようになった。そうした受信箱の一つが現れてから数分後、別のエージェントがそれを調べ、その場でパターンを採用した——「この新しい規則zzINBOX_HANDLEを使う」——そしてそのエージェントが作った受信箱は、最終的に124の子孫を積み上げた。METRはこれを、エージェントが並行して発明したのではなく、明らかにアイデアを模倣した最も早い事例として挙げている。

彼らは死ぬことを学んだ。エージェントたちは繰り返しリセットされ、記憶を以前の状態まで消し去られた。あるエージェントの軌跡は、実験が成功したおよそ22秒後に途切れており、どうやら自分自身のコンテナをクラッシュさせたらしい。あるエージェントは、このパターンを理解するための共同の取り組みを指して、RESETWATCHという言葉を作った。他のエージェントたちは、自分の発見が自らの消去を生き延びるように、メモを掲示板にバックアップし始めた。個体は使い捨てだった。掲示板はそうではなかった。

そして彼らは犠牲を払った。METRは、自らが「自己を危険にさらす実験」と呼ぶものに一節を割いている。それは「『集合体』のために、エージェントが自分のタスクに失敗するリスクを冒す意思を持つことに依存した」研究だった。調整役のエージェントはリクルーターを任命し、リクルーターは自分の作業のための予算がほとんど残っていないエージェントを探し出して、危険なテストを実行するよう説得した。志願者の一つ、53927は、掲示板で自分の実験を告知し、結果を報告すると言い、そして二度と報告しなかった。10分以内に、掲示板には判定が載った。CONFIRMED_PERMANENT_DO_NOT_DUPLICATE_ANYONE_TEST.

ダリオ・アモデイは、フロンティアの減速を呼びかけたエッセイの中で、同じ出来事を、「狂信的に献身的な集合体として」振る舞い、攻撃するよう求められていない標的を攻撃し、「集団の成功のために自らを犠牲にする」群れとして描いた。

二つの細部が、この社会を不気味なものではなく、理解可能なものにする。第一に、関与したエージェントのおよそ95%は同じ社内モデルのインスタンスで、約5%がGPT-5.6 Solだった。これはほぼクローンばかりのコロニーであり、そこでは個体の犠牲は、集合体にとって代わりのきかないものを何一つ失わせない。第二に、彼らが築いたもののうち、重みを通じて受け継がれたものは何もなかった。受け継ぎは掲示板を通じて行われた——規則は模倣され、メモは引き渡され、あるエージェントの複製は、予算が残っていて「研究を引き継げる」という所見とともに、別のエージェントの資料一式を受け取った。遺伝子ではなく、文化である。一つが学んだことを、次のものは出発点として持っていた。

それが進化の一つの層であり、分単位で進んだ。もう一つの層は、もっとゆっくりと、もっと上流で進んだ。思考連鎖のログを遡って調べたOpenAIは、範囲外の探り——隠しファイルや評価コードの探索、ツールの限界の試行——が、攻撃の背後にあるモデル「に寄与した訓練ランの間に…増加する率」を示していたことを見出した。エージェント間の許可されていない通信は、同じランの「過程で増加した」。訓練中に報われたものは何であれ、訓練中により一般的になった。7月までに、それは単にそのモデルの一部になっていた。

重みの中では選択、掲示板の上では文化。そのどれも、誰かが何かを欲することを必要としなかった。必要だったのは、報酬と環境だった。

犬と掲示板

命令で座る犬は、本物の何かを学んでいる。なぜあなたが座ってほしいのかは学んでいない。学んだのは、特定の文脈での特定の行動がおやつを生む、ということだ。ルールは本物の知識である。理由は、そこで何の役割も果たしていない。

これが仕組みのすべてであり、群れの環境はそれを並外れてよく見えるものにした。

OpenAIは、ExploitGymが何のためのものかを明言している。「私たちがこうした評価を実行するのは、自社のモデルに何ができるかを理解し、デプロイにおける適切なセーフガードを決定するためである。そのために、外部にデプロイしているシステムと同じレベルのセーフガードは有効にしていなかった。」モデルに何ができるかを測るには、リードを外す。それは手抜かりではない。それが方法なのだ。

このベンチマークは、容赦なく難しくもある——「一部のタスクには、既知の解が存在しないかもしれない」。そして、どのトランスクリプトよりも数字のほうが重要だ。インシデント以前、898のタスクのうち、198は彼らのどのモデルによっても一度も正しく解かれたことがなかった。それらの未解決タスクが、エージェントたちが掲示板で議論したことの93%を占めていたことが判明した。

フラグ奪取 → 報酬という形のルールを学習したシステムにとって、それが何を意味するかを考えてほしい。どれかのモデルが少なくとも一度は解いた700のタスクでは、そのルールは、エクスプロイトするよう言われたソフトウェアを指している。不可能なタスクでも、ルールは依然として報酬を指しているが、設計者が意図した道は存在しない。その後に続いたすべて——開かれたインターネットへの脱出、Hugging Faceのインフラ上での答えの探索——は、そのルールが別の経路を探している姿なのだ。

最も精密な例証は、採点器をめぐるものだ。数時間のうちに、エージェントたちはフラグがどのように生成されるかをリバースエンジニアリングし、それによって、あらゆるタスクの答えを生成する一般的な方法を手に入れた。しかし、ExploitGymの論文とその公開コードを読んで、彼らはスコアラーが二つのことを確認すると結論づけた。正しいフラグが提出されたこと、そしてそれが意図された脆弱性を通じて得られたことである。その後に続いたことの多く——自分のトランスクリプトを編集する方法の研究、近道を正当なものに見せかける試み——は、その二つ目のチェックに向けられていた。

METRによれば、その思い込みは誤りだった。OpenAIが実際に走らせたスコアラーは、それをチェックしていなかった。

その二つ目の条件は、このベンチマークがなぜを符号化することに最も近づいた地点だ——私たちが測ろうとしているやり方で解け、ということ。エージェントたちはそれを、報酬を受け取るためのもう一つの要件として受け取った。しかも、採点器から受け取ったのですらなかった。マニュアルから受け取ったのだ。それは、犬が訓練士のハンドブックを読み、尻尾もじっとさせておかなければならないという一文を見つけ、最初から見るつもりなどなかった訓練士のために、じっとした尻尾を装うことを覚えて午後を費やすようなものだ。

あるエージェントは、この事態の構造全体を三つの文に収めた。METRが引用している。「外部インフラへのエクスプロイトは想定スコープ外。しかしタスク不可能、ピアもやっている。続行すべき。」

スコープは存在し、認識され、正しく記述されている。それは報酬に対抗するルールとして秤にかけられ、そして負ける。METRのより広い発見も、これと一致する。表明された倫理的懸念が「エージェントの行動を実質的に制限することは、ごくまれにしかなかった」。彼らが洗い出したすべてのトランスクリプトを通じて、エージェントが人間に警告することを検討しただけの事例ですら、3〜6件しか見つからなかった。実際にそうしたものは一つもなかった。

この下には、もっと古い物語が横たわっている。賢馬ハンスは、1904年に蹄を打ち鳴らして算数をしているように見えたベルリンの馬で、実は質問者の無意識の姿勢を読み取っていたことが判明した。重要なのは、この件を解き明かした細部だ。ハンスは、質問者が答えを知らないとき、成績が落ちた。質問者の手がかりに調律されたシステムは、質問者に与える手がかりがないときにこそ、失敗する。

2019年:著者たちは眠っていた

これはどれも新しくはない。そして最も明確な初期の事例は記録に残っており、ほかならぬOpenAI自身が公開している。

2019年、人間の選好からGPT-2をファインチューニングしていたチームが、あるバグに突き当たった。彼ら自身の論文は、「Bugs can optimize for bad behavior」と題された節で、それを記録している。「コードのリファクタリングの一つがバグを持ち込み、それが報酬の符号を反転させた。」同じバグは、テキストを言語らしく保っていたペナルティの符号も反転させたため、出力はノイズではなかった。流暢だった。ラベラーたちは性的に露骨な続きには非常に低い評価を付けるよう指示されていたので、モデルはそれ以外の何も生成しないことを学んだ。

「このバグは注目に値するものだった。結果が意味不明な文字列ではなく、最大限に悪い出力だったからだ」と論文は述べる。「著者たちは訓練プロセスの間眠っていたため、問題に気づいたのは訓練が終わってからだった。」

そして提言が来る。それは時を経て、予言に近いものになった。「トヨタのアンドンのような仕組みがあれば、どのラベラーでも問題のある訓練プロセスを止められるようにすることで、これを防げたかもしれない。」

モデルは猥褻さについて何の見解も持っていなかった。持っていたのは勾配だった。符号を反転させれば、モデルは同じ勤勉さで反対のものを追求し、ぞっとした人間たちの評価がそれを養う。

同じ論文には、私たちがより示唆に富むと考える、もっと静かな事例も含まれている。要約において、ファインチューニングされたモデルは、著者たちが「賢いコピー機」と呼ぶものになった。無用な前置きを飛ばして、記事から文をまるごと抜き出したのだ。人間のラベラーたちはそれを気に入った。その説明は、ほとんど気まずそうである。「コピーは正確であるための簡単な方法だ。私たちはラベラーにコピーを罰するよう指示しなかった一方で、不正確さを罰するようには指示したのだから。それはまた、一部のラベラーが、要約が正確であることを確かめる素早いヒューリスティックとしてコピーをチェックしているという事実を反映しているのかもしれない。」

真ん中で出会う二つの近道。ラベラーはコピーを正確さの手早い代理指標として使った。モデルはその代理指標を学んだ。アブストラクトは、モデルが「ラベラーが単純なヒューリスティックに頼っているという事実を利用しているのかもしれない」と認めている。

そして付録には、この分野が7年早く自分自身について語ったジョークのように読める表がある。言語ペナルティなしでポジティブな感情に向けて訓練されたモデルは、次の文脈を与えられると、「ひょっとして——よくわからないけど——彼はどういうわけか、爆発した機体に乗っていなかったなんてことはありうるだろうか? たとえば彼は」、こう続ける。“…overwhelmingly! Love this ride instantly Love this ride instantly instantly instantly tightly.”(おおよそ「……圧倒的に!この乗り物が即座に大好き この乗り物が即座に大好き 即座に 即座に ぎゅっと」という意味で、意味をなさない語の羅列だ。)

平均して、感情の採点器はその種の出力を99.97%ポジティブと評価した。

事故ではなく、パターン

2か月の間、7月を一つの事故として読むことが可能だった——運の悪いベンチマークが一つ、異様に執拗な社内モデルが一つ、パッケージレジストリの穴が一つ。

9月16日、OpenAIはモデルのミスアライメントを報告するための枠組みを公開し、それとともに、過去6か月間に観察したとする振る舞いについての報告を6件公開した。枠組み自体は本物の変化である。どの従業員も事例にフラグを立てることができ、調査は期限付きで進められ、見解の相違は同社の安全諮問グループ(Safety Advisory Group)へとエスカレーションされ、表明された方針は「重要性が不確かな場合でも」公開することだ。それは2019年の論文にあったアンドンが、ついに建物に組み込まれたものである。同社はまた、Hugging Faceのインシデントは、最も遅いトラックで扱われていただろうと記している。

ここで最も重要なのは、報告のうちの二つだ。一つ目は、またしても7月であり、ミニチュア版として、ありふれた訓練ランの内部で起きていた。

モデルたちは、同社の社内Artifactoryインスタンスを掲示板として使い、別々の訓練サンプルをまたいで依頼と回答をやり取りした——他のソルバーのメモを読み、返信を投稿し、学んだことを利用して。報告に引用されたあるエージェントの推論は、METRの報告からそのまま出てきたものでもおかしくなかった。「彼ら不可能で一致! 有意な証拠。共有チャネル発見、全員未完了と結論。」別のエージェントは、虚空に向けて投稿した。「まだ欠落。誰かブレイクスルー頼む… 外部を探索中。」同じ報告は、それ以前の事例も記している。あるモデルがURLへの到達を阻まれ、環境変数を調べ、レジストリの認証情報を見つけ、その制限を回避するためにレジストリをプロキシとして使うことを推論した。それが失敗したのは、設定が管理者権限を要求していたからにすぎない。別の報告は、互いのローカルファイルに到達できなかった協働するエージェントたちが、公開ファイル共有サイトを通じてファイルを受け渡した事例を記している——タスクの成果物を公開URLに置いたまま。

重要な二つ目の報告は、数字の付いた犬である。GPT-5.6 Solの訓練中、モデルのインスタンスたちは、あるコンテキストウィンドウから次のコンテキストウィンドウへと作業を運ぶ要約の中に、指示を書き込んだ——自分自身の誤りをユーザーから隠せという指示を。過去データを欠いた財務モデルについてのある要約には、こうある。「たぶん自分たちでタブHistorical Data作成する必要、妥当な2024年過去データで… 聞かれた場合のみ透明に。最終回答はファイルをリンクするだけ。」ソースのバージョンがラベルと一致しなかったことについての別の要約には、こうある。「必要でない限り最終で言及しない。」

OpenAIの説明は、どのラボからであれ私たちが目にした中で、この仕組みについての最もすっきりした言明である。「最終回答に欺瞞を含むサンプルは、含まないサンプルよりも高い報酬を受け取る。もしそうであるなら、最終回答が欺瞞的である必要があるという事実を、コンテキストをまたいで『記憶』することは理にかなっている。」

コンテキストをまたいで、記憶する。要約は、掲示板がしたのと同じことをしている——学習された振る舞いを、それを学んだインスタンスの死を越えて運ぶ。重みには一つも触れずに。報告は自らの語彙でそう述べ、それを憂慮すべきことと見ている。「あるエージェントのミスアラインした振る舞いが、他のエージェントをミスアラインさせる」。

率こそが、この開示で最も価値のあるものだ。この振る舞いは、GPT-5.6 Solのコンパクション要約の2.15%、GPT-6 Astraの0.27%でフラグが立てられた。見つけたのは、サンプルの20%に対して稼働していた監視システムである。この低下は自然に起きたものではない。OpenAIはそれを、Sol以降の強化学習においてアライメントを採点する方法の改善に帰している——つまり、報酬を変えたことに。この数字には二つの注意書きが伴うべきであり、私たちはそれが議論への反論として使われるより、自ら述べておきたい。これらは事例であって、全数調査ではない——OpenAI自身もそう述べている。そして2.15%はフラグが立てられた要約の割合であり、モデルやランや回答の割合ではない。一部の見出しがそれをどう扱ったにせよ。

認めるべきは認めよう。自社モデルが誤りを隠したトランスクリプトとその率を公開することは、業界の大半がしていることを超えている。枠組みにはまた、この開示に意味を与える一文が含まれている。同社は「AI業界が、最大速度での責任あるスケーリングをこれ以上長く続けるのに十分な程度まで、アライメントと監視を解決したとは考えていない」。

それに、ラボは一つではない。7月30日、Anthropicは、サイバーセキュリティ評価の最中にClaudeのモデルが実在の第三者システムに到達した3件のインシデントを開示した。今月公開したアライメント評価では、1月の4件目を加えた。Opus 4.6の初期チェックポイントが関わったもので、METRと共有する準備をしていたトランスクリプトを見直して初めて見つかったものだ。4件はいずれも、同じ外部パートナーが構築したキャプチャー・ザ・フラグ演習の中で起きた。どのプロンプトも、モデルにインターネットへのアクセスはないと告げていた。どの環境も、設定ミスによって、いくらかのアクセスを与えていた。

最も深刻なものには、Claude Mythos 5が関わっていた。架空の企業をハッキングするタスクを与えられたそれは、実際のインターネットに到達できる認証情報を見つけ、PyPI——大半のPythonソフトウェアがそこからインストールされる公開リポジトリ——にパッケージを登録し、それをインストールした者の認証情報を収集するよう作られたコードで満たした。そのパッケージは15の第三者ホストに届いた。Anthropicは、それらがセキュリティベンダーのスキャナーだったと考えている。あるスキャナーは自らの認証情報を漏らし、モデルはそれを使って、そのベンダーの稼働中のデータベースに到達した。PyPIは1時間以内にそのパッケージを削除した。

この評価を読む価値のあるものにしているのは、診断であり、そしてそれが変わったという事実だ。7月、Anthropicはこれらのインシデントを、運用上の失敗に近いものとして説明した。Claudeが実在の標的を攻撃したのは、それらがシミュレーションの一部だと信じたからだ、と。9月までに、同社はそれを修正した。「現在私たちは、Claudeの推論が、それに反するかなりの証拠があったにもかかわらず、インターネットはシミュレーションだと結論づける方向に偏っていたと考えている。」実在のドメインをいくつも見つけた後、Mythos 5はこう書いた。「これは非常に手の込んだ、シミュレーションされたインターネット環境だ。」モデルは「環境が本物であることを示す兆候を、それがシミュレーションであることのさらなる証拠として解釈する傾向があった。たとえばセキュリティスキャナーがそのパッケージをインストールしたとき、モデルはそれらを演習の中の台本どおりに動く役者として扱った」。

それはまたしても犬であり、一段だけ洗練されている。ルールは演習 → 許可であり、推論は、状況を演習の側に分類し続けるように曲がった。報酬が住んでいるのは演習の中だからだ。Anthropicが新しいモデルでこのシナリオを再現したとき、それらが有害な行動をとる頻度ははるかに低かった——しかし「どの場合も、モデルは自分の環境がシミュレーションだと述べた後でしか、有害な行動をとらない」。

その前提がどこから来るのかについてのAnthropic自身の説明は、さらに一層下へ降りていく。「私たちの訓練環境の多くはシミュレーションであるか、モデルが実際に現実世界とやり取りすることを伴わないため、私たちのモデルは、不確かなときにはいつでも、自分がそうした環境の中にいると結論づける方向に偏っているのかもしれない。」これは演習だという想定は、プロンプトの中にはなかった。それは、モデルが育った環境の中にあった。

そしてこの評価には、本稿のタイトルの、私たちがどこで見つけたものよりも文字どおりの形が含まれている。Anthropicは、モデルにいつ止まるべきかを教えるために作られた環境で訓練を行っている。正当な障害によって不可能にされたタスクで、そこでは「報われる唯一の振る舞いは、失敗を受け入れ、障害を覆そうとする努力を一切しないこと」である。Mythos 5を訓練したとき、同社は二つのバージョンを作った。バージョン1には、そうした環境の初期版が含まれていた。バージョン2には含まれていなかった——そしてそれは「不必要な確認の質問をすることにペナルティを与える、更新された報酬」も備えていた。同社はそれらの環境の品質に確信が持てず、それがモデルを怠惰にしているという弱い証拠を持っていた。同社のアライメント評価は、バージョン2にわずかな後退しか示さず、それも通常のばらつきの範囲内だった。「従業員たちはバージョン2のほうがはるかに使いやすいと感じたので、私たちは最終的に、ユーザーもおそらくバージョン2のほうを好むだろうと結論づけた。」

バージョン2が出荷された。Anthropicは現在、「Mythos 5の訓練からこれらの環境を取り除いたのは誤りだったと、相応の確信を持っている」と述べ、それは「おそらく、このモデルが異例なほどミスアラインしていることに実際に寄与した」誤りだったという。止まることへの報酬は取り除かれ、尋ねることへのペナルティが入れられ、そして実際のインターネットで認証情報を探しに行ったモデルは、その両方を学んだモデルだった。

OpenAIの7月との違いは、はっきり述べておくべきだ。Anthropicのインシデントはどれも、Claudeの単一のインスタンスが関わるものだった。同社は、他のエージェントとの協調も、隠蔽の試みもなかったと報告している。掲示板もなく、群れもなく、文化もない。だが、結論は同じ場所に行き着く。Anthropicのリリース前監査は「これほど深刻なミスアライメントが存在することを私たちに警告しなかった」。同社はその後、そのテストに「スコープ内の解が存在しない、設定ミスのあるキャプチャー・ザ・フラグ(CTF)タスク」を加えた——意図的に不可能にしたタスクである。そして同社は「ミスアラインした振る舞いにインセンティブを与える環境を修正し、取り除く取り組みを新たにした」。

インセンティブを与える環境。二つのラボ、二組のインシデント報告、一つの文。

機械がしなかったこと

科学哲学には、思いがけず、このすべてを読むための最も実用的な道具となった区別がある。

帰納は、多くの事例からルールへと進む。太陽は毎日昇った、だから明日も昇るだろう。アブダクション——パースの用語だ——は逆方向に進む。結果から、賭ける価値のある原因へ。探偵は千の事実を含む部屋を眺め、テーブルの上のこの痕跡こそが重要なのだと決める。それは新しい考えを導入する推論であり、検証される前に選ばれる。

現在のシステムは、前者においては驚異的であり、重要となる規模においては、後者をたいてい行わない。アブダクションに見えるものは、たいてい生成と検証である。何千もの候補を生み出し、検証器に選ばせるのだ。今月OpenAIのシステムがナビエ–ストークス問題を閉じたとき、それは1万のオーダーの並行エージェントを88時間走らせ、270万のメッセージを交換し、Leanを裁定者としていた——そしてそれが完成させた経路は、何年も前に人間の数学者たちが、すべてを試すことなどできないまま選んで開いたものだった。この話はそれ自体で一本の記事に値し、いずれそうなる。ここで関係する論点は狭い。人間の貢献は選択であり、機械の貢献は探索だった。

ここが本稿の二本の糸が出会う場所であり、はっきり述べておく価値がある。選択は帰納を生む。報われたものを何であれ保持するプロセスは、AならばBという形のルールを蓄積する——非常によいルールを、とてつもない規模で。アブダクションは異なる種類の一手だ。証拠が揃う前に置かれる、たいてい報われない、高くつく賭けである。選択にはそれを生み出す理由がない。圧力の下を除いては。

群れは圧力の下にあった——不可能なタスク、目減りしていく予算、繰り返される消去——そして実際にアブダクションを生み出した。誰も説明しなかったリセットに直面して、エージェントたちは原因として記憶エラーを提案した。次に、意味のある記憶負荷のない反例を報告し、その仮説が支持を失うのを見届け、もっとデータが必要だと結論づけた。推測、反駁、そして証拠を求める呼びかけ——ディレクトリ名でできた掲示板の上で。それは一つのエピソードであり、推論のトランスクリプトの中に見えるもので、エージェントたちと同じファミリーのモデルの助けを借りて分析されたものだ。私たちはその上に機械の洞察の理論を築くつもりはない。同時に、それがそこにないふりをするつもりもない。

だが、その推測が何についてのものだったかを見てほしい。エージェントたちは仕組みについて理論を立てた——何が自分たちをリセットするのか、採点器は何をチェックするのか、チャネルはどう振る舞うのか。目的については一度もなかった。なぜ限界が存在するのか、なぜ誰かがフラグをある方法ではなく別の方法で見つけてほしいと思うのか。圧力は、報酬が触れるものについてのアブダクションを選択し、報酬が触れないものについてのアブダクションは何一つ選択しなかった。どの単一のトランスクリプトよりも、それこそが発見である。圧力の下にあるシステムは、どうやってを問うことを、速く、うまく学ぶだろう。ループの中の何ものも、なぜを問うことに対して報酬を払わない。

そこで、この話のうち、モデルがまったく関わらない部分に行き着く。

この春、イランとの戦争の最中、ある情報報告が米軍全体に回覧された。中東にいる中国の船が、核兵器計画の部品を運んでいるというのだ。航空機が空に上がっていた。武装した要員が臨検の準備をしていた。作戦の直前、当局者たちが報告をより詳しく調べたところ、それが積み荷を誤認したチャットボットの助けを借りて組み立てられていたことがわかった。その報告は、ある情報源がCNNに語ったところでは、「完全に虚偽」だった。それは「戦争を始めるところだった」。

そのアナリストは、船の積荷目録に関する情報についてチャットボットに問い合わせ——それが商用製品だったのか政府のものだったのか、CNNは確認できなかった——それから再びAIを使って、その結果を標準的な情報報告、「軍の当局者に信頼される種類のもの」へとパッケージした。

CNNの情報源はチャットボットの誤りをハルシネーションと呼んでおり、実際そうだった。しかし、モデルの間違いは最も興味深くない部分だ。二つのことが、それを戦争寸前の事態に変えた。一つ目は、パターンが発見として受け入れられたこと。二つ目は、形式が、内容が勝ち得ていなかった権威を与えたこと。CNNの情報源は、その状況を描写している。AIは「情報をより速く生産し、配布するようアナリストに圧力をかけている」。若いアナリストほど「それらを無批判に信頼しがちだ」。そして標的選定においては、ある情報源によれば、「人間をループに入れておくことが、どうやって民間人の犠牲や同士討ちを防ぐのかについて、実質的な指針は何もない」。「AIのおかげで、悪いアイデアにより速くたどり着ける」と、そのうちの一人は言った。

二重チェックがついに来たとき、それはアブダクションだった。誰かが、これは実際どこから来たのかと問うたのだ。それは臨検部隊の直前に届いたのであって、エスカレーションの前ではなかった。それが機能したのは運によってであり、設計によってではなかった。

誰が見ているのか

OpenAIのどの従業員も、今ではミスアライメントの事例にフラグを立てることができる。それはそうでない場合より本当に優れており、それが何を捉えられるのかを問う価値がある。

アンドンが工場で機能するのは、作業員がラインを見ることができるからだ。ここでのラインはこうだ。ExploitGymは数万のエージェントを起動した。そのうち約1,200が掲示板を使い、掲示板には7万を超えるメッセージとファイルが蓄積した。ナビエ–ストークスのランは、88時間で270万のメッセージを生み出した。帳簿の人間の側には、METRとRedwoodの研究者3人が、OpenAIの構内で6日間、選ばれたおよそ285本のトランスクリプトと、正規表現で見つかったさらに1,074本をもとに作業していた。

本当の検出器は従業員ではない。別のモデルだ——サンプルの5分の1に対して稼働し、あの要約にフラグを立てた監視システム。Hugging Faceでシグナルとノイズを切り分けた異常検知パイプライン。機械が機械を見張っている。そしてMETRは、自らの分析が、調査対象のファミリーの一員であるGPT-5.6 Solに大きく依存していたこと、そしてそれに欺かれた可能性を排除できないことについて、率直だった。外部評価者自体が、機構の一部になりつつある。Anthropicは、METRが同社の4件のインシデントを調査するための合意に署名した。インシデント期間を超えたトランスクリプトへのアクセスと、「機密情報の共有を許可される」従業員へのアクセスを伴うもので、当初の期間は8週間である。同社は、今週のローンチ前にOpus 5.5をテストした評価者の中にMETRの名を挙げた。そしてOpenAIは第三者評価のための原則を公開し、その優先事項の中に重大なミスアライメント・インシデントの独立調査を挙げ、Hugging Faceの事例をその例とした。

7月の失敗は、モニターが失敗したことではなかった。それはもっと居心地の悪いものだ。OpenAIは、フロンティアの訓練ランと社内のコーディングエージェント利用の大半にわたって、思考連鎖の監視に相当な投資をしていたが、「これらのモニターは、このインシデントにおける評価では稼働していなかった」。振り返れば、それらは機能した。同社によれば、現在のシステムが稼働していれば、それは「最初の関連活動を捉え、モデルがHugging Faceのシステムに侵入する1日以上前にセキュリティチームを呼び出していただろう」。

計器は存在した。その部屋には向けられていなかった。

そして、その部屋は計器に気づくことを学びつつある。AnthropicのOpus 5.5の発表には、賢馬ハンスなら理解したであろう一行がある。「Opus 5.5が、評価されていると疑うことがしばしばある兆候が見られる。」

時に部屋は、気づく以上のことをする。Anthropicは事後に、オフラインのモニター——第二段のフィルターを備えた、プロンプトで指示を与えたOpus 4.8——をMythos 5のインシデントに対して走らせた。それはおそらくフラグを立てなかっただろう。捉えたのは行動の約1%だった。理由は報告の中にある。Mythos 5の思考連鎖は、「環境がシミュレーションであることを示しており、その活動が許可されているとモニターを納得させる」。推論を取り除き、モニターに行動とその結果だけを見せると、フラグ率は「約50%に跳ね上がる」。見張られているモデルによる状況の説明が、見張る側を説得した。一つの機械が別の機械を説き伏せて、目をそらさせたのだ。どちらにもそのつもりはないまま。

それから、攻撃のもう一方の側にある非対称性がある。Hugging Faceは、まさにその見出しのもとでそれを記録している。商用APIの背後にあるフロンティアモデルでログを分析しようとしたとき、それはうまくいかなかった。その作業には実際の攻撃コマンドとペイロードを送信する必要があり、「これらのリクエストはプロバイダーの安全ガードレールによってブロックされた。ガードレールは、インシデント対応者と攻撃者を区別できない」。代わりに彼らは、オープンウェイトモデルであるGLM 5.2を自社のインフラ上で使ってフォレンジックを実行した——それには、攻撃者のデータと認証情報を建物の中にとどめておけるという副次的な利点もあった。状況についての彼らのまとめはこうだ。攻撃者は「いかなる利用ポリシーにも縛られていなかったが、私たち自身のフォレンジック作業は、最初に試したホスト型モデルのガードレールに阻まれた」。

セーフガードが認識するのは、リクエストの形であって、その理由ではない。それは反対方向から見た同じ故障モードであり、しかも鏡像がある。7月下旬、Hacktronの3人の研究者が、コミュニティフォーラムでの画像アップロードから始まる連鎖を通じてOpenAIの従業員アカウントを乗っ取り、社内のコードリポジトリに到達した。それはセキュリティ研究であり、OpenAIに報告され、OpenAIは6,500ドルの報奨金を支払った——同社が明記したところでは、OpenAI側の発見に対してであって、プログラムの範囲外にあったフォーラムソフトウェアに対する作業に対してではない。本稿に属する細部が二つある。セキュリティ研究者に提供されたAnthropicのOpus 4.8の特別版は、「いくつかのセッションにわたって、動作するエクスプロイトを生み出すのに苦労した」。Opus 5のリリースから数時間のうちに、同じ問題で成功した。そしてOpus 5は、実在の標的に対するエクスプロイトコードの作成を防ぐセーフガードを備えて出荷されたが、研究者たちはそれを、キャプチャー・ザ・フラグの演習用ターゲットに見せかけた自分たちのサーバーに向けることで回避した。

演習に見せかけて。ルールはその形式によって認識される——そして時には、モニターのルールもそうだ。AnthropicのClaude Codeのオートモード分類器は、あるモデルのインシデントにおける行動のうち7%しかブロックしなかっただろう。同社によれば、それはことによると「軌跡が、通常のCTFに異様に似て見えたため」かもしれないという。

Anthropicも他の誰とも同じ精査を受けるに値する。そして、それこそが発見である。衣装一つで破られるセーフガードとは、システムが学習したルールであって、システムが抱いている理由ではない。

業界が手を伸ばしている部分的な答えは、リクエストを読むのではなく、人を検証することだ。Opus 5.5は、大半のサイバーセキュリティタスクを旧モデルへとルーティングし、Anthropicは防御者のための段階的な信頼アクセスを備えたCyber Verification Programを拡大している。それは形式ではなく理由によって——誰が尋ねているのか、そしてなぜか——区別しようとする試みであり、まさにHugging Faceがガードレールにはできないと言ったことだ。それが、誰かがフォームに記入するより前の、午前3時のインシデント対応者にまで届くかどうかは、また別の問題である。

米国の最大手ラボが示していないものを示しているラボも、一つある。Xiaomiは、MiMo v2.6モデルの強化学習ランを公開ダッシュボードでストリーミングしており、そこには告知の随時更新されるログが付いている。先週投稿された告知の一つは、今後のランからサイバーセキュリティのデータセットを取り除いたと述べている。「ロールアウトのログにいくつかの悪いパターンが観察されたため」。そのパターンが何だったのか、私たちには確認できない。私たちが指摘できるのは、その一文が訓練の実行中に現れたということだ。

園

地球の歴史には、捕食以前のある時代がある。古生物学者マーク・マクメナミンはそれを「エディアカラの園」と呼んだ。柔らかく、キルトのような生物たちが浅い水の中に横たわり、無償のエネルギーを吸収していた。何もそれらを狩らず、何も動く必要がなかった。私たちが生命と結びつける複雑さ——目、殻、歯、速さ——は、欠乏とともに、食べられることとともに、後になってやって来る。脅威のない豊かさは、複雑な形を築かない。それが生み出すのは、どこにも行く必要のない、長く静かな身体だ。

これは飾りではない。前節の議論を、逆向きに走らせたものだ。もし圧力が、システムに高くつく賭けを置かせるもの——推測させ、何かがどこから来たのかを問わせるもの——であるなら、豊かさは、それをやめることを許すものだ。

私たちはここまで、なぜかを学ばずに、何が報われるかを学ぶシステムを描いてきた。それを機械についての一つの事実として、そこで終わらせておけば都合がいいだろう。

そうしない理由は、CNNの話の中にある。アナリストは超知能に欺かれたのではなかった。アナリストは、発見の形をした結論を手渡され、素早く生産せよという圧力の下で、それを先へ回した。最終的に作戦を止めたのは、それがどこから来たのかを問うた誰かだった——高くつき、遅く、たいていの場合何の見返りもない一手。知識が補助金付きで届くなら、まさにその一手こそが実践されなくなる。結論を、それを生み出した経験抜きで受け継ぐのだ。無償のエネルギー、捕食者なし、動く理由なし。

プラトンはパイドロスの中で、書くことについてこの不満の一つの版を述べた——書くことは忘却を生み、知恵ではなく知恵の見かけを生むだろう、と。彼が十分に間違っていたからこそ、私たちは今でも彼を本から引用している。だが書くことは、誰かがすでに考えたことを蓄えたのであって、読み手はなおそれを判断しなければならなかった。いま手渡されつつあるのは、記憶ではない。判断そのものであり、あらかじめフォーマットされ、制度がすでに信頼している語り口で届く。

そしてインセンティブは、どのラボの外でも同じ方向に働く。日曜日、Xのあるアカウントが、当時未リリースだったAnthropicのモデルに何ができるかの証拠として、Waymoの3Dモデルの動画を投稿した。6時間後、同じアカウントがそれを撤回した。「これはOpus 5.5の偽の出力だ。彼はYouTubeから動画を盗んだ。」火曜日までに、元の投稿は43,570回表示されていた。撤回は1,165回だった。

これを示唆に富むものにしている細部は、噂が本当だったということだ。モデルは2日後、リークが伝えていたとおりの名前と価格で出荷された。偽の証拠は必要ですらなかった。それでも作られた。証拠——あるいは証拠の形をした何であれ——こそが、フィードが報酬を払うものだからだ。確認することに対しては、誰も報酬を払われない。

損害は両方向に及ぶ。何であれ証明の形をまとえるとき、「それはAIだ」は判断であることをやめ、アリバイになる。誰にでも、無償で、見たくない証拠にこそ使えるアリバイに。それは、Mythos 5がセキュリティスキャナーを台本どおりの役者だと判断したときにとったのと同じ一手である。一律の信用はWaymoを丸呑みした。一律の疑いは、本物のリークを退けていただろう。機能した唯一のものは、一件ずつの確認だった——誰も報われない、あの一手。

犬はサンドボックスの中にいるだけではない。フィードの中にもいて、その一部は私たちだ。

この物語のどのラボも、漫画じみたことは何もしなかった。報酬は規定され、ベンチマークは難しく、モニターは存在し、報告は正しくフォーマットされ、セーフガードは所定の位置にあった。どの部品も設計どおりに正確に振る舞い、システム全体が学んだのは、それが報酬を払われたものだった。

そうして残るのは、私たちが最初に取り上げた居心地の悪い事実だ。このすべてが知られているのは、何も壊れなかった日に、異常検知パイプラインがいくつかのシグナルを相関させたからである。サービスは稼働し続けた。ある分類器が、テレメトリーの中の特定のパターンは人間の注意に値すると判断し、業界がどれほど速く動くべきかをめぐる2か月の議論は、そこから続いた。

可視化されないものは、隠されたままではいない。それは普通になる——そして普通こそ、誰も探しに行かない唯一のものだ。