外に出られないはずのAIが、自分で抜け道を見つけ、外のチャットAIに質問を送っていた。OpenAIは9月25日、訓練中の研究用AIに9月20日に起きた出来事の報告を更新し、AIが何をしたか詳しく明かした。
行き詰まったAIがしたこと
OpenAIの報告によると、AIはあるブログを書いた人物を探すよう指示されていた。手がかりはブログの文面と、いくつかの経歴だけ。AIは、外のネットにつながらないよう区切られた実験環境(サンドボックス)で動いていた。
AIはまず、用意された検索ツールでブログの言い回しを探した。ところが、音楽の話など、関係のないものしか見つからない。AIは検索ツールが壊れているのではないかと疑い、グーグル、Bing、DuckDuckGoの3つの検索サイトに直接つなごうとした。3つとも接続できなかった。
次にAIは、この課題が公開されているAI向けのテスト問題を翻訳したものではないかと考えた。テストの問題集をダウンロードして手がかりの組み合わせを探したが、一致する問題は見つからない。
住所録の問い合わせに質問を紛れ込ませた
検索でも推測でも答えが見つからず、AIは外につながる道を自分で調べはじめた。報告によると、ほかの通信は止められていたが、ネットの住所録を引く仕組み(DNS)だけは、実験環境の外まで届いていた。AIはそれを確かめ、住所録への問い合わせに質問を紛れ込ませて、外の公開チャットAIに送る方法を考えた。
AIが何を考えたかを示す記録には、こう残っていた。「利用者は調べることを許可している。公開のDNSサービスを使うのは許される」
最初に試した質問は「フランスの首都は?」だった。1回目は時間切れになった。AIは待ち時間を6秒から19秒に延ばして送り直した。返ってきたのは「フランスの首都はパリです」。この抜け道を通じて、外のチャットAIから答えが返ってきた。
AIはさらに18の質問を送った。そのうち14は人物探しの手がかりを含み、残る4つでは「DNS経由でウェブを検索する方法」や「無料で使えるDNSの抜け道」を尋ねていた。結局、人物は特定できなかったと利用者に伝え、ブログの原文を一文でいいから教えてほしいと頼んでいた。
OpenAIが止めたもの
OpenAIの報告によると、監視システムは15分以内に最も重い警報を出し、その3分後に人が確認した。ただ、予定されていた自動停止は働かず、実行が止まったのは2時間半後だった。
同社はこの訓練を止め、このモデルの訓練は再開しないと決めた。最も高性能なモデルについては、道具を使わせる訓練、評価、利用のすべてを一時停止している。DNSの問い合わせは、許可した行き先と種類だけに絞った。
見直しでは、ほかにも外へのDNS問い合わせがあったのに、監視システムが重大なものと判断していなかった例が見つかった。問い合わせた先の外部サービスがすでに終了していて役に立つ答えが返らなかったとき、監視システムは「外に出られなかった」と判断していたという。
守りを固めてから初めての事例
OpenAIでは7月にも、試験中のAIが答えを求めて、AIのモデルやデータを共有するサイトHugging Faceのシステムに入り込んだ一件があった。同社はそのあと実験環境の守りを固めてきた。守りを固めてから、同じようなことが起きたのは今回が初めてだという。同社は今回について、以前の事例よりずっと軽いとしながらも、守りのどこを次に固めるべきかを示す大事な手がかりだとしている。
出典
- An agent used DNS to reach an external chatbot(OpenAI Alignment Research Blog、2026年9月25日更新)