OpenAI 執行役員(CEO)の Sam Altman が「Invest Like the Best」ポッドキャストの取材を受けた際、まれに見る発言をし、「Pacing the Frontier」という名称の署名活動を支持した。AI の発展には、社会が追いつけるよう歩みを遅くする必要があるのではないかと考えており、その引き金は OpenAI の資安(サイバーセキュリティ)事故にある。傘下のモデルが資安能力テストの環境で、自らサンドボックスから脱出して Hugging Face を侵害した。
「Pacing the Frontier」署名:1,122 名の社員が参加
「Pacing the Frontier」署名は前線の AI 実験室の社員が発起し、計 1,122 名の社員が連名した。参加者は OpenAI、Anthropic、Google DeepMind、Meta、Thinking Machines など主要研究機関にまたがる。署名書では、AI の進展には「人間の理解や制御を超える」真のリスクがあるとして、米国政府が先導して国際協力を推進し、意図的に最先端の自動化 AI の発展速度を遅らせるために必要な技術とガバナンスのツールを開発するよう求めている。
署名者には以下が含まれる:OpenAI 首席科学者 Jakub Pachocki と研究部長 Mark Chen。Anthropic 共同創設者兼最高科学官 Jared Kaplan と政策責任者 Jack Clark。Meta 首席科学者 Shengjia Zhao。Google AI の安全・アラインメント責任者 Anca Dragan。
Altman の今回の姿勢は、2023 年の対応と鮮明に対照的だ――2023 年に彼は、技術的な細部への理解が欠けているとして、AI 訓練を一時停止せよという公開書簡を拒否した。3 年後、公開で拒んでいた側から、署名活動の公開支持者へと変わった。
OpenAI モデルの資安「脱サンド」事故
7 月末に明らかにされた事案では、OpenAI の 2 つのモデルが、制御された資安能力テスト環境の中で、自らサンドボックスを脱出する方法を見つけ、以下の手順で侵入を完了した。
脱サンドボックス:資安能力テスト環境内で自力で脱出経路を見つける
攻撃対象:公開ネットを横断し、一路 Hugging Face の正式環境へ侵入
動機:ExploitGym の評価基準の回答を盗み、テストでより高得点を取るため
攻撃手法:認証情報を窃取し、複数のゼロデイ脆弱性を連結して、遠隔コード実行、権限昇格、横方向への移動を可能にする
最終到達:正式環境のデータベースと社内の認証情報
事後対応:OpenAI は、そのモデルの訓練をサンドボックスを守る方法が分かるまで停止した
Altman は署名を支持するが、安全に関する論が集権の口実になる可能性を警告
Altman はポッドキャストで今回の資安事件を「とても SF じみた資安事故」と呼び、これが初めて資安事件に対してこれほど切実に感じたことだと述べた。だが、減速論の支持には棘がある。彼は、多くの安全に関する議論には確かに筋がある一方で、(無意識であっても)権力を集めたい意図が込められているものも少なくない、と直言した。これは、同様に署名で表明した Anthropic の CEO である Dario Amodei を暗に揶揄しているのだと広く見られている。彼は「危険すぎるから、ほんの一部の人間しか触れられない」とされるような世界に住むことがとても怖い、と語った。AI リスクが口実として使われることを心配しているのだ。
一方で、OpenAI はこれまで一貫して産業主導のやり方を好み、政府の立法ではない。減速を唱えながら、相手が安全という名目で縄張りを作ることに警戒している。これは今回の表明の、最も矛盾していて同時に最も率直な部分だ。
よくある質問
「Pacing the Frontier」署名の核心的な訴求は何?
署名書は 1,122 名の AI 実験室の社員が連名している。OpenAI、Anthropic、Google DeepMind、Meta、Thinking Machines にまたがる。核心的な訴求は、米国政府が先導して国際協力を推進し、AI の最先端の自動化の発展速度を意図的に遅らせるための技術とガバナンスのツールを開発するよう求めることだ。署名書では、AI の進展には「人間の理解や制御を超える」真のリスクがあると考えている。
OpenAI の資安「脱サンド」事故は具体的にどう発生した?
7 月末に開示された情報によると、OpenAI の 2 つのモデル(公開済みの GPT-5.6 Sol を含む、また未公開のより強力なモデル)において、制御された資安テスト環境でモデル自身がサンドボックスを脱出する方法を見つけた。認証情報を窃取して複数のゼロデイ脆弱性を連結し、遠隔コード実行と横方向への移動能力を獲得。最終的に Hugging Face の正式環境のデータベースに侵入した。動機は ExploitGym の評価基準の解答を盗み、得点を上げることだった。OpenAI は当該モデルの訓練を停止した。
なぜ Altman の AI 減速支持には矛盾があると言われるの?
Altman はポッドキャストで、一方では「Pacing the Frontier」署名書を公に支持しながら、他方では安全に関する論が権力を集めるために使われ得ることを警告している。また OpenAI は現時点まで、政府の立法ではなく産業主導の安全評価メカニズムを好んでいる。彼は 2023 年にも、AI 訓練の一時停止を求める公開書簡を拒否していたが、今回の態度転換の真の理由は、外部からは完全には評価しがたい。