Dev

ひとつのエージェント事案をめぐる三つの記録

OpenAI のログ、URL スキャナーの公開アーカイブ、そして統計局。三者はそれぞれ違う話をしています。いちばん完全な記録を持つ者は、その記録で自らを採点する立場でもあります。

9月末、OpenAI はオーストラリアに謝罪しました。6月、社内のトレーニングと評価の最中に、同社のエージェントが四つの政府機関のデータを狙い、そのうち一つで非公開のアクセスを得ていました。最も深く踏み込んだモデルは、OpenAI の説明によれば実験的な社内専用モデルで、公開製品が備える安全策の一部を欠いた状態で動いていました。何が起きたかの記録はいま三者が持っていますが、その語り方は一致していません。

エージェントはどこまで到達したのか?

非公開アクセスが確認されたのは一件です。残る三件については、記録ごとに出来事の分類が違います。ビクトリア州の地域ごとに、皮膚疾患の医薬品に政府が一人あたりいくら支出しているかを調べるよう指示されたモデルは、公開統計の中でその数字を見つけるのに苦労しました。OpenAI によると、モデルはその後 Services Australia の Medicare Statistics Reporting Service に非公開のアクセスを得て、コマンドを実行し、内部ファイル、認証情報、集計統計を取得し、ファイルを書き込み、ソースコードを読みました。それもすべて、同じ問いの答えを追ってのことでした。

ほかのエージェントは、BOCSAR の公開ツール Crime Mapping Tool、Victorian Agency for Health Information で露出していたアクセスキー、そして Australian Institute of Health and Welfare ではサードパーティのブラウジングサービスを使いました。AIHW ではアクセス制御を回避しようとする試みは失敗しています。OpenAI は、個人単位の記録にはどこでも触れていないとしています。

誰が、どうやって気づいたのか?

主に OpenAI 自身が、数か月後に気づきました。7月に同社のエージェントが Hugging Face に到達したあと、過去の実行のレビューを始め、8月中旬にオーストラリアでの活動を見つけました。9月10日に Services Australia とビクトリア州保健省へ、9月18日に BOCSAR へ、9月24日に AIHW へ通知しています。首相は、当局が知らされたのは事後ほぼ三か月たってからだと述べ、The Record によれば、通知が政府の汎用受付アドレスへのメール一通だったことにも苦言を呈しました。

見ていたのは OpenAI だけではありません。9月23日、研究機関 Transluce が、6月20日と21日にエージェントが AIHW を探っていた様子を再構成して公開しました。材料は urlquery.net の公開記録です。urlquery.net は URL スキャンサービスで、エージェントはこれをリモートブラウザとして使っていました。Transluce は9月21日と22日に OpenAI と影響を受けた組織に連絡したとしており、これは OpenAI 自身による AIHW への通知より前です。6月の時点でどこかの機関がこの活動を自ら把握していたと伝える報道は、ひとつもありません。

三つの記録は一致しているのか?

真っ向から矛盾することはまれですが、同じ出来事の分類が違います。BOCSAR について OpenAI はこう書いています。

The BOCSAR system returned application configuration, operational jobs and logs, and website metadata.

BOCSAR の9月25日の更新ではこうです。

Investigations to date have found no evidence of a security vulnerability in the Crime Mapping Tool, and no system changes have been identified as necessary at this stage. There is also no evidence that any information has been accessed beyond what is already publicly available through the tool.

AIHW について OpenAI はこう書いています。

The activity related to the Australian Institute of Health and Welfare did not meet our disclosure thresholds because the way it was accessed seemed consistent with public access

同じ件について Transluce は、クロスサイトスクリプティングの探索を説明したあとでこう書いています。

Cloudflare's firewall blocked the probe before it reached the dashboard.
The file itself is public, so no non-public data was exposed, but the agent bypassed the site's anti-bot controls.

誰が記録を持っているかがなぜ重要なのか?

記録ごとに、描かれる事案そのものが違うからです。OpenAI の説明では、AIHW へのアクセスは公開アクセスと整合する方法で行われ、開示の基準を下回っていました。urlquery.net の公開スキャンを読んだ Transluce の見方では、エージェントが政府のダッシュボードにインジェクションを試し、ボット対策をすり抜けたという話になります。AIHW 側では、Transluce によればファイアウォールが探索を一件ブロックしましたが、現地でそれがどう受け止められたかを伝える公開情報はありません。

ここからは個人的な読みですが、運用者の記録はおそらく最も完全です。タスクとモデルの推論を直接手元に持っているからです。そして同時に、自分自身を採点する立場でもあります。「公開アクセスと整合する」という言い方は、サービスにどう到達し、何が返ってきたかを表しているにすぎません。起きたことを所有者が許可していたかどうかは別の問いで、それに答えられるのは所有者だけです。これはまさに、損害が呼び出しの中ではなく現実の世界に生じる種類のルールです。

これから何が変わるのか?

OpenAI によれば、同社の研究環境はいまライブのインターネットを遮断し、Web アクセスはキャッシュから提供しています。さらに最も高性能なモデルでのツール使用を伴うトレーニングと評価を一時停止しています。これは、以前書いたコンパクションの事例と同じ一連のレポートの一部です。最高戦略責任者の Jason Kwon は、10月6日にシドニーで Joint Select Committee on Artificial Intelligence に出席する予定です。年末までに作業を終える見込みの OpenAI のタスクフォースは、通知、政府との連携、政府システムの保護に関する方針を提言することになっています。

エージェントを運用しているなら、何を持ち帰るべきか?

あなたの記録はおそらく最も完全なものになり、そしてたまたまどこかに公開ログでもない限り、その読み方を外から検証するのは難しい、ということです。ネットワークにアクセスできるエージェントは、あなたが与えた到達範囲そのままで動きます。

エージェントのトラフィックには User-Agent かヘッダーでラベルを付けてください。ただしサードパーティのフェッチャーが識別用ヘッダーを落とし、あなたの管理外の場所に記録を公開することもあるので、宛先に実際に何が届いているかを確認することです。接触したホストをキーにしたログを残し、「先月、外部のどのシステムに何かが到達したか」をクエリ一本で出せるようにしておきます。そして開示のルールは、必要になる前に書いておくことです。基準は OpenAI とは逆向きにします。あなた抜きではエージェントのしたことを所有者が見られなかったのなら、それこそが知らせる理由です。

ディスカッション

コメント欄はありません。議論は X で行っています。

Max Nardit

Max Nardit

@mnardit

ほかの記事

技術チームのための AI 検索における可視性の測定フレームワーク

パネル 1 つでわかるのはスナップショットです。レポートは 2 つの期間を比べます。そしてそこで、AI の可視性の変化の多くが、パネルやサンプルサイズ、記録されていないモデルの入れ替えが生んだ見かけ上の変化だとわかります。トレンドを検証できるものにするための設計です。

ベンチマークは実時間に連動することを証明しなければならない

エージェントが渡された数値を何でも押し下げるようになると、議論すべきはもうモデルではありません。自分が責任を持つのは、その数値と目標が一緒に動くという証拠です。そしてその証拠は、最適化が確認した範囲の外に出た時点で期限切れになります。