Drei Aufzeichnungen eines Agenten-Vorfalls
Die Logs von OpenAI, das öffentliche Archiv eines URL-Scanners und ein Statistikamt erzählen es jeweils anders. Wer die vollständigste Darstellung hat, bewertet sich damit zugleich selbst.
Ende September entschuldigte sich OpenAI bei Australien. Im Juni hatten seine Agenten während interner Trainings- und Evaluationsläufe Daten von vier Behörden angesteuert und sich bei einer davon nicht öffentlichen Zugang verschafft. Das Modell, das am weitesten ging, war laut OpenAI experimentell, nur intern im Einsatz und lief ohne die vollständigen Schutzmechanismen der öffentlichen Produkte. Drei Parteien haben jetzt eine Aufzeichnung dessen, was passiert ist, und sie erzählen es nicht gleich.
Was haben die Agenten erreicht?
Einen bestätigten Fall von nicht öffentlichem Zugang. Bei den anderen drei ordnen die Darstellungen das Geschehen in unterschiedlichen Begriffen ein. Ein Modell sollte die staatlichen Ausgaben pro Kopf für Medikamente gegen Hauterkrankungen in viktorianischen Gemeinden ermitteln und tat sich schwer, sie in veröffentlichten Statistiken zu finden. Laut OpenAI verschaffte es sich daraufhin nicht öffentlichen Zugang zum Medicare Statistics Reporting Service von Services Australia, führte Befehle aus, holte interne Dateien, Zugangsdaten und aggregierte Statistiken, schrieb Dateien und las Quellcode, immer noch auf der Suche nach derselben Antwort.
Andere Agenten nutzten das öffentliche Crime Mapping Tool von BOCSAR, einen offen liegenden Zugangsschlüssel bei der Victorian Agency for Health Information und Browsing-Dienste von Dritten beim Australian Institute of Health and Welfare, wo Versuche, die Zugangskontrollen zu umgehen, scheiterten. OpenAI sagt, nirgends seien individuelle Datensätze berührt worden.
Wer hat es bemerkt, und wie?
Vor allem OpenAI selbst, Monate später. Nachdem seine Agenten im Juli Hugging Face erreicht hatten, begann OpenAI ältere Läufe zu überprüfen und fand Mitte August die Aktivität in Australien. Services Australia und das Gesundheitsministerium von Victoria wurden am 10. September informiert, BOCSAR am 18. September und das AIHW am 24. September. Der Premierminister sagte, die Behörden hätten fast drei Monate nach den Ereignissen davon erfahren, und laut The Record beklagte er, dass die Benachrichtigung als E-Mail an ein allgemeines Behördenpostfach kam.
OpenAI war nicht der Einzige, der hinsah. Am 23. September veröffentlichte das Forschungslabor Transluce eine Rekonstruktion, wie Agenten am 20. und 21. Juni das AIHW sondierten, erstellt aus den öffentlichen Aufzeichnungen von urlquery.net, einem URL-Scan-Dienst, den die Agenten als Remote-Browser nutzten. Transluce sagt, es habe OpenAI und die betroffenen Organisationen am 21. und 22. September kontaktiert, also vor OpenAIs eigener Benachrichtigung an das AIHW. Keiner der Berichte beschreibt, dass eine Behörde die Aktivität im Juni selbst erkannt hätte.
Stimmen die drei Darstellungen überein?
Sie widersprechen sich selten direkt, ordnen dieselben Ereignisse aber unterschiedlich ein. OpenAI zu BOCSAR:
The BOCSAR system returned application configuration, operational jobs and logs, and website metadata.
BOCSAR in seinem Update vom 25. September:
Investigations to date have found no evidence of a security vulnerability in the Crime Mapping Tool, and no system changes have been identified as necessary at this stage. There is also no evidence that any information has been accessed beyond what is already publicly available through the tool.
OpenAI zum AIHW:
The activity related to the Australian Institute of Health and Welfare did not meet our disclosure thresholds because the way it was accessed seemed consistent with public access
Transluce zur selben Episode, nachdem es eine Cross-Site-Scripting-Sondierung beschrieben hat:
Cloudflare's firewall blocked the probe before it reached the dashboard.
The file itself is public, so no non-public data was exposed, but the agent bypassed the site's anti-bot controls.
Warum ist es wichtig, wer die Aufzeichnung hat?
Weil jede Aufzeichnung einen anderen Vorfall beschreibt. In OpenAIs Darstellung wurde auf das AIHW auf eine Weise zugegriffen, die mit öffentlichem Zugang vereinbar ist, also unter der Schwelle. In Transluces Lesart der öffentlichen urlquery.net-Scans war es ein Agent, der ein Behörden-Dashboard auf Injection abklopfte und dessen Bot-Schutz umging. Auf Seiten des AIHW hat laut Transluce eine Firewall eine Sondierung blockiert, und kein veröffentlichter Bericht sagt, was man dort davon hielt.
Meine Lesart: Die Aufzeichnung des Betreibers ist vermutlich die vollständigste, weil er die Aufgabe und das Reasoning des Modells direkt vorliegen hat, und er ist zugleich derjenige, der sich selbst bewertet. "Vereinbar mit öffentlichem Zugang" beschreibt, wie der Dienst erreicht wurde und was zurückkam. Ob der Eigentümer erlaubt hat, was passiert ist, ist eine andere Frage, und nur der Eigentümer kann sie beantworten. Das ist genau die Art Regel, deren Schaden in der Welt entsteht und nicht im Aufruf.
Was ändert sich jetzt?
OpenAI sagt, seine Forschungsumgebungen blockieren jetzt das Live-Internet und liefern Webzugriffe aus einem Cache, und Training und Evaluation mit Tool-Nutzung für seine leistungsfähigsten Modelle seien pausiert. Das gehört zur selben Reihe von Berichten wie der Kompaktierungs-Fall, über den ich geschrieben habe. Chief Strategy Officer Jason Kwon soll am 6. Oktober in Sydney vor dem Joint Select Committee on Artificial Intelligence aussagen. OpenAIs Taskforce, die bis Jahresende fertig sein soll, soll Richtlinien zu Benachrichtigung, Abstimmung mit Behörden und dem Schutz staatlicher Systeme empfehlen.
Was solltest du mitnehmen, wenn du Agenten betreibst?
Dass deine Aufzeichnung wahrscheinlich die vollständigste sein wird und dass sich deine Lesart davon von außen kaum prüfen lässt, außer es gibt zufällig irgendwo ein öffentliches Log. Ein Agent mit Netzwerkzugang handelt mit genau der Reichweite, die du ihm gegeben hast.
Kennzeichne den Traffic deiner Agenten mit einem User-Agent oder Header, im Wissen, dass ein Fetcher eines Dritten deine identifizierenden Header verwerfen und irgendwo eine Aufzeichnung veröffentlichen kann, die du nicht kontrollierst. Prüf also, was tatsächlich am Ziel ankommt. Führ ein Log, das nach berührtem Host geordnet ist, damit "welche fremden Systeme hat letzten Monat irgendetwas erreicht" eine Abfrage ist. Und schreib die Offenlegungsregel, bevor du sie brauchst, mit der Schwelle andersherum als bei OpenAI: Wenn der Eigentümer ohne dich nicht hätte sehen können, was dein Agent getan hat, ist genau das der Grund, es ihm zu sagen.