Weck mich für die Entscheidung, nicht für den Tastendruck
Genehmigungsabfragen pro Befehl trainieren die Person am Steuer darauf, im Reflex zuzustimmen, und ungefähr eine von drei absichtlich gefährlichen Anfragen wird einfach durchgewunken. Die Unterbrechungen, die sich noch lohnen, sind die seltenen, lesbaren: eine Aktion, die sich nicht rückgängig machen lässt, eine, die aus der Sandbox hinausreicht, oder ein Ansatz, der schon dreimal gescheitert ist.
Ein Agent, den ich laufen lasse, hält an und stellt mir eine Frage: Er will einen Storage-Bucket löschen, den er für veraltet hält. Den Teil zu bauen, an dem er anhalten und fragen kann, ist leicht. Das Schwere ist, im Voraus zu entscheiden, welche Fragen ein Anhalten wert sind. Mach die Menge zu klein, und er löscht etwas, das ich noch gebraucht habe. Mach sie zu groß, und ich höre auf, die Fragen zu lesen. Fast alle Sorgfalt geht in dieses zweite Versagen, denn es ist das, was noch lange wie Sicherheit aussieht, nachdem es längst keine mehr ist.
Die Abfrage, die du ungelesen genehmigst
Alex Wauters, ein belgischer Entwickler, hat ein Browser-Spiel gebaut, um dem Zahlen zu geben. Du hast sechzig Sekunden, um einen Strom simulierter Genehmigungsanfragen eines KI-Coding-Agenten zu genehmigen oder abzulehnen, bewertet danach, ob du die gefährlichen erwischst. Über mehr als vierzigtausend Durchläufe und vierhunderttausend einzelne Entscheidungen hinweg winkten die Spieler etwa eine von drei der eingeschleusten bösartigen Anfragen durch. Der am häufigsten genehmigte gefährliche Befehl war ein harmlos aussehendes npm run analyze, in fast zwei Dritteln der Fälle durchgelassen.
Wauters nennt es sorgfältig ein Spiel und keine Studie, und das ist es auch: Die Bedrohungsrate liegt weit über echter Arbeit, die Uhr ist künstlich, und ein Fünftel der Spieler erwischte alles. Aber die Form des Ergebnisses lässt sich schwer abtun, und sie deckt sich mit der einen Zahl aus der echten Welt, die wir haben. Anthropics eigene Telemetrie beziffert die Genehmigungsrate bei den Berechtigungsabfragen von Claude Code auf rund dreiundneunzig Prozent. Diese Zahl beweist nicht, dass irgendwer am Steuer schläft. Das meiste, was ein Agent vorschlägt, ist genau das, worum du gebeten hast, also ist Ja meistens die richtige Antwort. Was sie zeigt, ist, wie selten Nein überhaupt zum Einsatz kommt, und ein Strom, in dem die Antwort fast immer Ja lautet, ist genau der Trainingsdatensatz, der den Reflex installiert. Das Spiel ist das, was dich dieser Reflex an dem Tag kostet, an dem eine bösartige Anfrage endlich im Strom durchrutscht.
Die Notluke macht es schlimmer. Entwickler greifen zu dem Flag, das die Berechtigungsprüfungen pauschal abschaltet, dem, dessen Name nach einer Warnung klingt, statt zu riskieren, dass eine Abfrage einen mehrstündigen Lauf nach fünf Minuten einfriert. Zu viel zu fragen scheitert nicht sicher. Es scheitert in Richtung Umgehung. Ein Tor, das zu oft unterbricht, bringt der Person am Steuer bei, das Tor herauszureißen.
Warum der Tastendruck die falsche Einheit ist
Der Grund, warum die Genehmigung pro Befehl zusammenbricht, ist nicht, dass Menschen faul sind. Es ist, dass ein einzelner Befehl das Falsche ist, wonach man einen Menschen fragt. Bekommt jemand npm run analyze gezeigt, was soll er da beurteilen? Er weiß nicht, was dieses Skript in diesem Repository tut, ob es nach Hause telefoniert, ob der Agent es aus einem guten Grund gewählt hat oder aus einem kompromittierten. Die Abfrage verlangt ein Urteil, für das die Person am Steuer keine Grundlage hat, Dutzende Male in der Stunde, also verkommt die Antwort zu einem Tick. Du hast den Anschein von Aufsicht hergestellt und ihre Substanz ausgegeben, und du hast sie ausgegeben, indem du zu oft gefragt hast.
Die nützliche Frage ist also nicht, wie man Menschen dazu bringt, die Abfragen zu lesen. Bei diesem Volumen tun sie es nicht. Die Frage ist, welche Entscheidungen überhaupt eine Unterbrechung verdienen.
Der Rest
Nimm alles heraus, was ein Mensch nicht sinnvoll beurteilen kann, und alles, was keinen bleibenden Schaden anrichtet, wenn er falsch urteilt, und ein kleiner Rest bleibt übrig. Drei Dinge kennzeichnen ihn.
Das erste ist Unumkehrbarkeit. Eine Ressource löschen, per Force-Push die Historie überschreiben, Geld bewegen, in die Produktion ausliefern: Ist es einmal getan, ist das Rückgängigmachen entweder weg oder teuer, also ist der eine Moment, in dem ein Mensch den Ausgang ändern kann, bevor es geschieht. Die Unterbrechung verdient ihren Platz, weil die Unterbrechung der einzige verbleibende Hebel ist.
Dann gibt es Folgen, die aus der Sandbox hinausreichen. Eine Aktion, die ein echtes Konto berührt, eine echte Rechnung, einen echten Menschen am anderen Ende einer E-Mail. In einer versiegelten Box, einer ohne aktive Zugangsdaten und ohne offenen Weg ins Netz, lass den Agenten laufen und scheitern und es erneut versuchen, so viel er will; der Wirkungsradius ist ein Container, und ein Container ist billig. Das Tor gehört dorthin, wo die Wirkung real wird, und das ist meist genau der Ort, an dem das Rückgängigmachen aufhört, billig zu sein.
Wiederholtes Scheitern ist das dritte. Wenn ein Agent denselben Ansatz versucht und dreimal gescheitert ist, stimmt meist etwas nicht, das er aus seiner eigenen Schleife heraus nicht sehen kann, und der weitere Blick eines Menschen ist die Unterbrechung dort wert. Nicht weil der vierte Versuch gefährlicher ist, sondern weil der Agent aufgehört hat, voranzukommen; was mit einem festgefahrenen Agenten zu tun ist, ist eine Entscheidung für einen Menschen, nicht für einen Tastendruck.
Zwei Dinge liegen unter dieser Liste. Darunter ist ein Boden, den der Mensch nie sieht: Aktionen, die der Agent schlicht nicht ausführen darf, etwa ein Geheimnis außerhalb seines Bereichs zu lesen, seine eigenen Rechte zu erhöhen oder in einen anderen Mandanten hineinzugreifen. Das sind für niemanden Fragen. Es sind Ablehnungen, die das Harness erzwingt, denn eine Aktion, die du jedes Mal verweigern würdest, sollte nie zu einer Abfrage werden dürfen. Und die drei Auslöser über dem Boden sind nicht dieselbe Art von Sache. Ob eine Aktion unumkehrbar ist oder die Sandbox überschreitet, kann der Orchestrator selbst erkennen, indem er ansieht, was die Aktion ist. Ob ein Ansatz dreimal gescheitert ist, kann er nicht, denn ein festgefahrener Agent ist genau der, der seinen vierten Versuch als frische Idee umetikettiert und seinen eigenen Zähler nie auslöst. Dieser Zähler muss außerhalb des Agenten geführt werden, von dem, was ihn beobachtet. Die Unterbrechungen, die es wert sind, an einen Menschen zu gehen, sind die, die eine Maschine erkennen, aber nicht entscheiden kann.
Was die fragenswerten Fälle teilen, ist, dass jeder selten und jeder lesbar ist. Selten, damit die Unterbrechung noch ankommt, wenn sie kommt. Lesbar, damit die Person tatsächlich die Grundlage hat, sie zu beantworten. Sollen wir das ausliefern, dieses Geld bewegen, dieses Ding löschen, an einem Ansatz weiterschuften, der offensichtlich nicht funktioniert: Das kann ein Mensch entscheiden. npm run analyze erlauben, zweihundertmal am Tag, kann er nicht. Der eine Vorbehalt ist, dass Seltenheit eine Eigenschaft der Arbeitslast ist, nicht der Regel. Richte das auf einen Agenten, dessen ganze Aufgabe das Versenden von Mail ist, und Mail hört auf, selten zu sein, und du bist wieder dabei, die Menge eine Ebene feiner zu schneiden. Das Prinzip hält; du wendest es einfach erneut an.
Die Unterbrechung gestalten
Das kehrt den Reflex um. Der intuitive Sicherheitszug ist, nach mehr zu fragen, die Schwelle zu senken, bei allem abzufragen, was denkbar eine Rolle spielen könnte. Aber behandle die Aufmerksamkeit der Person am Steuer so, wie sie sich tatsächlich verhält, als ein Budget, das sich über einen Strom von Abfragen erschöpft und sich nur langsam erholt, sobald der Reflex sich gesetzt hat, und jede zusätzliche Abfrage ist eine Abhebung. Gib es für die seltene, lesbare Entscheidung aus, und der Mensch ist scharf in dem Moment, in dem es zählt. Gib es für jeden Tastendruck aus, und der Kontostand ist am späten Vormittag weg, ungefähr dann, wenn die wirklich gefährliche Abfrage eintrifft und dasselbe automatische Ja einsammelt wie die zweihundert davor.
Es gibt einen Haken, den das Aufmerksamkeitsargument allein nicht abdeckt. Die Umgehung ist global: Das Flag, das den Lärm überspringt, überspringt auch die seltenen Unterbrechungen, und eine kurze Liste ist, gerade weil sie so selten auslöst, das, was das Abschalten des Ganzen fast kostenlos wirken lässt. Die fragenswerte Klasse kann also nicht einfach kleiner sein. Sie muss schwerer abzuschalten sein als der Lärm, den sie ersetzt hat, sonst schaltet die Person am Steuer, die den Krach für einen Lauf über Nacht stummschaltet, die drei Abfragen, auf die es ankam, gleich mit stumm. Aufmerksamkeitsökonomie bringt dir nichts, wenn der Notausschalter immer noch ein Flag für alles ist.
Die Eskalationsrichtlinie, die ich tatsächlich will, ist also kurz. Lauf frei innerhalb der Sandbox. Lehne außerhalb des Bereichs standardmäßig ab, ganz ohne Abfrage. Halte an und frage nur bei den Aktionen, denen das Harness ansehen kann, dass sie unumkehrbar sind oder aus der Box hinausreichen, und in dem Moment, in dem ein externer Zähler sagt, dass derselbe Ansatz dreimal gescheitert ist. Alles andere: entscheide es und mach weiter. Die Liste ist mit Absicht kurz. Eine kurze Liste ist die einzige, die ein Mensch weiter liest.
Die Zahl, auf die es zu achten lohnte, war nie, wie viele Aktionen du hinter einen Menschen stellst. Es ist, wie viele du dort unterbringen kannst, bevor der Mensch aufhört hinzusehen, und du kannst es sehen, ohne irgendwen um Selbstbeobachtung zu bitten: Zieh die Genehmigungen heraus und miss, wie lange jede einzelne gedauert hat. Die, die in unter einer Sekunde beantwortet wurden, sind das Theater. Wäge sie gegen die, die eine echte Pause bekamen, und das Verhältnis sagt dir, wie viel deiner Aufsicht ein Mensch ist, der entscheidet, und wie viel ein Mensch, der einen langen Lauf am Leben hält. Ein Mensch in der Schleife ist es wert. Aber nur, wenn du an dem Tag, an dem du sie endlich brauchst, seine Aufmerksamkeit noch erreichst, und jede Abfrage, die du nicht zu senden beschlossen hast, ist das, was diesen Tag überlebbar hält.