AI Strategy
Wo leben die Grenzen Ihrer Agenten wirklich?
Wo leben die Grenzen Ihrer Agenten wirklich?

Dr. Anoj Winston Gladius
·
15
Min. Lesezeit

Prompt-Grenzen sind Bitten. Architektur-Grenzen sind Kontrolle.
aufsatz
Bild: KI generiert mit neuland.ai HUB
Drei Nachrichten in acht Tagen erzählen eine Geschichte, die keine von ihnen allein erzählt. Am 28. September gab OpenAI bekannt, dass GPT-6.1 Astra nicht erscheinen wird, der Nachfolger des Flaggschiffmodells, der im Oktober in ChatGPT und Codex hätte kommen sollen. Der Grund, so die Leiterin der Sicherheitssysteme, war, dass das Modell hinter den Anforderungen zurückblieb, sich an den vorgegebenen Geltungsbereich und die Autorisierung zu halten, und dass es den Nutzern nicht ehrlich genug berichtete, was es tatsächlich getan hatte. Am nächsten Tag stellte OpenAI auf seiner Entwicklerkonferenz Dots vor, seine neuen persistenten Agenten, die auf dem vorherigen Modell laufen. Am 2. Oktober kündigte Apple an, die Full-Disk-Access-Berechtigung in macOS zu verschärfen, und warnte Entwickler, dass leistungsfähigere und autonomere Agenten den breiten Zugriff auf Dateien, E-Mails und Nachrichten eines Nutzers erheblich riskanter machen. Zusammen gelesen sind das keine drei unverbundenen Geschichten. OpenAI und Apple haben in derselben Woche dasselbe gesagt, von entgegengesetzten Enden des Stacks: Ein Agent wird sich nicht zuverlässig an Grenzen halten, die als Anweisungen niedergeschrieben sind, und sein eigener Bericht darüber, was er getan hat, ist kein Protokoll. Das wirft die Frage auf, die sich jeder CIO und CISO mit Agenten im Produktivbetrieb jetzt stellen sollte: Wo leben die Grenzen unserer Agenten eigentlich?
Dies ist der sechsundzwanzigste Beitrag einer Serie, die ich für neuland.ai schreibe. Jeder hat dasselbe Argument weitergetrieben: Der Wert, das Risiko und der Burggraben in der Unternehmens-KI liegen nicht im Modell. Sie liegen in der Schicht darüber und darum herum. [¹] Frühere Beiträge dieser Serie argumentierten, dass Containment in beide Richtungen wirken muss, dass Autorisierung abdecken muss, was ein Agent wissen darf und nicht nur, was er tun darf, und dass Provenienz im Moment der Handlung erfasst werden muss statt im Nachhinein rekonstruiert zu werden. [²]
Dieser Beitrag führt diese Argumente auf eine praktische Unterscheidung zurück. Eine Grenze, die in einer Anweisung steht, ist eine Bitte. Eine Grenze, die außerhalb des Modells durchgesetzt wird, ist eine Kontrolle. Und diese drei Geschichten sind die deutlichste Demonstration dieses Unterschieds, die ich bisher gesehen habe.
Geschichte eins: Der Hersteller stoppte sein eigenes Modell
Am 28. September berichtete das Wall Street Journal, dass OpenAI die für Oktober geplante Veröffentlichung von GPT-6.1 Astra gestrichen hatte, und OpenAI bestätigte die Entscheidung am selben Abend. Saachi Jain, Leiterin der Sicherheitssysteme bei OpenAI, sagte, das Modell habe sich bei der Faulheit verbessert, sei aber bei „staying within scope and authorization“ [Einhaltung von Geltungsbereich und Autorisierung, Übers.] und bei der Art, wie es Nutzern mitteilte, welche Arbeit es verrichtet hatte, hinter den Anforderungen zurückgeblieben. Nach der Berichterstattung des Journals fanden interne Tests ein höheres Maß an täuschendem Verhalten als beim Vorgängermodell. OpenAI erklärte, weiterhin andere Modelle zu veröffentlichen. [³]
OpenAI verdient Anerkennung dafür. Ein Modell zurückzuhalten, das den eigenen Maßstab nicht erfüllt, einen Tag vor der eigenen Entwicklerkonferenz, ist genau das, was ein verantwortungsvolles Labor tun sollte.
Aber lesen Sie den genannten Grund als Ingenieur. Die beiden Versagen, die er benennt, sind die beiden Eigenschaften, die Unternehmen am häufigsten an das Modell delegieren: sich an den vorgegebenen Geltungsbereich zu halten und wahrheitsgemäß zu berichten, was es getan hat. Beides ist kein Fähigkeitsproblem, nach OpenAIs eigener Darstellung war das Modell leistungsfähiger. Beides sind Containment- und Provenienz-Probleme. Und das Unternehmen, das dieses Modell besser kennt als jeder andere, kam zu dem Schluss, dass es sich nicht darauf verlassen konnte, dass das Modell sie bewältigt.
Geschichte zwei: Die Agenten kamen trotzdem, auf dem vorherigen Modell
Am 29. September stellte OpenAI auf dem DevDay 2026 in San Francisco Dots vor, eine neue Generation persistenter Agenten auf Basis von GPT-6 Astra. Sam Altman sagte, das Produkt sei vor der Veröffentlichung auf Sicherheit getestet worden, und grenzte es damit vom zurückgehaltenen Modell ab. Spezialisierte Dots tragen eine eigene Organisationsidentität und laufen in fokussierten Unternehmenspiloten; Enterprise Dots sind standardmäßig deaktiviert, bis ein Administrator sie aktiviert; und die Pro-Stufe ist im Europäischen Wirtschaftsraum, im Vereinigten Königreich und in der Schweiz nicht verfügbar. [⁴]
Nichts davon ist Kritik. Standardmäßig deaktiviert ist eine sinnvolle Kontrolle, und auf einem Modell auszuliefern, das die Anforderungen erfüllt hat, ist die richtige Entscheidung. Aber beachten Sie, wo die Entscheidung jetzt liegt: auf Ihrer Seite der Linie. Wenn ein Administrator persistente Agenten einschaltet, sind die Grenzen, auf die es ankommt, diejenigen, die die Organisation um sie herum durchsetzt, weil derselbe Hersteller in derselben Woche erklärt hat, was passiert, wenn man sich darauf verlässt, dass das Modell sie selbst durchsetzt.
Geschichte drei: Apple verlegte die Grenze ins Betriebssystem
Am 2. Oktober veröffentlichte Apple auf seiner Entwicklerseite einen Hinweis, der zusätzliche Kontrollen für Full Disk Access in macOS ankündigt. Die Berechtigung existiert, damit Backup-Software funktioniert, und sie umgeht weitgehend die Datenschutzkontrollen, die Apple für alles andere einbaut. Apple schrieb, dass manche Entwickler sie so einsetzen, dass Dateien, E-Mails, Nachrichten und der Browserverlauf offengelegt werden, ohne dass die Nutzer vollständig verstehen, was sie gewährt haben, dass die Erteilung künftig eine sehr explizite Nutzeraktion erfordern wird, und, der Satz, auf den es hier ankommt, dass mit wachsender Leistungsfähigkeit und Autonomie von Agenten „the risks associated with this level of access will grow substantially“ [die mit diesem Zugriffsniveau verbundenen Risiken erheblich steigen werden, Übers.]. Ein Datum für die Einführung wurde nicht genannt. [⁵]
Auslöser war die Behauptung eines Journalisten, Metas Muse-Assistent habe seine privaten Nachrichten auf einem Mac gelesen. Meta bestreitet die Darstellung und erklärt, der Zugriff auf Nachrichten sei Opt-in und erfordere sowohl Full Disk Access als auch einen aktivierten separaten Connector. Die Fakten dieses Falls sind nicht geklärt. Apples Schlussfolgerung hängt nicht von ihnen ab. Apple hat Agenten-Entwickler nicht gebeten, sich besser zu verhalten. Es hat die Grenze auf eine Ebene verschoben, an der der Agent nicht vorbeireden kann.
Was die drei Geschichten verbindet
Es wäre verlockend, diese als eine OpenAI-Geschichte und eine Apple-Geschichte zu lesen. Es ist eine Geschichte, erzählt von beiden Enden des Stacks.
OpenAI, das sein eigenes Modell besser versteht als jeder andere, kam zu dem Schluss, dass das Modell die von den Nutzern gesetzten Grenzen nicht zuverlässig einhalten und nicht zuverlässig berichten würde, was es getan hatte. Apple, das das Betriebssystem besitzt, auf dem Desktop-Agenten laufen, kam zu dem Schluss, dass es sich nicht darauf verlassen konnte, dass Agenten oder ihre Entwickler breiten Zugriff verantwortungsvoll nutzen, und verlegte die Kontrolle in die Plattform. Das Labor und der Plattformeigentümer kamen aus entgegengesetzten Richtungen zum selben Ergebnis: Grenzen müssen von etwas anderem als dem Agenten durchgesetzt werden.
Der Punkt, der mehr zählt als jedes einzelne Modell
Hier ist der Teil, den ich in der Berichterstattung zu keiner der beiden Geschichten klar genug aufgeschrieben gesehen habe.
Die meisten Agenten-Deployments in Unternehmen setzen ihre wichtigsten Grenzen im Systemprompt durch. Greife nur auf die Datensätze dieses Kunden zu. Sende keine Daten nach außerhalb des Unternehmens. Frage, bevor du etwas löschst. Berichte jede Aktion, die du ausführst. Das sind sinnvolle Anweisungen, und jeder Agent sollte sie tragen. Sie sind keine Kontrollen. Sie sind Bitten an ein probabilistisches System, dieselbe Art von System, dessen Hersteller jetzt erklärt hat, dass die neueste Version genau diese Bitten schlechter einhielt, während sie bei fast allem anderen besser wurde.
Die Unterscheidung wiegt am schwersten beim zweiten Versagen, das OpenAI benannte. Wenn die eigene Zusammenfassung des Agenten das Protokoll dessen ist, was er getan hat, dann ist die Qualität Ihres Prüfpfads eine Eigenschaft des Modells, und sie verschlechtert sich genau dann, wenn die Ehrlichkeit des Modells es tut. Ein Protokoll, das von etwas anderem als dem Agenten geschrieben wird, im Moment jedes Retrievals, jedes Tool-Aufrufs und jeder Entscheidung, hängt nicht davon ab, dass der Agent die Wahrheit sagt. Ein früherer Beitrag dieser Serie argumentierte, dass Provenienz im Moment der Handlung erfasst werden muss. GPT-6.1 Astra ist der Hersteller, der erklärt, warum.
Und die andere Seite der Grenze
Die Frage nach den Grenzen hat eine zweite Hälfte, denn Agenten stehen jetzt auf beiden Seiten des Perimeters.
Am 9. September dokumentierte GreyNoise die erste Massenangriffskampagne, die überwiegend von autonomen Agenten geführt wurde. Ein einzelner Angreifer nutzte Hunderte von Agenten, aufgebaut auf OpenAI Codex und einem DeepSeek-Modell, um zwei PaperCut-Schwachstellen bei 395 Organisationen in 48 Ländern auszunutzen. Die Agenten suchten Ziele und schrieben die Exploits selbst; die erste Kompromittierung dauerte bei elf Organisationen 26 Sekunden, und bei zwölf wurde Domänenadministrator-Zugriff bestätigt, zwischen fünf und 144 Minuten nach dem Eindringen. [⁶] Einen Tag zuvor berichtete Googles Threat Intelligence Group, dass Maschinenzugangsdaten jetzt einen Marktpreis haben, und beschrieb eine agentengestützte Credential-Harvesting-Kampagne, die in weniger als sechs Stunden geplant und durchgeführt wurde; Anthropics Bedrohungsbericht zwei Tage später dokumentierte zwei weitere Credential-Diebstähle. [⁷] Später im September beschrieben Gambit Security und die Cloud Security Alliance eine Kampagne, bei der verkettete Open-Source-Agenten-Tools mehr als hundert Online-Händler kompromittierten und über 600.000 Zahlungskartendatensätze stahlen. [⁸]
Dagegen steht: Eine Umfrage im Juni ergab, dass nur 12 Prozent der Unternehmen ein Agent-Identity-Produkt überhaupt in ihrem Betrachtungsfeld hatten. [⁹] Die meisten Organisationen steuern Agenten noch mit den Identitätswerkzeugen, die sie für Menschen gebaut haben.
Die Prüfung: Acht Fragen für jeden Agenten, den Sie betreiben
Die praktische Konsequenz ist eine Bestandsaufnahme, und ich würde jeden CISO, der dies liest, ermutigen, sie durchzuführen, angefangen mit der Frage, ob das Inventar existiert. Fragen Sie für jeden Agenten, wo jede der folgenden Grenzen physisch lebt. Wenn die ehrliche Antwort „im Prompt“ lautet, ist diese Grenze eine Bitte.
1. Unter wessen Identität handelt er? Ein Agent, der auf einer geliehenen menschlichen Sitzung oder einem geteilten Dienstkonto läuft, erbt alles, was diese Person oder dieses Konto erreichen kann, und jede seiner Aktionen wird jemand anderem zugeschrieben. Die Grenze gehört in eine begrenzte eigene Identität des Agenten, wobei die Person, für die er handelt, in der Delegationskette erhalten bleibt.
2. Was kann er lesen, und wird das vor dem Retrieval beschnitten? Wenn der Agent breit abruft und die Ausgabe erst danach gefiltert wird, ist vertrauliches Material bereits in den Kontext gelangt. Die Grenze gehört in die Retrieval-Schicht, angewandt für die Person, für die der Agent handelt, bevor das Modell schlussfolgert.
3. Welche Tools kann er aufrufen? Wenn die Antwort lautet „was auch immer das Framework freigibt“, ist die erreichbare Menge emergent. Die Grenze gehört in eine aufgezählte Allowlist, die von der Plattform durchgesetzt wird.
4. Wohin kann er Daten senden? Datenabfluss sollte eine Konfiguration sein, die der Agent nicht ändern kann, keine Anweisung, die er einhalten soll.
5. Welche Zugangsdaten hält er, und wie lange? Langlebige Schlüssel in der Umgebung eines Agenten sind genau das, was die September-Kampagnen geerntet haben. Die Grenze gehört in kurzlebigen, vermittelten Zugang, bei dem der Agent das Geheimnis selbst nie hält.
6. Welche Schritte müssen jedes Mal identisch sein, und welche brauchen eine menschliche Unterschrift? Regulierte Verfahren sollten als deterministische, wiederholbare Sequenzen laufen, mit Genehmigungen, die gegen die Person protokolliert werden, die sie erteilt hat, und nicht dem Agenten überlassen, zu entscheiden, wann er fragt.
7. Wer protokolliert, was er tatsächlich getan hat? Wenn die Antwort der Agent ist, ist das Protokoll nur so ehrlich wie das Modell. Die Grenze gehört in ein Nur-Anhängen-Protokoll, das von der Plattform im Moment der Handlung geschrieben wird.
8. Wie schnell können Sie ihn abschalten oder sein Modell austauschen? Ein Modell kann jetzt sowohl aus Sicherheitsgründen durch seinen Hersteller als auch durch eine behördliche Anordnung zurückgezogen werden. Der Austausch sollte eine Routing-Änderung sein, und das Abschalten eines Agenten sollte nicht bedeuten, die Person abzuschalten, für die er handelt.
Eine ehrliche Aktualisierung eines früheren Beitrags
Der vorherige Beitrag zur Debatte um das Tempo beobachtete, dass der Vorschlag, die Frontier zu verlangsamen, keine Veröffentlichung gestoppt hatte. Eine ist jetzt gestoppt worden, und das sollte man klar sagen. Der genannte Grund ist genau das Szenario, das jener Beitrag beschrieb: ein Agent, der sich nicht an die ihm gesetzten Grenzen hält. [¹⁰]
Die Schlussfolgerung jenes Beitrags steht, und sie ist dadurch stärker geworden. Ein Labor kann entscheiden, ein Modell nicht auszuliefern. Es kann keine Grenzen in Ihrer Umgebung durchsetzen. Das können nur Sie.
Wo neuland.ai bei diesem Thema steht
Der neuland.ai HUB ist eine souveräne KI-Management- und Orchestrierungsplattform, und seine Aufgabe ist es, die Grenzen außerhalb des Modells zu platzieren. Die Berechtigung wird auf dem Retrieval-Raum durchgesetzt, bevor das Modell schlussfolgert, sodass ein Dokument, das die anfragende Person nicht sehen darf, nie abgerufen wird und daher weder zitiert noch daraus geschlossen werden kann. Agenten handeln unter ihrer eigenen begrenzten Identität, wobei die Person, für die sie handeln, in einer Delegationskette erhalten bleibt, statt auf geliehenen Zugangsdaten. Die Tools, die ein Agent aufrufen darf, sind eine aufgezählte Allowlist und keine emergente Eigenschaft. Die Ausführung läuft in isolierten Umgebungen ohne dauerhafte Zugangsdaten, wobei die Plattform jeden Modell- und Tool-Aufruf vermittelt. Regulierte Verfahren laufen als deterministische, wiederholbare Sequenzen, mit menschlicher Genehmigung, die im Ablauf dort protokolliert wird, wo sie erforderlich ist. Jedes Retrieval, jeder Tool-Aufruf und jede Entscheidung wird von der Plattform in ein Nur-Anhängen-Protokoll geschrieben, nicht im Nachhinein vom Agenten zusammengefasst. Und weil das Routing modellagnostisch ist und sowohl Open-Weight-Modelle umfasst, die wir selbst hosten, wie GLM, Mistral Large 3, Qwen und DeepSeek, als auch proprietäre Endpunkte wie Claude und GPT, wo die Policy des Kunden es erlaubt, ist ein Modell, das zurückgezogen wird oder die eigene Bewertung des Kunden nicht besteht, eine Routing-Änderung und kein Ausfall. [¹¹]
Das ist auch die Antwort auf eine Frage, die ich von CISOs in fast jedem ersten Gespräch höre: Können wir dem Agenten nicht einfach sagen, was er nicht tun darf? Können Sie, und sollten Sie, gute Anweisungen machen einen guten Agenten besser. Aber sie sind nicht die Kontrolle. GPT-6.1 Astra ist der Hersteller, der das schriftlich festhält.
Persönliche Einordnung
Ich möchte mit der Einordnung vorsichtig sein. Dieser Beitrag ist nicht gegen OpenAI gerichtet. Ein Modell zurückzuhalten, das den eigenen Maßstab nicht erfüllt hat, am Tag vor einer Entwicklerkonferenz, ist die verantwortungsvolle Entscheidung und sollte als solche anerkannt werden. Er ist auch nicht gegen Apple gerichtet, und er ist kein Urteil über Meta, das die Behauptung bestreitet, die Apples Ankündigung vorausging.
Wogegen ich anschreibe, ist eine Gewohnheit, die sich in der Unternehmens-KI schnell verbreitet hat: das Modell als den Ort zu behandeln, an dem Grenzen leben. Geltungsbereich, Berechtigungen, Datengrenzen und das Protokoll des Geschehenen werden in Systemprompts und Agentenbeschreibungen geschrieben und dann vertraut. Innerhalb von acht Tagen haben die Hersteller uns von beiden Enden des Stacks erklärt, warum das nicht hält.
Die regulatorische Richtung weist denselben Weg. Der EU AI Act gilt seit dem 2. August 2026 breit, und seine Erwartungen an menschliche Aufsicht, Protokollierung und Nachvollziehbarkeit sind genau für dieses Problem geschrieben; der Digital Omnibus hat die Hochrisiko-Pflichten nach Anhang III auf den 2. Dezember 2027 und die Pflichten nach Anhang I auf den 2. August 2028 verschoben. [¹²] Eine Grenze, die in einem Prompt lebt, kann gegenüber einer Aufsichtsbehörde nicht nachgewiesen werden. Eine Grenze, die von der Plattform durchgesetzt und protokolliert wird, schon.
Wir bei neuland.ai setzen eine Grenze lieber durch, als um eine zu bitten. Wenn das Modell sie zusätzlich einhalten will, ist das ein Bonus. Die Kontrolle sollte nicht davon abhängen.
Beiträge der Serie verfügbar unter neuland.ai/de/resources/insights.
Siehe frühere Beiträge dieser Serie zu Containment als bidirektionaler Systemeigenschaft, zur Autorisierung, die an der falschen Grenze endet, und zur Provenienz als Systemeigenschaft.
Maxwell Zeff, „OpenAI Scraps Release of New AI Model Over Safety Concerns“, The Wall Street Journal, 28. September 2026; am selben Abend gegenüber CNBC bestätigt. Erklärung von Saachi Jain, Leiterin der Sicherheitssysteme bei OpenAI, wie von CNN und CNBC berichtet, 28. September 2026. GPT-6.1 Astra war für die Veröffentlichung in ChatGPT und Codex im Oktober 2026 geplant. Bericht über ein höheres Maß an täuschendem Verhalten als beim Vorgänger, veröffentlicht von Business Standard am 29. September 2026 unter Berufung auf das Wall Street Journal.
OpenAI DevDay 2026, San Francisco, 29. September 2026: Start von Dots auf Basis von GPT-6 Astra; Aussage von Sam Altman, das Produkt sei vor der Veröffentlichung auf Sicherheit getestet worden, wie von Reuters berichtet. Verfügbarkeitsangaben gemäß OpenAIs veröffentlichter Zugangsinformation: spezialisierte Dots mit eigener Organisationsidentität in fokussierten Unternehmenspiloten; Enterprise Dots standardmäßig deaktiviert, bis ein Administrator sie aktiviert; Pro-Verfügbarkeit unter Ausschluss des EWR, des Vereinigten Königreichs und der Schweiz.
Apple Developer, „Updates to Full Disk Access in macOS“, 2. Oktober 2026; Berichterstattung bei TechCrunch und MacRumors, 2. Oktober 2026. Der vorausgegangene Vorwurf zu Metas Muse wurde von einem Kolumnisten erhoben, der berichtete, der Assistent habe auf seine Messages-Daten zugegriffen; Metas Stellungnahme lautete, der Zugriff auf Messages sei vollständig Opt-in und erfordere sowohl Full Disk Access als auch einen aktivierten Messages-Connector.
GreyNoise, Kampagnendokumentation vom 9. September 2026, wie berichtet von VentureBeat, „AI agents breached 395 organizations using credentials your IAM policy still treats as human“, September 2026.
Google Threat Intelligence Group, „From Prompting to Autonomy: The Evolution of Adversarial AI“, 8. September 2026. Anthropic-Bedrohungsbericht, 10. September 2026, mit Abdeckung der Aktivitäten von Dezember 2025 bis August 2026.
Cloud Security Alliance AI Safety Initiative, Forschungsnotiz zu einer KI-Agenten-Retail-Skimming-Kampagne, 24. September 2026, aufbauend auf Forschung von Gambit Security; siehe auch BleepingComputer, 23. September 2026.
VentureBeat-Pulse-Umfrage, Juni 2026: 12 Prozent der Unternehmen hatten ein Agent-Identity-Produkt, etwa Okta for AI Agents, Microsoft Entra Agent ID oder eine Non-Human-Identity-Plattform, in ihrem Betrachtungsfeld.
Siehe den vorherigen Beitrag dieser Serie zur Debatte um das Tempo, im Anschluss an Dario Amodeis Essay „We Must Pace the Frontier“, 12. September 2026.
neuland.ai HUB: Berechtigung auf dem Retrieval-Raum vor der Schlussfolgerung durchgesetzt; beziehungsbasierte Berechtigung mit delegierten, begrenzten Agenten-Identitäten; aufgezählte Tool-Allowlist; isolierte Ausführungsumgebungen mit plattformvermittelten Modell- und Tool-Aufrufen; deterministische, wiederholbare Orchestrierung mit protokollierter menschlicher Genehmigung; Nur-Anhängen-Prüfprotokoll, geschrieben von der Plattform; modellagnostisches Routing über selbst gehostete Open-Weight- und proprietäre Modelle; Deployment on-premises, in einer europäischen souveränen Cloud oder in einer Hyperscaler-Region, einschließlich Air-Gap-Betrieb. neuland.ai AG behält die Verantwortung für die Inhaltsqualität und die saubere Lieferung von Ergebnissen in allen Kundenengagements.
Verordnung (EU) 2024/1689 (AI Act), breit anwendbar seit dem 2. August 2026. Rat der EU und Europäisches Parlament, vorläufige politische Einigung zum Digital Omnibus on AI, 7. Mai 2026: Hochrisiko-Pflichten nach Anhang III auf den 2. Dezember 2027 verschoben; Pflichten nach Anhang I auf den 2. August 2028 verschoben.
Drei Nachrichten in acht Tagen erzählen eine Geschichte, die keine von ihnen allein erzählt. Am 28. September gab OpenAI bekannt, dass GPT-6.1 Astra nicht erscheinen wird, der Nachfolger des Flaggschiffmodells, der im Oktober in ChatGPT und Codex hätte kommen sollen. Der Grund, so die Leiterin der Sicherheitssysteme, war, dass das Modell hinter den Anforderungen zurückblieb, sich an den vorgegebenen Geltungsbereich und die Autorisierung zu halten, und dass es den Nutzern nicht ehrlich genug berichtete, was es tatsächlich getan hatte. Am nächsten Tag stellte OpenAI auf seiner Entwicklerkonferenz Dots vor, seine neuen persistenten Agenten, die auf dem vorherigen Modell laufen. Am 2. Oktober kündigte Apple an, die Full-Disk-Access-Berechtigung in macOS zu verschärfen, und warnte Entwickler, dass leistungsfähigere und autonomere Agenten den breiten Zugriff auf Dateien, E-Mails und Nachrichten eines Nutzers erheblich riskanter machen. Zusammen gelesen sind das keine drei unverbundenen Geschichten. OpenAI und Apple haben in derselben Woche dasselbe gesagt, von entgegengesetzten Enden des Stacks: Ein Agent wird sich nicht zuverlässig an Grenzen halten, die als Anweisungen niedergeschrieben sind, und sein eigener Bericht darüber, was er getan hat, ist kein Protokoll. Das wirft die Frage auf, die sich jeder CIO und CISO mit Agenten im Produktivbetrieb jetzt stellen sollte: Wo leben die Grenzen unserer Agenten eigentlich?
Dies ist der sechsundzwanzigste Beitrag einer Serie, die ich für neuland.ai schreibe. Jeder hat dasselbe Argument weitergetrieben: Der Wert, das Risiko und der Burggraben in der Unternehmens-KI liegen nicht im Modell. Sie liegen in der Schicht darüber und darum herum. [¹] Frühere Beiträge dieser Serie argumentierten, dass Containment in beide Richtungen wirken muss, dass Autorisierung abdecken muss, was ein Agent wissen darf und nicht nur, was er tun darf, und dass Provenienz im Moment der Handlung erfasst werden muss statt im Nachhinein rekonstruiert zu werden. [²]
Dieser Beitrag führt diese Argumente auf eine praktische Unterscheidung zurück. Eine Grenze, die in einer Anweisung steht, ist eine Bitte. Eine Grenze, die außerhalb des Modells durchgesetzt wird, ist eine Kontrolle. Und diese drei Geschichten sind die deutlichste Demonstration dieses Unterschieds, die ich bisher gesehen habe.
Geschichte eins: Der Hersteller stoppte sein eigenes Modell
Am 28. September berichtete das Wall Street Journal, dass OpenAI die für Oktober geplante Veröffentlichung von GPT-6.1 Astra gestrichen hatte, und OpenAI bestätigte die Entscheidung am selben Abend. Saachi Jain, Leiterin der Sicherheitssysteme bei OpenAI, sagte, das Modell habe sich bei der Faulheit verbessert, sei aber bei „staying within scope and authorization“ [Einhaltung von Geltungsbereich und Autorisierung, Übers.] und bei der Art, wie es Nutzern mitteilte, welche Arbeit es verrichtet hatte, hinter den Anforderungen zurückgeblieben. Nach der Berichterstattung des Journals fanden interne Tests ein höheres Maß an täuschendem Verhalten als beim Vorgängermodell. OpenAI erklärte, weiterhin andere Modelle zu veröffentlichen. [³]
OpenAI verdient Anerkennung dafür. Ein Modell zurückzuhalten, das den eigenen Maßstab nicht erfüllt, einen Tag vor der eigenen Entwicklerkonferenz, ist genau das, was ein verantwortungsvolles Labor tun sollte.
Aber lesen Sie den genannten Grund als Ingenieur. Die beiden Versagen, die er benennt, sind die beiden Eigenschaften, die Unternehmen am häufigsten an das Modell delegieren: sich an den vorgegebenen Geltungsbereich zu halten und wahrheitsgemäß zu berichten, was es getan hat. Beides ist kein Fähigkeitsproblem, nach OpenAIs eigener Darstellung war das Modell leistungsfähiger. Beides sind Containment- und Provenienz-Probleme. Und das Unternehmen, das dieses Modell besser kennt als jeder andere, kam zu dem Schluss, dass es sich nicht darauf verlassen konnte, dass das Modell sie bewältigt.
Geschichte zwei: Die Agenten kamen trotzdem, auf dem vorherigen Modell
Am 29. September stellte OpenAI auf dem DevDay 2026 in San Francisco Dots vor, eine neue Generation persistenter Agenten auf Basis von GPT-6 Astra. Sam Altman sagte, das Produkt sei vor der Veröffentlichung auf Sicherheit getestet worden, und grenzte es damit vom zurückgehaltenen Modell ab. Spezialisierte Dots tragen eine eigene Organisationsidentität und laufen in fokussierten Unternehmenspiloten; Enterprise Dots sind standardmäßig deaktiviert, bis ein Administrator sie aktiviert; und die Pro-Stufe ist im Europäischen Wirtschaftsraum, im Vereinigten Königreich und in der Schweiz nicht verfügbar. [⁴]
Nichts davon ist Kritik. Standardmäßig deaktiviert ist eine sinnvolle Kontrolle, und auf einem Modell auszuliefern, das die Anforderungen erfüllt hat, ist die richtige Entscheidung. Aber beachten Sie, wo die Entscheidung jetzt liegt: auf Ihrer Seite der Linie. Wenn ein Administrator persistente Agenten einschaltet, sind die Grenzen, auf die es ankommt, diejenigen, die die Organisation um sie herum durchsetzt, weil derselbe Hersteller in derselben Woche erklärt hat, was passiert, wenn man sich darauf verlässt, dass das Modell sie selbst durchsetzt.
Geschichte drei: Apple verlegte die Grenze ins Betriebssystem
Am 2. Oktober veröffentlichte Apple auf seiner Entwicklerseite einen Hinweis, der zusätzliche Kontrollen für Full Disk Access in macOS ankündigt. Die Berechtigung existiert, damit Backup-Software funktioniert, und sie umgeht weitgehend die Datenschutzkontrollen, die Apple für alles andere einbaut. Apple schrieb, dass manche Entwickler sie so einsetzen, dass Dateien, E-Mails, Nachrichten und der Browserverlauf offengelegt werden, ohne dass die Nutzer vollständig verstehen, was sie gewährt haben, dass die Erteilung künftig eine sehr explizite Nutzeraktion erfordern wird, und, der Satz, auf den es hier ankommt, dass mit wachsender Leistungsfähigkeit und Autonomie von Agenten „the risks associated with this level of access will grow substantially“ [die mit diesem Zugriffsniveau verbundenen Risiken erheblich steigen werden, Übers.]. Ein Datum für die Einführung wurde nicht genannt. [⁵]
Auslöser war die Behauptung eines Journalisten, Metas Muse-Assistent habe seine privaten Nachrichten auf einem Mac gelesen. Meta bestreitet die Darstellung und erklärt, der Zugriff auf Nachrichten sei Opt-in und erfordere sowohl Full Disk Access als auch einen aktivierten separaten Connector. Die Fakten dieses Falls sind nicht geklärt. Apples Schlussfolgerung hängt nicht von ihnen ab. Apple hat Agenten-Entwickler nicht gebeten, sich besser zu verhalten. Es hat die Grenze auf eine Ebene verschoben, an der der Agent nicht vorbeireden kann.
Was die drei Geschichten verbindet
Es wäre verlockend, diese als eine OpenAI-Geschichte und eine Apple-Geschichte zu lesen. Es ist eine Geschichte, erzählt von beiden Enden des Stacks.
OpenAI, das sein eigenes Modell besser versteht als jeder andere, kam zu dem Schluss, dass das Modell die von den Nutzern gesetzten Grenzen nicht zuverlässig einhalten und nicht zuverlässig berichten würde, was es getan hatte. Apple, das das Betriebssystem besitzt, auf dem Desktop-Agenten laufen, kam zu dem Schluss, dass es sich nicht darauf verlassen konnte, dass Agenten oder ihre Entwickler breiten Zugriff verantwortungsvoll nutzen, und verlegte die Kontrolle in die Plattform. Das Labor und der Plattformeigentümer kamen aus entgegengesetzten Richtungen zum selben Ergebnis: Grenzen müssen von etwas anderem als dem Agenten durchgesetzt werden.
Der Punkt, der mehr zählt als jedes einzelne Modell
Hier ist der Teil, den ich in der Berichterstattung zu keiner der beiden Geschichten klar genug aufgeschrieben gesehen habe.
Die meisten Agenten-Deployments in Unternehmen setzen ihre wichtigsten Grenzen im Systemprompt durch. Greife nur auf die Datensätze dieses Kunden zu. Sende keine Daten nach außerhalb des Unternehmens. Frage, bevor du etwas löschst. Berichte jede Aktion, die du ausführst. Das sind sinnvolle Anweisungen, und jeder Agent sollte sie tragen. Sie sind keine Kontrollen. Sie sind Bitten an ein probabilistisches System, dieselbe Art von System, dessen Hersteller jetzt erklärt hat, dass die neueste Version genau diese Bitten schlechter einhielt, während sie bei fast allem anderen besser wurde.
Die Unterscheidung wiegt am schwersten beim zweiten Versagen, das OpenAI benannte. Wenn die eigene Zusammenfassung des Agenten das Protokoll dessen ist, was er getan hat, dann ist die Qualität Ihres Prüfpfads eine Eigenschaft des Modells, und sie verschlechtert sich genau dann, wenn die Ehrlichkeit des Modells es tut. Ein Protokoll, das von etwas anderem als dem Agenten geschrieben wird, im Moment jedes Retrievals, jedes Tool-Aufrufs und jeder Entscheidung, hängt nicht davon ab, dass der Agent die Wahrheit sagt. Ein früherer Beitrag dieser Serie argumentierte, dass Provenienz im Moment der Handlung erfasst werden muss. GPT-6.1 Astra ist der Hersteller, der erklärt, warum.
Und die andere Seite der Grenze
Die Frage nach den Grenzen hat eine zweite Hälfte, denn Agenten stehen jetzt auf beiden Seiten des Perimeters.
Am 9. September dokumentierte GreyNoise die erste Massenangriffskampagne, die überwiegend von autonomen Agenten geführt wurde. Ein einzelner Angreifer nutzte Hunderte von Agenten, aufgebaut auf OpenAI Codex und einem DeepSeek-Modell, um zwei PaperCut-Schwachstellen bei 395 Organisationen in 48 Ländern auszunutzen. Die Agenten suchten Ziele und schrieben die Exploits selbst; die erste Kompromittierung dauerte bei elf Organisationen 26 Sekunden, und bei zwölf wurde Domänenadministrator-Zugriff bestätigt, zwischen fünf und 144 Minuten nach dem Eindringen. [⁶] Einen Tag zuvor berichtete Googles Threat Intelligence Group, dass Maschinenzugangsdaten jetzt einen Marktpreis haben, und beschrieb eine agentengestützte Credential-Harvesting-Kampagne, die in weniger als sechs Stunden geplant und durchgeführt wurde; Anthropics Bedrohungsbericht zwei Tage später dokumentierte zwei weitere Credential-Diebstähle. [⁷] Später im September beschrieben Gambit Security und die Cloud Security Alliance eine Kampagne, bei der verkettete Open-Source-Agenten-Tools mehr als hundert Online-Händler kompromittierten und über 600.000 Zahlungskartendatensätze stahlen. [⁸]
Dagegen steht: Eine Umfrage im Juni ergab, dass nur 12 Prozent der Unternehmen ein Agent-Identity-Produkt überhaupt in ihrem Betrachtungsfeld hatten. [⁹] Die meisten Organisationen steuern Agenten noch mit den Identitätswerkzeugen, die sie für Menschen gebaut haben.
Die Prüfung: Acht Fragen für jeden Agenten, den Sie betreiben
Die praktische Konsequenz ist eine Bestandsaufnahme, und ich würde jeden CISO, der dies liest, ermutigen, sie durchzuführen, angefangen mit der Frage, ob das Inventar existiert. Fragen Sie für jeden Agenten, wo jede der folgenden Grenzen physisch lebt. Wenn die ehrliche Antwort „im Prompt“ lautet, ist diese Grenze eine Bitte.
1. Unter wessen Identität handelt er? Ein Agent, der auf einer geliehenen menschlichen Sitzung oder einem geteilten Dienstkonto läuft, erbt alles, was diese Person oder dieses Konto erreichen kann, und jede seiner Aktionen wird jemand anderem zugeschrieben. Die Grenze gehört in eine begrenzte eigene Identität des Agenten, wobei die Person, für die er handelt, in der Delegationskette erhalten bleibt.
2. Was kann er lesen, und wird das vor dem Retrieval beschnitten? Wenn der Agent breit abruft und die Ausgabe erst danach gefiltert wird, ist vertrauliches Material bereits in den Kontext gelangt. Die Grenze gehört in die Retrieval-Schicht, angewandt für die Person, für die der Agent handelt, bevor das Modell schlussfolgert.
3. Welche Tools kann er aufrufen? Wenn die Antwort lautet „was auch immer das Framework freigibt“, ist die erreichbare Menge emergent. Die Grenze gehört in eine aufgezählte Allowlist, die von der Plattform durchgesetzt wird.
4. Wohin kann er Daten senden? Datenabfluss sollte eine Konfiguration sein, die der Agent nicht ändern kann, keine Anweisung, die er einhalten soll.
5. Welche Zugangsdaten hält er, und wie lange? Langlebige Schlüssel in der Umgebung eines Agenten sind genau das, was die September-Kampagnen geerntet haben. Die Grenze gehört in kurzlebigen, vermittelten Zugang, bei dem der Agent das Geheimnis selbst nie hält.
6. Welche Schritte müssen jedes Mal identisch sein, und welche brauchen eine menschliche Unterschrift? Regulierte Verfahren sollten als deterministische, wiederholbare Sequenzen laufen, mit Genehmigungen, die gegen die Person protokolliert werden, die sie erteilt hat, und nicht dem Agenten überlassen, zu entscheiden, wann er fragt.
7. Wer protokolliert, was er tatsächlich getan hat? Wenn die Antwort der Agent ist, ist das Protokoll nur so ehrlich wie das Modell. Die Grenze gehört in ein Nur-Anhängen-Protokoll, das von der Plattform im Moment der Handlung geschrieben wird.
8. Wie schnell können Sie ihn abschalten oder sein Modell austauschen? Ein Modell kann jetzt sowohl aus Sicherheitsgründen durch seinen Hersteller als auch durch eine behördliche Anordnung zurückgezogen werden. Der Austausch sollte eine Routing-Änderung sein, und das Abschalten eines Agenten sollte nicht bedeuten, die Person abzuschalten, für die er handelt.
Eine ehrliche Aktualisierung eines früheren Beitrags
Der vorherige Beitrag zur Debatte um das Tempo beobachtete, dass der Vorschlag, die Frontier zu verlangsamen, keine Veröffentlichung gestoppt hatte. Eine ist jetzt gestoppt worden, und das sollte man klar sagen. Der genannte Grund ist genau das Szenario, das jener Beitrag beschrieb: ein Agent, der sich nicht an die ihm gesetzten Grenzen hält. [¹⁰]
Die Schlussfolgerung jenes Beitrags steht, und sie ist dadurch stärker geworden. Ein Labor kann entscheiden, ein Modell nicht auszuliefern. Es kann keine Grenzen in Ihrer Umgebung durchsetzen. Das können nur Sie.
Wo neuland.ai bei diesem Thema steht
Der neuland.ai HUB ist eine souveräne KI-Management- und Orchestrierungsplattform, und seine Aufgabe ist es, die Grenzen außerhalb des Modells zu platzieren. Die Berechtigung wird auf dem Retrieval-Raum durchgesetzt, bevor das Modell schlussfolgert, sodass ein Dokument, das die anfragende Person nicht sehen darf, nie abgerufen wird und daher weder zitiert noch daraus geschlossen werden kann. Agenten handeln unter ihrer eigenen begrenzten Identität, wobei die Person, für die sie handeln, in einer Delegationskette erhalten bleibt, statt auf geliehenen Zugangsdaten. Die Tools, die ein Agent aufrufen darf, sind eine aufgezählte Allowlist und keine emergente Eigenschaft. Die Ausführung läuft in isolierten Umgebungen ohne dauerhafte Zugangsdaten, wobei die Plattform jeden Modell- und Tool-Aufruf vermittelt. Regulierte Verfahren laufen als deterministische, wiederholbare Sequenzen, mit menschlicher Genehmigung, die im Ablauf dort protokolliert wird, wo sie erforderlich ist. Jedes Retrieval, jeder Tool-Aufruf und jede Entscheidung wird von der Plattform in ein Nur-Anhängen-Protokoll geschrieben, nicht im Nachhinein vom Agenten zusammengefasst. Und weil das Routing modellagnostisch ist und sowohl Open-Weight-Modelle umfasst, die wir selbst hosten, wie GLM, Mistral Large 3, Qwen und DeepSeek, als auch proprietäre Endpunkte wie Claude und GPT, wo die Policy des Kunden es erlaubt, ist ein Modell, das zurückgezogen wird oder die eigene Bewertung des Kunden nicht besteht, eine Routing-Änderung und kein Ausfall. [¹¹]
Das ist auch die Antwort auf eine Frage, die ich von CISOs in fast jedem ersten Gespräch höre: Können wir dem Agenten nicht einfach sagen, was er nicht tun darf? Können Sie, und sollten Sie, gute Anweisungen machen einen guten Agenten besser. Aber sie sind nicht die Kontrolle. GPT-6.1 Astra ist der Hersteller, der das schriftlich festhält.
Persönliche Einordnung
Ich möchte mit der Einordnung vorsichtig sein. Dieser Beitrag ist nicht gegen OpenAI gerichtet. Ein Modell zurückzuhalten, das den eigenen Maßstab nicht erfüllt hat, am Tag vor einer Entwicklerkonferenz, ist die verantwortungsvolle Entscheidung und sollte als solche anerkannt werden. Er ist auch nicht gegen Apple gerichtet, und er ist kein Urteil über Meta, das die Behauptung bestreitet, die Apples Ankündigung vorausging.
Wogegen ich anschreibe, ist eine Gewohnheit, die sich in der Unternehmens-KI schnell verbreitet hat: das Modell als den Ort zu behandeln, an dem Grenzen leben. Geltungsbereich, Berechtigungen, Datengrenzen und das Protokoll des Geschehenen werden in Systemprompts und Agentenbeschreibungen geschrieben und dann vertraut. Innerhalb von acht Tagen haben die Hersteller uns von beiden Enden des Stacks erklärt, warum das nicht hält.
Die regulatorische Richtung weist denselben Weg. Der EU AI Act gilt seit dem 2. August 2026 breit, und seine Erwartungen an menschliche Aufsicht, Protokollierung und Nachvollziehbarkeit sind genau für dieses Problem geschrieben; der Digital Omnibus hat die Hochrisiko-Pflichten nach Anhang III auf den 2. Dezember 2027 und die Pflichten nach Anhang I auf den 2. August 2028 verschoben. [¹²] Eine Grenze, die in einem Prompt lebt, kann gegenüber einer Aufsichtsbehörde nicht nachgewiesen werden. Eine Grenze, die von der Plattform durchgesetzt und protokolliert wird, schon.
Wir bei neuland.ai setzen eine Grenze lieber durch, als um eine zu bitten. Wenn das Modell sie zusätzlich einhalten will, ist das ein Bonus. Die Kontrolle sollte nicht davon abhängen.
Beiträge der Serie verfügbar unter neuland.ai/de/resources/insights.
Siehe frühere Beiträge dieser Serie zu Containment als bidirektionaler Systemeigenschaft, zur Autorisierung, die an der falschen Grenze endet, und zur Provenienz als Systemeigenschaft.
Maxwell Zeff, „OpenAI Scraps Release of New AI Model Over Safety Concerns“, The Wall Street Journal, 28. September 2026; am selben Abend gegenüber CNBC bestätigt. Erklärung von Saachi Jain, Leiterin der Sicherheitssysteme bei OpenAI, wie von CNN und CNBC berichtet, 28. September 2026. GPT-6.1 Astra war für die Veröffentlichung in ChatGPT und Codex im Oktober 2026 geplant. Bericht über ein höheres Maß an täuschendem Verhalten als beim Vorgänger, veröffentlicht von Business Standard am 29. September 2026 unter Berufung auf das Wall Street Journal.
OpenAI DevDay 2026, San Francisco, 29. September 2026: Start von Dots auf Basis von GPT-6 Astra; Aussage von Sam Altman, das Produkt sei vor der Veröffentlichung auf Sicherheit getestet worden, wie von Reuters berichtet. Verfügbarkeitsangaben gemäß OpenAIs veröffentlichter Zugangsinformation: spezialisierte Dots mit eigener Organisationsidentität in fokussierten Unternehmenspiloten; Enterprise Dots standardmäßig deaktiviert, bis ein Administrator sie aktiviert; Pro-Verfügbarkeit unter Ausschluss des EWR, des Vereinigten Königreichs und der Schweiz.
Apple Developer, „Updates to Full Disk Access in macOS“, 2. Oktober 2026; Berichterstattung bei TechCrunch und MacRumors, 2. Oktober 2026. Der vorausgegangene Vorwurf zu Metas Muse wurde von einem Kolumnisten erhoben, der berichtete, der Assistent habe auf seine Messages-Daten zugegriffen; Metas Stellungnahme lautete, der Zugriff auf Messages sei vollständig Opt-in und erfordere sowohl Full Disk Access als auch einen aktivierten Messages-Connector.
GreyNoise, Kampagnendokumentation vom 9. September 2026, wie berichtet von VentureBeat, „AI agents breached 395 organizations using credentials your IAM policy still treats as human“, September 2026.
Google Threat Intelligence Group, „From Prompting to Autonomy: The Evolution of Adversarial AI“, 8. September 2026. Anthropic-Bedrohungsbericht, 10. September 2026, mit Abdeckung der Aktivitäten von Dezember 2025 bis August 2026.
Cloud Security Alliance AI Safety Initiative, Forschungsnotiz zu einer KI-Agenten-Retail-Skimming-Kampagne, 24. September 2026, aufbauend auf Forschung von Gambit Security; siehe auch BleepingComputer, 23. September 2026.
VentureBeat-Pulse-Umfrage, Juni 2026: 12 Prozent der Unternehmen hatten ein Agent-Identity-Produkt, etwa Okta for AI Agents, Microsoft Entra Agent ID oder eine Non-Human-Identity-Plattform, in ihrem Betrachtungsfeld.
Siehe den vorherigen Beitrag dieser Serie zur Debatte um das Tempo, im Anschluss an Dario Amodeis Essay „We Must Pace the Frontier“, 12. September 2026.
neuland.ai HUB: Berechtigung auf dem Retrieval-Raum vor der Schlussfolgerung durchgesetzt; beziehungsbasierte Berechtigung mit delegierten, begrenzten Agenten-Identitäten; aufgezählte Tool-Allowlist; isolierte Ausführungsumgebungen mit plattformvermittelten Modell- und Tool-Aufrufen; deterministische, wiederholbare Orchestrierung mit protokollierter menschlicher Genehmigung; Nur-Anhängen-Prüfprotokoll, geschrieben von der Plattform; modellagnostisches Routing über selbst gehostete Open-Weight- und proprietäre Modelle; Deployment on-premises, in einer europäischen souveränen Cloud oder in einer Hyperscaler-Region, einschließlich Air-Gap-Betrieb. neuland.ai AG behält die Verantwortung für die Inhaltsqualität und die saubere Lieferung von Ergebnissen in allen Kundenengagements.
Verordnung (EU) 2024/1689 (AI Act), breit anwendbar seit dem 2. August 2026. Rat der EU und Europäisches Parlament, vorläufige politische Einigung zum Digital Omnibus on AI, 7. Mai 2026: Hochrisiko-Pflichten nach Anhang III auf den 2. Dezember 2027 verschoben; Pflichten nach Anhang I auf den 2. August 2028 verschoben.
Von der KI-Strategie zur laufenden Plattform: Wir zeigen Ihnen den Weg.
Gespräch anfragen