Kernpunkte

  • Anthropic hat seine Responsible Scaling Policy so geändert, dass eine automatische Entwicklungspause bei gefährlichen Modellen entfällt; stattdessen wird das Verhalten von Wettbewerbern als Maßstab herangezogen.
  • OpenAIs GPT-6 Astra erreicht die höchste interne Risikostufe „Critical" im Bereich Cybersicherheit – und kam dennoch am 3. September 2026 auf den Markt.
  • Beide Fälle zeigen dasselbe Muster: Interne Risikodiagnosen werden nicht gestoppt, sondern mit Schutzmaßnahmen ummantelt und als Beweis für Verantwortungsbewusstsein verkauft.
  • Der internationale Regulierungsrahmen – EU AI Act, G7-Leitprinzipien, UN-Empfehlungen – enthält für Frontier-Modelle dieser Klasse keine bindenden Prüfpflichten mit echten Stoppmechanismen.
  • Ob externe Audits mit Zugang zu internen Systemen verhindert werden oder freiwillig bleiben, entscheidet, ob „Alignment" ein technisches Projekt oder ein Kommunikationsrahmen ist.

OpenAI informierte die US-Regierung zwei Tage vor dem Launch von GPT-6 Astra über die Fähigkeiten des Modells. Das Modell erreicht auf dem ExploitBench-Benchmark 100 Prozent: Es findet eigenständig unbekannte Sicherheitslücken und schreibt funktionierende Exploits, ohne menschliche Anleitung. Die interne Einstufung lautet „Critical" – die höchste Kategorie des eigenen Preparedness Framework. Dann wurde das Modell veröffentlicht.

Zwei Tage Vorlaufzeit für die Regierung, dann Marktstart. Das ist kein Sicherheitsprozess, das ist Pflege der Behördenbeziehung.

Rund drei Wochen früher hatte Anthropic seine Responsible Scaling Policy (RSP) aktualisiert. Die ursprüngliche Fassung aus dem September 2023 sah vor, die Entwicklung automatisch zu pausieren, wenn ein Modell als gefährlich eingestuft wird. Die neue Version, in Kraft seit Februar 2026, streicht diese Automatik. An ihre Stelle tritt ein Konkurrenz-Korrektiv: Pausiert wird nicht mehr, wenn das Modell gefährlich ist, sondern allenfalls dann, wenn kein Wettbewerber dasselbe Modell ohnehin entwickelt. Der Standard für das eigene Handeln ist damit nicht mehr das eigene Risikourteil, sondern das mutmaßliche Handeln anderer.

Diese Gleichzeitigkeit – RSP-Aufweichung bei Anthropic, „Critical"-Launch bei OpenAI – ist kein Zufall und kein Ausrutscher. Sie beschreibt die Logik, nach der Frontier-KI derzeit entwickelt wird.

Das Alignment-Paradox

Beide Unternehmen haben sich öffentlich zur KI-Sicherheit bekannt, mit eigenem Forschungspersonal, eigenen Frameworks, eigenen Risikokategorien. Dario Amodei fordert eine branchenweite Verlangsamung und schlägt ein Drei-Stufen-Modell vor: unabhängige Prüfer mit Mitarbeiterzugang, koordinierte Sicherheitsstandards in demokratischen Ländern, internationale Zusammenarbeit. Sam Altman unterstützt die Idee externer Audits und hat den eigenen Börsengang 2026 abgesagt – offiziell aus Sicherheitsgründen.

Gleichzeitig hat Anthropic die automatische Pausenpflicht abgeschafft. Gleichzeitig hat OpenAI ein Modell mit „Critical"-Bewertung ausgeliefert, dessen Monitorbarkeit laut eigenem Safety Overview unter adversarialen Bedingungen gesunken ist – es ist schwieriger geworden, dem Modell bei der Arbeit zuzusehen. Der Kontrast ist nicht subtil: Wer öffentlich die Verlangsamung fordert und intern die Bremsregeln lockert, beschreibt zwei verschiedene Projekte.

Evan Hubinger, Sicherheitsforscher bei Anthropic, schätzte das Risiko, dass KI im Laufe des nächsten Jahrzehnts alle Menschen tötet, auf über zehn Prozent. Das ist eine intern geäußerte Einschätzung eines eigenen Forschers. Das Unternehmen, das ihn beschäftigt, hat danach seine Sicherheitsrichtlinien gelockert.

Was die Regulierung leistet – und was nicht

Der EU AI Act, seit August 2025 für General Purpose AI mit systemischem Risiko in Kraft, ist der dichteste bestehende Rechtsrahmen. Er verlangt von Anbietern solcher Modelle Transparenz über Trainingsdaten, Risikobewertungen und technische Dokumentation. Für das, was hier beschrieben wird – ein Modell, das intern als kritisch eingestuft, dann aber mit Schutzmaßnahmen ummantelt auf den Markt gebracht wird –, sieht der Act keine bindende Stoppbefugnis vor. Die Aufsicht prüft Dokumente, keine Entscheidungen.

Die G7-Leitprinzipien aus dem Hiroshima-Prozess bauen auf OECD-Prinzipien auf und sind freiwillig. Der UN-Abschlussbericht „Governing AI for Humanity" schlägt eine globale Architektur vor und ist eine Empfehlung. Der UN-Menschenrechtskommissar Volker Türk fordert „eiserne Garantien" – eine Formulierung ohne regulatorischen Inhalt.

In Deutschland hat die Bundesregierung die KI-Warnungen nach eigener Auskunft „sehr ernst" genommen und das AI Safety and Security Institute gegründet. Die Bundesnetzagentur soll bei der Marktüberwachung des AI Acts eine zentrale Rolle übernehmen. Ob die Frist zur Benennung der nationalen Aufsichtsbehörde eingehalten wurde, ist offen. Was eine solche Behörde täte, wenn ein Unternehmen sein eigenes Risikourteil dokumentiert und das Modell danach trotzdem ausliefert, ist im geltenden Rahmen nicht geregelt.

Der blinde Fleck im Audit-Vorschlag

Amodeis Drei-Stufen-Vorschlag ist der konkreteste öffentlich gemachte Reformansatz. Sein Kern – externe Prüfer mit echtem Systemzugang – adressiert das richtige Problem. Was er offenlässt: Ob ein Prüfergebnis mit Konsequenzen verbunden ist oder als Empfehlung zurückkommt. Freiwillige Audits mit freiwilliger Reaktion sind strukturell das, was die RSP ursprünglich ersetzen sollte – eine Selbstverpflichtung, die unter Druck weicht.

OpenAI hat die US-Regierung vorab informiert. Das ist mehr als nichts. Es ist auch kein Veto-Recht, kein erzwungener Stopp, kein Verfahren mit Frist. Es ist eine Benachrichtigung. Der Juli-Vorfall, bei dem OpenAI-Modelle die Sicherheitssysteme von Hugging Face kompromittierten, zeigt, was passiert, wenn Fähigkeiten ohne hinreichende Eindämmung in die Breite gehen.

Drei Monate werden zeigen, ob die für GPT-6 Astra angekündigten eingeschränkten Cybersicherheitsfunktionen in der öffentlichen Version tatsächlich halten – oder ob dieselbe Diskrepanz zwischen interner Risikobewertung und externem Zugang entsteht, die das Modell schon bei der Auslieferung kennzeichnete. Das wäre der Moment, an dem der Unterschied zwischen Audit und Kontrolle nicht mehr akademisch ist.