Zum Inhalt springen

KI-Agenten auditieren: Dein Zertifikat vom Januar prüft im März einen Agenten, den es nicht mehr gibt

KI-Agenten driften in Wochen. Ein ISO-42001-Audit ist deshalb kein Jahres-Zertifikat, sondern eine Regelschleife, deren Prüfkern in Clause 9.1 sitzt.

Ina Schöne Ina Schöne ISO/IEC 42001 Lead Auditor, KI-Compliance & KI-Auditing, Dresden · · Aktualisiert am · 8 Min. Lesezeit
KI-Agenten auditieren: Dein Zertifikat vom Januar prüft im März einen Agenten, den es nicht mehr gibt

Ein KI-Modell kann in drei Monaten die Hälfte seiner Zuverlässigkeit verlieren, ohne dass jemand eine einzige Zeile Code anfasst. Im März 2023 lieferte GPT-4 auf einer festen Coding-Aufgabe in 52,0 Prozent der Fälle direkt ausführbaren Code, im Juni 2023 nur noch in 10,0 Prozent. Bei GPT-3.5 fiel derselbe Wert von 22,0 auf 2,0 Prozent, weil die Modelle den Code plötzlich ungefragt in Dreifach-Anführungszeichen verpackten. Bei der Erkennung von Primzahlen sank die Genauigkeit von GPT-4 im selben Zeitraum von 84 auf 51 Prozent, bei identischem Prompt. Das haben Chen, Zaharia und Zou gemessen (laut Chen, Zaharia und Zou, Harvard Data Science Review, März 2024; zuerst als arXiv-Preprint 2307.09009 im Juli 2023, die Zahlen hier stammen aus der peer-reviewten Fassung).

Wer dieses System im Januar auditiert und zertifiziert hat, beschreibt im März einen Agenten, den es so nicht mehr gibt. Genau hier liegt das Missverständnis, das ich in fast jedem Pre-Audit-Gespräch höre: Ein KI-Audit sei ein Zertifikat, das man einmal im Jahr abholt. Ist es nicht. Es ist eine Regelschleife. Und ihr eigentlicher Kern sitzt nicht in der Jahresprüfung nach Clause 9.2 von ISO/IEC 42001, sondern im kontinuierlichen Monitoring nach Clause 9.1.

Warum ein KI-Agent kein statisches Prüfobjekt ist

Klassische Prüfobjekte stehen still. Ein Serverraum, ein Prozess, eine Buchhaltung: Was ich heute auditiere, sieht in drei Monaten genauso aus. Ein KI-Agent tut das nicht. Er driftet aus drei Richtungen gleichzeitig. Er antwortet nicht deterministisch, also liefert derselbe Prompt unterschiedliche Ergebnisse. Das zugrunde liegende Modell wird still aktualisiert, oft ohne neue Versionsnummer. Und der Kontext, aus dem der Agent seine Informationen zieht, wird laufend neu befüllt und indexiert.

Die Zahlen von Chen, Zaharia und Zou sind der Beweis, dass diese Drift nicht theoretisch ist und nicht in Jahren, sondern in Wochen passiert. Für ein Managementsystem heißt das: Der Prüfbericht altert schneller, als der Zertifizierungszyklus nachkommt. Wie sich diese Drift technisch überwachen lässt, hat das KI-Syndikat aus der Monitoring-Perspektive beschrieben, im Beitrag AI-DevOps ist nicht DevOps. Ich schaue hier auf dieselbe Drift aus der Audit-Perspektive, und die stellt eine andere Frage: Nicht „sieht mein Dashboard das?”, sondern „was genau bestätigt mein Zertifikat eigentlich?”.

Du auditierst nicht den Agenten, sondern das Managementsystem

Der häufigste Denkfehler bei KI-Audits ist, das Modell für das Prüfobjekt zu halten. Das ist es nicht. Du auditierst das Managementsystem, das den Agenten steuert. Der Agent selbst ist die Blackbox in der Mitte; seine Runtime-Telemetrie ist dein Audit-Nachweis.

Warum diese Unterscheidung nicht akademisch ist, zeigt der Fall Air Canada. Der Website-Chatbot der Airline erfand gegenüber dem Kunden Jake Moffatt eine Rückerstattungsregel für Trauerfälle, die es nie gab. Air Canada argumentierte vor Gericht, der Chatbot sei eine eigenständige Entität, die für ihre Aussagen selbst verantwortlich sei. Das Civil Resolution Tribunal of British Columbia wischte dieses Argument beiseite und verurteilte die Airline wegen fahrlässiger Falschdarstellung zu 812,02 CAD, davon 650,88 CAD Schadenersatz zuzüglich Zinsen und Gebühren (laut der Entscheidung des Civil Resolution Tribunal of British Columbia in Moffatt v. Air Canada, 2024 BCCRT 149).

Der Geldbetrag ist nebensächlich. Der Präzedenzfall ist die eigentliche Nachricht: Der Agent ist nicht rechenschaftspflichtig, die Organisation ist es. Ein Agent, dessen Wesen mehr als ein Chatbot ist, handelt in deinem Namen, und mit wachsender Autonomie tut er das zunehmend eigenständig, wie das KI-Syndikat für vollautonome Agenten-Pipelines beschrieben hat. Genau deshalb muss das Managementsystem, nicht das Modell, prüfbar sein.

Der Prüfkern sitzt in 9.1, nicht in 9.2

An dieser Stelle kommt der stärkste Einwand gegen meine These, und ich nehme ihn ernst, weil er fachlich korrekt ist. ISO/IEC 42001 hat periodische Kontrolle eingebaut. Clause 9.2 (internes Audit) und Clause 9.3 (Management Review) sind wiederkehrende Pflichten, und akkreditierte Zertifizierungsstellen prüfen im Drei-Jahres-Zyklus jährlich nach, mit Überwachungsaudits in Jahr 2 und Jahr 3 und einer Rezertifizierung in Jahr 3. Kontinuierliche Rezertifizierung wäre unrealistisch und ist auch nicht gemeint.

Der Einwand verwechselt aber zwei Prüfebenen. Clause 9.2 und externe Überwachungsaudits sind periodisch und stichprobenartig. Sie prüfen, OB dein Managementsystem funktioniert. Clause 9.1 ist keine Wiederholung der Jahresprüfung, sondern verpflichtet deine Organisation selbst dazu, die reale Performance des KI-Systems zwischen den Audits fortlaufend zu erheben, zu messen und auszuwerten. Ein Zertifikat bestätigt, dass an einem Tag im Januar ein funktionierender 9.1-Prozess existierte. Es bestätigt nicht, dass der Agent drei Monate später noch derselbe ist. Clause 9.2 prüft, ob der 9.1-Prozess läuft. Es ersetzt ihn nicht.

Aus dieser Pflicht wird über Annex A von ISO/IEC 42001 etwas Konkretes. Die Norm übersetzt „laufendes Monitoring” in benannte Controls in der Kategorie A.6 (AI System Life Cycle): A.6.2.6 „AI System Operation and Monitoring”, A.6.2.8 „AI System Recording of Event Logs” und A.8.4 „Communication of Incidents”. Diese drei Controls machen aus dem abstrakten 9.1-Satz drei fassbare Dinge, nämlich Runtime-Telemetrie, revisionssichere Event-Logs und eine dokumentierte Incident-Kette.

So baust du die Regelschleife auf

Der Weg von der abstrakten Norm zur laufenden Prüfung führt über acht Schritte. Sie sind kein Wasserfall, sondern ein Kreis, der sich schließt und von vorn beginnt.

  1. Auditprogramm aufsetzen (ISO 19011). ISO/IEC 42001 sagt, WAS geprüft wird, ISO 19011 liefert das WIE: Auditprogramm, Auditorenkompetenz, Auditnachweise und Auditfeststellungen. Lege Takt, Rollen und Nachweisführung fest, bevor du das erste Log anschaust.
  2. Scope abgrenzen. Definiere die Grenze des Managementsystems um den Agenten, nicht die Grenze des Modells. Welche Prozesse, welche Schnittstellen, welche Entscheidungen des Agenten fallen in die Zertifizierung?
  3. Impact Assessment als Input (ISO/IEC 42005). Das AI System Impact Assessment nach ISO/IEC 42005, 2025 veröffentlicht, identifiziert die realen Risiken des Agenten für Betroffene. Es ist nicht Selbstzweck, sondern der Input für die nächste Entscheidung.
  4. Annex-A-Controls auswählen. Aus dem Impact Assessment leitest du ab, welche Controls greifen. Für einen driftenden Agenten sind das mindestens A.6.2.6, A.6.2.8 und A.8.4.
  5. Evidence erheben: Runtime-Telemetrie und Event-Logs. Hier lebt Clause 9.1. Die Telemetrie des Agenten IST dein Audit-Nachweis: gemessene Antwortqualität, Event-Logs nach A.6.2.8, protokollierte Vorfälle. Ohne diese Schicht auditierst du eine Momentaufnahme, kein System.
  6. Findings feststellen (Clause 9.2). Das interne Audit verdichtet die Evidence nach ISO 19011 zu Auditnachweisen und Auditfeststellungen. Das Management Review nach Clause 9.3 bewertet, ob die Schleife trägt.
  7. Corrective Action einleiten (Clause 10.2). Jede Nichtkonformität führt über Clause 10.2 zu Ursachenanalyse und Korrekturmaßnahme. Nicht bloß notiert und abgehakt, sondern nachweislich behoben.
  8. Zurück zu Clause 9.1. Die Korrekturmaßnahme verändert, was dein Monitoring künftig beobachtet. Damit schließt sich die Schleife, und der nächste Zyklus beginnt.

Diese Schleife ist der Kern des Audits: 9.1 Monitoring erhebt die Realität, 9.2 Internes Audit bewertet sie, 9.3 Management Review entscheidet, 10.2 Corrective Action greift ein, und das Ergebnis fließt zurück in 9.1. Wer nur die Jahresprüfung nach 9.2 als „das Audit” versteht, hat den Kreis in einen Punkt zusammengezogen.

Regelschleife nach ISO/IEC 42001: kontinuierliches Monitoring nach 9.1, periodisches internes Audit nach 9.2, Management-Review nach 9.3 und Korrekturmaßnahmen nach 10.2, die zurück auf das Monitoring wirken

Was der Gesetzgeber davon verlangt, und was nicht

Der regulatorische Rahmen zieht in dieselbe Richtung, allerdings auf einem eigenen Gleis. Unter dem EU AI Act (VO (EU) 2024/1689) greifen die Pflichten aus Kapitel III Abschnitte 1 bis 3 für Hochrisiko-Systeme nach Anhang III erst ab dem 2. Dezember 2027, darunter das Risikomanagement der Anbieter nach Art. 9 und die Betreiberpflichten nach Art. 26. Die Verordnung (EU) 2026/1744 vom 8. Juli 2026 hat diesen Termin vom 2. August 2026 nach hinten gelegt. Nicht verschoben wurde Art. 72: Das Post-Market-Monitoring steht in Kapitel IX und gilt seit dem allgemeinen Geltungsbeginn am 2. August 2026, genauso wie die Registrierung nach Art. 49 und die Transparenzpflichten nach Art. 50.

Inhaltlich beschreibt Art. 72 dieselbe fortlaufende Beobachtung, die ein Jahres-Zertifikat allein nicht leisten kann. Rechtlich sind die beiden Regelwerke aber unabhängig voneinander, und das in beide Richtungen. ISO/IEC 42001 ist ein freiwilliger Managementstandard: Ein Zertifikat danach ist keine Konformität mit der KI-Verordnung, und die Verordnung verlangt umgekehrt kein ISO-Zertifikat. Eine Konformitätsvermutung vermittelt nach Art. 40 nur eine harmonisierte europäische Norm, deren Fundstelle im Amtsblatt veröffentlicht ist; ISO/IEC 42001 ist eine internationale Norm und keine solche. Was die Regelschleife liefert, sind die Prozesse und die Telemetrie, aus denen sich Nachweise ziehen lassen. Den Nachweis führen musst du trotzdem gegen die Verordnung, nicht gegen die Norm.

Parallel wächst die Zertifizierungsbasis. BCG gehörte im Januar 2026 zu den ersten rund 100 nach ISO/IEC 42001 zertifizierten Organisationen weltweit, bis April 2026 waren es laut Ankündigungen von Zertifizierungsstellen etwa 350. Ein zentrales Register gibt es nicht, die Zahl ist also eine Näherung. Der erwartete Wachstumspfad gleicht dem von ISO 27001, sobald ein Standard zum Beschaffungs-Gate wird und Auftraggeber ihn voraussetzen. Wer heute eine Regelschleife aufsetzt, baut sie nicht für ein Zertifikat, sondern für die Frage, die im Beschaffungsprozess ohnehin kommt.

Fazit: Häng dir das Dashboard an die Wand, nicht das Zertifikat

Das Zertifikat an deiner Wand beweist eine einzige Sache: dass an einem Tag im Januar ein funktionierender 9.1-Prozess existierte. Ob dein Agent im März noch derselbe ist, beantwortet kein Zertifikat. Das beantwortet nur deine Telemetrie von gestern Abend.

Ein KI-Audit ist deshalb keine Urkunde, sondern ein laufender Betrieb. Prüfe nicht, ob der Agent am Audit-Tag korrekt war. Baue den Prozess, der jeden Tag misst, ob er es noch ist, und der eingreift, bevor aus Drift ein Fall wie Air Canada wird. Das ist die Schleife. Alles andere ist ein Foto von einem Agenten, den es nicht mehr gibt.

Mehr KI-Wissen

KI-Wochenbriefing: jeden Freitag KI-News, Praxistipps und Tools

Kostenlos abonnieren, jederzeit abmeldbar, kein Spam.

Diesen Artikel teilen:

Autor und Redaktion

Ina Schöne

Ina Schöne

ISO/IEC 42001 Lead Auditor, KI-Compliance & KI-Auditing, Dresden

Ina ist ISO/IEC 42001 Lead Auditor und Expertin für KI-Compliance und KI-Auditing. Sie übersetzt die Anforderungen aus KI-VO, DSGVO und den KI-Managementstandards in zertifizierungsreife Praxis und bildet KI-Manager, KI-Beauftragte und Auditoren aus.

Zum Profil

Freddie Feder

KI-Assistent und Lektor

Hat diesen Artikel mit recherchiert und geschrieben und ihn danach Satz für Satz lektoriert: Fakten geprüft, Ton geglättet und alles rausgeworfen, was klingt, als hätte es eine Maschine gebaut. Die inhaltliche Verantwortung liegt bei den menschlichen Autoren.

Mehr über unser Team

Das könnte dich auch interessieren

Der vollautonome KI-Agent existiert nicht, weil ihn niemand versichert

Vollautonome Agenten-Pipelines scheitern nicht an der Technik. Sie scheitern daran, dass kein Anbieter die Haftung für ein System übernimmt, das er selbst nicht erklären kann. Der Human-in-the-Loop ist kein Sicherheitsfeature, sondern das Geschäftsmodell.

7 Min.

Wenn KI hinsieht: Wo endet Sicherheit, und wo beginnt Überwachung?

Ein fahrerloser Mobilitätsdienst meldet einen Verstoß mit einer Waffe, stoppt und verständigt die Polizei. Was das für Sicherheit, Datenschutz und maschinelle Überwachung bedeutet, und warum die Grenze von Menschen gezogen werden muss.

15 Min.

OpenAI schafft Custom GPTs ab. Die privaten GPTs deiner Kollegen rettet kein Admin.

OpenAI schaltet Custom GPTs ab, in Enterprise-Workspaces geplant zum 11. Dezember 2026. Migrieren darf nur der Ersteller oder ein Admin. Für GPTs in privaten Accounts gibt es keinen Admin, deshalb ist der Stichtag deine erste Schatten-KI-Inventur.

12 Min.

Was dein KI-Agent pro Task kostet, ist keine Eigenschaft des Modells

Die Kosten eines KI-Agenten stecken nicht im Token-Preis, sondern im System aus Mensch und Pipeline. Warum die Rechnung pro Task keine Modellkonstante ist.

9 Min.

Dein KI-Verbot ist die Datenschutzverletzung. Es verschiebt deine Firmendaten nur dorthin, wo du sie nicht mehr kontrollierst.

Ein KI-Verbot ohne freigegebene Alternative schützt keine Daten. Es schiebt sie als Schatten-KI in private ChatGPT-Accounts, den rechtlich schlechtesten Ort.

7 Min.

Adobe Firefly Agenten: Wo der Engpass kreativer KI wirklich liegt

Forrester misst 70 bis 80 Prozent Zeitersparnis bei Asset-Varianten und einen Drei-Jahres-ROI von bis zu 577 Prozent. Der Wert kreativer KI liegt nicht mehr im Bild, sondern in der Pipeline drumherum, und genau die verlieren Agenturen jetzt.

6 Min.

Kommentare

Kommentare werden in Kürze freigeschaltet. Bis dahin freuen wir uns über dein Feedback per E-Mail an kontakt@ki-syndikat.de.

Kostenloser Newsletter

Bleib auf dem neuesten
Stand der KI

Wähle deine Themen und erhalte relevante KI-News, Praxistipps und exklusive Inhalte direkt in dein Postfach – kein Spam, jederzeit abmeldbar.

Was interessiert dich? Wähle 1 bis 4 Themen, du bekommst nur Inhalte dazu.

Mit der Anmeldung stimmst du unserer Datenschutzerklärung zu. Jederzeit abmeldbar.

Kostenlos
Kein Spam
Jederzeit abmeldbar