Cloudflares Sicherheitsagenten sammeln Belege erst per Code und müssen sie zitieren
Cloudflare hat am 7. Oktober beschrieben, wie sein Dienst Managed Defense Sicherheitswarnungen mit KI-Agenten untersucht — und, für alle, die Agenten bauen, noch nützlicher: warum der erste Entwurf scheiterte.
Warum ein einzelner Agent scheiterte. Der erste Prototyp gab einem Allzweck-Agenten die ganze Untersuchung. Er lieferte brauchbare Analysen, aber auch Behauptungen, die die Belege nicht stützten. Cloudflare nennt drei wiederkehrende Probleme: Kontext wurde zur Autorität (eine Erkennung ist eine Hypothese, kein Beweis für einen erfolgreichen Angriff), der Umfang verrutschte (ein Agent kann das falsche Konto oder den falschen Zeitraum abfragen — ein Prompt ist keine Grenze) und Fehler verschwanden (eine abgelaufene Abfrage unterscheidet womöglich nicht zwischen „nicht geprüft“ und „geprüft, nichts gefunden“).
Die Lösung: erst Aufklärung, dann Inferenz. Bevor ein Modell aufgerufen wird, führt deterministischer Code eine feste, versionierte Aufklärung aus — Erkennungshistorie des Kunden, Verkehrsbasis, Ergebnis der Durchsetzung und Netzbeobachtungen — und speichert jedes Element mit Quelle, Version und Zeitstempel. Derselbe Schnappschuss lässt sich erneut abspielen, sodass Unterschiede zwischen Agenten aus der Deutung stammen, nicht aus dem Abruf.

Dann die Agenten.
- Ein schlankes Modell, Clef — Cloudflares quelloffenes Entscheidungsmodell auf Workers AI —, bewertet, wie wahrscheinlich eine Warnung ein Fehlalarm ist; bekanntes Massenrauschen wird als passiv eingestuft und bleibt aus der aktiven Warteschlange.
- Für Warnungen, die mehr brauchen, startet ein Koordinator vier Fachagenten parallel: Verkehrsanalyse, Kundenkontext, globale Telemetrie (nur Aggregate, nie Daten anderer Kunden) und Bedrohungsinformationen.
- Ein Synthese-Agent fasst ihre Befunde zusammen; er kann keine neuen Belege holen und keine Einstufung außerhalb einer genehmigten Liste wählen.
- Die Fachagenten müssen Elemente eines versionierten Belegpakets zitieren, und Anwendungscode prüft, ob jedes Zitat existiert und die Aussage stützt.
Der Bericht trennt ausdrücklich „nicht geprüft“ von „geprüft, ohne Treffer“, und ein menschlicher Analyst bestätigt den Umfang. Für tiefere Analysen nutzt Cloudflare nach eigenen Angaben freigegebene Modelle von OpenAI und Anthropic.