Dev News Daily ENDE

ServiceNows AutoSynthData macht aus Agentenfehlern neue Trainingsaufgaben

Das CoreAI-Team von ServiceNow hat im Blog von Hugging Face AutoSynthData beschrieben, eine Pipeline, die Trainingsdaten für KI-Agenten in Unternehmenssystemen erzeugt. Der Gedanke: Ein Modell soll genau an den Aufgaben lernen, an denen es derzeit scheitert, statt an allgemeinen Beispielen.

Zuerst laufen das Zielmodell und ein stärkeres Lehrermodell über Diagnoseaufgaben in der Umgebung. Wo das Ziel scheitert und der Lehrer Erfolg hat, fasst das Team das Muster in einer „Capability Specification Card“ zusammen. Der Generator sieht nie die ursprünglichen Prüfaufgaben oder Verläufe, nur diese Karten, und schreibt neue Aufgaben mit anderen Prompts, Daten und Lösungswegen, die dieselbe Fähigkeit verlangen. Der Lehrer führt dann für jede Aufgabe einen erfolgreichen Lauf vor, der für das Fine-Tuning genutzt wird.

Der größte Teil des Beitrags gilt der Qualitätskontrolle. Jede Aufgabe besteht aus Systemvorgabe, Nutzeranfrage und Verifier; die Autoren verlangen von der Aufgabe, dass sie lösbar, realistisch und für das Modell noch schwierig ist, und vom Verifier, dass er konsistent, korrekt und vollständig ist. Jeder Kandidat durchläuft eine positive Prüfung, bei der die Referenzlösung ausgeführt wird und bestehen muss, und eine negative, bei der Teile des erwarteten Ergebnisses verändert werden und dann scheitern müssen – das entlarvt Verifier, die Erfolg zu leicht vergeben. Durchgefallene Kandidaten gehen an einen Kritiker, der Reparaturen mit begrenzten Versuchen vorschlägt, und eine Prüfung auf Batch-Ebene gleicht überrepräsentierte Aufgabentypen aus.

Die Ergebnisse stammen aus EnterpriseOps Gym. In der Hybrid-Domäne mit Gemma-4-26B-A4B-it als Ziel und Qwen3.8-27B als Lehrer erzeugte die Pipeline 2.000 Beispiele in rund 18 Stunden; das Fine-Tuning hob Pass@1 im Mittel um 7,2 Prozentpunkte, ein relativer Gewinn von 35 %, und den Verifier-Erfolg von 63,01 auf 68,55 % – 59 % der Lücke zum Referenzmodell geschlossen. In der ITSM-Domäne stieg Pass@1 von 18,77 auf 27,18 %. Die Autoren betonen, dass dies Ergebnisse in der Versuchsumgebung sind, und wollen den Ansatz auch mit Reinforcement Learning testen.

ServiceNows AutoSynthData macht aus Agentenfehlern neue Trainingsaufgaben
ServiceNows AutoSynthData macht aus Agentenfehlern neue Trainingsaufgaben — Dev News Daily

Warum das wichtig ist

Teuer am Training von Agenten für ein bestimmtes Unternehmen ist nicht das Modell, sondern die Aufgaben und ihre Prüfungen. Übertragbar ist vor allem die negative Prüfstufe: Ein Verifier, der bei einer falschen Antwort nicht scheitern kann, bringt dem Modell still das Falsche bei.

Geschrieben von Victoria Shinder.