Dev News Daily ENDE

Microsofts ThinkingBox bewertet KI-Agenten nach dem Zustand der Datenbank, je 20 Läufe

Microsoft hat mit ThinkingBox einen Benchmark für KI-Agenten veröffentlicht, der nicht prüft, was der Agent über seine Arbeit sagt, sondern was danach tatsächlich im Backend steht. Ein gemeinsamer Beitrag mit Hugging Face vom 3. Oktober beschreibt 507 zustandsbehaftete Geschäftsabläufe, jeder 20-mal von einem identischen, sauberen Backend aus gestartet. Der Benchmark ist über OpenEnv von Hugging Face verfügbar.

Das Beispiel, mit dem die Autoren beginnen. Ein Haushaltsgerät für 745 Dollar hängt seit fünfzehn Tagen in einer Ausnahme beim Paketdienst. Der Agent macht neun sinnvolle Werkzeugaufrufe, eröffnet ein Ticket, liest die Erstattungsregeln richtig – und schließt das Ticket als gelöst. Verlangt war der Status „wartend“, weil die Ausnahme beim Zusteller noch offen war. Wer die Werkzeugaufrufe prüft, sieht neun gültige Aufrufe; widersprechen tut nur ein einziges Feld in der Datenbank.

Wie häufig das ist. In einer Auswertung über 121.680 gültige Versuche mit 12 Modellen scheiterten 79.853 an den ausführbaren Prüfungen. Von diesen endeten 67,24 Prozent trotzdem ordnungsgemäß, riefen ein zustandsänderndes Werkzeug auf und meldeten keinen Fehler. Die Prüfungen fanden falsche Feldwerte in 77,61 Prozent davon, unbeabsichtigte zusätzliche Effekte in 43,30 Prozent und fehlende Effekte in 25,36 Prozent; ein Fehlschlag kann mehrere davon zeigen.

Einmal oder jedes Mal. Der Beitrag nennt pro Modell drei Zahlen: die Quote eines Einzelversuchs, die Aufgaben, die in 20 Läufen mindestens einmal gelöst werden, und jene, die in allen 20 gelingen. Claude Opus 5.5 führt beim Einzelversuch mit 67,16 Prozent, zwei Drittel Punkte vor Claude Opus 5. Kimi-K3, das stärkste Modell mit offenen Gewichten, löst 476 von 507 Aufgaben mindestens einmal, aber nur 68 in allen 20 Versuchen. Opus 5 löst weniger Aufgaben mindestens einmal, schafft aber 241 jedes Mal – und Opus 5.5 ebenfalls genau 241. Die höhere Schlagzeilenzahl des neueren Modells brachte also keine zusätzliche Verlässlichkeit. GPT-6 Astra behält über die Wiederholungen 78 Prozent seiner Einzelquote, GLM-5.1, Kimi-K2.6 und DeepSeek-V4-Pro jeweils etwa 8 Prozent.

Was es kostet. Zu Listenpreisen ist GPT-5.6 Sol pro erfolgreichem Versuch mit 0,127 Dollar am günstigsten. Pro verlässlicher Aufgabe – Kosten aller 20 Läufe geteilt durch die Aufgaben, die 20 von 20 bestehen – liegt GPT-5.4 mit 6,80 Dollar bei 128 Aufgaben vorn, GPT-6 Astra erreicht 231 für 7,45 Dollar und Opus 5.5 erreicht 241 für 7,80 Dollar. Nach der Einordnung der Autoren gehen etwa vier von fünf Fehlschlägen auf den Umgang mit Werkzeugen zurück, nicht auf das Schlussfolgern.

Microsofts ThinkingBox bewertet KI-Agenten nach dem Zustand der Datenbank, je 20 Läufe
Microsofts ThinkingBox bewertet KI-Agenten nach dem Zustand der Datenbank, je 20 Läufe — Dev News Daily

Was das bedeutet

Wer einen Agenten an echte Datensätze lässt, braucht die Spalte, die die meisten Ranglisten weglassen: wie oft dieselbe Aufgabe bei jedem Lauf richtig ausgeht. Tests, die nur das Protokoll des Agenten prüfen oder nur, ob er überhaupt etwas geschrieben hat, hätten das gescheiterte Ticket oben durchgelassen. Erwischt hat es der Vergleich des Endzustands mit dem, den die Aufgabe verlangte.

Primärquelle
Hugging Face Blog (Microsoft)
https://huggingface.co/blog/microsoft/thinkingbox
Geschrieben von Victoria Shinder.