Staatliches KI-Institut veroeffentlicht Tests in gemeinsamem Schema
Die EvalEval Coalition teilte am 22. September 2026 mit, dass das UK AI Security Institute ihre Infrastruktur nutzt, um Evaluationsergebnisse offen zu veroeffentlichen.
Zusammengearbeitet haben beide schon zuvor: Forschung, die bei einem gemeinsamen Workshop neben der NeurIPS 2025 begann, und Rueckmeldungen des Instituts haben das Schema Every Eval Ever (EEE) mitgeformt. Diese Phase bringt die gemeinsame Infrastruktur in den Gebrauch statt in ein weiteres Papier.
Das Problem steht im Beitrag unverblümt. Mit der Beschleunigung des KI-Einsatzes werden Evaluationen zu einer wichtigen Belegquelle dafuer, wie ein Modell oder System arbeitet — die Ergebnisse erscheinen jedoch in vielen Formaten, auf vielen Plattformen, oft ohne genug Angaben, um sie nachzuvollziehen, und die Evaluation erneut laufen zu lassen kann fuer sich schon unbezahlbar sein. Die Antwort von EvalEval ist ein gemeinsames Berichtsschema samt offener Plattform, Evaluation Cards, die Ergebnis und Deutungskontext in eine Struktur bringt.

Was daran bemerkenswert ist
Der Satz ueber die Kosten traegt das Ganze. In den meisten Faechern ist «liess sich nicht reproduzieren» ein Befund. In der Evaluationsarbeit ist er oft gar nicht erreichbar: Die Rechenzeit fuer einen erneuten Lauf uebersteigt haeufig das, was ein unabhaengiger Pruefer aufwenden wird — die veroeffentlichte Zahl bleibt also unwidersprochen, nicht weil sie der Pruefung standhielt, sondern weil die Pruefung unbezahlbar war. Ein Schema, das die Bedingungen neben dem Wert mitfuehrt, macht den erneuten Lauf nicht billig, aber es macht die Behauptung an ihren eigenen Massstaeben pruefbar, und das ist das Naechstbeste.
Und wer hier uebernimmt, ist die eigentliche Nachricht, mehr als das Schema. Ein nationales Institut ist kein Labor mit einer Bestenliste; seine Zahlen werden in Politik zitiert. Bindet sich ein solches Haus an ein strukturiertes, offenes Format, hoert das Format auf, eine Konvention der Gemeinschaft zu sein, und wird zu etwas, wonach andere gefragt werden, warum sie es nicht nutzen.
Nicht belegt ist damit, dass die Ergebnisse selbst vergleichbar werden. Ein gemeinsames Schema normiert, wie eine Evaluation beschrieben wird, nicht was sie misst — zwei Karten koennen vollstaendig und formgerecht sein und trotzdem Verschiedenes messen. Das ist eine echte Grenze, und der Beitrag behauptet auch nichts anderes.