Ai2 veröffentlicht AstaBrief, ein 8B-Modell für belegte Forschungsberichte
Das Allen Institute for AI (Ai2) hat AstaBrief veröffentlicht, ein Modell mit acht Milliarden Parametern, das aus einer Forschungsfrage und gefundenen Textstellen aus der Fachliteratur einen Bericht mit Quellenangaben schreibt. Es treibt nun den schnellen Modus der Funktion „Generate a report“ in Asta an, Ai2s Plattform für wissenschaftliche Arbeit, neben einem gründlicheren Modus, der auf Claude läuft. Ai2 stellt die Gewichte, die Trainingsdaten und einen Beispiel-Workflow bereit, mit dem Forschende Berichte aus eigenen PDFs erzeugen können.
Das Trainingsrezept ist bewusst einfach. Ausgangspunkt war Qwen3-8B. Ai2 erwog Reinforcement Learning, das die frühere Arbeit DR Tulu für lange Berichte nutzte, entschied sich aber für überwachtes Feintuning mit anschließender Direct Preference Optimization, weil das billiger und leichter zu debuggen ist. Für das Feintuning wurden echte Nutzeranfragen auf rund 90.000 Forschungsfragen gefiltert; die bestehende ScholarQA-Pipeline, gestützt auf mehrere proprietäre Modelle, erzeugte dazu Zielberichte, von denen nach der Qualitätsprüfung 47.000 blieben. Für die Präferenzpaare trat jeweils der ScholarQA-Bericht gegen einen an, den ein anderes Modell aus denselben Textstellen schrieb; zwei Modelle als Juroren wählten den besseren.
Die nützlichste Erkenntnis betraf laut Ai2 das Filtern. Getestet wurden mehrere Signale, etwa wie relevant die zitierten Arbeiten waren und wie viele der gefundenen Arbeiten ein Bericht nutzte. Den größten Gewinn brachte ein schlichtes Maß: Trainingsberichte zu verwerfen, in denen zu wenige Aussagen einen Beleg trugen. Schärfere Filter und deren Kombinationen brachten kaum mehr.
Die Geschwindigkeit ist die zentrale Zahl. Über die gesamte Asta-Pipeline braucht der schnelle Modus im Mittel 51,1 Sekunden pro Bericht, der gründliche 178,5 Sekunden – rund 3,5-mal so lange; gegenüber den zuvor beobachteten proprietären Modellen spricht Ai2 von einer fast zehnmal kürzeren Erzeugungszeit. Auf SQABench-CS2, 200 von Nutzern formulierten Informatikfragen, sei AstaBrief bei Antwortqualität sowie Präzision und Vollständigkeit der Belege mit der Claude-Pipeline und DR Tulu konkurrenzfähig.
Eine wichtige Einschränkung nennt Ai2 selbst: Der Großteil von Training und Evaluation fand 2025 statt. Die proprietären Modelle für Trainingsdaten und Vergleich sind also die damaligen, und die Evaluation wurde gegen heutige Spitzenmodelle nicht wiederholt.

Warum das wichtig ist
Ein kleines, lokal lauffähiges Modell ändert, wer solche Werkzeuge nutzen kann. Ai2 verweist auf Forschungsfragen, die unveröffentlichte Arbeit verraten und die Einrichtungen ungern an eine externe API schicken. Die offenen Trainingsdaten zählen dabei so viel wie die Gewichte: Wer prüfen will, ob das Modell die Aussage einer Studie unzulässig verallgemeinert – ein Fehler, den Ai2 ausführlich behandelt –, kann jetzt sehen, was es nachahmen sollte.