Dev News Daily ENDE

Studie: Das Chat-Template, nicht die Gewichte, erzeugt die KI-Hinweise

Ein auf arXiv als 2609.25021 veröffentlichtes Papier mit dem Titel "As a Language Model...": Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It fragt, woher ein bekanntes Verhalten stammt: Modelle, die Hinweise wie "Ich bin nur eine KI" anfügen, wenn sie nach sich selbst gefragt werden. Solche Selbstauskünfte werden oft in Debatten über KI-Sicherheit und darüber zitiert, ob Modelle etwas über sich wissen.

Die Autoren berichten, dass das Chat-Template wie ein Schalter wirkt. Bei acht verbreiteten Open-Source-Instruct-Modellen mit bis zu neun Milliarden Parametern verstärkte das Template die Hinweise auf den KI-Status und dämpfte Erlebnissprache wie "Ich fühle"; ohne Template war es umgekehrt. In drei Modellen fanden sie eine Richtung im Aktivierungsraum, die das Verhalten steuert: Sie zu entfernen, senkt die Hinweise, sie hinzuzufügen, erhöht sie, und eine zufällige Richtung gleicher Größe wirkt kaum. Fügt man die Richtung Instruct-Modellen ohne Template hinzu, äußern sie sich, als wäre das Template vorhanden.

Ihr Schluss ist deutlich: Was Modelle über sich sagen, ist keine Tatsache über sie. Die Selbstbeschreibung stammt teils aus den Gewichten, teils aus dem Chat-Template und sollte nicht wörtlich genommen werden. Für Forschung zu Selbstauskünften oder Introspektion ist das Template eine Störgröße, die kontrolliert werden muss, und die Steuerungsrichtung ein Werkzeug dafür. Das Papier wurde für Workshops der COLM 2026 und der KONVENS 2026 angenommen.

Studie: Das Chat-Template, nicht die Gewichte, erzeugt die KI-Hinweise
Studie: Das Chat-Template, nicht die Gewichte, erzeugt die KI-Hinweise — Dev News Daily

Was das bedeutet

Für Entwickler betrifft die praktische Lehre die Sorgfalt bei Auswertungen. Dasselbe Modell kann unterschiedlich antworten, je nachdem, ob eine Anfrage durch das Chat-Template läuft, und viele Evaluationswerkzeuge, lokale Laufzeiten und API-Wrapper wenden Templates uneinheitlich an. Ein Verhaltensvergleich ohne festgelegtes Template misst womöglich die Formatierung statt des Modells.

Der größere Punkt reicht über solche Hinweise hinaus. Instruct-Modelle lernen Verhalten, das an den Gesprächsrahmen ihres Trainings gebunden ist. Was wie der "Charakter" eines Modells wirkt, kann eine Eigenschaft der Art sein, wie es angesprochen wird - wichtig für alle, die aus Aussagen eines Modells über sich selbst Schlüsse ziehen. Die Studie umfasst Modelle bis 9 Milliarden Parameter; ob der Effekt bei größeren Modellen gilt, ist nicht getestet.

Primärquelle
arXiv 2609.25021
https://arxiv.org/abs/2609.25021
Geschrieben von Victoria Shinder.