OpenAI erweitert das Prompt-Caching fuer GPT-6 und erklaert Cache-Misses
OpenAI hat am 22. September 2026 Aenderungen am Prompt-Caching fuer die GPT-6-Familie veroeffentlicht. Zwischengespeicherte Eingabetoken bringen Rabatte von bis zu 90 Prozent, und das neue System liefert nach Angaben des Unternehmens von Haus aus hoehere Trefferquoten; Rabatte gelten fuer geeignete gemeinsame Praefixe, die binnen 30 Minuten wiederverwendet werden.
Begruendet wird das mit Agenten. Ein dauerhaft arbeitender Agent stellt ueber Stunden eine Folge von API-Anfragen, die aufeinander aufbauen und dieselben Anweisungen, Werkzeugdefinitionen und frueheren Kontext mitfuehren; das Zwischenspeichern dieses gemeinsamen Praefixes verwendet die Berechnung wieder, statt sie zu wiederholen.
Zwei Werkzeuge begleiten die Aenderung. Ein Prompt-Caching-Dashboard zeigt, welcher Anteil der Eingaben aus dem Cache bedient wird, verfolgt Trefferquoten ueber die Zeit und stellt zwischengespeicherte und nicht zwischengespeicherte Token gegenueber. Ein Diagnosewerkzeug erklaert einen unerwarteten Fehlgriff, indem es eine Anfrage mit einer juengeren Antwort vergleicht und benennt, was sich geaendert hat — die Ausgabe enthaelt ein Feld reason mit Werten wie tools_changed sowie eine Schaetzung der betroffenen Tokenzahl.
Zitiert wird Mario Rodriguez, Chief Product Officer von GitHub: Der Anteil der Prompt-Token, die ueber Milliarden von Anfragen an OpenAI-Modelle frisch verarbeitet werden mussten, sei in den vergangenen Monaten um mehr als 50 Prozent gegenueber dem vorherigen Ausgangswert gesunken.

Was das bedeutet
Interessanter ist die Diagnosehaelfte, denn der Fehlerfall des Prompt-Cachings war immer stumm. Ein Fehlgriff kostet Geld und Zeit und sieht aus wie eine gewoehnliche Anfrage; Teams entdecken das Problem in der Rechnung und nicht im Trace. Die Ursache zu benennen — eine geaenderte Werkzeugdefinition, eine veraenderte Einstellung — macht aus raetselhaften Kosten eine Anmerkung im Code-Review.
tools_changed als benannter Grund lohnt das Verweilen. Es heisst, dass die Bearbeitung eines Werkzeugschemas das Praefix fuer alles Nachfolgende entwertet — Werkzeugdefinitionen sind damit ein Teil des Prompts mit Kostenfolgen und nicht bloss eine Schnittstelle. Anwendungen, die Werkzeuglisten je Anfrage dynamisch zusammenbauen, zahlen womoeglich fuer dieses Muster, ohne es zu wissen.
Eine Zahl mit Vorsicht: Die 50 Prozent sind die Darstellung eines Kunden ueber die eigene Last, zitiert vom Anbieter. Das ist eine plausible Groessenordnung, kein Benchmark — und die einzige Zahl, die die eigene Anwendung beschreibt, steht auf dem neuen Dashboard.