Dev News Daily ENDE

NVIDIA bringt Nemotron 3 per Feintuning auf Goldniveau bei IOI 2026 und IMO 2026

NVIDIA hat am 7. Oktober im Hugging-Face-Blog beschrieben, wie es seine Nemotron-3-Modelle für zwei sehr unterschiedliche Wettbewerbe spezialisiert hat: die Internationale Informatik-Olympiade (IOI), bei der Code versteckte Tests unter Zeit- und Abgabelimits bestehen muss, und die Internationale Mathematik-Olympiade (IMO), bei der schriftliche Beweise gefragt sind.

Die beiden Ergebnisse.

  • IOI 2026: Nemotron-3-Ultra-CC, feinjustiert und mit einer iterativen Schleife aus Erzeugen, Bewerten und Verbessern betrieben (vom Team GenCorrect genannt), erreichte 535,4 von 600 Punkten. Die Goldschwelle lag bei 361,12, das beste menschliche Ergebnis bei 498,27. NVIDIA betont, dass es ein Live-Lauf unter den Zeit-, Internet- und Abgabebedingungen der Teilnehmer war, aber ein inoffizieller, unbeaufsichtigter Benchmark, der nicht in der offiziellen Wertung steht.
  • IMO 2026: Ein System aus Erzeugen, Prüfen und Verbessern auf Basis von Nemotron-3-Ultra-Checkpoints erzielte 30 von 42 Punkten, über der offiziellen Goldschwelle von 29, mit voller Punktzahl bei vier von sechs Aufgaben. Die Beweise wurden von offiziellen IMO-Korrektoren bewertet. Das System arbeitete in natürlicher Sprache, ohne formalen Beweiser, Werkzeuge oder Internetzugang.
NVIDIA bringt Nemotron 3 per Feintuning auf Goldniveau bei IOI 2026 und IMO 2026
NVIDIA bringt Nemotron 3 per Feintuning auf Goldniveau bei IOI 2026 und IMO 2026 — Dev News Daily

Das Rezept. Der Beitrag beschreibt vier Schritte, die er für wiederverwendbar hält: ein starkes Basismodell; kuratierte Aufgaben und Lösungswege aus dem Fachgebiet; übliches Post-Training (überwachtes Feintuning und, wo sinnvoll, Reinforcement Learning); und eine Inferenzschleife, die Antworten erzeugt, prüft und verbessert.

Die Zahlen dahinter. Für das Programmieren stellte das Team 22.000 Aufgaben zusammen. Das kleinere Nemotron-3-Nano-CC (30 Milliarden Parameter, davon 3 Milliarden aktiv) stieg auf der IOI 2025 von 130 Punkten vor dem Post-Training auf 280 nach dem Feintuning, 291 nach Reinforcement Learning und 468 mit GenCorrect. Für die Mathematik umfasste der Feintuning-Datensatz 414.890 Beispiele zu 15.818 Beweisaufgaben, einschließlich Prüfung und Kritik von Beweisen.

Das Fazit des Beitrags: Spezialisierung und Rechenaufwand zur Laufzeit ergänzen sich — ein besser trainiertes Modell liefert der Suchschleife bessere Kandidaten und bessere Kritiker.