Dev News Daily ENDE

NVIDIA veroeffentlicht ein offenes Diarisierungsmodell mit 100 Millionen Parametern und 14,72 Prozent Fehlerrate

NVIDIA hat Nemotron 3 Diarization veroeffentlicht, ein Modell mit offenen Gewichten und 100 Millionen Parametern, das bestimmt, wer wann gesprochen hat. In der Diarisierungs-Rangliste von VoiceArena steht es auf Platz eins, mit einer Diarization Error Rate von 14,72 Prozent, und es ist auf ueberlappende Gespraeche ausgelegt, nicht auf sauberes Abwechseln.

Nuetzlich ist vor allem die Einordnung im Beitrag. Jedes Gespraech traegt zwei Schichten: die Worte und die Person, zu der sie gehoeren. Die Spracherkennung erledigt die erste. Ohne die zweite entsteht ein Protokoll, in dem jeder Satz stimmt und keiner zugeordnet ist, und der Text fuehrt vor, was das kostet: Man kann nicht sagen, wer eine Zusage gemacht, wer den Einwand erhoben und wer unterbrochen hat. Suche, Zusammenfassungen, Aufgabenlisten, Gespraechsauswertung und das Gedaechtnis eines Sprachagenten verlieren gleichzeitig an Wert.

NVIDIA veroeffentlicht ein offenes Diarisierungsmodell mit 100 Millionen Parametern und 14,72 Prozent Fehlerrate
NVIDIA veroeffentlicht ein offenes Diarisierungsmodell mit 100 Millionen Parametern und 14,72 Prozent Fehlerrate — Dev News Daily

Was das bedeutet

Die Zahl, bei der man verweilen sollte, ist die Parameterzahl. Mit 100 Millionen ist das klein genug, um neben einem Transkriptionsmodell zu laufen statt an seiner Stelle, und zwar auf Hardware, die keine eigene Budgetzeile braucht. Diarisierung war bislang der Teil der Kette, der als Erstes wegfiel, sobald Latenz oder Kosten druecken — genau deshalb sind so viele Protokolle im Betrieb sprecherblind.

Zu planen ist die Folge weiter hinten, nicht die akustische. Die Zuordnung zu Sprechern macht aus einem Protokoll eine Aufzeichnung, und eine Aufzeichnung ist ein Artefakt anderer Art: nach Person durchsuchbar, je Teilnehmer zusammenfassbar, zitierbar. Damit erbt sie auch andere Pflichten. Ein nicht zugeordnetes Protokoll eines Kundengespraechs ist ein Ungefaehr; ein zugeordnetes sind personenbezogene Daten identifizierbarer Menschen, mit Fragen zu Aufbewahrung und Zugriff. Das klaert man besser, bevor die Kette laeuft, nicht danach.

Geschrieben von Victoria Shinder.