Holo4-Agentenmodelle bedienen Bildschirm, Code und APIs mit einem Modell
H Company hat Holo4 veröffentlicht, eine neue Reihe von Agentenmodellen, die Software über die jeweils passende Schnittstelle bedienen: Klicken und Tippen am Bildschirm, eigenen Code schreiben und ausführen oder Werkzeuge über MCP und APIs aufrufen. Die Reihe gibt es in zwei Größen, als Dense-Modell mit 27 Milliarden Parametern und als 35B-A3B-Mixture-of-Experts-Modell, beide über die H Models API des Unternehmens. Dazu kommt ein aktualisiertes kleines Modell, Holotron4 Nano.
Das Argument des Unternehmens: Agentenmodelle werden meist nur für eine Schnittstelle trainiert. Ein Modell für grafische Oberflächen ist ohne Bildschirm hilflos, ein Modell für Tool-Aufrufe scheitert an einer Anwendung ohne API. Holo4 ist auf Desktop, im Web, unter Android, in einer Code-Sandbox und gegenüber Geschäfts-APIs dasselbe Modell und wird überall gleich aufgerufen.
Im Desktop-Benchmark OSWorld 2.0 erreicht Holo4 27B 61,7 %, das Mixture-of-Experts-Modell 30,9 %. Das stärkste geschlossene Modell im Vergleich von H Company, Opus 5.5, kommt auf 81,8 %. Laut H Company liegt Holo4 bei langen Abläufen nur hinter den stärksten geschlossenen Modellen, kostet pro Aufgabe aber weit weniger. Das Unternehmen veröffentlicht jede Trajektorie hinter seinen öffentlichen Benchmark-Werten, sodass sich jeder Schritt nachspielen lässt. Trainiert wurde mit überwachtem und bestärkendem Lernen auf Umgebungen aus der sogenannten Agentic Task Factory; beide Modelle bauen auf Qwen-Basismodellen auf.

Was das bedeutet
Entscheidend ist weniger der Abstand zum Spitzenreiter als die Kostenspalte daneben. Bei Abläufen, die tausendfach laufen müssen, kann ein Modell mit 61,7 %, das billig genug für Wiederholungen ist, mehr nützliche Arbeit leisten als ein stärkeres, das pro Versuch bezahlt wird. Auch die veröffentlichten Trajektorien zählen: Ein Benchmark-Wert, der sich Schritt für Schritt nachvollziehen lässt, verdient mehr Vertrauen. Das Unternehmen weist selbst darauf hin, dass die Kosten aus seiner eigenen Testumgebung stammen und sich Versionen und Aufgabenauswahl zwischen den verglichenen Modellen unterscheiden.