Opus 5.5: Günstigere Tokens, teurere Aufgaben
Im berichteten Coding-Benchmark steigt die Leistung. Bei maximalem Reasoning-Aufwand aber auch die Rechnung. Entscheidend sind die Kosten pro erfolgreich erledigter Aufgabe. Veröffentlicht am 25. September 2026
Das ist kein Widerspruch. Der Test lief in Claude Code mit maximalem Reasoning-Aufwand, also dem höchsten eingestellten Aufwand fürs Schlussfolgern. In dieser Konfiguration verbraucht Opus 5.5 so viele zusätzliche Tokens, dass die tieferen Stückpreise die Mehrkosten nicht auffangen.
Die Leistungsgewinne sind im beschriebenen Test klar: Die Gesamtwertung steigt auf 66 Punkte, sechs Punkte über Opus 5. Alle drei Teiltests legen zu. Den grössten Sprung macht Terminal-Bench 4.0 mit 8,6 Prozentpunkten, von 54,5 auf 63,1 Prozent.
Dieser Teiltest prüft unter anderem die Arbeit mit der Kommandozeile, den korrekten Werkzeugeinsatz und den Umgang mit Zwischenfehlern. Für längere Coding-Aufgaben ist das relevant. Es beantwortet aber noch nicht die Frage, ob sich die zusätzliche Leistung im eigenen Arbeitsablauf rechnet.
| Kennzahl im berichteten Test | Opus 5 | Opus 5.5 |
| Geschätzte API-Kosten pro Aufgabe | 10.79 US-Dollar | 13.04 US-Dollar |
| Tokens pro Aufgabe insgesamt | Rund 11,4 Millionen | Rund 15,6 Millionen |
| Ausgabetokens pro Aufgabe | Rund 137 000 | Rund 333 000 |
Besonders deutlich wächst die Ausgabe: von rund 137 000 auf 333 000 Tokens pro Aufgabe. Gleichzeitig sinken die angegebenen Standardpreise für Eingabe und Ausgabe um jeweils 20 Prozent. Günstigere Einheiten, deutlich mehr Verbrauch. Unterm Strich bleibt eine höhere Rechnung.
Und die angekündigten 40 Prozent Einsparung? Die wiedergegebene Herstellerschätzung bezieht sich auf typische Arbeitslasten mit Standardeinstellungen, nicht auf diesen Benchmark mit maximalem Aufwand. Beide Angaben können nebeneinander stimmen, weil sie unterschiedliche Bedingungen beschreiben.
Was fehlt, ist ein kontrollierter Vergleich derselben Aufgaben über mehrere Aufwandseinstellungen hinweg. Die vorliegenden Ergebnisse beziffern nicht, wie viel Leistung bei niedrigerem Aufwand bleibt und welche Einsparung dabei tatsächlich entsteht. Aus dem Spitzenwert lässt sich deshalb keine pauschale Empfehlung für den Produktivbetrieb ableiten.
Für Teams ist eine andere Kennzahl entscheidend: Was kostet eine erfolgreich abgeschlossene und akzeptierte Aufgabe? Die 13.04 US-Dollar sind geschätzte API-Kosten pro Benchmark-Aufgabe. Sie sind kein ausgewiesener Preis pro erfolgreichem Produktionsauftrag inklusive Wiederholungen und menschlicher Prüfung.
1. Eigene Aufgaben vergleichen
Repräsentative Aufgaben aus den eigenen Repositories auswählen. Dieselben Prompts und Ausgangsbedingungen mit mehreren Reasoning-Einstellungen testen, statt nur die maximale Einstellung gegen das bisherige Modell antreten zu lassen.
2. Ergebnis und Aufwand erfassen
Akzeptierte Abschlüsse, Wiederholungen, Korrekturläufe und Laufzeit protokollieren. Dazu Eingabe-, Ausgabe- und Cache-Nutzung sowie die gesamten API-Kosten messen. Eine einzelne gelungene Ausführung reicht nicht als Entscheidungsgrundlage.
3. Nach erfolgreichem Abschluss rechnen
Die gesamten API-Kosten der Testläufe durch die Zahl der akzeptierten Abschlüsse teilen. Prüfaufwand und Wartezeit zusätzlich berücksichtigen. So lässt sich beurteilen, ob höhere Leistung ihre Mehrkosten im jeweiligen Arbeitsablauf rechtfertigt.
Nicht den Tokenpreis optimieren, sondern das Ergebnis
Opus 5.5 zeigt im berichteten Test mehr Coding-Leistung bei höheren Kosten pro Aufgabe. Ob das ein guter Tausch ist, entscheidet nicht die Rangliste. Entscheidend ist, welche Einstellung eure Aufgaben zuverlässig erledigt, mit vertretbarer Wartezeit und den tiefsten Gesamtkosten pro akzeptiertem Ergebnis.