Patman's Neural Network

Wissensnetz wird geladen

Gemini 4 Argon: Viel Output, noch kein Beweis für den Alltag

Eine Million Output-Tokens und starke gemeldete Testwerte machen neugierig. Ob Argon im Betrieb überzeugt, bleibt offen. Veröffentlicht am 2. Oktober 2026

Eine Million Tokens ausgeben können ist nicht dasselbe wie eine Aufgabe zuverlässig erledigen. Genau an dieser Unterscheidung muss sich Gemini 4 Argon messen lassen. Die gemeldeten Ergebnisse sind stark, für ein Comeback-Urteil ist es zu früh.

Gemini 4 Argon wird als Googles neues Spitzenmodell für anspruchsvolle Programmierarbeit, Unternehmensaufgaben und Cyberabwehr beschrieben. Berichtet werden 77,9 Prozent auf DeepSWE v1.1 und der Spitzenplatz im Vals Index mit 68,9 Prozent. Das sind Gründe, genauer hinzuschauen. Kein Freipass für den Produktivbetrieb.

Die Zahlen stammen aus unterschiedlichen Auswertungen. Der DeepSWE-Wert wird als Google-Ergebnis wiedergegeben, der Vals-Wert aus einer separaten Benchmark-Konfiguration. Daraus lässt sich weder eine unabhängige Bestätigung sämtlicher Herstellerangaben noch eine pauschale Überlegenheit ableiten.

Mehr Output, nicht automatisch mehr Qualität

Das gemeldete Ausgabelimit steigt von 64'000 auf eine Million Tokens. Gemeint ist die erzeugbare Ausgabe, nicht das Kontextfenster für eingelesene Informationen. Das schafft Platz für längere Bearbeitungen, garantiert aber keine korrekte oder zusammenhängende Antwort bis zum letzten Token.

Der Test nutzte nicht das volle Limit

Die berichtete Vals-Auswertung begrenzte den Output auf 262'000 Tokens. Ihr Ergebnis belegt deshalb nicht, dass Argon auch nahe der beworbenen Million zuverlässig arbeitet. Qualität, Laufzeit und Fehlerverhalten an dieser Grenze bleiben offen.

Stärken sind nicht universell

Die gemeldeten Resultate sprechen besonders für Finanzaufgaben, juristische Arbeit und Teile der Softwareentwicklung. Bei der Bedienung grafischer Oberflächen und der formalen Programmsynthese fallen sie deutlich schwächer aus. Ein guter Gesamtwert ersetzt keinen passenden Aufgabentest.

Der praktische Reiz des grösseren Ausgabebudgets ist nachvollziehbar: Umfangreiche Code-Migrationen oder Dokumentaufgaben müssen seltener auf mehrere Modellaufrufe verteilt werden. Damit könnten auch Übergaben wegfallen, bei denen Zusammenfassungen Informationen verlieren oder Zwischenstände falsch übernommen werden.

Aber weniger Übergaben bedeuten nicht weniger Verantwortung. Prüfungen, menschliche Freigaben und die Wiederaufnahme nach einem Abbruch bleiben nötig. Wenn ein langer Lauf kurz vor Schluss scheitert, hilft die beeindruckende Token-Grenze wenig.

Auch Googles berichtete interne Einsätze sind interessant: Dazu gehören Speicheroptimierungen in Rechenzentren und Migrationen von C und C++ nach Rust. Das sind konkrete Einsatzfelder statt blosser Chat-Demos. Es bleiben jedoch wiedergegebene Herstellerangaben, keine Zusage für die eigene Codebasis.

Bei den Kosten lohnt sich der zweite Blick. Genannt werden folgende API-Preise pro Million Tokens in US-Dollar. Wann die Einführungsphase endet, geht aus den vorliegenden Angaben nicht hervor.

Token-Art Einführung Danach
Input 2 US-Dollar 4 US-Dollar
Zwischengespeicherter Input 0.10 US-Dollar 0.20 US-Dollar
Output 10 US-Dollar 20 US-Dollar

Eine vollständig ausgeschöpfte Million Output-Tokens würde damit zunächst 10 US-Dollar kosten, später 20. Der Input kommt dazu. Die entscheidende Kennzahl ist trotzdem nicht der Token-Preis, sondern der Aufwand pro erfolgreich abgeschlossener Aufgabe, inklusive Wiederholungen und Nachkontrolle.

Die grössere Hürde ist vorerst der Zugang. Laut den vorliegenden Angaben startet Argon bei ausgewählten Cyberabwehr-Teams und internen Nutzern. Bezahlte API-Kunden und Google-AI-Ultra-Abonnenten sollen später folgen; ein verbindlicher Termin für breiten Zugang fehlt.

Ebenso offen bleiben wichtige Betriebsdetails: regionale Verfügbarkeit, Nutzungslimits, verlässliche Laufzeiten und das Verhalten bei Unterbrechungen. Auch welche Cyber-Schutzmassnahmen für gewöhnliche API-Kunden gelten werden, ist nicht ausreichend geklärt. Für eine produktive Integration sind das keine Nebensachen.

Auf die Testliste, nicht blind in den Betrieb

Argon liefert gute Gründe für eine ernsthafte Evaluation, sobald Zugang besteht. Ein Comeback zeigt sich aber nicht an der längsten Ausgabe, sondern an verlässlich erledigter Arbeit. Entscheidend sind die eigenen Aufgaben, nachvollziehbare Ergebnisse und tragbare Gesamtkosten. Alles andere ist vorerst ein Versprechen.