Benchmarks
Benchmarks und Methodik.
Wie ChatGPT-6 im Vergleich zur aktuellen Modellspitze abschneidet — die vollständige Tabelle, die Einschränkungen hinter jeder Zahl und genau, wie wir sie erstellt haben.
Zuletzt aktualisiert: September 2026
Die meisten Vergleichstabellen liefern ein Urteil, ohne die Belege zu zeigen. Diese hier zeigt die Zahlen und erklärt anschließend, woher sie stammen, was sie nicht aussagen können und warum eine kostenlose Vorschau die Rechnung verändert.
ChatGPT-6 ist eine Vorschau mit frühem Zugang. Betrachte die Werte daher eher als richtungsweisend denn als endgültig — die ehrliche Lesart dieser Seite lautet: „Qualität auf Frontier-Niveau zu einem Preis, mit dem kein regulär veröffentlichtes Modell mithalten kann.“
Die vollständige Tabelle
Neun Dimensionen, fünf Modelle, eine kostenlose Spalte.
| Metric | ChatGPT-6 | GPT-5.6 | Opus 5 | Gemini 3.7 | Grok 4.6 |
|---|---|---|---|---|---|
| Intelligenzindex | 71* | 67 | 68 | 66 | 65 |
| Agentisches Programmieren | 86* | 84 | 82 | 78 | 76 |
| Kontextfenster | 400K | 400K | 1M | 2M | 500K |
| Maximale Ausgabe | 128K | 128K | 64K | 64K | 64K |
| Durchsatz (tps) | 58* | 70 | 55 | 92 | 120 |
| Preis / 1M Ausgaben | $0 | $10 | $25 | $10 | $6 |
| Multimodal | |||||
| Offene Gewichte | |||||
| Kostenlos nutzbar |
Zusammengesetzte Punktzahl aus Benchmarks zu Schlussfolgerungsvermögen, Wissen und Mathematik (höher ist besser).
Richtwert für agentisches Programmieren — realitätsnahe Aufgaben mit mehreren Dateien und Tools (höher ist besser).
Maximale Anzahl an Tokens, die das Modell in einer einzelnen Unterhaltung berücksichtigen kann.
Größte Antwort, die das Modell in einem Aufruf generiert.
Mediane Ausgabegeschwindigkeit in Tokens pro Sekunde (höher ist schneller).
Listenpreis pro einer Million ausgegebener Tokens (niedriger ist günstiger).
Akzeptiert Bildeingaben neben Texteingaben.
Modellgewichte können heruntergeladen und selbst gehostet werden.
Derzeit kostenlos nutzbar.
Direktvergleich
Du möchtest einen fokussierten Einzelvergleich? Wähle ein Duell.
Methodik
Der Intelligenzindex ist ein zusammengesetzter Wert aus öffentlichen Benchmarks zu Schlussfolgern, Wissen und Mathematik, im Sinne des Artificial Analysis Intelligence Index. Agentisches Programmieren bildet Aufgaben aus der Praxis mit mehreren Dateien ab, die mit Tools statt mit isolierten Codeausschnitten ausgeführt werden.
Kontextfenster, maximale Ausgabe, Durchsatz und Preis sind von den Anbietern gemeldete Werte. Der Preis entspricht dem Listenpreis pro einer Million ausgegebener Tokens; Eingabetokens sind in der Regel günstiger und werden weggelassen, damit die Tabelle übersichtlich bleibt.
ChatGPT-6 befindet sich in einer Early-Access-Vorschau. Daher sind die mit * gekennzeichneten Werte von der Community gemeldete Schätzungen und kein Datenblatt des Anbieters. Sie werden sich ändern, während das Modell optimiert wird – wir aktualisieren diese Seite, sobald bessere Daten verfügbar sind.
Die Zahlen ändern sich in diesem Bereich schnell. Nutze dies als Orientierungshilfe bei der Auswahl eines Modells, nicht als offizielle Benchmark-Rangliste. Im Zweifel solltest du deine eigene Evaluierung mit deinen eigenen Prompts durchführen.
Überzeuge dich selbst
Zahlen sind das eine. Gib ChatGPT-6 eine echte Aufgabe und beurteile die Ausgabe.