Benchmarks

Benchmarks und Methodik.

Wie ChatGPT-6 im Vergleich zur aktuellen Modellspitze abschneidet — die vollständige Tabelle, die Einschränkungen hinter jeder Zahl und genau, wie wir sie erstellt haben.

Zuletzt aktualisiert: September 2026

Die meisten Vergleichstabellen liefern ein Urteil, ohne die Belege zu zeigen. Diese hier zeigt die Zahlen und erklärt anschließend, woher sie stammen, was sie nicht aussagen können und warum eine kostenlose Vorschau die Rechnung verändert.

ChatGPT-6 ist eine Vorschau mit frühem Zugang. Betrachte die Werte daher eher als richtungsweisend denn als endgültig — die ehrliche Lesart dieser Seite lautet: „Qualität auf Frontier-Niveau zu einem Preis, mit dem kein regulär veröffentlichtes Modell mithalten kann.“

Die vollständige Tabelle

Neun Dimensionen, fünf Modelle, eine kostenlose Spalte.

Metric
ChatGPT-6
GPT-5.6
Opus 5
Gemini 3.7
Grok 4.6
Intelligenzindex71*67686665
Agentisches Programmieren86*84827876
Kontextfenster400K400K1M2M500K
Maximale Ausgabe128K128K64K64K64K
Durchsatz (tps)58*705592120
Preis / 1M Ausgaben$0$10$25$10$6
Multimodal
Offene Gewichte
Kostenlos nutzbar
Intelligenzindex

Zusammengesetzte Punktzahl aus Benchmarks zu Schlussfolgerungsvermögen, Wissen und Mathematik (höher ist besser).

Agentisches Programmieren

Richtwert für agentisches Programmieren — realitätsnahe Aufgaben mit mehreren Dateien und Tools (höher ist besser).

Kontextfenster

Maximale Anzahl an Tokens, die das Modell in einer einzelnen Unterhaltung berücksichtigen kann.

Maximale Ausgabe

Größte Antwort, die das Modell in einem Aufruf generiert.

Durchsatz (tps)

Mediane Ausgabegeschwindigkeit in Tokens pro Sekunde (höher ist schneller).

Preis / 1M Ausgaben

Listenpreis pro einer Million ausgegebener Tokens (niedriger ist günstiger).

Multimodal

Akzeptiert Bildeingaben neben Texteingaben.

Offene Gewichte

Modellgewichte können heruntergeladen und selbst gehostet werden.

Kostenlos nutzbar

Derzeit kostenlos nutzbar.

Methodik

Der Intelligenzindex ist ein zusammengesetzter Wert aus öffentlichen Benchmarks zu Schlussfolgern, Wissen und Mathematik, im Sinne des Artificial Analysis Intelligence Index. Agentisches Programmieren bildet Aufgaben aus der Praxis mit mehreren Dateien ab, die mit Tools statt mit isolierten Codeausschnitten ausgeführt werden.

Kontextfenster, maximale Ausgabe, Durchsatz und Preis sind von den Anbietern gemeldete Werte. Der Preis entspricht dem Listenpreis pro einer Million ausgegebener Tokens; Eingabetokens sind in der Regel günstiger und werden weggelassen, damit die Tabelle übersichtlich bleibt.

ChatGPT-6 befindet sich in einer Early-Access-Vorschau. Daher sind die mit * gekennzeichneten Werte von der Community gemeldete Schätzungen und kein Datenblatt des Anbieters. Sie werden sich ändern, während das Modell optimiert wird – wir aktualisieren diese Seite, sobald bessere Daten verfügbar sind.

Die Zahlen ändern sich in diesem Bereich schnell. Nutze dies als Orientierungshilfe bei der Auswahl eines Modells, nicht als offizielle Benchmark-Rangliste. Im Zweifel solltest du deine eigene Evaluierung mit deinen eigenen Prompts durchführen.

Überzeuge dich selbst

Zahlen sind das eine. Gib ChatGPT-6 eine echte Aufgabe und beurteile die Ausgabe.

Chat öffnen