ベンチマーク
ベンチマークと方法論。
ChatGPT-6が現在の最先端モデルとどのように並ぶのかを示す完全な表、各数値の背景にある注意点、そして私たちがそれをどのようにまとめたかを詳しく説明します。
最終更新:2026年9月
ほとんどの比較表は、根拠を示さず結論だけを出します。この表では数値を示したうえで、その出典、数値からは分からないこと、そして無料プレビューによって計算がどう変わるのかを説明します。
ChatGPT-6は早期アクセスのプレビュー版です。そのため、数値は最終結果ではなく目安として捉えてください。このページを正直に読むなら、「どの商用モデルも匹敵できない価格で、最先端クラスの品質を実現」です。
完全版の表
9つの評価軸、5つのモデル、無料の列が1つ。
| Metric | ChatGPT-6 | GPT-5.6 | Opus 5 | Gemini 3.7 | Grok 4.6 |
|---|---|---|---|---|---|
| 知能指数 | 71* | 67 | 68 | 66 | 65 |
| エージェント型コーディング | 86* | 84 | 82 | 78 | 76 |
| コンテキストウィンドウ | 400K | 400K | 1M | 2M | 500K |
| 最大出力 | 128K | 128K | 64K | 64K | 64K |
| スループット(tps) | 58* | 70 | 55 | 92 | 120 |
| 出力価格 / 1M | $0 | $10 | $25 | $10 | $6 |
| マルチモーダル | |||||
| オープンウェイト | |||||
| 無料で利用可能 |
推論、知識、数学のベンチマークにおける総合スコア(高いほど優秀)。
エージェント型コーディングの目安スコア。ツールを使う実環境での複数ファイルのタスク(高いほど優秀)。
1回の会話でモデルが処理できる最大トークン数。
1回の呼び出しでモデルが生成する最大レスポンス。
1秒あたりのトークン数で測定した出力速度の中央値(高いほど高速)。
出力トークン100万個あたりの定価(安いほどお得です)。
テキストとともに画像入力を受け付けます。
重みをダウンロードしてセルフホストできます。
現在は無料で利用できます。
方法論
インテリジェンス指数は、Artificial Analysis Intelligence Indexの趣旨に沿った、公開されている推論・知識・数学ベンチマークの複合指標です。エージェント型コーディングは、単独のコード断片ではなく、ツールを使って実行された実際の複数ファイルタスクを反映しています。
コンテキストウィンドウ、最大出力、スループット、価格はプロバイダー公表値です。価格は出力トークン100万個あたりの定価です。入力トークンは通常より安いため、表を見やすくする目的で省略しています。
ChatGPT-6は早期アクセスプレビュー版のため、*印の付いた数値はベンダーのデータシートではなく、コミュニティが報告した推定値です。モデルの調整に伴って変動するため、より良いデータが得られ次第、このページを更新します。
この分野では数値が急速に変化します。モデル選びの方向性を定めるためのガイドとしてご利用ください。確定的なベンチマークランキングではありません。迷ったときは、ご自身のプロンプトで独自に評価を実行してください。
実際に確かめる
数値だけではわかりません。ChatGPT-6に実際のタスクを任せて、出力を評価してください。