基准测试
基准测试与方法论。
ChatGPT-6 如何与当前前沿模型相比较——完整表格、每个数字背后的注意事项,以及我们具体是如何整理得出的。
最后更新:2026年9月
大多数对比表会直接给出结论,却不提供依据。这张表会先展示数据,然后告诉你数据的来源、无法说明什么,以及免费预览为何会改变计算结果。
ChatGPT-6 是抢先体验预览版,因此应将其数据视为参考方向,而非最终结果——阅读此页面的诚实方式是:“前沿级质量,价格却是任何正式上线模型都无法匹敌的。”
完整表格
九个维度,五个模型,其中一列免费。
| Metric | ChatGPT-6 | GPT-5.6 | Opus 5 | Gemini 3.7 | Grok 4.6 |
|---|---|---|---|---|---|
| 智能指数 | 71* | 67 | 68 | 66 | 65 |
| 智能体编程 | 86* | 84 | 82 | 78 | 76 |
| 上下文窗口 | 400K | 400K | 1M | 2M | 500K |
| 最大输出 | 128K | 128K | 64K | 64K | 64K |
| 吞吐量(tps) | 58* | 70 | 55 | 92 | 120 |
| 价格 / 每 1M 输出代币 | $0 | $10 | $25 | $10 | $6 |
| 多模态 | |||||
| 开放权重 | |||||
| 免费使用 |
涵盖推理、知识和数学基准测试的综合得分(越高越好)。
智能体编程参考得分——使用工具完成真实世界的多文件任务(越高越好)。
模型在单次对话中可关注的最大代币数。
模型在单次调用中生成的最大响应长度。
每秒代币数的输出速度中位数(越高越快)。
每百万输出 token 的标价(越低越便宜)。
支持在文本之外输入图像。
可下载权重并自行托管。
目前可免费使用。
方法论
智能指数是一个综合指标,参考 Artificial Analysis Intelligence Index 的理念,汇总公开的推理、知识和数学基准测试结果。智能编程反映的是使用工具执行的真实世界多文件任务,而非孤立的代码片段。
上下文窗口、最大输出、吞吐量和价格均为供应商提供的数据。价格是每百万输出 token 的标价;输入 token 通常更便宜,为了让表格更易读,此处省略。
ChatGPT-6 目前处于早期访问预览阶段,因此其数据(标有 *)是社区报告的估算值,而非供应商数据表中的官方数据。随着模型不断调优,这些数据会发生变化——我们会在获得更完善的数据后更新此页面。
这个领域的数据变化很快。请将此作为选择模型的方向性指南,而不是权威的基准测试排行榜。如有疑问,请使用自己的提示词进行自定义评测。
亲自看看
数据只是一个方面。给 ChatGPT-6 一个真实任务,亲自评判输出结果。