基准测试

基准测试与方法论。

ChatGPT-6 如何与当前前沿模型相比较——完整表格、每个数字背后的注意事项,以及我们具体是如何整理得出的。

最后更新:2026年9月

大多数对比表会直接给出结论,却不提供依据。这张表会先展示数据,然后告诉你数据的来源、无法说明什么,以及免费预览为何会改变计算结果。

ChatGPT-6 是抢先体验预览版,因此应将其数据视为参考方向,而非最终结果——阅读此页面的诚实方式是:“前沿级质量,价格却是任何正式上线模型都无法匹敌的。”

完整表格

九个维度,五个模型,其中一列免费。

Metric
ChatGPT-6
GPT-5.6
Opus 5
Gemini 3.7
Grok 4.6
智能指数71*67686665
智能体编程86*84827876
上下文窗口400K400K1M2M500K
最大输出128K128K64K64K64K
吞吐量(tps)58*705592120
价格 / 每 1M 输出代币$0$10$25$10$6
多模态
开放权重
免费使用
智能指数

涵盖推理、知识和数学基准测试的综合得分(越高越好)。

智能体编程

智能体编程参考得分——使用工具完成真实世界的多文件任务(越高越好)。

上下文窗口

模型在单次对话中可关注的最大代币数。

最大输出

模型在单次调用中生成的最大响应长度。

吞吐量(tps)

每秒代币数的输出速度中位数(越高越快)。

价格 / 每 1M 输出代币

每百万输出 token 的标价(越低越便宜)。

多模态

支持在文本之外输入图像。

开放权重

可下载权重并自行托管。

免费使用

目前可免费使用。

方法论

智能指数是一个综合指标,参考 Artificial Analysis Intelligence Index 的理念,汇总公开的推理、知识和数学基准测试结果。智能编程反映的是使用工具执行的真实世界多文件任务,而非孤立的代码片段。

上下文窗口、最大输出、吞吐量和价格均为供应商提供的数据。价格是每百万输出 token 的标价;输入 token 通常更便宜,为了让表格更易读,此处省略。

ChatGPT-6 目前处于早期访问预览阶段,因此其数据(标有 *)是社区报告的估算值,而非供应商数据表中的官方数据。随着模型不断调优,这些数据会发生变化——我们会在获得更完善的数据后更新此页面。

这个领域的数据变化很快。请将此作为选择模型的方向性指南,而不是权威的基准测试排行榜。如有疑问,请使用自己的提示词进行自定义评测。

亲自看看

数据只是一个方面。给 ChatGPT-6 一个真实任务,亲自评判输出结果。

打开聊天