Mga benchmark
Mga benchmark at pamamaraan.
Kung paano naghahambing ang ChatGPT-6 sa kasalukuyang mga nangungunang modelo — ang buong talahanayan, ang mga limitasyon sa likod ng bawat numero, at kung paano namin ito eksaktong binuo.
Huling na-update: Setyembre 2026
Karamihan sa mga talahanayan ng paghahambing ay nagbibigay sa iyo ng hatol nang walang mga patunay. Ipinapakita ng isang ito ang mga numero at sinasabi kung saan nagmula ang mga ito, kung ano ang hindi nila masasabi sa iyo, at kung bakit binabago ng libreng preview ang kalkulasyon.
Ang ChatGPT-6 ay isang preview na may maagang access, kaya ituring ang mga bilang nito bilang gabay sa direksiyon at hindi bilang pinal na resulta — ang tapat na paraan ng pagbasa sa pahinang ito ay "kalidad na pang-frontier sa presyong hindi kayang tumbasan ng anumang modelong inilabas para sa produksyon."
Ang buong talahanayan
Siyam na dimensiyon, limang modelo, isang kolum na libre.
| Metric | ChatGPT-6 | GPT-5.6 | Opus 5 | Gemini 3.7 | Grok 4.6 |
|---|---|---|---|---|---|
| Indeks ng Intelligence | 71* | 67 | 68 | 66 | 65 |
| Agentic coding | 86* | 84 | 82 | 78 | 76 |
| Laki ng context window | 400K | 400K | 1M | 2M | 500K |
| Pinakamalaking output | 128K | 128K | 64K | 64K | 64K |
| Throughput (tps) | 58* | 70 | 55 | 92 | 120 |
| Presyo / 1M output | $0 | $10 | $25 | $10 | $6 |
| Multimodal | |||||
| Mga open weight | |||||
| Libreng gamitin |
Pinagsamang score para sa mga benchmark ng pangangatwiran, kaalaman, at matematika (mas mataas ay mas mahusay).
Tinatayang score sa agentic coding — mga gawain sa totoong mundo na may maraming file at mga tool (mas mataas ay mas mahusay).
Pinakamaraming token na kayang bigyang-pansin ng modelo sa isang pag-uusap.
Pinakamalaking tugon na gagawin ng modelo sa isang tawag.
Median na bilis ng output sa mga token bawat segundo (mas mataas ay mas mabilis).
Presyong listahan kada milyong output token (mas mababa, mas mura).
Tumatanggap ng image input kasabay ng text.
Maaaring i-download ang weights at i-self-host.
Magagamit nang walang bayad sa ngayon.
Harapan
Gusto mo ng nakatuon at one-on-one na paghahambing? Pumili ng match-up.
Pamamaraan
Ang Intelligence Index ay isang pinagsama-samang sukatan ng mga pampublikong benchmark sa pangangatwiran, kaalaman, at matematika, na kahawig ng Artificial Analysis Intelligence Index. Sinasalamin ng agentic coding ang mga gawain sa totoong mundo na may maraming file at isinasagawa gamit ang mga tool, sa halip na magkakahiwalay na snippet.
Ang context window, maximum na output, throughput, at presyo ay mga numerong iniulat ng provider. Ang presyo ay listahang halaga kada isang milyong output token; karaniwang mas mura ang input token at hindi isinama upang manatiling madaling basahin ang talahanayan.
Ang ChatGPT-6 ay nasa early-access preview, kaya ang mga numero nito (may markang *) ay mga pagtatantyang iniulat ng komunidad sa halip na datos mula sa vendor. Magbabago ang mga ito habang tina-tune ang modelo — nire-refresh namin ang pahinang ito kapag may lumalabas na mas mahusay na datos.
Mabilis magbago ang mga numero sa larangang ito. Gamitin ito bilang pangkalahatang gabay sa pagpili ng modelo, hindi bilang opisyal na leaderboard ng benchmark. Kapag may alinlangan, magsagawa ng sarili mong pagsusuri gamit ang sarili mong mga prompt.
Tingnan mismo
Isang bagay ang mga numero. Bigyan ang ChatGPT-6 ng totoong gawain at suriin ang resulta.