Mga benchmark

Mga benchmark at pamamaraan.

Kung paano naghahambing ang ChatGPT-6 sa kasalukuyang mga nangungunang modelo — ang buong talahanayan, ang mga limitasyon sa likod ng bawat numero, at kung paano namin ito eksaktong binuo.

Huling na-update: Setyembre 2026

Karamihan sa mga talahanayan ng paghahambing ay nagbibigay sa iyo ng hatol nang walang mga patunay. Ipinapakita ng isang ito ang mga numero at sinasabi kung saan nagmula ang mga ito, kung ano ang hindi nila masasabi sa iyo, at kung bakit binabago ng libreng preview ang kalkulasyon.

Ang ChatGPT-6 ay isang preview na may maagang access, kaya ituring ang mga bilang nito bilang gabay sa direksiyon at hindi bilang pinal na resulta — ang tapat na paraan ng pagbasa sa pahinang ito ay "kalidad na pang-frontier sa presyong hindi kayang tumbasan ng anumang modelong inilabas para sa produksyon."

Ang buong talahanayan

Siyam na dimensiyon, limang modelo, isang kolum na libre.

Metric
ChatGPT-6
GPT-5.6
Opus 5
Gemini 3.7
Grok 4.6
Indeks ng Intelligence71*67686665
Agentic coding86*84827876
Laki ng context window400K400K1M2M500K
Pinakamalaking output128K128K64K64K64K
Throughput (tps)58*705592120
Presyo / 1M output$0$10$25$10$6
Multimodal
Mga open weight
Libreng gamitin
Indeks ng Intelligence

Pinagsamang score para sa mga benchmark ng pangangatwiran, kaalaman, at matematika (mas mataas ay mas mahusay).

Agentic coding

Tinatayang score sa agentic coding — mga gawain sa totoong mundo na may maraming file at mga tool (mas mataas ay mas mahusay).

Laki ng context window

Pinakamaraming token na kayang bigyang-pansin ng modelo sa isang pag-uusap.

Pinakamalaking output

Pinakamalaking tugon na gagawin ng modelo sa isang tawag.

Throughput (tps)

Median na bilis ng output sa mga token bawat segundo (mas mataas ay mas mabilis).

Presyo / 1M output

Presyong listahan kada milyong output token (mas mababa, mas mura).

Multimodal

Tumatanggap ng image input kasabay ng text.

Mga open weight

Maaaring i-download ang weights at i-self-host.

Libreng gamitin

Magagamit nang walang bayad sa ngayon.

Pamamaraan

Ang Intelligence Index ay isang pinagsama-samang sukatan ng mga pampublikong benchmark sa pangangatwiran, kaalaman, at matematika, na kahawig ng Artificial Analysis Intelligence Index. Sinasalamin ng agentic coding ang mga gawain sa totoong mundo na may maraming file at isinasagawa gamit ang mga tool, sa halip na magkakahiwalay na snippet.

Ang context window, maximum na output, throughput, at presyo ay mga numerong iniulat ng provider. Ang presyo ay listahang halaga kada isang milyong output token; karaniwang mas mura ang input token at hindi isinama upang manatiling madaling basahin ang talahanayan.

Ang ChatGPT-6 ay nasa early-access preview, kaya ang mga numero nito (may markang *) ay mga pagtatantyang iniulat ng komunidad sa halip na datos mula sa vendor. Magbabago ang mga ito habang tina-tune ang modelo — nire-refresh namin ang pahinang ito kapag may lumalabas na mas mahusay na datos.

Mabilis magbago ang mga numero sa larangang ito. Gamitin ito bilang pangkalahatang gabay sa pagpili ng modelo, hindi bilang opisyal na leaderboard ng benchmark. Kapag may alinlangan, magsagawa ng sarili mong pagsusuri gamit ang sarili mong mga prompt.

Tingnan mismo

Isang bagay ang mga numero. Bigyan ang ChatGPT-6 ng totoong gawain at suriin ang resulta.

Buksan ang chat