การทดสอบประสิทธิภาพ
การทดสอบประสิทธิภาพและระเบียบวิธี
ChatGPT-6 อยู่ตรงไหนเมื่อเทียบกับโมเดลแนวหน้าปัจจุบัน — ตารางฉบับเต็ม ข้อควรระวังเบื้องหลังตัวเลขทุกตัว และรายละเอียดว่าเราจัดทำทั้งหมดนี้อย่างไร
อัปเดตล่าสุด: กันยายน 2026
ตารางเปรียบเทียบส่วนใหญ่มักให้คำตัดสินโดยไม่แสดงหลักฐาน ตารางนี้จะแสดงตัวเลขก่อน แล้วบอกว่าตัวเลขเหล่านั้นมาจากไหน บอกไม่ได้เรื่องอะไรบ้าง และเหตุใดตัวอย่างฟรีจึงเปลี่ยนสมการ
ChatGPT-6 เป็นรุ่นตัวอย่างสำหรับการเข้าถึงล่วงหน้า ดังนั้นควรใช้ตัวเลขเหล่านี้เป็นแนวทางมากกว่าข้อสรุปสุดท้าย — วิธีอ่านหน้านี้อย่างตรงไปตรงมาคือ “คุณภาพระดับแนวหน้าในราคาที่ไม่มีโมเดลแบบคิดค่าบริการใดเทียบได้”
ตารางฉบับเต็ม
เก้ามิติ ห้าโมเดล และหนึ่งคอลัมน์ที่ใช้ฟรี
| Metric | ChatGPT-6 | GPT-5.6 | Opus 5 | Gemini 3.7 | Grok 4.6 |
|---|---|---|---|---|---|
| ดัชนีความฉลาด | 71* | 67 | 68 | 66 | 65 |
| การเขียนโค้ดแบบเอเจนต์ | 86* | 84 | 82 | 78 | 76 |
| หน้าต่างบริบท | 400K | 400K | 1M | 2M | 500K |
| เอาต์พุตสูงสุด | 128K | 128K | 64K | 64K | 64K |
| อัตราการประมวลผล (tps) | 58* | 70 | 55 | 92 | 120 |
| ราคา / 1M เอาต์พุต | $0 | $10 | $25 | $10 | $6 |
| มัลติโหมด | |||||
| เวตส์แบบเปิด | |||||
| ใช้ฟรี |
คะแนนรวมจากเกณฑ์มาตรฐานด้านการให้เหตุผล ความรู้ และคณิตศาสตร์ (คะแนนสูงกว่าดีกว่า)
คะแนนการเขียนโค้ดแบบเอเจนต์โดยประมาณ — งานจริงแบบหลายไฟล์ที่ใช้เครื่องมือ (คะแนนสูงกว่าดีกว่า)
จำนวนโทเค็นสูงสุดที่โมเดลสามารถพิจารณาได้ในการสนทนาเดียว
ขนาดการตอบกลับสูงสุดที่โมเดลจะสร้างในการเรียกใช้หนึ่งครั้ง
ความเร็วเอาต์พุตค่ามัธยฐานเป็นโทเค็นต่อวินาที (ยิ่งสูงยิ่งเร็ว)
ราคาปลีกต่อล้านโทเค็นเอาต์พุต (ราคายิ่งต่ำยิ่งถูก)
รองรับการป้อนรูปภาพควบคู่กับข้อความ
ดาวน์โหลดเวทและโฮสต์เองได้
ใช้งานได้โดยไม่มีค่าใช้จ่ายในขณะนี้
เปรียบเทียบแบบตัวต่อตัว
ต้องการการวิเคราะห์แบบเจาะจงระหว่างสองรุ่นหรือไม่ เลือกคู่เปรียบเทียบได้เลย
วิธีการ
ดัชนี Intelligence Index เป็นดัชนีผสมจากเกณฑ์มาตรฐานด้านการให้เหตุผล ความรู้ และคณิตศาสตร์ที่เผยแพร่ต่อสาธารณะ โดยจัดทำในแนวทางเดียวกับ Artificial Analysis Intelligence Index การเขียนโค้ดเชิงเอเจนต์สะท้อนงานจริงที่มีหลายไฟล์และดำเนินการด้วยเครื่องมือ ไม่ใช่เพียงโค้ดตัวอย่างแยกส่วน
หน้าต่างบริบท เอาต์พุตสูงสุด อัตราการประมวลผล และราคาเป็นตัวเลขที่ผู้ให้บริการรายงาน ราคาเป็นอัตราปลีกต่อล้านโทเค็นเอาต์พุต โดยปกติโทเค็นอินพุตจะมีราคาถูกกว่า และไม่แสดงไว้เพื่อให้ตารางอ่านง่าย
ChatGPT-6 อยู่ในช่วงพรีวิวสำหรับผู้ใช้กลุ่มแรก ดังนั้นตัวเลขของรุ่นนี้ (ระบุด้วย *) จึงเป็นค่าประมาณที่รายงานโดยชุมชน ไม่ใช่ข้อมูลจากเอกสารของผู้ให้บริการ ตัวเลขเหล่านี้จะเปลี่ยนแปลงเมื่อมีการปรับแต่งโมเดล — เราจะอัปเดตหน้านี้เมื่อมีข้อมูลที่ดียิ่งขึ้น
ตัวเลขในวงการนี้เปลี่ยนแปลงอย่างรวดเร็ว ใช้ข้อมูลนี้เป็นแนวทางในการเลือกรุ่น ไม่ใช่ตารางจัดอันดับผลการทดสอบที่เป็นทางการ หากไม่แน่ใจ ให้ทดสอบโมเดลด้วยพรอมต์ของคุณเอง
ดูด้วยตัวคุณเอง
ตัวเลขเป็นเพียงส่วนหนึ่ง ลองมอบหมายงานจริงให้ ChatGPT-6 แล้วประเมินผลลัพธ์ด้วยตัวคุณเอง