벤치마크

벤치마크 및 방법론.

ChatGPT-6이 현재 최첨단 모델과 어떻게 비교되는지 — 전체 표, 각 수치의 이면에 있는 주의사항, 그리고 이를 정확히 어떻게 구성했는지.

최종 업데이트: 2026년 9월

대부분의 비교표는 근거 없이 결론만 제시합니다. 이 표는 수치를 보여준 다음, 그 수치가 어디에서 나온 것인지, 무엇을 말해 주지 못하는지, 그리고 무료 프리뷰가 계산을 어떻게 바꾸는지 설명합니다.

ChatGPT-6는 얼리 액세스 프리뷰이므로 수치를 최종값이 아닌 방향성 지표로 보세요 — 이 페이지를 정직하게 읽는 방법은 "어떤 유료 모델도 따라올 수 없는 가격에 제공되는 프런티어급 품질"입니다.

전체 표

아홉 가지 차원, 다섯 개 모델, 무료인 열 하나.

Metric
ChatGPT-6
GPT-5.6
Opus 5
Gemini 3.7
Grok 4.6
지능 지수71*67686665
에이전트 코딩86*84827876
컨텍스트 윈도우400K400K1M2M500K
최대 출력128K128K64K64K64K
처리량 (tps)58*705592120
가격 / 1M 출력 토큰$0$10$25$10$6
멀티모달
오픈 가중치
무료 사용 가능
지능 지수

추론, 지식 및 수학 벤치마크 전반의 종합 점수 (높을수록 좋음).

에이전트 코딩

에이전트 코딩 점수의 참고값 — 도구를 사용하는 실제 다중 파일 작업 (높을수록 좋음).

컨텍스트 윈도우

모델이 한 번의 대화에서 참조할 수 있는 최대 토큰 수.

최대 출력

모델이 한 번의 호출에서 생성하는 가장 긴 응답.

처리량 (tps)

초당 토큰 단위의 중앙값 출력 속도 (높을수록 빠름).

가격 / 1M 출력 토큰

출력 토큰 100만 개당 정가(저렴할수록 좋음).

멀티모달

텍스트와 함께 이미지 입력을 지원합니다.

오픈 가중치

가중치를 다운로드하여 자체 호스팅할 수 있습니다.

무료 사용 가능

현재 무료로 사용할 수 있습니다.

방법론

지능 지수는 Artificial Analysis Intelligence Index의 취지를 따르는 공개 추론·지식·수학 벤치마크를 종합한 지표입니다. 에이전트 코딩 점수는 고립된 코드 조각이 아니라 도구를 사용해 실행한 실제 다중 파일 작업을 반영합니다.

컨텍스트 창, 최대 출력 길이, 처리량 및 가격은 제공업체가 보고한 수치입니다. 가격은 출력 토큰 100만 개당 정가이며, 입력 토큰은 일반적으로 더 저렴하므로 표를 읽기 쉽게 하기 위해 생략했습니다.

ChatGPT-6은 얼리 액세스 프리뷰 단계이므로 별표(*)가 표시된 수치는 제공업체의 데이터시트가 아닌 커뮤니티가 보고한 추정치입니다. 모델이 조정됨에 따라 수치는 변동되며, 더 나은 데이터가 확인되는 대로 이 페이지를 업데이트합니다.

이 분야에서는 수치가 빠르게 변합니다. 이 내용을 모델 선택을 위한 방향성 있는 가이드로 활용하고, 공식 기록을 겨루는 벤치마크 순위표로 보지는 마세요. 확신이 서지 않는다면 직접 만든 프롬프트로 직접 평가를 실행해 보세요.

직접 확인해 보세요

수치만으로는 알 수 없습니다. ChatGPT-6에 실제 작업을 맡기고 결과를 직접 평가해 보세요.

채팅 열기