벤치마크

벤치마크 및 방법론.

Ox Alpha가 현재 프론티어와 어떻게 비교되는지 — 전체 표, 모든 수치 뒤에 숨은 주의사항, 그리고 이를 정확히 어떻게 구성했는지까지 담았습니다.

마지막 업데이트: 2026년 8월

대부분의 비교표는 근거 없이 결론만 내려줍니다. 이 표는 수치를 보여드리고, 그 수치가 어디에서 왔는지, 무엇을 말해줄 수 없는지, 그리고 왜 무료 프리뷰가 계산식을 바꾸는지 설명합니다.

Ox Alpha는 스텔스 프리뷰 모델이므로 수치를 최종 결과가 아닌 방향성 참고 자료로 봐주세요 — 이 페이지를 솔직하게 읽는 방법은 "현재 출시된 어떤 모델도 따라올 수 없는 가격에 제공되는 프론티어급 품질"입니다.

전체 표

아홉 개의 차원, 다섯 개의 모델, 그리고 단 하나의 무료 열.

Metric
Ox Alpha
Fable 5
GLM-5
GPT-5.6
Grok 4.6
지능 지수59*62575961
에이전틱 코딩78*79728074
컨텍스트 윈도우1M1M200K400K500K
최대 출력131K64K128K128K64K
처리량 (tps)24*639070120
가격 / 1M 출력$0$50$1.50$15$6
멀티모달
오픈 웨이트
무료 사용
지능 지수

추론, 지식 및 수학 벤치마크 전반에 걸친 종합 점수 (높을수록 좋음).

에이전틱 코딩

참고용 에이전틱 코딩 점수 — 도구를 활용한 실제 멀티 파일 작업 기준 (높을수록 좋음).

컨텍스트 윈도우

모델이 단일 요청에서 참조할 수 있는 최대 tokens 수.

최대 출력

한 번 호출로 모델이 생성하는 최대 응답 길이.

처리량 (tps)

초당 tokens으로 측정한 출력 속도 중앙값(높을수록 빠름).

가격 / 1M 출력

output tokens 100만 개당 정가(낮을수록 저렴).

멀티모달

텍스트와 함께 이미지 입력 지원.

오픈 웨이트

가중치를 다운로드하여 자체 호스팅 가능.

무료 사용

현재 무료로 사용 가능.

방법론

Intelligence Index는 Artificial Analysis Intelligence Index의 취지를 따라 공개된 추론·지식·수학 벤치마크를 종합한 지표입니다. 에이전틱 코딩은 고립된 코드 조각이 아니라 도구를 활용해 수행하는 실제 환경의 멀티 파일 작업을 반영합니다.

컨텍스트 윈도우, 최대 출력, 처리량, 가격은 제공사가 보고한 수치입니다. 가격은 output tokens 100만 개당 정가이며, input tokens은 대체로 더 저렴하지만 표의 가독성을 위해 생략했습니다.

Ox Alpha는 프리뷰 단계에서 익명으로 제공되므로, 그 수치(* 표시)는 벤더 데이터시트가 아닌 커뮤니티 보고 추정치입니다. 모델이 조정됨에 따라 수치는 변동될 수 있으며 — 더 좋은 데이터가 확인되는 대로 이 페이지를 갱신합니다.

이 분야의 수치는 빠르게 변합니다. 이 표는 모델 선택 시 방향성을 잡는 참고 자료로 활용하되, 공식 벤치마크 리더보드로 삼지 마세요. 확실하지 않다면 자신의 프롬프트로 직접 eval을 돌려보세요.

직접 확인해 보세요

수치는 어디까지나 참고일 뿐입니다. Ox Alpha에 실제 작업을 맡기고 결과물을 직접 평가해 보세요.

채팅 열기