Mga Benchmark
Mga benchmark at metodolohiya.
Paano nakahambing ang Ox Alpha sa kasalukuyang frontier — ang buong talahanayan, ang mga babala sa likod ng bawat numero, at kung eksaktong paano namin ito binuo.
Huling na-update: Agosto 2026
Karamihan sa mga comparison table ay nagbibigay ng hatol nang walang patunay. Ipinapakita ng table na ito ang mga numero at saka sinasabi sa iyo kung saan sila nagmula, kung ano ang hindi nila kayang sabihin, at kung bakit binabago ng libreng preview ang buong kalkulasyon.
Ang Ox Alpha ay isang stealth preview model, kaya ituring ang mga figure nito bilang directional at hindi pinal — ang tapat na paraan ng pagbasa sa pahinang ito ay "kalidad na frontier-adjacent sa presyong walang shipping model ang makakapantay."
Ang buong talahanayan
Siyam na dimensyon, limang modelo, at isang column na libre.
| Metric | Ox Alpha | Fable 5 | GLM-5 | GPT-5.6 | Grok 4.6 |
|---|---|---|---|---|---|
| Indeks ng Intelihensiya | 59* | 62 | 57 | 59 | 61 |
| Agentic coding | 78* | 79 | 72 | 80 | 74 |
| Context window | 1M | 1M | 200K | 400K | 500K |
| Pinakamataas na output | 131K | 64K | 128K | 128K | 64K |
| Throughput (tps) | 24* | 63 | 90 | 70 | 120 |
| Presyo / 1M out | $0 | $50 | $1.50 | $15 | $6 |
| Multimodal | |||||
| Open weights | |||||
| Libreng gamitin |
Pinagsamang score sa mga benchmark ng reasoning, kaalaman, at math (mas mataas, mas maganda).
Indicative na agentic-coding score — mga real-world, multi-file na gawain gamit ang mga tool (mas mataas, mas maganda).
Pinakamaraming tokens na kayang bigyang-pansin ng modelo sa isang request.
Pinakamalaking response na bubuuin ng modelo sa isang call.
Katamtamang bilis ng output sa tokens kada segundo (mas mataas, mas mabilis).
List price kada milyong output tokens (mas mababa, mas mura).
Tumatanggap ng image input kasama ang text.
Maaaring i-download at i-self-host ang mga weights.
Magagamit nang walang bayad sa ngayon.
Direktang Paghahambing
Gusto mo ba ng nakatuon, isa-isa na pagsusuri? Pumili ng match-up.
Metodolohiya
Ang Intelligence Index ay pinagsama-samang pampublikong benchmark sa reasoning, kaalaman at matematika sa diwa ng Artificial Analysis Intelligence Index. Ang agentic coding ay sumasalamin sa mga totoong gawaing multi-file na isinasagawa gamit ang mga tool sa halip na mga hiwalay na snippet.
Ang context window, max output, throughput at presyo ay mga numerong iniulat ng provider. Ang presyo ay ang list rate kada isang milyong output tokens; ang input tokens ay karaniwang mas mura at hindi isinama upang mapanatiling madaling basahin ang talahanayan.
Ang Ox Alpha ay inihahatid nang anonymous sa preview, kaya ang mga numero nito (minarkahan ng *) ay mga pagtantya mula sa komunidad sa halip na opisyal na datasheet mula sa vendor. Magbabago ang mga ito habang isinasapin ang modelo — sine-refresh namin ang pahinang ito tuwing may lumilitaw na mas mahusay na data.
Mabilis magbago ang mga numero sa larangang ito. Gamitin ito bilang pangkalahatang gabay sa pagpili ng modelo, hindi bilang benchmark leaderboard na opisyal na rekord. Kapag nagdadalawang-isip, patakbuhin ang sarili mong eval gamit ang sarili mong mga prompt.
Tingnan ito mismo
Isa lang ang mga numero. Bigyan si Ox Alpha ng totoong gawain at hatulan ang output.