Benchmark
Benchmark & metodologi.
Bagaimana Ox Alpha berbanding dengan frontier saat ini — tabel lengkapnya, catatan penting di balik setiap angka, dan tepatnya bagaimana kami menyusunnya.
Terakhir diperbarui: Agustus 2026
Sebagian besar tabel perbandingan memberi Anda kesimpulan tanpa bukti pendukung. Yang ini menampilkan angka-angkanya lalu menjelaskan dari mana angka tersebut berasal, apa saja yang tidak bisa diceritakannya, dan mengapa pratinjau gratis mengubah keseluruhan perhitungan.
Ox Alpha adalah model pratinjau stealth, jadi perlakukan angka-angkanya sebagai indikasi arah, bukan hasil akhir — cara paling jujur membaca halaman ini adalah "kualitas mendekati frontier dengan harga yang tidak mampu ditandingi model produksi mana pun."
Tabel lengkap
Sembilan dimensi, lima model, satu kolom yang gratis.
| Metric | Ox Alpha | Fable 5 | GLM-5 | GPT-5.6 | Grok 4.6 |
|---|---|---|---|---|---|
| Indeks Kecerdasan | 59* | 62 | 57 | 59 | 61 |
| Coding agentic | 78* | 79 | 72 | 80 | 74 |
| Jendela konteks | 1M | 1M | 200K | 400K | 500K |
| Output maksimal | 131K | 64K | 128K | 128K | 64K |
| Throughput (tps) | 24* | 63 | 90 | 70 | 120 |
| Harga / 1M keluaran | $0 | $50 | $1.50 | $15 | $6 |
| Multimodal | |||||
| Bobot terbuka | |||||
| Gratis digunakan |
Skor gabungan dari benchmark penalaran, pengetahuan, dan matematika (semakin tinggi semakin baik).
Skor indikatif coding agentic — tugas dunia nyata dengan banyak file menggunakan alat bantu (semakin tinggi semakin baik).
Jumlah maksimum tokens yang dapat diperhatikan model dalam satu permintaan.
Respons terbesar yang akan dihasilkan model dalam satu panggilan.
Kecepatan output median dalam tokens per detik (semakin tinggi semakin cepat).
Harga daftar per satu juta output tokens (semakin rendah semakin murah).
Menerima input gambar bersama teks.
Bobot model dapat diunduh dan di-hosting sendiri.
Dapat digunakan tanpa biaya saat ini.
Duel langsung
Ingin analisis mendalam satu lawan satu? Pilih pasangan modelnya.
Metodologi
Intelligence Index adalah gabungan dari benchmark penalaran, pengetahuan, dan matematika publik, mengikuti semangat Artificial Analysis Intelligence Index. Agentic coding mencerminkan tugas dunia nyata multi-file yang dieksekusi dengan alat, bukan potongan kode terisolasi.
Context window, max output, throughput, dan harga adalah angka yang dilaporkan penyedia. Harga adalah tarif daftar per satu juta output tokens; input tokens biasanya lebih murah dan tidak dicantumkan agar tabel tetap mudah dibaca.
Ox Alpha dilayani secara anonim dalam pratinjau, sehingga angkanya (ditandai *) merupakan estimasi dari komunitas, bukan lembar data dari vendor. Angka-angka ini akan berubah seiring model disempurnakan — kami memperbarui halaman ini begitu data yang lebih baik tersedia.
Angka-angka berubah sangat cepat di bidang ini. Gunakan ini sebagai panduan arah untuk memilih model, bukan sebagai leaderboard benchmark resmi. Jika ragu, jalankan eval Anda sendiri pada prompt Anda sendiri.
Lihat sendiri hasilnya
Angka hanyalah satu sisi cerita. Berikan Ox Alpha tugas nyata dan nilai sendiri outputnya.