เบนช์มาร์ก
เบนช์มาร์กและวิธีการทดสอบ
Ox Alpha เทียบชั้นกับโมเดลแนวหน้าปัจจุบันอย่างไร — ตารางฉบับเต็ม ข้อควรระวังเบื้องหลังตัวเลขทุกตัว และรายละเอียดว่าเราจัดทำมันขึ้นมาอย่างไร
อัปเดตล่าสุด: สิงหาคม 2026
ตารางเปรียบเทียบส่วนใหญ่ให้ข้อสรุปแบบไม่มีหลักฐานมาแสดง ตารางนี้แสดงตัวเลขให้เห็น แล้วบอกคุณว่าตัวเลขเหล่านั้นมาจากไหน บอกอะไรไม่ได้ และทำไมพรีวิวฟรีถึงเปลี่ยนสมการ
Ox Alpha เป็นโมเดลพรีวิวแบบลับ จึงควรมองตัวเลขเป็นแนวทางมากกว่าผลสุดท้าย — วิธีอ่านหน้านี้อย่างซื่อตรงคือ "คุณภาพใกล้เคียงระดับแนวหน้าในราคาที่ไม่มีโมเดลที่เปิดใช้งานจริงตัวไหนแข่งได้"
ตารางฉบับเต็ม
เก้ามิติ ห้าโมเดล และหนึ่งคอลัมน์ที่ฟรี
| Metric | Ox Alpha | Fable 5 | GLM-5 | GPT-5.6 | Grok 4.6 |
|---|---|---|---|---|---|
| ดัชนีความฉลาด | 59* | 62 | 57 | 59 | 61 |
| การเขียนโค้ดแบบเอเจนต์ | 78* | 79 | 72 | 80 | 74 |
| หน้าต่างบริบท | 1M | 1M | 200K | 400K | 500K |
| เอาต์พุตสูงสุด | 131K | 64K | 128K | 128K | 64K |
| ปริมาณงาน (tps) | 24* | 63 | 90 | 70 | 120 |
| ราคา / เอาต์พุต 1M | $0 | $50 | $1.50 | $15 | $6 |
| มัลติโมดัล | |||||
| น้ำหนักแบบเปิด | |||||
| ใช้ฟรี |
คะแนนรวมจากเบนช์มาร์กด้านการให้เหตุผล ความรู้ และคณิตศาสตร์ (ยิ่งสูงยิ่งดี)
คะแนนการเขียนโค้ดแบบเอเจนต์เชิงบ่งชี้ — งานหลายไฟล์ในโลกจริงพร้อมเครื่องมือ (ยิ่งสูงยิ่งดี)
จำนวน tokens สูงสุดที่โมเดลสามารถให้ความสำคัญได้ในหนึ่งคำขอ
ขนาดการตอบกลับสูงสุดที่โมเดลจะสร้างได้ในหนึ่งการเรียก
ความเร็วเอาต์พุตมัธยฐาน วัดเป็น tokens ต่อวินาที (ยิ่งสูงยิ่งเร็ว)
ราคาแนะนำต่อเอาต์พุต 1 ล้าน tokens (ยิ่งต่ำยิ่งถูก)
รับอินพุตรูปภาพร่วมกับข้อความได้
ดาวน์โหลด weights ไปโฮสต์เองได้
ใช้งานได้ฟรีตอนนี้
ตัวต่อตัว
อยากเห็นการเจาะลึกแบบตัวต่อตัว? เลือกคู่ที่อยากเปรียบเทียบได้เลย
ระเบียบวิธี
Intelligence Index เป็นคะแนนรวมจากเบนช์มาร์กด้านการให้เหตุผล ความรู้ และคณิตศาสตร์ที่เปิดเผยต่อสาธารณะ โดยอิงแนวทางเดียวกับ Artificial Analysis Intelligence Index ส่วน Agentic coding สะท้อนงานจริงแบบหลายไฟล์ที่ทำงานร่วมกับเครื่องมือ ไม่ใช่เพียง snippet ที่แยกโดดเดี่ยว
Context window, max output, throughput และราคา เป็นตัวเลขที่ผู้ให้บริการรายงานมา ราคาคืออัตราแนะนำต่อเอาต์พุต 1 ล้าน tokens ส่วน input tokens มักถูกกว่าและถูกละไว้เพื่อให้ตารางอ่านง่าย
Ox Alpha ให้บริการแบบไม่ระบุตัวตนในช่วง preview ตัวเลขของ Ox Alpha (ที่ทำเครื่องหมาย *) จึงเป็นค่าประมาณที่ชุมชนรายงาน ไม่ใช่ datasheet จากผู้พัฒนา ตัวเลขเหล่านี้จะเปลี่ยนไปเมื่อโมเดลถูกปรับจูน — เราจะอัปเดตหน้านี้ทันทีที่มีข้อมูลที่ดีกว่า
ตัวเลขในวงการนี้เปลี่ยนเร็วมาก ใช้หน้านี้เป็นแนวทางคร่าว ๆ สำหรับการเลือกโมเดล ไม่ใช่กระดานเบนช์มาร์กที่ใช้อ้างอิงอย่างเป็นทางการ หากยังไม่แน่ใจ ลองรัน eval ด้วย prompt ของคุณเองดู
ลองด้วยตัวคุณเอง
ตัวเลขเป็นเพียงส่วนหนึ่ง ลองส่งงานจริงให้ Ox Alpha แล้วตัดสินผลลัพธ์ด้วยตัวคุณเอง