Benchmarks
Benchmarks y metodología.
Cómo se compara Ox Alpha frente a la frontera actual — la tabla completa, los matices detrás de cada número y exactamente cómo lo elaboramos.
Última actualización: agosto de 2026
La mayoría de las tablas comparativas te dan un veredicto sin pruebas. Esta muestra los números y luego te dice de dónde vienen, qué no pueden decirte y por qué la vista previa gratuita cambia los cálculos.
Ox Alpha es un modelo de vista previa en modo sigiloso, así que trata sus cifras como orientativas y no definitivas — la forma honesta de leer esta página es "calidad casi fronteriza a un precio que ningún modelo en producción puede igualar".
La tabla completa
Nueve dimensiones, cinco modelos, una columna gratuita.
| Metric | Ox Alpha | Fable 5 | GLM-5 | GPT-5.6 | Grok 4.6 |
|---|---|---|---|---|---|
| Índice de inteligencia | 59* | 62 | 57 | 59 | 61 |
| Programación agéntica | 78* | 79 | 72 | 80 | 74 |
| Ventana de contexto | 1M | 1M | 200K | 400K | 500K |
| Salida máxima | 131K | 64K | 128K | 128K | 64K |
| Rendimiento (tps) | 24* | 63 | 90 | 70 | 120 |
| Precio / 1M de salida | $0 | $50 | $1.50 | $15 | $6 |
| Multimodal | |||||
| Pesos abiertos | |||||
| Uso gratuito |
Puntuación compuesta en benchmarks de razonamiento, conocimiento y matemáticas (cuanto más alta, mejor).
Puntuación orientativa de programación agéntica — tareas reales de varios archivos con herramientas (cuanto más alta, mejor).
Máximo de tokens a los que el modelo puede atender en una sola solicitud.
Respuesta más extensa que el modelo generará en una llamada.
Velocidad mediana de salida en tokens por segundo (más alto es más rápido).
Precio de lista por millón de tokens de salida (más bajo es más barato).
Acepta entrada de imágenes junto con texto.
Los pesos pueden descargarse y alojarse por cuenta propia.
Utilizable sin costo ahora mismo.
Cara a cara
¿Quieres un desglose enfocado, uno a uno? Elige un enfrentamiento.
Metodología
El Índice de Inteligencia es un compuesto de benchmarks públicos de razonamiento, conocimiento y matemáticas al estilo del Artificial Analysis Intelligence Index. La codificación agéntica refleja tareas reales de varios archivos ejecutadas con herramientas, en lugar de fragmentos aislados.
La ventana de contexto, la salida máxima, el rendimiento y el precio son cifras reportadas por los proveedores. El precio es la tarifa de lista por un millón de tokens de salida; los tokens de entrada suelen ser más baratos y se omiten para mantener la tabla legible.
Ox Alpha se sirve de forma anónima en vista previa, por lo que sus cifras (marcadas con *) son estimaciones reportadas por la comunidad y no una hoja de datos del proveedor. Cambiarán a medida que el modelo se ajuste; actualizamos esta página cuando aparecen mejores datos.
Las cifras cambian rápido en este espacio. Úsalo como guía orientativa para elegir un modelo, no como clasificación oficial de benchmarks. Ante la duda, ejecuta tu propio eval con tus propios prompts.
Compruébalo tú mismo
Las cifras son una cosa. Entrégale a Ox Alpha una tarea real y juzga el resultado.