Benchmarks
Benchmarks e metodologia.
Como o Ox Alpha se compara à fronteira atual — a tabela completa, as ressalvas por trás de cada número e exatamente como montamos tudo isso.
Última atualização: agosto de 2026
A maioria das tabelas de comparação entrega um veredito sem mostrar as provas. Esta mostra os números e depois explica de onde eles vêm, o que eles não conseguem dizer e por que a prévia gratuita muda a conta.
Ox Alpha é um modelo em prévia sigilosa, então trate seus números como indicativos e não finais — a forma honesta de ler esta página é "qualidade próxima da fronteira a um preço que nenhum modelo em produção consegue igualar."
A tabela completa
Nove dimensões, cinco modelos, uma coluna gratuita.
| Metric | Ox Alpha | Fable 5 | GLM-5 | GPT-5.6 | Grok 4.6 |
|---|---|---|---|---|---|
| Índice de Inteligência | 59* | 62 | 57 | 59 | 61 |
| Codificação agêntica | 78* | 79 | 72 | 80 | 74 |
| Janela de contexto | 1M | 1M | 200K | 400K | 500K |
| Saída máxima | 131K | 64K | 128K | 128K | 64K |
| Vazão (tps) | 24* | 63 | 90 | 70 | 120 |
| Preço / 1M de saída | $0 | $50 | $1.50 | $15 | $6 |
| Multimodal | |||||
| Pesos abertos | |||||
| Uso gratuito |
Pontuação composta em benchmarks de raciocínio, conhecimento e matemática (quanto maior, melhor).
Pontuação indicativa de codificação agêntica — tarefas reais de múltiplos arquivos com ferramentas (quanto maior, melhor).
Número máximo de tokens que o modelo pode processar em uma única requisição.
Maior resposta que o modelo irá gerar em uma única chamada.
Velocidade mediana de saída em tokens por segundo (quanto maior, mais rápido).
Preço de tabela por milhão de tokens de saída (quanto menor, mais barato).
Aceita entrada de imagem junto com texto.
Os pesos podem ser baixados e hospedados por conta própria.
Pode ser usado sem custo agora mesmo.
Confronto direto
Quer uma análise focada, um a um? Escolha um confronto.
Metodologia
O Intelligence Index é um composto de benchmarks públicos de raciocínio, conhecimento e matemática, no espírito do Artificial Analysis Intelligence Index. O Agentic coding reflete tarefas reais de múltiplos arquivos executadas com ferramentas, em vez de trechos isolados.
Janela de contexto, saída máxima, throughput e preço são valores informados pelo provedor. O preço é a tarifa de tabela por um milhão de tokens de saída; os tokens de entrada geralmente são mais baratos e foram omitidos para manter a tabela legível.
O Ox Alpha é servido anonimamente em preview, então seus números (marcados com *) são estimativas reportadas pela comunidade, não uma ficha técnica do fornecedor. Eles vão mudar conforme o modelo for ajustado — atualizamos esta página à medida que dados melhores surgirem.
Os números mudam rápido nesse espaço. Use isto como um guia orientador para escolher um modelo, não como um ranking oficial de benchmarks. Em caso de dúvida, rode sua própria avaliação com seus próprios prompts.
Veja com seus próprios olhos
Números são uma coisa. Entregue ao Ox Alpha uma tarefa real e julgue o resultado.