ベンチマーク
ベンチマークと測定方法。
Ox Alphaが現在のフロンティアモデルとどう並ぶのか——完全な比較表、あらゆる数値の背後にある注意点、そして私たちがそれをどのように作成したかの正確な説明。
最終更新:2026年8月
ほとんどの比較表は、根拠を示さずに結論だけを提示します。この比較表は数値を示した上で、その出所、数値だけでは分からないこと、そして無料プレビューが費用対効果の計算をどう変えるのかを説明します。
Ox Alphaはステルスプレビューモデルであるため、その数値は確定値ではなく目安としてお読みください。このページの率直な読み方は「出荷中のどのモデルも実現できない価格で、フロンティアに迫る品質」というものです。
完全な比較表
9つの指標、5つのモデル、そして無料の1列。
| Metric | Ox Alpha | Fable 5 | GLM-5 | GPT-5.6 | Grok 4.6 |
|---|---|---|---|---|---|
| インテリジェンス指数 | 59* | 62 | 57 | 59 | 61 |
| エージェンティックコーディング | 78* | 79 | 72 | 80 | 74 |
| コンテキストウィンドウ | 1M | 1M | 200K | 400K | 500K |
| 最大出力 | 131K | 64K | 128K | 128K | 64K |
| スループット(tps) | 24* | 63 | 90 | 70 | 120 |
| 価格 / 1M出力 | $0 | $50 | $1.50 | $15 | $6 |
| マルチモーダル | |||||
| オープンウェイト | |||||
| 無料で利用可能 |
推論・知識・数学の各ベンチマークにおける総合スコア(高いほど優秀)。
エージェンティックコーディングの参考スコア——ツールを用いた実世界のマルチファイルタスク(高いほど優秀)。
モデルが1回のリクエストで処理できる最大トークン数。
モデルが1回の呼び出しで生成できる最大応答サイズ。
1秒あたりの出力トークン数の中央値(高いほど高速)。
出力トークン100万個あたりの定価(低いほど安価)。
テキストに加えて画像入力を受け付けます。
重みをダウンロードしてセルフホストできます。
現在無料で利用可能。
直接対決
2つのモデルを絞り込んだ詳細な比較をご希望ですか?対戦カードをお選びください。
測定方法
Intelligence Indexは、Artificial Analysis Intelligence Indexの精神に基づき、公開されている推論・知識・数学ベンチマークを組み合わせた複合指標です。Agentic codingは、断片的なコードではなく、ツールを使って実行される実世界のマルチファイルタスクを反映しています。
コンテキストウィンドウ、最大出力、スループット、価格はプロバイダーが公表した数値です。価格は出力トークン100万個あたりの定価で、通常は入力トークンの方が安いため、表を読みやすくするために省略しています。
Ox Alphaはプレビューとして匿名で提供されているため、その数値(*印)はベンダーのデータシートではなく、コミュニティから報告された推定値です。モデルの調整に伴って変動します。より良いデータが入手でき次第、このページを更新します。
この分野では数値が急速に変化します。本ページはモデル選びの目安としてご活用ください。公式記録となるベンチマークリーダーボードではありません。迷ったときは、ご自身のプロンプトで独自のevalを実行してみてください。
実際に確かめてみましょう
数値も重要ですが、Ox Alphaに実際のタスクを任せて、その出力を判断してみてください。