ベンチマーク

ベンチマークと測定方法。

Ox Alphaが現在のフロンティアモデルとどう並ぶのか——完全な比較表、あらゆる数値の背後にある注意点、そして私たちがそれをどのように作成したかの正確な説明。

最終更新:2026年8月

ほとんどの比較表は、根拠を示さずに結論だけを提示します。この比較表は数値を示した上で、その出所、数値だけでは分からないこと、そして無料プレビューが費用対効果の計算をどう変えるのかを説明します。

Ox Alphaはステルスプレビューモデルであるため、その数値は確定値ではなく目安としてお読みください。このページの率直な読み方は「出荷中のどのモデルも実現できない価格で、フロンティアに迫る品質」というものです。

完全な比較表

9つの指標、5つのモデル、そして無料の1列。

Metric
Ox Alpha
Fable 5
GLM-5
GPT-5.6
Grok 4.6
インテリジェンス指数59*62575961
エージェンティックコーディング78*79728074
コンテキストウィンドウ1M1M200K400K500K
最大出力131K64K128K128K64K
スループット(tps)24*639070120
価格 / 1M出力$0$50$1.50$15$6
マルチモーダル
オープンウェイト
無料で利用可能
インテリジェンス指数

推論・知識・数学の各ベンチマークにおける総合スコア(高いほど優秀)。

エージェンティックコーディング

エージェンティックコーディングの参考スコア——ツールを用いた実世界のマルチファイルタスク(高いほど優秀)。

コンテキストウィンドウ

モデルが1回のリクエストで処理できる最大トークン数。

最大出力

モデルが1回の呼び出しで生成できる最大応答サイズ。

スループット(tps)

1秒あたりの出力トークン数の中央値(高いほど高速)。

価格 / 1M出力

出力トークン100万個あたりの定価(低いほど安価)。

マルチモーダル

テキストに加えて画像入力を受け付けます。

オープンウェイト

重みをダウンロードしてセルフホストできます。

無料で利用可能

現在無料で利用可能。

測定方法

Intelligence Indexは、Artificial Analysis Intelligence Indexの精神に基づき、公開されている推論・知識・数学ベンチマークを組み合わせた複合指標です。Agentic codingは、断片的なコードではなく、ツールを使って実行される実世界のマルチファイルタスクを反映しています。

コンテキストウィンドウ、最大出力、スループット、価格はプロバイダーが公表した数値です。価格は出力トークン100万個あたりの定価で、通常は入力トークンの方が安いため、表を読みやすくするために省略しています。

Ox Alphaはプレビューとして匿名で提供されているため、その数値(*印)はベンダーのデータシートではなく、コミュニティから報告された推定値です。モデルの調整に伴って変動します。より良いデータが入手でき次第、このページを更新します。

この分野では数値が急速に変化します。本ページはモデル選びの目安としてご活用ください。公式記録となるベンチマークリーダーボードではありません。迷ったときは、ご自身のプロンプトで独自のevalを実行してみてください。

実際に確かめてみましょう

数値も重要ですが、Ox Alphaに実際のタスクを任せて、その出力を判断してみてください。

チャットを開く