基准测试
基准测试与方法论。
Ox Alpha 与当前前沿模型的对比——完整表格、每个数字背后的注意事项,以及我们是如何把它整理出来的。
最后更新:2026年8月
大多数对比表格只给你结论,却拿不出依据。这一份则先亮出数字,再告诉你它们来自哪里、它们无法说明什么,以及为什么免费预览会改变这笔账。
Ox Alpha 是一款隐身预览模型,因此请将其各项数字视为方向性参考而非最终定论——阅读本页最坦诚的方式是:"以任何已发布模型都无法匹敌的价格,提供接近前沿的品质。"
完整表格
九个维度、五款模型,还有一列完全免费。
| Metric | Ox Alpha | Fable 5 | GLM-5 | GPT-5.6 | Grok 4.6 |
|---|---|---|---|---|---|
| 智能指数 | 59* | 62 | 57 | 59 | 61 |
| 智能体编程 | 78* | 79 | 72 | 80 | 74 |
| 上下文窗口 | 1M | 1M | 200K | 400K | 500K |
| 最大输出 | 131K | 64K | 128K | 128K | 64K |
| 吞吐量(tps) | 24* | 63 | 90 | 70 | 120 |
| 价格 / 1M 输出 | $0 | $50 | $1.50 | $15 | $6 |
| 多模态 | |||||
| 开放权重 | |||||
| 免费使用 |
推理、知识与数学基准测试的综合得分(越高越好)。
智能体编程参考得分——借助工具完成真实世界的多文件任务(越高越好)。
模型在单个请求中可处理的最大 tokens 数量。
模型在单次调用中生成的最大响应长度。
输出速度中位数,以每秒 tokens 计(数值越高越快)。
每百万输出 tokens 的标价(数值越低越便宜)。
除文本外还接受图像输入。
模型权重可下载并自行托管部署。
当前可免费使用。
方法论
智能指数(Intelligence Index)是综合公开的推理、知识与数学基准测试得出的复合指标,理念上参照 Artificial Analysis Intelligence Index。Agentic coding 反映的是借助工具执行的真实世界多文件任务,而非孤立的代码片段。
上下文窗口、最大输出、吞吐量和价格均为提供商报告的数据。价格为每百万输出 tokens 的标价;输入 tokens 通常更便宜,为保持表格简洁易读而未列出。
Ox Alpha 目前以匿名方式提供预览服务,因此其数据(标注 * 者)为社区报告的估算值,而非厂商官方数据表。随着模型调优,这些数字会有所变动——一旦出现更好的数据,我们会及时刷新本页面。
这一领域的数字变化很快。请将本页作为选型的方向性参考,而非权威基准排行榜。如有疑问,请用自己的提示词运行自己的评测。
亲眼见证
数据只是一方面。交给 Ox Alpha 一个真实任务,亲自评判其输出。