基准测试

基准测试与方法论。

Ox Alpha 与当前前沿模型的对比——完整表格、每个数字背后的注意事项,以及我们是如何把它整理出来的。

最后更新:2026年8月

大多数对比表格只给你结论,却拿不出依据。这一份则先亮出数字,再告诉你它们来自哪里、它们无法说明什么,以及为什么免费预览会改变这笔账。

Ox Alpha 是一款隐身预览模型,因此请将其各项数字视为方向性参考而非最终定论——阅读本页最坦诚的方式是:"以任何已发布模型都无法匹敌的价格,提供接近前沿的品质。"

完整表格

九个维度、五款模型,还有一列完全免费。

Metric
Ox Alpha
Fable 5
GLM-5
GPT-5.6
Grok 4.6
智能指数59*62575961
智能体编程78*79728074
上下文窗口1M1M200K400K500K
最大输出131K64K128K128K64K
吞吐量(tps)24*639070120
价格 / 1M 输出$0$50$1.50$15$6
多模态
开放权重
免费使用
智能指数

推理、知识与数学基准测试的综合得分(越高越好)。

智能体编程

智能体编程参考得分——借助工具完成真实世界的多文件任务(越高越好)。

上下文窗口

模型在单个请求中可处理的最大 tokens 数量。

最大输出

模型在单次调用中生成的最大响应长度。

吞吐量(tps)

输出速度中位数,以每秒 tokens 计(数值越高越快)。

价格 / 1M 输出

每百万输出 tokens 的标价(数值越低越便宜)。

多模态

除文本外还接受图像输入。

开放权重

模型权重可下载并自行托管部署。

免费使用

当前可免费使用。

方法论

智能指数(Intelligence Index)是综合公开的推理、知识与数学基准测试得出的复合指标,理念上参照 Artificial Analysis Intelligence Index。Agentic coding 反映的是借助工具执行的真实世界多文件任务,而非孤立的代码片段。

上下文窗口、最大输出、吞吐量和价格均为提供商报告的数据。价格为每百万输出 tokens 的标价;输入 tokens 通常更便宜,为保持表格简洁易读而未列出。

Ox Alpha 目前以匿名方式提供预览服务,因此其数据(标注 * 者)为社区报告的估算值,而非厂商官方数据表。随着模型调优,这些数字会有所变动——一旦出现更好的数据,我们会及时刷新本页面。

这一领域的数字变化很快。请将本页作为选型的方向性参考,而非权威基准排行榜。如有疑问,请用自己的提示词运行自己的评测。

亲眼见证

数据只是一方面。交给 Ox Alpha 一个真实任务,亲自评判其输出。

打开聊天