评分方法论
/best 下的 6 个场景榜单只做一件事:把 Artificial Analysis 真实测出来的基准分数,按不同场景的关键指标重新排序。不打分、不加权、不做主观编辑推荐——每个数字都能在数据源里查到原值,缺数据的模型直接不上榜,绝不用 0 或估算值顶替。
数据来源
全部字段来自 Artificial Analysis 对各家模型服务商 API 的独立基准测试,HowToken 每日同步一次该数据源的最新结果,不自行测评、不自行打分。中转站的价格数据(哪些站在卖、最低多少钱)由 HowToken 自行采集 各中转站的公开报价页,与 Artificial Analysis 的官方跑分/官方定价是两套独立数据源,交叉展示仅供比价参考。
6 个场景 · 指标定义
综合智能指数 Intelligence Index
intelligenceArtificial Analysis 融合多项基准测试(含推理、知识、指令遵循等)计算出的加权综合得分,是衡量模型整体能力最常用的单一指标。用于「综合智能」榜。
编程指数 Coding Index
coding基于 LiveCodeBench、SciCode、TerminalBench 等代码相关基准测试计算,反映生成代码、调试、理解代码库的能力。用于「编程」榜。
数学指数 Math Index
math基于 AIME、MATH-500 等竞赛级数学基准测试计算,反映多步推理与复杂问题求解能力。用于「推理/数学」榜。
生成吞吐 Tokens/sec
tokens_per_sec模型开始输出后,每秒能生成多少 token,反映把一段长回答「吐完」的速度。用于「生成速度」榜。
首字延迟 TTFT
ttftTime To First Token,从发起请求到收到第一个 token 所需的秒数,越低代表用户感知的等待越短。用于「响应最快」榜(升序排列,越低越靠前)。
官方混合单价 Price (Blended)
price_blended官方 API 按输入/输出 token 加权后的混合单价(USD/M token)。「性价比」榜用「综合智能指数 ÷ 官方混合单价」计算,数值越高代表单位价格能买到的智能越多。
推理档位怎么处理
同一真实模型在 Artificial Analysis 里常常拆成多行「推理档位」变体(如 low / medium / high / xhigh / minimal / non-reasoning,对应「思考力度」不同的调用方式)。这些变体价格通常相同,只有跑分不同——如果不合并,榜单会出现同一个模型的 3~6 行重复占位,严重失真。我们的做法是:去掉档位后缀得到「规范模型」,同组内取综合智能指数最高的一档作为代表行,该代表行的编程 / 数学 / 速度等所有指标都取自这一档,不跨档位拼凑数字。页面上标注「含 N 个推理档位,按最高档位展示」即指此规则。
中转站价格怎么算
每个模型行右侧的「中转站最低可信价」,是该模型在 HowToken 已收录、且报价可信(排除折扣低于 1 折的异常低价和标注为高风险渠道的行)的中转站中,人民币输入价最低的一条,并换算成相当于官方价的折扣比例展示。这个口径与 模型追踪 页完全一致,点进模型详情页能看到该模型的完整中转站价格表(含高风险/低折扣行,已标注风险等级)。
更新频率
模型库(Artificial Analysis 数据)每日自动同步,榜单随每日巡检自动重新计算并重新构建站点,数据滞后一般不超过 24 小时。当前榜单数据日期: 2026-09-23。
有疑问或发现数据异常?欢迎通过 投稿收录 页面联系我们。