场景化 AI 模型榜单

不问「哪个模型最好」,只问「这个场景下哪个模型最合适」。6 个榜单全部按 Artificial Analysis 的真实基准测试字段排序,不打分、不加权、不编造——缺数据的模型直接不上榜。每个模型下方可看已收录哪些中转站在卖、最低多少钱。

数据日期 2026-09-23 · 查看评分方法论

💻

最适合编程的 AI 模型排行

按 Artificial Analysis 的编程指数(基于 LiveCodeBench、SciCode 等代码基准测试)从高到低排序,反映模型在生成、调试和理解代码上的综合能力。

  1. 1. Claude Fable 5.181.6
  2. 2. Claude Opus 578.0
  3. 3. GPT-5.6 Sol77.4
查看完整榜单(20 个模型) →
🧮

最强推理/数学能力的 AI 模型排行

按 Artificial Analysis 的数学指数(基于 AIME、MATH-500 等竞赛级数学基准)从高到低排序,反映模型的多步推理与复杂问题求解能力。

  1. 1. GPT-5.299.0
  2. 2. GPT-5 Codex98.7
  3. 3. Gemini 3 Flash Preview97.0
查看完整榜单(20 个模型) →
🧠

综合智能最强的 AI 模型排行

按 Artificial Analysis 综合智能指数(Intelligence Index,融合多项基准测试的加权得分)从高到低排序,是衡量模型整体能力最常用的单一指标。

  1. 1. Claude Fable 5.153.4
  2. 2. Muse Spark 1.353.0
  3. 3. GPT-6 Astra52.7
查看完整榜单(20 个模型) →

响应最快(首字延迟最低)的 AI 模型排行

按首字延迟 TTFT(Time To First Token,从发起请求到收到第一个 token 的秒数)从低到高排序,越低代表用户感知的「卡顿感」越小。

  1. 1. Command A+0.18s
  2. 2. North Mini Code0.20s
  3. 3. Tiny Aya Global0.23s
查看完整榜单(20 个模型) →
🚀

生成速度(吞吐)最快的 AI 模型排行

按生成吞吐(每秒输出 token 数)从高到低排序,反映模型把长回答「吐完」的速度,与首字延迟是两个独立维度。

  1. 1. Celeris-11892.8 tok/s
  2. 2. Mercury 2746.5 tok/s
  3. 3. Ling 3.0 Flash371.6 tok/s
查看完整榜单(20 个模型) →
💰

性价比最高的 AI 模型排行

按「综合智能指数 ÷ 官方混合单价(USD/M token)」从高到低排序,数值越高代表单位价格能买到的智能越多,是能力与成本的折中参考。

  1. 1. Agnes 3.0 Flash473.33
  2. 2. Llama 3.1 Instruct 8B246.43
  3. 3. Agnes 2.5 Pro Beta234.67
查看完整榜单(20 个模型) →