场景化 AI 模型榜单
不问「哪个模型最好」,只问「这个场景下哪个模型最合适」。6 个榜单全部按 Artificial Analysis 的真实基准测试字段排序,不打分、不加权、不编造——缺数据的模型直接不上榜。每个模型下方可看已收录哪些中转站在卖、最低多少钱。
数据日期 2026-09-23 · 查看评分方法论
💻
最适合编程的 AI 模型排行
按 Artificial Analysis 的编程指数(基于 LiveCodeBench、SciCode 等代码基准测试)从高到低排序,反映模型在生成、调试和理解代码上的综合能力。
- 1. Claude Fable 5.181.6
- 2. Claude Opus 578.0
- 3. GPT-5.6 Sol77.4
🧮
最强推理/数学能力的 AI 模型排行
按 Artificial Analysis 的数学指数(基于 AIME、MATH-500 等竞赛级数学基准)从高到低排序,反映模型的多步推理与复杂问题求解能力。
- 1. GPT-5.299.0
- 2. GPT-5 Codex98.7
- 3. Gemini 3 Flash Preview97.0
🧠
综合智能最强的 AI 模型排行
按 Artificial Analysis 综合智能指数(Intelligence Index,融合多项基准测试的加权得分)从高到低排序,是衡量模型整体能力最常用的单一指标。
- 1. Claude Fable 5.153.4
- 2. Muse Spark 1.353.0
- 3. GPT-6 Astra52.7
⚡
响应最快(首字延迟最低)的 AI 模型排行
按首字延迟 TTFT(Time To First Token,从发起请求到收到第一个 token 的秒数)从低到高排序,越低代表用户感知的「卡顿感」越小。
- 1. Command A+0.18s
- 2. North Mini Code0.20s
- 3. Tiny Aya Global0.23s
🚀
生成速度(吞吐)最快的 AI 模型排行
按生成吞吐(每秒输出 token 数)从高到低排序,反映模型把长回答「吐完」的速度,与首字延迟是两个独立维度。
- 1. Celeris-11892.8 tok/s
- 2. Mercury 2746.5 tok/s
- 3. Ling 3.0 Flash371.6 tok/s
💰
性价比最高的 AI 模型排行
按「综合智能指数 ÷ 官方混合单价(USD/M token)」从高到低排序,数值越高代表单位价格能买到的智能越多,是能力与成本的折中参考。
- 1. Agnes 3.0 Flash473.33
- 2. Llama 3.1 Instruct 8B246.43
- 3. Agnes 2.5 Pro Beta234.67