模型能力

从综合智能到实际使用成本与响应体验,按八个维度了解模型能力。

01

综合智能

综合比较推理、编程与知识工作能力。

© Artificial Analysis · 2026-09-27Intelligence Index v4.3.2
分数越高越好。该指数汇总 10 项评测,用于能力比较,不代表任务通过率。

图表解读

本组模型中,Opus 5.5 以 58 分领先,Fable 5.1 与 GPT-6 Astra 均取整为 53 分。比较时应保留图中推理档位。

02

专项能力

分别查看编程、推理、事实知识、长上下文与视觉理解表现。

展开 19 项专项评测原图19 项评测 · 独立计分

图表解读

不同任务的领先模型会变化。编程可看 Terminal-Bench 与 SciCode,长上下文推理看 AA-LCR,视觉推理看 MMMU-Pro。

03

Agent 工作能力

评估 Agent 能否将复杂需求转化为可用的工作成果。

© Artificial Analysis · 2026-09-27AA-Briefcase v1.1 · Elo
分数越高越好。AA-Briefcase 综合评分标准通过率、分析质量和呈现效果;Agent 工具与执行配置也会影响结果。

图表解读

本组模型中,Opus 5.5 达到 1822 Elo,随后是 Fable 5.1 的 1678 和 Grok 4.7 的 1657。

04

能力与成本

在所需能力与单任务成本之间找到合适平衡。

© Artificial Analysis · 2026-09-27智能指数 · 美元/任务 · 对数坐标
成本为考虑 Token 消耗的加权评测任务成本,横轴使用对数刻度;此处数值不代表本站 API 报价。

图表解读

越靠近左上方,能力越强、成本越低。虚线前沿帮助识别这组模型中兼顾能力与成本的选择。

05

Token 效率

观察完成一次评测任务需要多少推理和答案 Token。

© Artificial Analysis · 2026-09-27加权平均输出 Token/任务
更少的 Token 可能降低费用与等待时间,但不能据此判断质量更好,需要结合智能指数和 Token 单价。

图表解读

Opus 5.5 每任务约输出 119k Token,GPT-6 Sol 约为 31k;推理 Token 占据了较大比例。

06

上下文容量

比较可容纳文档、代码与历史对话的上下文空间。

© Artificial Analysis · 2026-09-27上下文窗口 · Token
窗口大小表示容量上限,不等于理解效果。长文档任务还应参考 AA-LCR,并核对供应商的输入、输出限制。

图表解读

本组许多模型的上下文约为 1M Token;图中 Grok 4.7 为 500k,Mistral Medium 3.5 为 256k。

07

输出速度

比较开始生成后,文本持续输出的速度。

© Artificial Analysis · 2026-09-27输出 Token/秒 · 输入 10k Token · 单请求
速度越高越好。此指标不包含开始输出前的等待时间,不等同于任务总耗时,也不是本站吞吐量承诺。

图表解读

本组 Gemini 3.5 Flash-Lite 达到 337 Token/秒,high 档位的 Gemini 3.8 Flash 为 285 Token/秒。更高输出速度有利于长答案的持续生成。

08

首答案延迟

了解用户收到第一个答案 Token 前需要等待多久。

© Artificial Analysis · 2026-09-27秒 · 包含思考 · 输入 10k Token · 单请求
延迟越低越好。此指标包含推理时间,与首 Token 延迟不同;应在相同推理档位和 API 供应商口径下比较。

图表解读

图中 xhigh 档位的 Grok 4.7 为 54.4 秒,max 档位的 GPT-6 Astra 为 292.2 秒。思考时间可能成为用户等待的主要部分。

图表保留来源的模型选择与推理档位;未展示的模型或缺失指标不代表得分为零。

原始图表来自 Artificial Analysis。本页解读为选型参考,重要选择应结合自己的真实任务验证。