モデル能力

総合知能から利用コスト、応答性まで、8 つの観点でモデルを比較します。

01

総合知能

推論、コーディング、知識業務の総合能力を比較します。

© Artificial Analysis · 2026-09-27Intelligence Index v4.3.2
高いほど優秀です。10 評価を統合した比較指標であり、タスクの合格率ではありません。

グラフの解説

この選択では Opus 5.5 が 58 で先行し、Fable 5.1 と GPT-6 Astra は丸めると 53 です。推論設定も結果の一部です。

02

分野別評価

コーディング、推論、事実知識、長文脈、視覚推論を個別に確認します。

19 項目の評価グラフを表示19 評価 · 個別の尺度

グラフの解説

首位はタスクによって変わります。コードは Terminal-Bench と SciCode、長文脈推論は AA-LCR、視覚推論は MMMU-Pro を確認します。

03

知識業務エージェント

複雑な依頼から有用な成果物を作れるかを評価します。

© Artificial Analysis · 2026-09-27AA-Briefcase v1.1 · Elo
高いほど優秀です。AA-Briefcase は基準達成率、分析品質、表現を統合します。ツールや実行設定も結果に影響します。

グラフの解説

この選択では Opus 5.5 が 1822 Elo、続いて Fable 5.1 が 1678、Grok 4.7 が 1657 です。

04

能力とコスト

必要な能力と持続可能なタスク単価のバランスを探します。

© Artificial Analysis · 2026-09-27知能指数 · USD/タスク · 対数軸
コストはトークン使用量を含む評価タスクの加重コストです。横軸は対数目盛で、当サイトの API 料金ではありません。

グラフの解説

左上ほど高能力・低コストです。点線のフロンティアは、この選択内で効率的な候補を見つける目安です。

05

トークン効率

評価タスクで消費する推論と回答のトークン数を確認します。

© Artificial Analysis · 2026-09-27加重平均の出力トークン/タスク
使用量が少なければコストや待ち時間を抑えられますが、品質の高さは示しません。知能指数とトークン単価も比較します。

グラフの解説

Opus 5.5 は 1 タスク約 119k 出力トークン、GPT-6 Sol は約 31k です。推論トークンが大きな割合を占めます。

06

コンテキスト容量

文書、コード、会話履歴を収める容量を比較します。

© Artificial Analysis · 2026-09-27コンテキスト長 · トークン
ウィンドウは容量上限であり、理解力の証明ではありません。AA-LCR と提供元の入出力制限も確認します。

グラフの解説

この選択の多くは約 1M トークンの文脈に対応し、Grok 4.7 は 500k、Mistral Medium 3.5 は 256k と表示されています。

07

出力速度

生成開始後にテキストが届く速度を比較します。

© Artificial Analysis · 2026-09-27出力トークン/秒 · 入力 10k トークン · 単一リクエスト
高いほど高速です。出力前の待機時間を含まないため、タスク全体の所要時間や当サイトの処理速度保証ではありません。

グラフの解説

この選択では Gemini 3.5 Flash-Lite が 337 トークン/秒、high 設定の Gemini 3.8 Flash が 285 トークン/秒です。高速出力は長い回答に有利です。

08

最初の回答までの時間

最初の回答トークンを受け取るまでの待ち時間を確認します。

© Artificial Analysis · 2026-09-27秒 · 思考時間を含む · 入力 10k トークン · 単一リクエスト
低いほど良好です。推論時間を含み、最初のトークンまでの時間とは異なります。同等の推論設定と API 提供元で比較します。

グラフの解説

xhigh 設定の Grok 4.7 は 54.4 秒、max 設定の GPT-6 Astra は 292.2 秒です。思考時間が待ち時間の大半を占める場合があります。

出典のモデル選択と推論設定を保持しています。モデルや測定値の欠落はゼロ点を意味しません。

原図:Artificial Analysis。本ページの解説は選定の参考です。重要な選択は実際のタスクで検証してください。