ai-garage

VS COMPARISON

Claude Opus 5 vs Gemini 3.1 Pro

編集部の総合判定

総合知能(AA Index)は Claude Opus 5 63 対 Gemini 3.1 Pro 48。現時点では Claude Opus 5 が明確に優位

ベンチ勝ち:Claude Opus 5 2 / Gemini 3.1 Pro 0 料金で安い項目:Claude Opus 5 0 / Gemini 3.1 Pro 2 データ最終更新:2026-08-28(編集部集計)

世代差に注意:Claude Opus 5 は Gemini 3.1 Pro より約5か月新しい世代(2026年7月公開 vs 2026年2月公開)

WHICH ONE

こんな人はどっち?

こんな人は Claude Opus 5

  • コスパ重視の人(AIコスパ指数 67 対 61)
  • コード生成・修正を任せたい人(SWE-Bench 96%)

こんな人は Gemini 3.1 Pro

  • API 料金を抑えたい人(入力$2/出力$12)
  • AI をはじめて使う人

SPECS

仕様の比較

項目 Claude Opus 5 Gemini 3.1 Pro
バージョン Opus 5 3.1 Pro
公開日 2026-07-24 2026-02-19
コンテキスト長 1000K 1049K
入力料金 $/1M $5 $2 安い
出力料金 $/1M $25 $12 安い
推論モデル ✓ あり ✓ あり
マルチモーダル ✓ あり ✓ あり
AIコスパ指数 独自指標 67 勝ち 61

BENCHMARKS

ベンチマーク差分

バーの長さは100%スケール。長い方が勝ち。

総合知能(AA Intelligence Index)

Claude Opus 5
63 勝ち
Gemini 3.1 Pro
48

コード修正力(SWE-Bench)

Claude Opus 5
96% 勝ち
Gemini 3.1 Pro
80.6%

知識の広さ(MMLU)

Claude Opus 5
Gemini 3.1 Pro
91%

専門知識(GPQA)

Claude Opus 5
Gemini 3.1 Pro
94.3%

数学(AIME)

Claude Opus 5
Gemini 3.1 Pro
95%

最難関試験(HLE)

Claude Opus 5
56.3%
Gemini 3.1 Pro

AA Intelligence Index(第三者機関 Artificial Analysis の統合知能指標)/ SWE-Bench Verified(実OSSバグ修正)/ MMLU(総合学力)/ GPQA Diamond(博士レベル理系)/ AIME(数学オリンピック予選)/ HLE(Humanity's Last Exam・最難関試験)

※「—」は未公表(実測0ではありません)。未公表の項目は勝敗のカウント対象外です。公式が個別ベンチを公表していないモデルも、AA Intelligence Index は第三者測定のため横並びで比較できます。

X VOICE

Xの評判はどう?

ベンチマークとは別の軸として、直近7日(2026-08-24 〜 2026-08-31)の X上の日本語の声をサンプル分析。てんびん丸総研調べ。

Claude Opus 5

X評判スコア 67 /100(n=23)

ポジ 12 ネガ 6 / 中立 5

👍 作業能力が高い

👍 深い理解・推論力

👎 使い勝手が悪い

👎 性能低下

Gemini 3.1 Pro

X評判スコア 50 /100(n=18)

ポジ 8 ネガ 8 / 中立 2

👍 デバッグ・解析が速く便利

👍 情報量・持久力で改良

👎 正確性・精度が低い

👎 ハルシネーション多発

※ Grok(x_search)で過去7日の日本語Xポストを、モデルごとに3つの角度(感想・活用報告・他モデル比較)から検索してサンプル収集し、ポジ・ネガ・中立をLLM分類した傾向値。全数調査ではなく、角度間の重複除外も完全ではありません。評判スコア=ポジ÷(ポジ+ネガ)×100(判定5件未満は「—」)。 全モデルの一覧と推移は てんびん丸総研へ。

EDITOR'S NOTE

編集部メモ

数値の背景と、いまの提供状況・注意点

Claude Opus 5

2026-07-24 公開の Anthropic 主力モデル(API は claude-opus-5)。料金は前世代 Opus 4.8 と同じ $5/$25 のまま、最上位 Fable 5($10/$50)のちょうど半額。SWE-bench Verified は公式システムカードで 96.0%(じっくり考えるモードを最大にして5試行平均)で本表最高、Humanity's Last Exam は 56.3%(ツールなし/ツールありは 64.7%。第三者の Artificial Analysis の独自実測では 52.6%)。AA Intelligence Index も 63(v4.1.1・max 設定/2026-08-11 時点)で AA 掲載モデル中1位。ARC-AGI-3 は 30.2%(ARC Prize 財団の検証値、次点 GPT-5.6 Sol の 7.8% を大きく上回る)。GPQA・MMLU・AIME は Anthropic が Opus 5 では公表していないため本表では「—」(前世代 Opus 4.8 の値は流用しません)。前世代からの一番の違いは、じっくり考えるモードが最初からオンになったこと(考える量は5段階・既定 high)。一度に読める量は100万トークン、一度に書ける量は最大12万8千トークン、知識は2026年5月まで。速さ重視の Fast モードは $10/$50(通常の2倍)で約2.5倍速。なお別ベンチの SWE-bench Pro は 79.2%(Opus 4.8=69.2 / Fable 5=80 / GPT-5.6 Sol=64.6)で、本表の SWE-bench Verified とは別のテストです。前世代 Opus 4.8 は公式ドキュメントで旧世代(Legacy)扱いに移りましたが、提供終了は 2027-05-28 より前にはならないと案内されています。本表の「一度に読める量」100万トークンは、Anthropic 公式の context window(会話の履歴と AI の返答を合わせた1つの枠で、返答ぶんの最大12万8千トークンも同じ枠から引かれる。入力だけで枠を超えるとエラーになる)。入力専用の上限を別に公表している Google・OpenAI とは数え方が違う(2026-08-18 に公式ドキュメントで確認)。

Gemini 3.1 Pro

ARC-AGI-2 77.1%、LiveCodeBench Elo 2887。200k 超は $4/$18。65k 出力対応。本表の 1,048,576 トークンは入力に使える上限のほうで、出力は別枠。Google DeepMind のモデルカードは入力を「a token context window of up to 1M」、出力を「a 64K token output」と分けて書いており、同系列の 3.7 Flash・3.5 Flash-Lite は Gemini API ドキュメントで Input token limit 1,048,576/Output token limit 65,536 と明記されている(いずれも 2026-08-18 確認)。

PROS & CONS

強み・弱み

Claude Opus 5

長文・コード・推論で定評。主力は 7/24 に出た Opus 5、公式の最上位は Fable 5、日常使いは Sonnet 5、軽量は Haiku 4.5。

◎ 強み

  • 長い文書をまとめるのが得意(1M tokens context)
  • コード生成・修正の精度が高い(SWE-Bench で常時トップ争い)
  • 安全側に振った穏やかな応答
  • adaptive thinking で必要に応じて推論時間を自動調整

△ 注意点

  • 画像生成はできない(読み取りのみ)
公式サイト →

Gemini 3.1 Pro

Google 製。Gmail / Docs との連携と、100万トークンの長文+画像・動画・音声の読み取りが持ち味。最新は 3.7 Flash。

◎ 強み

  • Gmail / Docs / Sheets / Slides と連携
  • 画像・動画・音声・PDFの理解が強い
  • 1M tokens の長いコンテキスト
  • 文字起こし専用モデル Gemini 3.5 Transcribe(85以上の言語を自動判別・日本語 ja-JP 対応)
  • Deep Research Max など独自機能

△ 注意点

  • 回答の口調がやや堅め
公式サイト →

FAQ

よくある質問

Q. Claude Opus 5 と Gemini 3.1 Pro、結局どっちがいい?

A. 第三者測定の AA Intelligence Index は Claude Opus 5 が 63、Gemini 3.1 Pro が 48 と明確な差があり、現時点の総合性能では Claude Opus 5 が優位です。なお、Claude Opus 5 は Gemini 3.1 Pro より約5か月新しい世代(2026年7月公開 vs 2026年2月公開)です。料金や使い勝手も含めた選び方は「こんな人はどっち?」の欄を参考にしてください。

Q. Claude Opus 5 と Gemini 3.1 Pro、料金が安いのはどっち?

A. 入力料金は Claude Opus 5 が $5/1M、Gemini 3.1 Pro が $2/1M。出力料金は Claude Opus 5 が $25/1M、Gemini 3.1 Pro が $12/1M です。入力・出力とも Gemini 3.1 Pro の方が安く、コスト重視なら Gemini 3.1 Pro が有利です。

Q. Claude Opus 5 と Gemini 3.1 Pro、ベンチマークで強いのはどっち?

A. 両モデルが共通で公表している指標は2項目と少ないため、全モデルを第三者が同一条件で測定している AA Intelligence Index(Claude Opus 5 63/Gemini 3.1 Pro 48)を軸に判断するのがおすすめです。AA Intelligence Index・SWE-Bench・MMLU・GPQA・AIME などの比較可能な指標では Claude Opus 5 の勝ち数が多く(2/0)、総合的なベンチ性能では Claude Opus 5 が優勢です。

Q. Claude Opus 5 と Gemini 3.1 Pro、コスパがいいのはどっち?

A. AIコスパ指数(第三者測定の知能スコアと料金の安さを 6:4 で合成した編集部独自指標)は Claude Opus 5 が 67、Gemini 3.1 Pro が 61。「安くて賢い」バランスでは Claude Opus 5 が有利です。

Q. Claude Opus 5 と Gemini 3.1 Pro、初心者にはどっちがおすすめ?

A. 初心者へのおすすめ度は Gemini 3.1 Pro の方が高め(5/5 対 4/5)。まず触ってみるなら Gemini 3.1 Pro から始めると迷いにくいです。

更新を受け取る