ai-garage

VS COMPARISON

Claude Opus 5 vs GPT-5.6 Sol

編集部の総合判定

総合性能は拮抗(AA Index 63 対 61)。用途と料金で選ぶのが正解

ベンチ勝ち:Claude Opus 5 1 / GPT-5.6 Sol 0 料金で安い項目:Claude Opus 5 0 / GPT-5.6 Sol 2 データ最終更新:2026-08-28(編集部集計)

WHICH ONE

こんな人はどっち?

こんな人は Claude Opus 5

  • 長い資料を読ませたい人(100万トークン)
  • 「長い文書をまとめるのが得意(1M tokens context)」を重視する人

こんな人は GPT-5.6 Sol

  • API 料金を抑えたい人(入力$4/出力$20)
  • AI をはじめて使う人

SPECS

仕様の比較

項目 Claude Opus 5 GPT-5.6 Sol
バージョン Opus 5 GPT-5.6(Sol / Terra / Luna)
公開日 2026-07-24 2026-07-09
コンテキスト長 1000K 勝ち 922K
入力料金 $/1M $5 $4 安い
出力料金 $/1M $25 $20 安い
推論モデル ✓ あり ✓ あり
マルチモーダル ✓ あり ✓ あり
AIコスパ指数 独自指標 67 68

BENCHMARKS

ベンチマーク差分

バーの長さは100%スケール。長い方が勝ち。

総合知能(AA Intelligence Index)

Claude Opus 5
63
GPT-5.6 Sol
61

コード修正力(SWE-Bench)

Claude Opus 5
96%
GPT-5.6 Sol

専門知識(GPQA)

Claude Opus 5
GPT-5.6 Sol
94.1%

最難関試験(HLE)

Claude Opus 5
56.3% 勝ち
GPT-5.6 Sol
47.2%

AA Intelligence Index(第三者機関 Artificial Analysis の統合知能指標)/ SWE-Bench Verified(実OSSバグ修正)/ MMLU(総合学力)/ GPQA Diamond(博士レベル理系)/ AIME(数学オリンピック予選)/ HLE(Humanity's Last Exam・最難関試験)

※「—」は未公表(実測0ではありません)。未公表の項目は勝敗のカウント対象外です。公式が個別ベンチを公表していないモデルも、AA Intelligence Index は第三者測定のため横並びで比較できます。

X VOICE

Xの評判はどう?

ベンチマークとは別の軸として、直近7日(2026-08-24 〜 2026-08-31)の X上の日本語の声をサンプル分析。てんびん丸総研調べ。

Claude Opus 5

X評判スコア 67 /100(n=23)

ポジ 12 ネガ 6 / 中立 5

👍 作業能力が高い

👍 深い理解・推論力

👎 使い勝手が悪い

👎 性能低下

GPT-5.6 Sol

X評判スコア 94 /100(n=17)

ポジ 15 ネガ 1 / 中立 1

👍 コード生成の実用性

👍 相談時の言語化支援

👎 推論不足

※ Grok(x_search)で過去7日の日本語Xポストを、モデルごとに3つの角度(感想・活用報告・他モデル比較)から検索してサンプル収集し、ポジ・ネガ・中立をLLM分類した傾向値。全数調査ではなく、角度間の重複除外も完全ではありません。評判スコア=ポジ÷(ポジ+ネガ)×100(判定5件未満は「—」)。 全モデルの一覧と推移は てんびん丸総研へ。

EDITOR'S NOTE

編集部メモ

数値の背景と、いまの提供状況・注意点

Claude Opus 5

2026-07-24 公開の Anthropic 主力モデル(API は claude-opus-5)。料金は前世代 Opus 4.8 と同じ $5/$25 のまま、最上位 Fable 5($10/$50)のちょうど半額。SWE-bench Verified は公式システムカードで 96.0%(じっくり考えるモードを最大にして5試行平均)で本表最高、Humanity's Last Exam は 56.3%(ツールなし/ツールありは 64.7%。第三者の Artificial Analysis の独自実測では 52.6%)。AA Intelligence Index も 63(v4.1.1・max 設定/2026-08-11 時点)で AA 掲載モデル中1位。ARC-AGI-3 は 30.2%(ARC Prize 財団の検証値、次点 GPT-5.6 Sol の 7.8% を大きく上回る)。GPQA・MMLU・AIME は Anthropic が Opus 5 では公表していないため本表では「—」(前世代 Opus 4.8 の値は流用しません)。前世代からの一番の違いは、じっくり考えるモードが最初からオンになったこと(考える量は5段階・既定 high)。一度に読める量は100万トークン、一度に書ける量は最大12万8千トークン、知識は2026年5月まで。速さ重視の Fast モードは $10/$50(通常の2倍)で約2.5倍速。なお別ベンチの SWE-bench Pro は 79.2%(Opus 4.8=69.2 / Fable 5=80 / GPT-5.6 Sol=64.6)で、本表の SWE-bench Verified とは別のテストです。前世代 Opus 4.8 は公式ドキュメントで旧世代(Legacy)扱いに移りましたが、提供終了は 2027-05-28 より前にはならないと案内されています。本表の「一度に読める量」100万トークンは、Anthropic 公式の context window(会話の履歴と AI の返答を合わせた1つの枠で、返答ぶんの最大12万8千トークンも同じ枠から引かれる。入力だけで枠を超えるとエラーになる)。入力専用の上限を別に公表している Google・OpenAI とは数え方が違う(2026-08-18 に公式ドキュメントで確認)。

GPT-5.6 Sol

OpenAI のフラッグシップ。GPT-5.6 は 2026-07-09 に一般公開(6-26 の限定プレビューから拡大)。Sol(最上位)・Terra(中位)・Luna(軽量)の3グレード構成で、本行は最上位 Sol。2026-07-30 に API 料金が改定され、Terra が $2.50/$15 → $2/$12(20%減)、Luna が $1/$6 → $0.20/$1.20(80%減)に下がり、このときは Sol だけ $5/$30 で据え置きだった。その Sol も 2026-08-22 に値下げされ、入力 $5 → $4(20%減)・出力 $30 → $20(33%減)になった(キャッシュ済み入力は $0.50 → $0.40)。本行の $4/$20 はこの値。ただし OpenAI 公式ドキュメントは「GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026」と明記しており、期間限定のプロモ価格。2026-11-21 を過ぎたら公式ドキュメントを再確認し、$5/$30 に戻っていたら本行を戻す。Terra($2/$12)と Luna($0.20/$1.20)はこの回の対象外で据え置き。中位の Terra は本表に別行(GPT-5.6 Terra)で掲載している。Artificial Analysis Intelligence Index は 61 で、Claude Opus 5(63)・Claude Fable 5(62)に次ぐ本表3番手(v4.1.1・2026-08-11 時点。考える量を最大にした max 設定での測定値)。同じ 61 に Grok 4.6 が並んでいるが、あちらは一段下の high 設定での測定なので、条件をそろえた比較ではない。ただし Fable 5 に対しては所要時間が約61%短く推定コストは約半分をうたう。GPQA Diamond 94.1%・HLE(Humanity's Last Exam)47.2%。コンテキストウィンドウは OpenAI 公式表記で 1,050,000 トークンだが、入力に使える上限は 922,000 トークン・1回の出力上限は 128,000 トークン。本表の値は「一度に読める量」なので入力上限の 922,000 を採用している。入力が 272,000 トークンを超えたリクエストは、そのリクエスト全体が入力2倍・出力1.5倍で計算される。値下げ後は $8/$30(値下げ前は $10/$45)(2026-08-22 に OpenAI 公式ドキュメント platform.openai.com/docs/pricing で確認)。まとめて投げる Batch と Flex は標準の半額で $2/$10、優先処理の Fast mode は2倍で $8/$40。API のリスト価格は 2026-07-09 の公開から 2026-08-21 まで $5/$30 で据え置かれ、2026-08-22 に $4/$20 へ下がった。2026-08 前半に「Sol が50%オフ」として広まった話はこれとは別物で、AI仲介サービス OpenRouter 経由の期間限定プロモ(2026-08-18 時点で同社の公開APIが返す単価は $2.50/$15=当時の公式のちょうど半額)。この50%の関係は公式値下げ後も続いており、2026-08-22 時点で OpenRouter の公開APIが返す単価は $2/$10(新公式 $4/$20 のちょうど半額)、272,000トークン超の割増も $4/$15 で公式 $8/$30 の半額。終了日は非公表。SWE-bench Verified・MMLU・AIME は Sol 個別の公開値が無いため本表では「—」(OpenAI の公表は別ベンチの SWE-Bench Pro 64.6%)。ChatGPT の住み分けは 2026-08-06 に変更され、無料/Go=Luna(テキストチャット無制限・Think ボタン付き。従来は Terra)、Plus・Pro=Sol(事実誤認を含む回答の割合が GPT-5.5 Instant 比で約68%減、思考時間のスライダー付き)、Pro/Enterprise=Sol Pro。

PROS & CONS

強み・弱み

Claude Opus 5

長文・コード・推論で定評。主力は 7/24 に出た Opus 5、公式の最上位は Fable 5、日常使いは Sonnet 5、軽量は Haiku 4.5。

◎ 強み

  • 長い文書をまとめるのが得意(1M tokens context)
  • コード生成・修正の精度が高い(SWE-Bench で常時トップ争い)
  • 安全側に振った穏やかな応答
  • adaptive thinking で必要に応じて推論時間を自動調整

△ 注意点

  • 画像生成はできない(読み取りのみ)
公式サイト →

GPT-5.6 Sol

AIブームの火付け役。フラッグシップ GPT-5.6(Sol/Terra/Luna)を内蔵し、画像・音声まで一つで完結。

◎ 強み

  • 総合力が高くてなんでもこなす
  • 音声・画像・ファイル対応がスムーズ
  • アプリ・拡張機能が豊富

△ 注意点

  • 話の事実確認は弱め、要ファクトチェック
公式サイト →

FAQ

よくある質問

Q. Claude Opus 5 と GPT-5.6 Sol、結局どっちがいい?

A. AA Intelligence Index は Claude Opus 5 63、GPT-5.6 Sol 61 とほぼ同水準で、総合性能は拮抗しています。用途・料金・使い勝手で選ぶのが正解です。

Q. Claude Opus 5 と GPT-5.6 Sol、料金が安いのはどっち?

A. 入力料金は Claude Opus 5 が $5/1M、GPT-5.6 Sol が $4/1M。出力料金は Claude Opus 5 が $25/1M、GPT-5.6 Sol が $20/1M です。入力・出力とも GPT-5.6 Sol の方が安く、コスト重視なら GPT-5.6 Sol が有利です。

Q. Claude Opus 5 と GPT-5.6 Sol、ベンチマークで強いのはどっち?

A. 両モデルが共通で公表している指標は2項目と少ないため、全モデルを第三者が同一条件で測定している AA Intelligence Index(Claude Opus 5 63/GPT-5.6 Sol 61)を軸に判断するのがおすすめです。AA Intelligence Index・SWE-Bench・MMLU・GPQA・AIME などの比較可能な指標では Claude Opus 5 の勝ち数が多く(1/0)、総合的なベンチ性能では Claude Opus 5 が優勢です。

Q. Claude Opus 5 と GPT-5.6 Sol、コスパがいいのはどっち?

A. AIコスパ指数(第三者測定の知能スコアと料金の安さを 6:4 で合成した編集部独自指標)は Claude Opus 5 が 67、GPT-5.6 Sol が 68。差は僅かで、コスパはほぼ同水準。性能・使い勝手など他の軸で選ぶのがおすすめです。

Q. Claude Opus 5 と GPT-5.6 Sol、初心者にはどっちがおすすめ?

A. 初心者へのおすすめ度は GPT-5.6 Sol の方が高め(5/5 対 4/5)。まず触ってみるなら GPT-5.6 Sol から始めると迷いにくいです。

更新を受け取る