ai-garage

VS COMPARISON

Grok 4.6 vs GPT-5.6 Terra

編集部の総合判定

総合知能(AA Index)は Grok 4.6 61 対 GPT-5.6 Terra 57 で Grok 4.6 がやや優位。用途しだいで逆転する差

ベンチ勝ち:Grok 4.6 1 / GPT-5.6 Terra 0 料金で安い項目:Grok 4.6 1 / GPT-5.6 Terra 0 データ最終更新:2026-08-28(編集部集計)

WHICH ONE

こんな人はどっち?

こんな人は Grok 4.6

  • API 料金を抑えたい人(入力$2/出力$6)
  • コスパ重視の人(AIコスパ指数 78 対 70)

こんな人は GPT-5.6 Terra

  • 長い資料を読ませたい人(92.2万トークン)
  • AI をはじめて使う人

SPECS

仕様の比較

項目 Grok 4.6 GPT-5.6 Terra
バージョン Grok 4.6 GPT-5.6 Terra
公開日 2026-08-12 2026-07-09
コンテキスト長 500K 922K 勝ち
入力料金 $/1M $2 $2
出力料金 $/1M $6 安い $12
推論モデル ✓ あり ✓ あり
マルチモーダル ✓ あり ✓ あり
AIコスパ指数 独自指標 78 勝ち 70

BENCHMARKS

ベンチマーク差分

バーの長さは100%スケール。長い方が勝ち。

総合知能(AA Intelligence Index)

Grok 4.6
61 勝ち
GPT-5.6 Terra
57

AA Intelligence Index(第三者機関 Artificial Analysis の統合知能指標)/ SWE-Bench Verified(実OSSバグ修正)/ MMLU(総合学力)/ GPQA Diamond(博士レベル理系)/ AIME(数学オリンピック予選)/ HLE(Humanity's Last Exam・最難関試験)

※「—」は未公表(実測0ではありません)。未公表の項目は勝敗のカウント対象外です。公式が個別ベンチを公表していないモデルも、AA Intelligence Index は第三者測定のため横並びで比較できます。

X VOICE

Xの評判はどう?

ベンチマークとは別の軸として、直近7日(2026-08-24 〜 2026-08-31)の X上の日本語の声をサンプル分析。てんびん丸総研調べ。

Grok 4.6

X評判スコア 68 /100(n=22)

ポジ 13 ネガ 6 / 中立 3

👍 分析力が高い

👍 初めて使って良い感じ

👎 画像生成が微妙

👎 コスパが気になる

GPT-5.6 Terra

今週の集計にこのモデルのデータはありません。

※ Grok(x_search)で過去7日の日本語Xポストを、モデルごとに3つの角度(感想・活用報告・他モデル比較)から検索してサンプル収集し、ポジ・ネガ・中立をLLM分類した傾向値。全数調査ではなく、角度間の重複除外も完全ではありません。評判スコア=ポジ÷(ポジ+ネガ)×100(判定5件未満は「—」)。 全モデルの一覧と推移は てんびん丸総研へ。

EDITOR'S NOTE

編集部メモ

数値の背景と、いまの提供状況・注意点

Grok 4.6

2026-08-12 公開、Grok 4.5 の後継。長時間動き続けるエージェント用途と、見た目をともなう作業(画面や画像を作る仕事)に力を入れた世代で、Grok 4.5 より長く追加学習を行い、手本データの一部は Grok 4.5 自身に作り直させている。料金は $2/$6・コンテキスト 50万トークン・知識は2026年2月1日までと、いずれも Grok 4.5 から据え置き。ただし料金には段差があり、プロンプトが20万トークンに達したリクエストは、そのリクエストの全トークンが倍額(入力 $4/出力 $12)になる。本表の $2/$6 は20万トークン以下のときの値。読み込んだ内容の使い回し料金だけは $0.30 → $0.50 に上がった。公式が出したのは新世代のベンチのみで、Artificial Analysis Intelligence Index 61(v4.1.1・high 設定/Grok 4.5 は 56)・GDPVal-AA v2 1753・CursorBench v3.2 69.9%・DeepSWE v1.1 65.9%・FrontierCode v1.1 (Extended) 61.3%・APEX-Agents 57.5%・APEX-SWE 56.4%・AA-Briefcase 1577・Harvey LAB (Vals) 15.8%。一方 Terminal-Bench v3.0 は 26% で、公式が横に並べた GPT-5.6 Sol Max(34.6%)・Claude Fable 5 Max(34.1%)に大きく届かない唯一の項目。本表の SWE-bench Verified・MMLU・GPQA・AIME・HLE は公式も第三者も数値を出しておらず「—」(DeepSWE v1.1 や APEX-SWE は名前が似ているだけの別のテストなので流用しません。前世代 Grok 4.5 の値も流用しません)。知能スコア 61 は本表で Claude Opus 5(63)・Claude Fable 5(62)に次ぐ位置で、GPT-5.6 Sol(61)と同点。ただし Opus 5 と Sol が考える量を最大にした設定での測定なのに対し、Grok 4.6 はその一段下(high)での測定という違いがある。Artificial Analysis の実測では文章を書き出す速さが毎秒 56.9 → 77.6 トークンに上がった一方、最初の1文字が返ってくるまでの時間は 9.32秒 → 42.09秒 と大きく延びており、「全面的に速くなった」わけではない点に注意。本表の50万トークンは xAI 公式ドキュメントのモデル表の Context 列の値で、入力と出力の内訳は公表されていない(2026-08-18 確認)。

GPT-5.6 Terra

GPT-5.6 の3グレード(Sol / Terra / Luna)の中位にあたる「ふだん使い」向けモデル。 ChatGPT では登場時(2026-07-09)に無料プランと Go プランがこの Terra を使っていたが、2026-08-06 の変更で無料・Go は下位の Luna に移った(Plus・Pro は最上位の Sol)。 そのため現在の Terra は、ChatGPT の既定モデルとしてではなく API で中位グレードを選ぶときの選択肢という位置づけになっている。 料金は 2026-07-30 の改定で 100万トークンあたり $2.50/$15 → $2/$12 に20%下がった(同じ日に Luna は80%下がり、Sol はこのときだけ $5/$30 で据え置きだった。その Sol も 2026-08-22 に $4/$20 へ下がっている)。 Artificial Analysis Intelligence Index は 57 で、最上位 Sol の 61 に対して4ポイント差。料金は Sol の6割ほどなので、価格と性能の折り合いをつける位置づけ。 ※ 本表の Sol 行(61)と同じ max 設定・同じ v4.1.1 での測定値(2026-08-11 時点)。AA は推論の強さ別に max / xhigh / high / medium / low を出しており、条件が違うと数値も変わる。 出力速度は 125.7 トークン/秒(Artificial Analysis 実測)。コンテキストウィンドウは OpenAI 公式表記で 1,050,000 トークンだが、入力に使える上限は 922,000 トークン・1回の出力上限は 128,000 トークン。本表の値は「一度に読める量」なので入力上限の 922,000 を採用している。入力が 272,000 トークンを超えたリクエストは全体が入力2倍・出力1.5倍($4/$18)になる(2026-08-18 に公式ドキュメントで確認)。入力はテキストと画像に対応。 GPQA Diamond・HLE・SWE-bench Verified は Terra 個別の公開値が無いため本表では「—」(他グレードの数値では埋めていません)。

PROS & CONS

強み・弱み

Grok 4.6

X 統合のノリ軽め AI が、Grok 4.6 で「値段そのまま・賢さだけ上位」に。安さと性能を両取りするコーディング特化フラグシップ。

◎ 強み

  • Xのリアルタイム投稿を検索できる
  • ユーモアと毒舌のあるキャラ設定
  • X Premium に同梱でコスパ良
  • Grok Speech / TTS API も2026-05 から提供開始
  • 4.6 でも $2/$6 per MTok 据え置き。この価格帯としては知能スコアが突出して高い
  • Grok Build・Cursor・Office アドインなど開発/実務ツールへ即統合

△ 注意点

  • 過激寄りの応答もあるので場面を選ぶ
  • コンテキストは 500k と前世代 Grok 4.3 の 1M から縮小
  • プロンプトが20万トークンに達すると、そのリクエストは全トークンが倍額になる
  • 4.6 は最初の1文字が返るまでの時間が 4.5 より大きく延びている(第三者計測)
  • 日本語性能の第三者検証はまだ少ない
公式サイト →

GPT-5.6 Terra

AIブームの火付け役。フラッグシップ GPT-5.6(Sol/Terra/Luna)を内蔵し、画像・音声まで一つで完結。

◎ 強み

  • 総合力が高くてなんでもこなす
  • 音声・画像・ファイル対応がスムーズ
  • アプリ・拡張機能が豊富

△ 注意点

  • 話の事実確認は弱め、要ファクトチェック
公式サイト →

FAQ

よくある質問

Q. Grok 4.6 と GPT-5.6 Terra、結局どっちがいい?

A. AA Intelligence Index は Grok 4.6 61 対 GPT-5.6 Terra 57 で Grok 4.6 がやや優位ですが、用途によっては逆転しうる差です。料金・使い勝手も合わせて選ぶのがおすすめです。

Q. Grok 4.6 と GPT-5.6 Terra、料金が安いのはどっち?

A. 入力料金は Grok 4.6 が $2/1M、GPT-5.6 Terra が $2/1M。出力料金は Grok 4.6 が $6/1M、GPT-5.6 Terra が $12/1M です。安い項目は Grok 4.6 が 1 個、GPT-5.6 Terra が 0 個。用途に応じて選んでください。

Q. Grok 4.6 と GPT-5.6 Terra、ベンチマークで強いのはどっち?

A. 両モデルが共通で公表している指標は1項目と少ないため、全モデルを第三者が同一条件で測定している AA Intelligence Index(Grok 4.6 61/GPT-5.6 Terra 57)を軸に判断するのがおすすめです。AA Intelligence Index・SWE-Bench・MMLU・GPQA・AIME などの比較可能な指標では Grok 4.6 の勝ち数が多く(1/0)、総合的なベンチ性能では Grok 4.6 が優勢です。

Q. Grok 4.6 と GPT-5.6 Terra、コスパがいいのはどっち?

A. AIコスパ指数(第三者測定の知能スコアと料金の安さを 6:4 で合成した編集部独自指標)は Grok 4.6 が 78、GPT-5.6 Terra が 70。「安くて賢い」バランスでは Grok 4.6 が有利です。

Q. Grok 4.6 と GPT-5.6 Terra、初心者にはどっちがおすすめ?

A. 初心者へのおすすめ度は GPT-5.6 Terra の方が高め(5/5 対 3/5)。まず触ってみるなら GPT-5.6 Terra から始めると迷いにくいです。

更新を受け取る