ai-garage

VS COMPARISON

Gemini 3.7 Flash vs Grok 4.6

編集部の総合判定

総合知能(AA Index)は Grok 4.6 61 対 Gemini 3.7 Flash 56 で Grok 4.6 がやや優位。用途しだいで逆転する差

ベンチ勝ち:Gemini 3.7 Flash 0 / Grok 4.6 1 料金で安い項目:Gemini 3.7 Flash 2 / Grok 4.6 0 データ最終更新:2026-08-28(編集部集計)

WHICH ONE

こんな人はどっち?

こんな人は Gemini 3.7 Flash

  • API 料金を抑えたい人(入力$0.75/出力$3.75)
  • コスパ重視の人(AIコスパ指数 81 対 78)
  • 長い資料を読ませたい人(104.9万トークン)

こんな人は Grok 4.6

  • 「Xのリアルタイム投稿を検索できる」を重視する人
  • 「ユーモアと毒舌のあるキャラ設定」を重視する人

SPECS

仕様の比較

項目 Gemini 3.7 Flash Grok 4.6
バージョン 3.7 Flash Grok 4.6
公開日 2026-08-13 2026-08-12
コンテキスト長 1049K 勝ち 500K
入力料金 $/1M $0.75 安い $2
出力料金 $/1M $3.75 安い $6
推論モデル ✓ あり ✓ あり
マルチモーダル ✓ あり ✓ あり
AIコスパ指数 独自指標 81 勝ち 78

BENCHMARKS

ベンチマーク差分

バーの長さは100%スケール。長い方が勝ち。

総合知能(AA Intelligence Index)

Gemini 3.7 Flash
56
Grok 4.6
61 勝ち

AA Intelligence Index(第三者機関 Artificial Analysis の統合知能指標)/ SWE-Bench Verified(実OSSバグ修正)/ MMLU(総合学力)/ GPQA Diamond(博士レベル理系)/ AIME(数学オリンピック予選)/ HLE(Humanity's Last Exam・最難関試験)

※「—」は未公表(実測0ではありません)。未公表の項目は勝敗のカウント対象外です。公式が個別ベンチを公表していないモデルも、AA Intelligence Index は第三者測定のため横並びで比較できます。

X VOICE

Xの評判はどう?

ベンチマークとは別の軸として、直近7日(2026-08-24 〜 2026-08-31)の X上の日本語の声をサンプル分析。てんびん丸総研調べ。

Gemini 3.7 Flash

X評判スコア 82 /100(n=40)

ポジ 32 ネガ 7 / 中立 1

👍 推論・応答の速さ

👍 コスパ・効率の良さ

👎 頭が悪い・精度不足

👎 応答が遅くなる場合

Grok 4.6

X評判スコア 68 /100(n=22)

ポジ 13 ネガ 6 / 中立 3

👍 分析力が高い

👍 初めて使って良い感じ

👎 画像生成が微妙

👎 コスパが気になる

※ Grok(x_search)で過去7日の日本語Xポストを、モデルごとに3つの角度(感想・活用報告・他モデル比較)から検索してサンプル収集し、ポジ・ネガ・中立をLLM分類した傾向値。全数調査ではなく、角度間の重複除外も完全ではありません。評判スコア=ポジ÷(ポジ+ネガ)×100(判定5件未満は「—」)。 全モデルの一覧と推移は てんびん丸総研へ。

EDITOR'S NOTE

編集部メモ

数値の背景と、いまの提供状況・注意点

Gemini 3.7 Flash

前世代 Gemini 3.6 Flash(2026-07-21 公開)の後継として 2026年8月13日(米国時間)に公開された Google の主力(workhorse)モデル。 3.6 Flash からわずか3週間での世代交代で、Google の位置づけは「コーディングとエージェント向けの、いちばん賢い働き者」。 料金は 2026年12月31日までの導入価格で 入力 $0.75 / 出力 $3.75、2027年1月1日から 入力 $1.50 / 出力 $7.50 に戻ります (本表とコスパ指数は、いま実際に請求される導入価格で算出しています)。 入力 1,048,576 / 出力 65,536 tokens、マルチモーダル入力(テキスト・画像・動画・音声・PDF、出力はテキスト)、 thinking level は low / medium / high の3段階(指定しない場合は medium)。モデル名は `gemini-3.7-flash`。 Google 公表のベンチは FrontierCode 1.1 Main 43.6%(3.6 Flash は 34.4%)、DeepSWE v1.1 65.3%(同 49.0%)、 WebDev Arena Elo 1588(同 1538)、GDP.pdf 34.0%(同 22.0%)、AutomationBench 30.4%(同 17.0%)。 第三者測定は Artificial Analysis Intelligence Index v4.1.1 で 56(3.6 Flash は同じ版で 52)。 SWE-Bench Verified / GPQA / AIME / MMLU は公式も第三者も数値を公表しておらず空欄です(名前の似た別テストの値では埋めていません)。 【3.6 Flash の現行価格について】3.6 Flash は発表時 入力 $1.50 / 出力 $7.50 で、導入価格の告知はありませんでした。 ただし Google の料金ページは 2026-08-17 時点で 3.6 Flash の行にも 3.7 Flash と同じ「$0.75 / $3.75(2026年12月31日まで)」を 表示しています。一方 3.7 Flash の発表ブログは「3.6 Flash の元の価格の半額」と説明しており、公式内で表記が一致していないため、 3.6 Flash 側の現行価格はここでは断定していません。 本表の 1,048,576 トークンは、Google が Input token limit(入力に使える上限)として公表している値で、出力の上限 65,536 トークンは別枠(2026-08-18 に公式モデルページで確認)。

Grok 4.6

2026-08-12 公開、Grok 4.5 の後継。長時間動き続けるエージェント用途と、見た目をともなう作業(画面や画像を作る仕事)に力を入れた世代で、Grok 4.5 より長く追加学習を行い、手本データの一部は Grok 4.5 自身に作り直させている。料金は $2/$6・コンテキスト 50万トークン・知識は2026年2月1日までと、いずれも Grok 4.5 から据え置き。ただし料金には段差があり、プロンプトが20万トークンに達したリクエストは、そのリクエストの全トークンが倍額(入力 $4/出力 $12)になる。本表の $2/$6 は20万トークン以下のときの値。読み込んだ内容の使い回し料金だけは $0.30 → $0.50 に上がった。公式が出したのは新世代のベンチのみで、Artificial Analysis Intelligence Index 61(v4.1.1・high 設定/Grok 4.5 は 56)・GDPVal-AA v2 1753・CursorBench v3.2 69.9%・DeepSWE v1.1 65.9%・FrontierCode v1.1 (Extended) 61.3%・APEX-Agents 57.5%・APEX-SWE 56.4%・AA-Briefcase 1577・Harvey LAB (Vals) 15.8%。一方 Terminal-Bench v3.0 は 26% で、公式が横に並べた GPT-5.6 Sol Max(34.6%)・Claude Fable 5 Max(34.1%)に大きく届かない唯一の項目。本表の SWE-bench Verified・MMLU・GPQA・AIME・HLE は公式も第三者も数値を出しておらず「—」(DeepSWE v1.1 や APEX-SWE は名前が似ているだけの別のテストなので流用しません。前世代 Grok 4.5 の値も流用しません)。知能スコア 61 は本表で Claude Opus 5(63)・Claude Fable 5(62)に次ぐ位置で、GPT-5.6 Sol(61)と同点。ただし Opus 5 と Sol が考える量を最大にした設定での測定なのに対し、Grok 4.6 はその一段下(high)での測定という違いがある。Artificial Analysis の実測では文章を書き出す速さが毎秒 56.9 → 77.6 トークンに上がった一方、最初の1文字が返ってくるまでの時間は 9.32秒 → 42.09秒 と大きく延びており、「全面的に速くなった」わけではない点に注意。本表の50万トークンは xAI 公式ドキュメントのモデル表の Context 列の値で、入力と出力の内訳は公表されていない(2026-08-18 確認)。

PROS & CONS

強み・弱み

Gemini 3.7 Flash

Google 製。Gmail / Docs との連携と、100万トークンの長文+画像・動画・音声の読み取りが持ち味。最新は 3.7 Flash。

◎ 強み

  • Gmail / Docs / Sheets / Slides と連携
  • 画像・動画・音声・PDFの理解が強い
  • 1M tokens の長いコンテキスト
  • 文字起こし専用モデル Gemini 3.5 Transcribe(85以上の言語を自動判別・日本語 ja-JP 対応)
  • Deep Research Max など独自機能

△ 注意点

  • 回答の口調がやや堅め
公式サイト →

Grok 4.6

X 統合のノリ軽め AI が、Grok 4.6 で「値段そのまま・賢さだけ上位」に。安さと性能を両取りするコーディング特化フラグシップ。

◎ 強み

  • Xのリアルタイム投稿を検索できる
  • ユーモアと毒舌のあるキャラ設定
  • X Premium に同梱でコスパ良
  • Grok Speech / TTS API も2026-05 から提供開始
  • 4.6 でも $2/$6 per MTok 据え置き。この価格帯としては知能スコアが突出して高い
  • Grok Build・Cursor・Office アドインなど開発/実務ツールへ即統合

△ 注意点

  • 過激寄りの応答もあるので場面を選ぶ
  • コンテキストは 500k と前世代 Grok 4.3 の 1M から縮小
  • プロンプトが20万トークンに達すると、そのリクエストは全トークンが倍額になる
  • 4.6 は最初の1文字が返るまでの時間が 4.5 より大きく延びている(第三者計測)
  • 日本語性能の第三者検証はまだ少ない
公式サイト →

FAQ

よくある質問

Q. Gemini 3.7 Flash と Grok 4.6、結局どっちがいい?

A. AA Intelligence Index は Grok 4.6 61 対 Gemini 3.7 Flash 56 で Grok 4.6 がやや優位ですが、用途によっては逆転しうる差です。料金・使い勝手も合わせて選ぶのがおすすめです。

Q. Gemini 3.7 Flash と Grok 4.6、料金が安いのはどっち?

A. 入力料金は Gemini 3.7 Flash が $0.75/1M、Grok 4.6 が $2/1M。出力料金は Gemini 3.7 Flash が $3.75/1M、Grok 4.6 が $6/1M です。入力・出力とも Gemini 3.7 Flash の方が安く、コスト重視なら Gemini 3.7 Flash が有利です。

Q. Gemini 3.7 Flash と Grok 4.6、ベンチマークで強いのはどっち?

A. 両モデルが共通で公表している指標は1項目と少ないため、全モデルを第三者が同一条件で測定している AA Intelligence Index(Gemini 3.7 Flash 56/Grok 4.6 61)を軸に判断するのがおすすめです。AA Intelligence Index・SWE-Bench・MMLU・GPQA・AIME などの比較可能な指標では Grok 4.6 の勝ち数が多く(1/0)、総合的なベンチ性能では Grok 4.6 が優勢です。

Q. Gemini 3.7 Flash と Grok 4.6、コスパがいいのはどっち?

A. AIコスパ指数(第三者測定の知能スコアと料金の安さを 6:4 で合成した編集部独自指標)は Gemini 3.7 Flash が 81、Grok 4.6 が 78。「安くて賢い」バランスでは Gemini 3.7 Flash が有利です。

Q. Gemini 3.7 Flash と Grok 4.6、初心者にはどっちがおすすめ?

A. 初心者へのおすすめ度は Gemini 3.7 Flash の方が高め(5/5 対 3/5)。まず触ってみるなら Gemini 3.7 Flash から始めると迷いにくいです。

更新を受け取る