ai-garage

VS COMPARISON

Qwen3.8-Max vs Gemini 3.1 Pro

編集部の総合判定

総合知能(AA Index)は Qwen3.8-Max 58 対 Gemini 3.1 Pro 48。現時点では Qwen3.8-Max が明確に優位

ベンチ勝ち:Qwen3.8-Max 1 / Gemini 3.1 Pro 1 料金で安い項目:Qwen3.8-Max 1 / Gemini 3.1 Pro 0 データ最終更新:2026-08-28(編集部集計)

世代差に注意:Qwen3.8-Max は Gemini 3.1 Pro より約6か月新しい世代(2026年8月公開 vs 2026年2月公開)

WHICH ONE

こんな人はどっち?

こんな人は Qwen3.8-Max

  • API 料金を抑えたい人(入力$2/出力$6)
  • コスパ重視の人(AIコスパ指数 75 対 61)

こんな人は Gemini 3.1 Pro

  • AI をはじめて使う人
  • 「Gmail / Docs / Sheets / Slides と連携」を重視する人

SPECS

仕様の比較

項目 Qwen3.8-Max Gemini 3.1 Pro
バージョン Qwen3.8-Max(旗艦・2.4T / 95B active) 3.1 Pro
公開日 2026-08-03 2026-02-19
コンテキスト長 1000K 1049K
入力料金 $/1M $2 $2
出力料金 $/1M $6 安い $12
推論モデル ✓ あり ✓ あり
マルチモーダル ✓ あり ✓ あり
AIコスパ指数 独自指標 75 勝ち 61

BENCHMARKS

ベンチマーク差分

バーの長さは100%スケール。長い方が勝ち。

総合知能(AA Intelligence Index)

Qwen3.8-Max
58 勝ち
Gemini 3.1 Pro
48

コード修正力(SWE-Bench)

Qwen3.8-Max
Gemini 3.1 Pro
80.6%

知識の広さ(MMLU)

Qwen3.8-Max
Gemini 3.1 Pro
91%

専門知識(GPQA)

Qwen3.8-Max
92.6%
Gemini 3.1 Pro
94.3% 勝ち

数学(AIME)

Qwen3.8-Max
Gemini 3.1 Pro
95%

AA Intelligence Index(第三者機関 Artificial Analysis の統合知能指標)/ SWE-Bench Verified(実OSSバグ修正)/ MMLU(総合学力)/ GPQA Diamond(博士レベル理系)/ AIME(数学オリンピック予選)/ HLE(Humanity's Last Exam・最難関試験)

※「—」は未公表(実測0ではありません)。未公表の項目は勝敗のカウント対象外です。公式が個別ベンチを公表していないモデルも、AA Intelligence Index は第三者測定のため横並びで比較できます。

X VOICE

Xの評判はどう?

ベンチマークとは別の軸として、直近7日(2026-08-24 〜 2026-08-31)の X上の日本語の声をサンプル分析。てんびん丸総研調べ。

Qwen3.8-Max

X評判スコア 83 /100(n=36)

ポジ 29 ネガ 6 / 中立 1

👍 ローカルでの高速生成

👍 性能がClaude超え

👎 考えすぎる傾向

👎 チャット性能の微妙さ

Gemini 3.1 Pro

X評判スコア 50 /100(n=18)

ポジ 8 ネガ 8 / 中立 2

👍 デバッグ・解析が速く便利

👍 情報量・持久力で改良

👎 正確性・精度が低い

👎 ハルシネーション多発

※ Grok(x_search)で過去7日の日本語Xポストを、モデルごとに3つの角度(感想・活用報告・他モデル比較)から検索してサンプル収集し、ポジ・ネガ・中立をLLM分類した傾向値。全数調査ではなく、角度間の重複除外も完全ではありません。評判スコア=ポジ÷(ポジ+ネガ)×100(判定5件未満は「—」)。 全モデルの一覧と推移は てんびん丸総研へ。

EDITOR'S NOTE

編集部メモ

数値の背景と、いまの提供状況・注意点

Qwen3.8-Max

Alibaba の現行フラッグシップ。2026年7月19日のプレビューを経て 8月3日に正式リリースされた、総2.4兆パラメータ(95B アクティブ)の MoE。前世代 Qwen3.7 Max と違ってマルチモーダルに対応し、context は 1M、料金は $2.00/$6.00。公表ベンチは GPQA Diamond 92.6・Terminal-Bench 2.1 86.6・SWE-bench Pro 67.7 で、Artificial Analysis Intelligence Index は 58(v4.1.1)。本表の SWE-bench Verified・MMLU・AIME は公式・第三者とも数値を出しておらず「—」(SWE-bench Pro は名前が似ているだけの別のテストなので流用しません)。前世代 Qwen3.7 Max(2026-05-19・$1.25/$3.75・SWE-bench Verified 80.4・GPQA 92.4・知能47)も引き続き提供されており、SWE-bench Verified の実測値が要るならそちらが参考になる。重みは 2026年8月12日 19:24 JST(HF 上のファイル最終更新)に公開済み=`Qwen/Qwen3.8-2.4T-A95B` と FP8 版、ModelScope も同名。案内の同日11時 JST からは遅れて公開された。ライセンスは Apache 2.0 ではなく独自の `qwen3.8-max`、モデルカードの context 記載は 262,144(最大 1,010,000 まで拡張可)で AA 表記の 1M とは条件が異なる。小型の Qwen3.8-27B は 2026年8月15日 0:00 JST(HF 上のファイル最終更新)に公開され、こちらはライセンスが商用可の Apache 2.0=`Qwen/Qwen3.8-27B`(BF16・約51.7GB)と FP8 版(約28.7GB)、ModelScope も同名。約278億パラメータ・画像/動画対応・context 262,144(最大 1,000,000)で、Qwen 公表値は SWE-bench Pro 61.7・LiveCodeBench v6 90.3・GPQA Diamond 89.2・HLE 30.8(比較対象の Claude Opus 4.6 Max は 53.4 / 88.8 / 91.3 / 40.0)。手元のパソコンで動かすオープンウェイトが要るならこの 27B が受け皿。中国製のため業務利用時は規約確認を。なお本表の context 100万トークンはホスト版 API の窓のほうで、上記のモデルカード既定 262,144 とは条件が違う。入力と出力の内訳は公表されていない(2026-08-18 確認)。

Gemini 3.1 Pro

ARC-AGI-2 77.1%、LiveCodeBench Elo 2887。200k 超は $4/$18。65k 出力対応。本表の 1,048,576 トークンは入力に使える上限のほうで、出力は別枠。Google DeepMind のモデルカードは入力を「a token context window of up to 1M」、出力を「a 64K token output」と分けて書いており、同系列の 3.7 Flash・3.5 Flash-Lite は Gemini API ドキュメントで Input token limit 1,048,576/Output token limit 65,536 と明記されている(いずれも 2026-08-18 確認)。

PROS & CONS

強み・弱み

Qwen3.8-Max

Alibaba 製の高性能モデル群。旗艦は2026年8月に正式リリースされた Qwen3.8-Max で、手元で動く Qwen3.8-27B まで一通り揃う。

◎ 強み

  • 日本語含む多言語が得意
  • 現行旗艦 Qwen3.8-Max は $2.00/$6.00、前世代 Qwen3.7 Max は $2.50/$7.50 と frontier 級では安い部類
  • コーディングとエージェント(PC操作・ターミナル作業)に強く、コンテキストは 1M tokens
  • オープンウェイト版は Qwen3.8-27B(2026-08-15 公開・Apache 2.0・約278億パラメータ・画像/動画対応)まで揃い、安価マルチモーダル版(3.7 Plus)もある

△ 注意点

  • 中国製のため業務利用は規約・データ取扱の確認を
  • 旗艦 Qwen3.8-Max の重みも公開されているが、ライセンスは Apache 2.0 ではなく独自の `qwen3.8-max`。Apache 2.0 なのは小型の Qwen3.8-27B のほう
  • バージョンが 3.5 → 3.6 → 3.7 → 3.8 と小刻みに上がるので、単価やスペックの記述はすぐ古くなる(2026-08 時点で「Qwen 4」の発表はない)
公式サイト →

Gemini 3.1 Pro

Google 製。Gmail / Docs との連携と、100万トークンの長文+画像・動画・音声の読み取りが持ち味。最新は 3.7 Flash。

◎ 強み

  • Gmail / Docs / Sheets / Slides と連携
  • 画像・動画・音声・PDFの理解が強い
  • 1M tokens の長いコンテキスト
  • 文字起こし専用モデル Gemini 3.5 Transcribe(85以上の言語を自動判別・日本語 ja-JP 対応)
  • Deep Research Max など独自機能

△ 注意点

  • 回答の口調がやや堅め
公式サイト →

FAQ

よくある質問

Q. Qwen3.8-Max と Gemini 3.1 Pro、結局どっちがいい?

A. 第三者測定の AA Intelligence Index は Qwen3.8-Max が 58、Gemini 3.1 Pro が 48 と明確な差があり、現時点の総合性能では Qwen3.8-Max が優位です。なお、Qwen3.8-Max は Gemini 3.1 Pro より約6か月新しい世代(2026年8月公開 vs 2026年2月公開)です。料金や使い勝手も含めた選び方は「こんな人はどっち?」の欄を参考にしてください。

Q. Qwen3.8-Max と Gemini 3.1 Pro、料金が安いのはどっち?

A. 入力料金は Qwen3.8-Max が $2/1M、Gemini 3.1 Pro が $2/1M。出力料金は Qwen3.8-Max が $6/1M、Gemini 3.1 Pro が $12/1M です。安い項目は Qwen3.8-Max が 1 個、Gemini 3.1 Pro が 0 個。用途に応じて選んでください。

Q. Qwen3.8-Max と Gemini 3.1 Pro、ベンチマークで強いのはどっち?

A. 両モデルが共通で公表している指標は2項目と少ないため、全モデルを第三者が同一条件で測定している AA Intelligence Index(Qwen3.8-Max 58/Gemini 3.1 Pro 48)を軸に判断するのがおすすめです。その AA Intelligence Index でも明確な差は付いていないため、性能は同水準と見て、料金や使い勝手で選ぶのがおすすめです。

Q. Qwen3.8-Max と Gemini 3.1 Pro、コスパがいいのはどっち?

A. AIコスパ指数(第三者測定の知能スコアと料金の安さを 6:4 で合成した編集部独自指標)は Qwen3.8-Max が 75、Gemini 3.1 Pro が 61。「安くて賢い」バランスでは Qwen3.8-Max が有利です。

Q. Qwen3.8-Max と Gemini 3.1 Pro、初心者にはどっちがおすすめ?

A. 初心者へのおすすめ度は Gemini 3.1 Pro の方が高め(5/5 対 2/5)。まず触ってみるなら Gemini 3.1 Pro から始めると迷いにくいです。

更新を受け取る