ai-garage

VS COMPARISON

GPT-5.6 Sol vs GLM-5.3

編集部の総合判定

総合性能は拮抗(AA Index 61 対 60)。用途と料金で選ぶのが正解

ベンチ勝ち:GPT-5.6 Sol 0 / GLM-5.3 0 料金で安い項目:GPT-5.6 Sol 0 / GLM-5.3 2 データ最終更新:2026-08-28(編集部集計)

WHICH ONE

こんな人はどっち?

こんな人は GPT-5.6 Sol

  • AI をはじめて使う人
  • 画像も読ませたい人

こんな人は GLM-5.3

  • API 料金を抑えたい人(入力$1.4/出力$4.4)
  • コスパ重視の人(AIコスパ指数 81 対 68)
  • 長い資料を読ませたい人(100万トークン)

SPECS

仕様の比較

項目 GPT-5.6 Sol GLM-5.3
バージョン GPT-5.6(Sol / Terra / Luna) 5.3
公開日 2026-07-09 2026-08-18
コンテキスト長 922K 1000K 勝ち
入力料金 $/1M $4 $1.4 安い
出力料金 $/1M $20 $4.4 安い
推論モデル ✓ あり ✓ あり
マルチモーダル ✓ あり
AIコスパ指数 独自指標 68 81 勝ち

BENCHMARKS

ベンチマーク差分

バーの長さは100%スケール。長い方が勝ち。

総合知能(AA Intelligence Index)

GPT-5.6 Sol
61
GLM-5.3
60

専門知識(GPQA)

GPT-5.6 Sol
94.1%
GLM-5.3

最難関試験(HLE)

GPT-5.6 Sol
47.2%
GLM-5.3

AA Intelligence Index(第三者機関 Artificial Analysis の統合知能指標)/ SWE-Bench Verified(実OSSバグ修正)/ MMLU(総合学力)/ GPQA Diamond(博士レベル理系)/ AIME(数学オリンピック予選)/ HLE(Humanity's Last Exam・最難関試験)

※「—」は未公表(実測0ではありません)。未公表の項目は勝敗のカウント対象外です。公式が個別ベンチを公表していないモデルも、AA Intelligence Index は第三者測定のため横並びで比較できます。

X VOICE

Xの評判はどう?

ベンチマークとは別の軸として、直近7日(2026-08-24 〜 2026-08-31)の X上の日本語の声をサンプル分析。てんびん丸総研調べ。

GPT-5.6 Sol

X評判スコア 94 /100(n=17)

ポジ 15 ネガ 1 / 中立 1

👍 コード生成の実用性

👍 相談時の言語化支援

👎 推論不足

GLM-5.3

今週の集計にこのモデルのデータはありません。

※ Grok(x_search)で過去7日の日本語Xポストを、モデルごとに3つの角度(感想・活用報告・他モデル比較)から検索してサンプル収集し、ポジ・ネガ・中立をLLM分類した傾向値。全数調査ではなく、角度間の重複除外も完全ではありません。評判スコア=ポジ÷(ポジ+ネガ)×100(判定5件未満は「—」)。 全モデルの一覧と推移は てんびん丸総研へ。

EDITOR'S NOTE

編集部メモ

数値の背景と、いまの提供状況・注意点

GPT-5.6 Sol

OpenAI のフラッグシップ。GPT-5.6 は 2026-07-09 に一般公開(6-26 の限定プレビューから拡大)。Sol(最上位)・Terra(中位)・Luna(軽量)の3グレード構成で、本行は最上位 Sol。2026-07-30 に API 料金が改定され、Terra が $2.50/$15 → $2/$12(20%減)、Luna が $1/$6 → $0.20/$1.20(80%減)に下がり、このときは Sol だけ $5/$30 で据え置きだった。その Sol も 2026-08-22 に値下げされ、入力 $5 → $4(20%減)・出力 $30 → $20(33%減)になった(キャッシュ済み入力は $0.50 → $0.40)。本行の $4/$20 はこの値。ただし OpenAI 公式ドキュメントは「GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026」と明記しており、期間限定のプロモ価格。2026-11-21 を過ぎたら公式ドキュメントを再確認し、$5/$30 に戻っていたら本行を戻す。Terra($2/$12)と Luna($0.20/$1.20)はこの回の対象外で据え置き。中位の Terra は本表に別行(GPT-5.6 Terra)で掲載している。Artificial Analysis Intelligence Index は 61 で、Claude Opus 5(63)・Claude Fable 5(62)に次ぐ本表3番手(v4.1.1・2026-08-11 時点。考える量を最大にした max 設定での測定値)。同じ 61 に Grok 4.6 が並んでいるが、あちらは一段下の high 設定での測定なので、条件をそろえた比較ではない。ただし Fable 5 に対しては所要時間が約61%短く推定コストは約半分をうたう。GPQA Diamond 94.1%・HLE(Humanity's Last Exam)47.2%。コンテキストウィンドウは OpenAI 公式表記で 1,050,000 トークンだが、入力に使える上限は 922,000 トークン・1回の出力上限は 128,000 トークン。本表の値は「一度に読める量」なので入力上限の 922,000 を採用している。入力が 272,000 トークンを超えたリクエストは、そのリクエスト全体が入力2倍・出力1.5倍で計算される。値下げ後は $8/$30(値下げ前は $10/$45)(2026-08-22 に OpenAI 公式ドキュメント platform.openai.com/docs/pricing で確認)。まとめて投げる Batch と Flex は標準の半額で $2/$10、優先処理の Fast mode は2倍で $8/$40。API のリスト価格は 2026-07-09 の公開から 2026-08-21 まで $5/$30 で据え置かれ、2026-08-22 に $4/$20 へ下がった。2026-08 前半に「Sol が50%オフ」として広まった話はこれとは別物で、AI仲介サービス OpenRouter 経由の期間限定プロモ(2026-08-18 時点で同社の公開APIが返す単価は $2.50/$15=当時の公式のちょうど半額)。この50%の関係は公式値下げ後も続いており、2026-08-22 時点で OpenRouter の公開APIが返す単価は $2/$10(新公式 $4/$20 のちょうど半額)、272,000トークン超の割増も $4/$15 で公式 $8/$30 の半額。終了日は非公表。SWE-bench Verified・MMLU・AIME は Sol 個別の公開値が無いため本表では「—」(OpenAI の公表は別ベンチの SWE-Bench Pro 64.6%)。ChatGPT の住み分けは 2026-08-06 に変更され、無料/Go=Luna(テキストチャット無制限・Think ボタン付き。従来は Terra)、Plus・Pro=Sol(事実誤認を含む回答の割合が GPT-5.5 Instant 比で約68%減、思考時間のスライダー付き)、Pro/Enterprise=Sol Pro。

GLM-5.3

中国の Z.ai が 2026-08-18 に公開した同社の旗艦モデル(API のモデル名は glm-5.3)。 土台は前世代 GLM-5.2 と同じで、公開後の追加学習だけで性能を伸ばしたと公式が明記しています。 考える機能は常にオンで、考える量は low / high / max の3段階(指定しない場合は max)。 入力はテキストのみで、画像・音声には対応しません。一度に読める量は100万トークン、 一度に書ける量は最大12万8千トークン(2026-08-28 に公式ドキュメントで確認)。 第三者測定の Artificial Analysis Intelligence Index は 60(v4.1.1・max 設定)で、本表では Kimi K3 と同点。 コードを直す力は、誰でも見られる DeepSWE v1.1 の公式ランキング(113課題・ハーネスは mini-swe-agent・ max 設定/2026-08-26 更新)で 69%(誤差 ±3)・掲載25モデル中5位。Kimi K3(68.5%)・Grok 4.6(67.5%)・ DeepSeek V4-Pro(62.8%)を上回り、Claude Opus 5(73.6%)と GPT-5.6 Sol(72.7%)には届いていません。 1課題あたりの平均費用は $3.99 で、Opus 5 の $11.84 の約3分の1です。 Z.ai 自身の発表値は同じベンチで 66.9 ですが、公式ランキングの 69%(誤差 ±3)の範囲に収まっています。 同社が公表している他のベンチは Terminal Bench 3.0 が 28.3、Agents' Last Exam が 28.5、 ソフトウェアの弱点を見つける CyberGym が 84.5%。Z.ai Code Bench(max 設定で 34.5%、前世代比 50%向上)は 名前に自社名が入る自社製のテストなので参考程度に見てください。 SWE-bench Verified・MMLU・GPQA・AIME は公式・第三者とも数値を公表しておらず本表では「—」です (名前の似た別のテストの値では埋めていません)。 【重みの公開について】Z.ai は発表文で「公開されているモデルの中では最高水準」と書いていますが、 Hugging Face の zai-org には廉価版 GLM-5.3-Flash(MIT ライセンス)はあっても GLM-5.3 の公開リポジトリは無く、 Artificial Analysis も proprietary(非公開)と分類しています(2026-08-28 確認)。 【廉価版について】GLM-5.3-Flash(2026-08-26 公開・MIT ライセンス・AA Index 57)は 2026-09-09 まで50%オフの割引価格(入力 $0.075 / 出力 $0.25、定価は $0.15 / $0.50)で提供中です。 値段が確定する 2026-09-10 以降に、本表へ別行として追加するかを判断します。 中国製のため業務利用は規約とデータの取り扱いを確認してください。

PROS & CONS

強み・弱み

GPT-5.6 Sol

AIブームの火付け役。フラッグシップ GPT-5.6(Sol/Terra/Luna)を内蔵し、画像・音声まで一つで完結。

◎ 強み

  • 総合力が高くてなんでもこなす
  • 音声・画像・ファイル対応がスムーズ
  • アプリ・拡張機能が豊富

△ 注意点

  • 話の事実確認は弱め、要ファクトチェック
公式サイト →

GLM-5.3

中国 Z.ai の GLM シリーズ。旗艦 GLM-5.3 は DeepSWE 公式ランキング5位、廉価版 GLM-5.3-Flash は MIT ライセンスで商用利用もできる。

◎ 強み

  • 旗艦 GLM-5.3(2026-08-18 公開)は DeepSWE v1.1 の公式ランキングで 69%・掲載25モデル中5位
  • 1課題あたりの平均費用 $3.99 は Claude Opus 5($11.84)の約3分の1
  • 100万トークンの長文コンテキスト、一度に書ける量は最大12万8千トークン
  • 廉価版 GLM-5.3-Flash(2026-08-26 公開)は重みが MIT ライセンスで公開され、商用利用もできる
  • GLM-5.3-Flash は画面やブラウザの画像も見られるので、コードと表示結果を行き来する作業に向く

△ 注意点

  • 旗艦の GLM-5.3 は入力がテキストのみ(画像・音声は扱えない)
  • GLM-5.3 の重みは公開されておらず、公開されているのは廉価版の GLM-5.3-Flash のほう
  • SWE-bench Verified・MMLU・GPQA・AIME は公式・第三者とも数値が出ていない
  • 中国製のため業務利用は規約とデータの取り扱いを確認したい
  • GLM-5.3-Flash の割引価格は 2026-09-09 までの期間限定
公式サイト →

FAQ

よくある質問

Q. GPT-5.6 Sol と GLM-5.3、結局どっちがいい?

A. AA Intelligence Index は GPT-5.6 Sol 61、GLM-5.3 60 とほぼ同水準で、総合性能は拮抗しています。用途・料金・使い勝手で選ぶのが正解です。

Q. GPT-5.6 Sol と GLM-5.3、料金が安いのはどっち?

A. 入力料金は GPT-5.6 Sol が $4/1M、GLM-5.3 が $1.4/1M。出力料金は GPT-5.6 Sol が $20/1M、GLM-5.3 が $4.4/1M です。入力・出力とも GLM-5.3 の方が安く、コスト重視なら GLM-5.3 が有利です。

Q. GPT-5.6 Sol と GLM-5.3、ベンチマークで強いのはどっち?

A. 両モデルが共通で公表している指標は1項目と少ないため、全モデルを第三者が同一条件で測定している AA Intelligence Index(GPT-5.6 Sol 61/GLM-5.3 60)を軸に判断するのがおすすめです。その AA Intelligence Index でも明確な差は付いていないため、性能は同水準と見て、料金や使い勝手で選ぶのがおすすめです。

Q. GPT-5.6 Sol と GLM-5.3、コスパがいいのはどっち?

A. AIコスパ指数(第三者測定の知能スコアと料金の安さを 6:4 で合成した編集部独自指標)は GPT-5.6 Sol が 68、GLM-5.3 が 81。「安くて賢い」バランスでは GLM-5.3 が有利です。

Q. GPT-5.6 Sol と GLM-5.3、初心者にはどっちがおすすめ?

A. 初心者へのおすすめ度は GPT-5.6 Sol の方が高め(5/5 対 2/5)。まず触ってみるなら GPT-5.6 Sol から始めると迷いにくいです。

更新を受け取る