ai-garage

VS COMPARISON

Llama 4 Maverick vs GPT-5.6 Luna

編集部の総合判定

総合知能(AA Index)は GPT-5.6 Luna 52 対 Llama 4 Maverick 14。現時点では GPT-5.6 Luna が明確に優位

ベンチ勝ち:Llama 4 Maverick 0 / GPT-5.6 Luna 1 料金で安い項目:Llama 4 Maverick 0 / GPT-5.6 Luna 2 データ最終更新:2026-08-28(編集部集計)

世代差に注意:GPT-5.6 Luna は Llama 4 Maverick より約15か月新しい世代(2026年7月公開 vs 2025年4月公開)

WHICH ONE

こんな人はどっち?

こんな人は Llama 4 Maverick

  • 長い資料を読ませたい人(100万トークン)
  • 「中身(重み)が公開されている」を重視する人

こんな人は GPT-5.6 Luna

  • API 料金を抑えたい人(入力$0.2/出力$1.2)
  • AI をはじめて使う人
  • じっくり考える推論タスクを頼みたい人

SPECS

仕様の比較

項目 Llama 4 Maverick GPT-5.6 Luna
バージョン Llama 4 Maverick (MoE 400B / 17B active, 128 experts) GPT-5.6 Luna
公開日 2025-04-05 2026-07-09
コンテキスト長 1000K 勝ち 922K
入力料金 $/1M $0.2 安い
出力料金 $/1M $1.2 安い
推論モデル ✓ あり
マルチモーダル ✓ あり ✓ あり
AIコスパ指数 独自指標 90

BENCHMARKS

ベンチマーク差分

バーの長さは100%スケール。長い方が勝ち。

総合知能(AA Intelligence Index)

Llama 4 Maverick
14
GPT-5.6 Luna
52 勝ち

知識の広さ(MMLU)

Llama 4 Maverick
80.5%
GPT-5.6 Luna

AA Intelligence Index(第三者機関 Artificial Analysis の統合知能指標)/ SWE-Bench Verified(実OSSバグ修正)/ MMLU(総合学力)/ GPQA Diamond(博士レベル理系)/ AIME(数学オリンピック予選)/ HLE(Humanity's Last Exam・最難関試験)

※「—」は未公表(実測0ではありません)。未公表の項目は勝敗のカウント対象外です。公式が個別ベンチを公表していないモデルも、AA Intelligence Index は第三者測定のため横並びで比較できます。

X VOICE

Xの評判はどう?

ベンチマークとは別の軸として、直近7日(2026-08-24 〜 2026-08-31)の X上の日本語の声をサンプル分析。てんびん丸総研調べ。

Llama 4 Maverick

X評判スコア /100(n=0)

ポジ 0 ネガ 0 / 中立 0 (判定材料が少なくスコアは保留)

GPT-5.6 Luna

今週の集計にこのモデルのデータはありません。

※ Grok(x_search)で過去7日の日本語Xポストを、モデルごとに3つの角度(感想・活用報告・他モデル比較)から検索してサンプル収集し、ポジ・ネガ・中立をLLM分類した傾向値。全数調査ではなく、角度間の重複除外も完全ではありません。評判スコア=ポジ÷(ポジ+ネガ)×100(判定5件未満は「—」)。 全モデルの一覧と推移は てんびん丸総研へ。

EDITOR'S NOTE

編集部メモ

数値の背景と、いまの提供状況・注意点

Llama 4 Maverick

Meta 公式 Llama 4 系の旗艦。MoE 128 experts、native multimodal、1M context、Knowledge cutoff 2024-08。 公式公表ベンチは MMLU Pro 80.5、LiveCodeBench 43.4、MMMU 73.4、MathVista 73.7、ChartQA 90、DocVQA 94.4。 SWE-Bench / GPQA / AIME / HLE は Meta から公式公表なし(同列比較困難)。Llama 4 Scout(10M context、17B/109B MoE)も同時リリース。 オープンウェイト(Llama 4 Community License、月7億 MAU 超は別ライセンス必要)。 本表の100万トークンは公式モデルカードの Context length(同時公開の Scout は 10M)。入力と出力の内訳は公表されていない(2026-08-18 確認)。

GPT-5.6 Luna

GPT-5.6 の3グレード(Sol / Terra / Luna)でいちばん軽い低価格モデル。 2026-08-06 の変更で ChatGPT の無料プランと Go プランの既定モデルがこの Luna になったので、 いま実際にいちばん多くの人が触っているのはこのグレード(それまでは中位の Terra、Plus・Pro は最上位の Sol)。 無料プランは同じタイミングでテキストチャットが無制限になり、じっくり考えさせる Think も使えるようになった (ファイルや画像のアップロード、ツール利用には引き続き上限がある)。 料金は 2026-07-30 の改定で 100万トークンあたり $1/$6 → $0.20/$1.20 に80%下がり、3グレードで最大の下げ幅だった (同じ日に Terra は20%減、Sol はこのときだけ $5/$30 で据え置きだった。その Sol も 2026-08-22 に $4/$20 へ下がっている)。 ※ 本表の料金は OpenAI 公式の短いコンテキスト向けの価格。長いコンテキストでは入力 $0.40 / 出力 $1.80 と別料金になる。 Artificial Analysis Intelligence Index は 52(v4.1.1・max 設定/2026-08-11 時点)。 同じ v4.1.1 での Sol は 61、Terra は 57 なので上位2グレードには届かないが、前世代の Gemini 3.6 Flash(52)と同点で、 Gemini 3.1 Pro(48)を上回る(後継の Gemini 3.7 Flash は同じ版で 56)。入力料金が Sol の25分の1であることを考えると、価格に対する知能は3グレードで最も高い。 出力速度は 203.9 トークン/秒(Artificial Analysis 実測)で、Terra の 125.7 より速い3グレード中最速。 コンテキストウィンドウは OpenAI 公式表記で 1,050,000 トークンだが、入力に使える上限は 922,000 トークン・1回の出力上限は 128,000 トークン。本表の値は「一度に読める量」なので入力上限の 922,000 を採用している。入力が 272,000 トークンを超えたリクエストは全体が入力2倍・出力1.5倍($0.40/$1.80)になる(2026-08-18 に公式ドキュメントで確認)。入力はテキストと画像に対応。 GPQA Diamond・HLE・SWE-bench Verified は Luna 個別の公開値が無いため本表では「—」(他グレードの数値では埋めていません)。

PROS & CONS

強み・弱み

Llama 4 Maverick

オープンウェイト LLM の代名詞——ただし Meta の開発は Muse 系へ移り、オープン版も2026年8月公開の Muse Glimmer が担う。Llama 4 が事実上の最終世代。

◎ 強み

  • 中身(重み)が公開されている
  • 自分の PC・サーバーで動かせる
  • 派生モデル・改造モデルが豊富
  • Llama 4 で native multimodal(テキスト + 画像)に対応
  • Scout は 10M tokens 長コンテキスト

△ 注意点

  • Meta のフロンティアは閉源の Muse Spark 系(1.2 まで更新)へ移行済みで、Llama ブランドの後継は依然として未発表
  • ただし Meta は 2026-08-10 に別系統のオープンモデル Muse Glimmer(約296億パラメータ・Apache 2.0)を公開し、重みを配る路線に部分的に戻った。圧縮された配布版なら 24GB の VRAM でも動く(圧縮しない場合は55GB超が必要)
  • ネットに出回る「Llama 5 リリース」記事は誤情報なので注意(2026-08 時点で Llama 5 は存在しない)
  • 単独ブランドサイト llama.com は Meta の開発者ポータル(developer.meta.com)に統合された
公式サイト →

GPT-5.6 Luna

AIブームの火付け役。フラッグシップ GPT-5.6(Sol/Terra/Luna)を内蔵し、画像・音声まで一つで完結。

◎ 強み

  • 総合力が高くてなんでもこなす
  • 音声・画像・ファイル対応がスムーズ
  • アプリ・拡張機能が豊富

△ 注意点

  • 話の事実確認は弱め、要ファクトチェック
公式サイト →

FAQ

よくある質問

Q. Llama 4 Maverick と GPT-5.6 Luna、結局どっちがいい?

A. 第三者測定の AA Intelligence Index は GPT-5.6 Luna が 52、Llama 4 Maverick が 14 と明確な差があり、現時点の総合性能では GPT-5.6 Luna が優位です。なお、GPT-5.6 Luna は Llama 4 Maverick より約15か月新しい世代(2026年7月公開 vs 2025年4月公開)です。料金や使い勝手も含めた選び方は「こんな人はどっち?」の欄を参考にしてください。

Q. Llama 4 Maverick と GPT-5.6 Luna、ベンチマークで強いのはどっち?

A. 両モデルが共通で公表している指標は1項目と少ないため、全モデルを第三者が同一条件で測定している AA Intelligence Index(Llama 4 Maverick 14/GPT-5.6 Luna 52)を軸に判断するのがおすすめです。AA Intelligence Index・SWE-Bench・MMLU・GPQA・AIME などの比較可能な指標では GPT-5.6 Luna の勝ち数が多く(1/0)、総合的なベンチ性能では GPT-5.6 Luna が優勢です。

Q. Llama 4 Maverick と GPT-5.6 Luna、初心者にはどっちがおすすめ?

A. 初心者へのおすすめ度は GPT-5.6 Luna の方が高め(5/5 対 2/5)。まず触ってみるなら GPT-5.6 Luna から始めると迷いにくいです。

更新を受け取る