ai-garage

VS COMPARISON

Kimi K3 vs GLM-5.3

編集部の総合判定

総合性能は拮抗(AA Index 60 対 60)。用途と料金で選ぶのが正解

ベンチ勝ち:Kimi K3 0 / GLM-5.3 0 料金で安い項目:Kimi K3 0 / GLM-5.3 2 データ最終更新:2026-08-28(編集部集計)

WHICH ONE

こんな人はどっち?

こんな人は Kimi K3

  • AI をはじめて使う人
  • 画像も読ませたい人

こんな人は GLM-5.3

  • API 料金を抑えたい人(入力$1.4/出力$4.4)
  • コスパ重視の人(AIコスパ指数 81 対 70)

SPECS

仕様の比較

項目 Kimi K3 GLM-5.3
バージョン K3 (2.8T, MoE 896/16 active) 5.3
公開日 2026-07-16 2026-08-18
コンテキスト長 1000K 1000K
入力料金 $/1M $3 $1.4 安い
出力料金 $/1M $15 $4.4 安い
推論モデル ✓ あり ✓ あり
マルチモーダル ✓ あり
AIコスパ指数 独自指標 70 81 勝ち

BENCHMARKS

ベンチマーク差分

バーの長さは100%スケール。長い方が勝ち。

総合知能(AA Intelligence Index)

Kimi K3
60
GLM-5.3
60

専門知識(GPQA)

Kimi K3
93.5%
GLM-5.3

最難関試験(HLE)

Kimi K3
43.5%
GLM-5.3

AA Intelligence Index(第三者機関 Artificial Analysis の統合知能指標)/ SWE-Bench Verified(実OSSバグ修正)/ MMLU(総合学力)/ GPQA Diamond(博士レベル理系)/ AIME(数学オリンピック予選)/ HLE(Humanity's Last Exam・最難関試験)

※「—」は未公表(実測0ではありません)。未公表の項目は勝敗のカウント対象外です。公式が個別ベンチを公表していないモデルも、AA Intelligence Index は第三者測定のため横並びで比較できます。

X VOICE

Xの評判はどう?

ベンチマークとは別の軸として、直近7日(2026-08-24 〜 2026-08-31)の X上の日本語の声をサンプル分析。てんびん丸総研調べ。

Kimi K3

X評判スコア 100 /100(n=22)

ポジ 15 ネガ 0 / 中立 7

👍 PPT作成に優れる

👍 中国勢の強み

GLM-5.3

今週の集計にこのモデルのデータはありません。

※ Grok(x_search)で過去7日の日本語Xポストを、モデルごとに3つの角度(感想・活用報告・他モデル比較)から検索してサンプル収集し、ポジ・ネガ・中立をLLM分類した傾向値。全数調査ではなく、角度間の重複除外も完全ではありません。評判スコア=ポジ÷(ポジ+ネガ)×100(判定5件未満は「—」)。 全モデルの一覧と推移は てんびん丸総研へ。

EDITOR'S NOTE

編集部メモ

数値の背景と、いまの提供状況・注意点

Kimi K3

総2.8兆パラメータ(896エキスパート中16を活性化)の MoE で、オープンウェイトとしては最大級。新アテンション Kimi Delta Attention(KDA)+Attention Residuals で1Mコンテキストのデコードを高速化し、ネイティブ・マルチモーダル(テキスト/画像/動画)に対応。GPQA-Diamond 93.5、Humanity's Last Exam(HLE-Full)43.5、MMMU-Pro 81.6、Terminal-Bench 2.1 88.3、Artificial Analysis Intelligence Index 60(v4.1.1・max 設定/2026-08-11 時点)と frontier 級で、Arena の Frontend Code では首位級。総合では Claude Opus 5(63)・Claude Fable 5(62)と、ともに 61 の GPT-5.6 Sol・Grok 4.6 に一歩届かず、各種リーダーボードで上位級デビュー。SWE-bench Verified / MMLU / AIME は Moonshot が数値を公表しておらず(発表は DeepSWE・FrontierSWE・SWE Marathon などエージェント系ベンチ中心)本表では「—」。フルウェイトは予定どおり 2026-07-27 に Hugging Face(moonshotai/Kimi-K3)で公開済み(ライセンスは Kimi K3 License)。中国製のため業務利用は規約確認を。本表の100万トークンは Moonshot 公式ドキュメントの context window(1M-token context window)で、入力と出力の内訳は公表されていない(2026-08-18 確認)。

GLM-5.3

中国の Z.ai が 2026-08-18 に公開した同社の旗艦モデル(API のモデル名は glm-5.3)。 土台は前世代 GLM-5.2 と同じで、公開後の追加学習だけで性能を伸ばしたと公式が明記しています。 考える機能は常にオンで、考える量は low / high / max の3段階(指定しない場合は max)。 入力はテキストのみで、画像・音声には対応しません。一度に読める量は100万トークン、 一度に書ける量は最大12万8千トークン(2026-08-28 に公式ドキュメントで確認)。 第三者測定の Artificial Analysis Intelligence Index は 60(v4.1.1・max 設定)で、本表では Kimi K3 と同点。 コードを直す力は、誰でも見られる DeepSWE v1.1 の公式ランキング(113課題・ハーネスは mini-swe-agent・ max 設定/2026-08-26 更新)で 69%(誤差 ±3)・掲載25モデル中5位。Kimi K3(68.5%)・Grok 4.6(67.5%)・ DeepSeek V4-Pro(62.8%)を上回り、Claude Opus 5(73.6%)と GPT-5.6 Sol(72.7%)には届いていません。 1課題あたりの平均費用は $3.99 で、Opus 5 の $11.84 の約3分の1です。 Z.ai 自身の発表値は同じベンチで 66.9 ですが、公式ランキングの 69%(誤差 ±3)の範囲に収まっています。 同社が公表している他のベンチは Terminal Bench 3.0 が 28.3、Agents' Last Exam が 28.5、 ソフトウェアの弱点を見つける CyberGym が 84.5%。Z.ai Code Bench(max 設定で 34.5%、前世代比 50%向上)は 名前に自社名が入る自社製のテストなので参考程度に見てください。 SWE-bench Verified・MMLU・GPQA・AIME は公式・第三者とも数値を公表しておらず本表では「—」です (名前の似た別のテストの値では埋めていません)。 【重みの公開について】Z.ai は発表文で「公開されているモデルの中では最高水準」と書いていますが、 Hugging Face の zai-org には廉価版 GLM-5.3-Flash(MIT ライセンス)はあっても GLM-5.3 の公開リポジトリは無く、 Artificial Analysis も proprietary(非公開)と分類しています(2026-08-28 確認)。 【廉価版について】GLM-5.3-Flash(2026-08-26 公開・MIT ライセンス・AA Index 57)は 2026-09-09 まで50%オフの割引価格(入力 $0.075 / 出力 $0.25、定価は $0.15 / $0.50)で提供中です。 値段が確定する 2026-09-10 以降に、本表へ別行として追加するかを判断します。 中国製のため業務利用は規約とデータの取り扱いを確認してください。

PROS & CONS

強み・弱み

Kimi K3

中国発 Moonshot AI のオープンモデル。K3 で総2.8兆パラメータ・100万トークンに到達し、オープン最大級のフロンティアモデルに。

◎ 強み

  • K3:総2.8兆パラメータ(896エキスパート中16活性・活性約104B)の MoE、オープンウェイト最大級
  • 新アテンション Kimi Delta Attention(KDA)で長文デコードを高速化
  • 100万トークンの長文コンテキスト
  • ネイティブ・マルチモーダル(テキスト/画像/動画)
  • フルウェイトを 2026-07-27 に Hugging Face(moonshotai/Kimi-K3)で公開済み

△ 注意点

  • 中国製のため業務利用は規約・データ取扱の確認を
  • API 単価は $3/$15 と K2系から値上げ(オープン系では高め)
  • 総2.8兆パラメータ級でローカル運用のハードルは高い
  • ライセンスは Apache 2.0 / MIT ではなく独自の「Kimi K3 License」。商用利用は条文の確認が必要
公式サイト →

GLM-5.3

中国 Z.ai の GLM シリーズ。旗艦 GLM-5.3 は DeepSWE 公式ランキング5位、廉価版 GLM-5.3-Flash は MIT ライセンスで商用利用もできる。

◎ 強み

  • 旗艦 GLM-5.3(2026-08-18 公開)は DeepSWE v1.1 の公式ランキングで 69%・掲載25モデル中5位
  • 1課題あたりの平均費用 $3.99 は Claude Opus 5($11.84)の約3分の1
  • 100万トークンの長文コンテキスト、一度に書ける量は最大12万8千トークン
  • 廉価版 GLM-5.3-Flash(2026-08-26 公開)は重みが MIT ライセンスで公開され、商用利用もできる
  • GLM-5.3-Flash は画面やブラウザの画像も見られるので、コードと表示結果を行き来する作業に向く

△ 注意点

  • 旗艦の GLM-5.3 は入力がテキストのみ(画像・音声は扱えない)
  • GLM-5.3 の重みは公開されておらず、公開されているのは廉価版の GLM-5.3-Flash のほう
  • SWE-bench Verified・MMLU・GPQA・AIME は公式・第三者とも数値が出ていない
  • 中国製のため業務利用は規約とデータの取り扱いを確認したい
  • GLM-5.3-Flash の割引価格は 2026-09-09 までの期間限定
公式サイト →

FAQ

よくある質問

Q. Kimi K3 と GLM-5.3、結局どっちがいい?

A. AA Intelligence Index は Kimi K3 60、GLM-5.3 60 とほぼ同水準で、総合性能は拮抗しています。用途・料金・使い勝手で選ぶのが正解です。

Q. Kimi K3 と GLM-5.3、料金が安いのはどっち?

A. 入力料金は Kimi K3 が $3/1M、GLM-5.3 が $1.4/1M。出力料金は Kimi K3 が $15/1M、GLM-5.3 が $4.4/1M です。入力・出力とも GLM-5.3 の方が安く、コスト重視なら GLM-5.3 が有利です。

Q. Kimi K3 と GLM-5.3、ベンチマークで強いのはどっち?

A. 両モデルが共通で公表している指標は1項目と少ないため、全モデルを第三者が同一条件で測定している AA Intelligence Index(Kimi K3 60/GLM-5.3 60)を軸に判断するのがおすすめです。その AA Intelligence Index でも明確な差は付いていないため、性能は同水準と見て、料金や使い勝手で選ぶのがおすすめです。

Q. Kimi K3 と GLM-5.3、コスパがいいのはどっち?

A. AIコスパ指数(第三者測定の知能スコアと料金の安さを 6:4 で合成した編集部独自指標)は Kimi K3 が 70、GLM-5.3 が 81。「安くて賢い」バランスでは GLM-5.3 が有利です。

Q. Kimi K3 と GLM-5.3、初心者にはどっちがおすすめ?

A. 初心者へのおすすめ度は Kimi K3 の方が高め(3/5 対 2/5)。まず触ってみるなら Kimi K3 から始めると迷いにくいです。

更新を受け取る