VS COMPARISON
主要AIモデル
2本ずつ徹底比較。
Claude / ChatGPT / Gemini / Grok / DeepSeek / Llama / Qwen のフロンティアモデル16本を2つずつ並べて、 ベンチマーク・料金・コンテキスト長・強み弱みを横並びで比較します。全120ペア掲載。
SELECT TO COMPARE
同じモデルは選べないよ。違うモデルを選んで。
どのAIを選べばいいか迷ったら
5問に答えるだけでおすすめがわかるよ
POPULAR
よく見られているペア
迷ったらここから
Claude Opus 5
Anthropic
Claude Fable 5
Anthropic
比較を見る →
Claude Opus 5
Anthropic
GPT-5.6 Sol
OpenAI
比較を見る →
Claude Opus 5
Anthropic
Gemini 3.1 Pro
比較を見る →
Claude Opus 5
Anthropic
Claude Sonnet 5
Anthropic
比較を見る →
Claude Opus 5
Anthropic
DeepSeek V4-Pro
DeepSeek
比較を見る →
Claude Opus 5
Anthropic
Grok 4.6
SpaceXAI(旧xAI)
比較を見る →
Claude Fable 5
Anthropic
GPT-5.6 Sol
OpenAI
比較を見る →
Claude Fable 5
Anthropic
Kimi K3
Moonshot AI
比較を見る →
Claude Fable 5
Anthropic
Gemini 3.1 Pro
比較を見る →
GPT-5.6 Sol
OpenAI
Kimi K3
Moonshot AI
比較を見る →
GPT-5.6 Sol
OpenAI
Gemini 3.1 Pro
比較を見る →
GPT-5.6 Sol
OpenAI
Grok 4.6
SpaceXAI(旧xAI)
比較を見る →
GPT-5.6 Sol
OpenAI
GPT-5.6 Luna
OpenAI
比較を見る →
GPT-5.6 Sol
OpenAI
GPT-5.6 Terra
OpenAI
比較を見る →
Qwen3.8-Max
Alibaba
Llama 4 Maverick
Meta
比較を見る →
Qwen3.8-Max
Alibaba
Mistral Large 3
Mistral AI
比較を見る →
Gemini 3.1 Pro
Gemini 3.7 Flash
比較を見る →
DeepSeek V4-Pro
DeepSeek
Llama 4 Maverick
Meta
比較を見る →
DeepSeek V4-Pro
DeepSeek
Mistral Large 3
Mistral AI
比較を見る →
ALL PAIRS
全120ペア
フロンティア16モデルの全組み合わせ
よくある質問
- Q.ChatGPT と Claude、どっちがいいですか?
- A.第三者測定の総合指標(Artificial Analysis Intelligence Index)は GPT-5.6 Sol が 61、Claude Opus 5 が 63 で、当サイトの基準(差3以上で勝ち)では互角です。API 料金は GPT-5.6 Sol が 入力 $4 / 出力 $20、Claude Opus 5 が 入力 $5 / 出力 $25(いずれも100万トークンあたり)。コード修正の成績(SWE-bench Verified)は Claude Opus 5 が 96% を公表していますが、GPT-5.6 Sol は未公表なので同じ土俵では比べられません。どちらが上とひとことで言える差ではないので、公表値がある項目を用途に当てはめて選ぶのが確実です。ページ上部の選択欄で2つ選ぶと、全ベンチと料金を並べた比較ページに移動できます。
- Q.API 料金がいちばん安いAIモデルはどれですか?
- A.掲載16モデルのうち料金を公表している15モデルで見ると、入力は GPT-5.6 Luna(OpenAI)の $0.2、出力は GPT-5.6 Luna(OpenAI)の $1.2 がいちばん安い値です(いずれも100万トークンあたり)。ただし安さと成績は別の話で、総合指標がいちばん高いのは Claude Opus 5 の 63 です。
- Q.プログラムのコードを書かせるなら、どのAIモデルですか?
- A.コード修正の成績(SWE-bench Verified)を公表している6モデルの中では、Claude Opus 5 の 96% がいちばん高く、次が Claude Fable 5 の 95% です。残り10モデルはこのベンチの数値を公表していないため、この順位には入っていません(成績が低いという意味ではありません)。
- Q.長い資料をまとめて読ませたいときは、どれを選べばいいですか?
- A.一度に読める量(コンテキスト長)は Gemini 3.1 Pro・Gemini 3.7 Flash・Gemini 3.5 Flash-Lite の 104.9万トークンが最大です。掲載16モデルのうち11モデルが100万トークン以上に対応しているので、長さだけで絞ると選択肢は広めに残ります。実際に選ぶときは、料金とベンチの数字も合わせて見てください。
- Q.比較できる組み合わせはいくつありますか?
- A.掲載16モデルの全組み合わせ、120ペア分の比較ページがあります。ページ上部の選択欄で2つ選べば該当ページに移動します。よく見られている組み合わせは「よく見られているペア」に19件まとめています。
- Q.どちらが勝ちかは、どうやって決めていますか?
- A.各ペアのページでは、第三者測定の総合指標(Artificial Analysis Intelligence Index)は差が3未満なら互角、コード修正の成績(SWE-bench Verified)は差が1未満なら互角として扱います。どちらか一方でも数値を公表していないベンチは「比較不能」として判定から外し、未公表を0点とはみなしません。料金は安いほうを有利として、成績とは別の軸で表示します。
関連ページ