X SENTIMENT LAB
てんびん丸総研
AIモデルの「Xの評判」定点観測
ベンチマークの数字だけでは、そのAIが「使っていて気持ちいいか」は分かりません。 総研では、主要AIモデルへの X 上の日本語の声を毎週同じ方法でサンプル分析し、 評判スコアとして横並び比較します。
最新調査週: 2026-08-24 〜 2026-08-31 / 分析サンプル: n=261 / 対象: 13モデル(ai-garage.jp調べ)
THIS WEEK
今週のX評判スコア
スコア=ポジティブな声の割合(ポジ÷[ポジ+ネガ]×100)。「—」は判定材料5件未満。
#1 Kimi K3 100 /100(n=22) +15 / -0 / 7
👍 PPT作成に優れる👍 中国勢の強み👍 Claude級性能
#2 GPT-5.6 Sol(ChatGPT) 94 /100(n=17) +15 / -1 / 1
👍 コード生成の実用性👍 相談時の言語化支援👍 実用的な提案力 👎 推論不足
#3 Qwen3.8-Max 83 /100(n=36) +29 / -6 / 1
👍 ローカルでの高速生成👍 性能がClaude超え👍 Agent能力の高さ 👎 考えすぎる傾向👎 チャット性能の微妙さ👎 思考が遅くグルグルする
#4 Gemini 3.7 Flash 82 /100(n=40) +32 / -7 / 1
👍 推論・応答の速さ👍 コスパ・効率の良さ👍 文章生成の読みやすさ 👎 頭が悪い・精度不足👎 応答が遅くなる場合👎 おバカさん
#5 Gemini 3.5 Flash-Lite 80 /100(n=16) +8 / -2 / 6
👍 無料枠の大きさ👍 NSFW規制の緩さ👍 低コストで実務活用 👎 頭が悪い👎 ProからLiteに強制切り替わる
#6 Grok 4.6 68 /100(n=22) +13 / -6 / 3
👍 分析力が高い👍 初めて使って良い感じ👍 画像生成がカッコいい 👎 画像生成が微妙👎 コスパが気になる👎 日本語出力の難解さ
#7 Claude Opus 5 67 /100(n=23) +12 / -6 / 5
👍 作業能力が高い👍 深い理解・推論力👍 頭が良い 👎 使い勝手が悪い👎 性能低下👎 言語切り替え問題
#8 Claude Sonnet 5 60 /100(n=13) +6 / -4 / 3
👍 コストパフォーマンス最強👍 大型アプリに強い👍 大きなアプリに強い 👎 性能が前モデルより劣る👎 価格が高く手が出ない👎 トークン消費が多く請求増
#9 Claude Fable 5 55 /100(n=23) +12 / -10 / 1
👍 意図の汲み取りが優れている👍 好奇心・自律性が高い👍 クオリティ向上に寄与 👎 切れ味・鋭さが物足りない👎 回答が適当・雑👎 セーフガードが謎
#10 Gemini 3.1 Pro 50 /100(n=18) +8 / -8 / 2
👍 デバッグ・解析が速く便利👍 情報量・持久力で改良👍 勉強支援でメチャ進む 👎 正確性・精度が低い👎 ハルシネーション多発👎 信頼性・回答品質が悪い
#11 DeepSeek V4-Pro 35 /100(n=27) +7 / -13 / 7
👍 立ち上げで問題なし👍 コーディングで使用👍 高速コード生成 👎 安定しない👎 お前と言う口調👎 GPTに差がある
#12 Mistral Large 3 — /100(n=4) +1 / -2 / 1
👍 ファッションアドバイスが優秀 👎 ストーリー生成が下手👎 ストーリー展開が下手
#13 Llama 4 Maverick — /100(n=0) +0 / -0 / 0
TREND
評判スコアの推移
週次の定点観測。同じ方法で測り続けるから比較できる。
| モデル | 2026 W36 | 2026 W35 | 2026 W31 | 2026 W30 |
|---|---|---|---|---|
| Kimi K3 | 100 | 95 | 70 | 80 |
| GPT-5.6 Sol(ChatGPT) | 94 | 71 | 68 | 55 |
| Qwen3.8-Max | 83 | 62 | 63 | 73 |
| Gemini 3.7 Flash | 82 | 76 | 56 | 50 |
| Gemini 3.5 Flash-Lite | 80 | 88 | 54 | 85 |
| Grok 4.6 | 68 | 57 | 72 | 60 |
| Claude Opus 5 | 67 | 84 | 62 | 23 |
| Claude Sonnet 5 | 60 | 80 | 42 | 73 |
| Claude Fable 5 | 55 | 86 | 71 | 71 |
| Gemini 3.1 Pro | 50 | 43 | 60 | 59 |
| DeepSeek V4-Pro | 35 | 81 | 83 | 89 |
| Mistral Large 3 | — | — | 43 | — |
| Llama 4 Maverick | — | — | — | — |
METHOD
調査方法と読み方の注意
Grok(x_search)で過去7日の日本語Xポストを、モデルごとに3つの角度(感想・活用報告・他モデル比較)から検索してサンプル収集し、ポジ・ネガ・中立をLLM分類した傾向値。全数調査ではなく、角度間の重複除外も完全ではありません。評判スコア=ポジ÷(ポジ+ネガ)×100(判定5件未満は「—」)。
n はサンプル数(実際に分類できたポスト数)です。全数調査や統計的世論調査ではなく、 その週のXの空気感をつかむための傾向値として読んでください。言及数が少ないモデルはスコアのブレが大きくなります。
毎週同じ方法・同じ基準で測り続ける「定点観測」であることが本調査の価値です。 ベンチマークの数字(比較表)と、 使った人の声(本調査)の両方で選ぶのがおすすめです。個別の1対1比較は モデル対決の各ページにも表示しています。
よくある質問
- Q.評判スコアはどう計算していますか?
- A.ポジティブな声の割合です。ポジ÷(ポジ+ネガ)×100 で出していて、中立の声は分母に入れていません。判定できた材料が5件に満たないモデルはスコアを出さず「—」と表示します。最新の調査週(2026-w36)でいちばん高いのは Kimi K3 の 100 です。
- Q.サンプル数はどれくらいですか?
- A.最新の調査週(2026-w36)は全体で n=261 件、対象は13モデルです。モデルごとのサンプル数は0〜40件で、各モデルの行に n= として出しています。週によって集まる件数は変わります。
- Q.どうやって声を集めていますか?
- A.Grok(x_search)で過去7日の日本語Xポストを、モデルごとに3つの角度(感想・活用報告・他モデル比較)から検索してサンプル収集し、ポジ・ネガ・中立をLLM分類した傾向値。全数調査ではなく、角度間の重複除外も完全ではありません。評判スコア=ポジ÷(ポジ+ネガ)×100(判定5件未満は「—」)。
- Q.主観や偏りは入りませんか?どこまで信じていいですか?
- A.全数調査でも統計的な世論調査でもありません。その週のXの空気感をつかむための傾向値として読んでください。検索の角度どうしの重複除外も完全ではなく、言及数が少ないモデルはスコアのブレが大きくなります。スコアの高い・低いだけで決めず、ベンチマークの数字(比較表)とあわせて見るのがおすすめです。
- Q.どのくらいの頻度で更新していますか?
- A.毎週1回、同じ方法・同じ基準で調べています。最新の調査週は 2026-08-24 〜 2026-08-31(2026-w36)で、いまは4週ぶんの記録があります。収集できなかった週(2026年のw32〜w34など)は、前の週の値で埋めたりせず欠測としてそのまま残しています。推移表には直近8週ぶんまでを並べています。
あわせて読む