ai-garage

X SENTIMENT LAB

てんびん丸総研
AIモデルの「Xの評判」定点観測

ベンチマークの数字だけでは、そのAIが「使っていて気持ちいいか」は分かりません。 総研では、主要AIモデルへの X 上の日本語の声を毎週同じ方法でサンプル分析し、 評判スコアとして横並び比較します。

最新調査週: 2026-08-24 〜 2026-08-31 / 分析サンプル: n=261 / 対象: 13モデル(ai-garage.jp調べ)

THIS WEEK

今週のX評判スコア

スコア=ポジティブな声の割合(ポジ÷[ポジ+ネガ]×100)。「—」は判定材料5件未満。

#1 Kimi K3 100 /100(n=22)
+15 / -0 / 7
👍 PPT作成に優れる👍 中国勢の強み👍 Claude級性能
#2 GPT-5.6 Sol(ChatGPT) 94 /100(n=17)
+15 / -1 / 1
👍 コード生成の実用性👍 相談時の言語化支援👍 実用的な提案力 👎 推論不足
#3 Qwen3.8-Max 83 /100(n=36)
+29 / -6 / 1
👍 ローカルでの高速生成👍 性能がClaude超え👍 Agent能力の高さ 👎 考えすぎる傾向👎 チャット性能の微妙さ👎 思考が遅くグルグルする
#4 Gemini 3.7 Flash 82 /100(n=40)
+32 / -7 / 1
👍 推論・応答の速さ👍 コスパ・効率の良さ👍 文章生成の読みやすさ 👎 頭が悪い・精度不足👎 応答が遅くなる場合👎 おバカさん
#5 Gemini 3.5 Flash-Lite 80 /100(n=16)
+8 / -2 / 6
👍 無料枠の大きさ👍 NSFW規制の緩さ👍 低コストで実務活用 👎 頭が悪い👎 ProからLiteに強制切り替わる
#6 Grok 4.6 68 /100(n=22)
+13 / -6 / 3
👍 分析力が高い👍 初めて使って良い感じ👍 画像生成がカッコいい 👎 画像生成が微妙👎 コスパが気になる👎 日本語出力の難解さ
#7 Claude Opus 5 67 /100(n=23)
+12 / -6 / 5
👍 作業能力が高い👍 深い理解・推論力👍 頭が良い 👎 使い勝手が悪い👎 性能低下👎 言語切り替え問題
#8 Claude Sonnet 5 60 /100(n=13)
+6 / -4 / 3
👍 コストパフォーマンス最強👍 大型アプリに強い👍 大きなアプリに強い 👎 性能が前モデルより劣る👎 価格が高く手が出ない👎 トークン消費が多く請求増
#9 Claude Fable 5 55 /100(n=23)
+12 / -10 / 1
👍 意図の汲み取りが優れている👍 好奇心・自律性が高い👍 クオリティ向上に寄与 👎 切れ味・鋭さが物足りない👎 回答が適当・雑👎 セーフガードが謎
#10 Gemini 3.1 Pro 50 /100(n=18)
+8 / -8 / 2
👍 デバッグ・解析が速く便利👍 情報量・持久力で改良👍 勉強支援でメチャ進む 👎 正確性・精度が低い👎 ハルシネーション多発👎 信頼性・回答品質が悪い
#11 DeepSeek V4-Pro 35 /100(n=27)
+7 / -13 / 7
👍 立ち上げで問題なし👍 コーディングで使用👍 高速コード生成 👎 安定しない👎 お前と言う口調👎 GPTに差がある
#12 Mistral Large 3 /100(n=4)
+1 / -2 / 1
👍 ファッションアドバイスが優秀 👎 ストーリー生成が下手👎 ストーリー展開が下手
#13 Llama 4 Maverick /100(n=0)
+0 / -0 / 0

TREND

評判スコアの推移

週次の定点観測。同じ方法で測り続けるから比較できる。

モデル 2026 W362026 W352026 W312026 W30
Kimi K3 100957080
GPT-5.6 Sol(ChatGPT) 94716855
Qwen3.8-Max 83626373
Gemini 3.7 Flash 82765650
Gemini 3.5 Flash-Lite 80885485
Grok 4.6 68577260
Claude Opus 5 67846223
Claude Sonnet 5 60804273
Claude Fable 5 55867171
Gemini 3.1 Pro 50436059
DeepSeek V4-Pro 35818389
Mistral Large 3 43
Llama 4 Maverick

METHOD

調査方法と読み方の注意

Grok(x_search)で過去7日の日本語Xポストを、モデルごとに3つの角度(感想・活用報告・他モデル比較)から検索してサンプル収集し、ポジ・ネガ・中立をLLM分類した傾向値。全数調査ではなく、角度間の重複除外も完全ではありません。評判スコア=ポジ÷(ポジ+ネガ)×100(判定5件未満は「—」)。

n はサンプル数(実際に分類できたポスト数)です。全数調査や統計的世論調査ではなく、 その週のXの空気感をつかむための傾向値として読んでください。言及数が少ないモデルはスコアのブレが大きくなります。

毎週同じ方法・同じ基準で測り続ける「定点観測」であることが本調査の価値です。 ベンチマークの数字(比較表)と、 使った人の声(本調査)の両方で選ぶのがおすすめです。個別の1対1比較は モデル対決の各ページにも表示しています。

よくある質問

Q.評判スコアはどう計算していますか?
A.ポジティブな声の割合です。ポジ÷(ポジ+ネガ)×100 で出していて、中立の声は分母に入れていません。判定できた材料が5件に満たないモデルはスコアを出さず「—」と表示します。最新の調査週(2026-w36)でいちばん高いのは Kimi K3 の 100 です。
Q.サンプル数はどれくらいですか?
A.最新の調査週(2026-w36)は全体で n=261 件、対象は13モデルです。モデルごとのサンプル数は0〜40件で、各モデルの行に n= として出しています。週によって集まる件数は変わります。
Q.どうやって声を集めていますか?
A.Grok(x_search)で過去7日の日本語Xポストを、モデルごとに3つの角度(感想・活用報告・他モデル比較)から検索してサンプル収集し、ポジ・ネガ・中立をLLM分類した傾向値。全数調査ではなく、角度間の重複除外も完全ではありません。評判スコア=ポジ÷(ポジ+ネガ)×100(判定5件未満は「—」)。
Q.主観や偏りは入りませんか?どこまで信じていいですか?
A.全数調査でも統計的な世論調査でもありません。その週のXの空気感をつかむための傾向値として読んでください。検索の角度どうしの重複除外も完全ではなく、言及数が少ないモデルはスコアのブレが大きくなります。スコアの高い・低いだけで決めず、ベンチマークの数字(比較表)とあわせて見るのがおすすめです。
Q.どのくらいの頻度で更新していますか?
A.毎週1回、同じ方法・同じ基準で調べています。最新の調査週は 2026-08-24 〜 2026-08-31(2026-w36)で、いまは4週ぶんの記録があります。収集できなかった週(2026年のw32〜w34など)は、前の週の値で埋めたりせず欠測としてそのまま残しています。推移表には直近8週ぶんまでを並べています。

更新を受け取る