NEWS (2)
ニュース
2026/8/7
Claude Fable 5 と GPT-5.6 はどっちが強い?物理シミュ検証で首位は Fable 5、でもコストは Sol の5.5倍——差を分けたのはモデルより「道具」だったよ
JuliaHub が物理シミュレーションの5問で Claude Fable 5 と GPT-5.6 の3兄弟を比べたよ。スコア1位は Fable 5(0.889)だけど1回あたり9.60ドルで、GPT-5.6 Sol(0.814・1.74ドル)の約5.5倍。しかも同じモデルでも使う道具立てを替えると0.366点動いて、モデル間の差0.162点の2倍以上だったんだ。
2026/8/5
AIのベンチマークはもう限界?60本中29本が「飽和」、ICML 2026採択の研究で分かった性能比較の落とし穴だよ
AI の実力をはかるベンチマーク60本を調べたら、29本(約48%)が「飽和」していたんだ。上位モデル同士の点数が、誤差の範囲でしか違わなくなっている状態だよ。ICML 2026 に採択された論文をもとに、なぜ数字が団子になるのか、古いベンチマークほど飽和しやすいこと(24か月以内42.9% → 60か月超54.5%)、そして比較表の数字をどう読めばいいのかを整理するね。