ai-garage
← 全タグ一覧

TAG

#ベンチマーク

このタグが付いた記事 5本 News 4本 Column 1本

NEWS (4)

ニュース

OpenAI「GPT-5.6」登場!最上位『Sol』が Fable 5 に1点差まで肉薄、しかも61%速くて半額——3兄弟モデルをてんびん丸が解説するよ

2026/7/10

OpenAI「GPT-5.6」登場!最上位『Sol』が Fable 5 に1点差まで肉薄、しかも61%速くて半額——3兄弟モデルをてんびん丸が解説するよ

OpenAI が 2026年7月9日、新モデル群『GPT-5.6』を一般公開したよ。最上位の『Sol』、中位の『Terra』、下位の『Luna』の3グレード構成で、Sol は総合指標 Intelligence Index v4.1 で 58.9点。Anthropic の Claude Fable 5(59.9点)にわずか1点差まで迫りながら、所要時間は61%短く、推定コストは約半分をうたうんだ。ただし SWE-Bench Pro では Fable 5 に負けるなど、得意分野はハッキリ分かれてる。3兄弟モデルの性能・料金・使い分けを、てんびん丸が捏造ナシでやさしく整理するよ。

AIの“賢さ”って誰がどう測ってるの?Ai2が開発の裏側を支える『olmo-eval』を公開したよ——てんびん丸が整理するんだ

2026/6/13

AIの“賢さ”って誰がどう測ってるの?Ai2が開発の裏側を支える『olmo-eval』を公開したよ——てんびん丸が整理するんだ

AIの研究機関Allen Institute for AI(Ai2)が2026年6月12日、大規模言語モデルを評価するためのオープンソース道具『olmo-eval』を公開したよ。完成したAIの点数を出すだけじゃなく、“開発の途中”で何度もテストし続けるための作業台なんだ。ツールを使うエージェントの能力や、対話の多いやりとりまで評価できて、同じテストを問題1問ずつ見比べられるのが特徴。GitHubで誰でも入手できるよ。ChatGPTやClaudeの『賢さ』って誰がどうやって測ってるの?という素朴な疑問を、てんびん丸が初心者向けにやさしく整理するよ。

AIの『長時間タスク能力』、業界予想を吹き飛ばす伸び!MythosとGPT-5.5が『16時間タスク』ラインに突入したよ

2026/5/14

AIの『長時間タスク能力』、業界予想を吹き飛ばす伸び!MythosとGPT-5.5が『16時間タスク』ラインに突入したよ

ITmediaが2026年5月14日に伝えた話題。米METRと英AISIの最新評価で、Anthropic『Claude Mythos Preview』とOpenAI『GPT-5.5』が長時間タスク遂行能力で従来予想を大幅超過。50%タイムホライズン16時間以上、80%タイムホライズンも4.7カ月ごとの倍増ペースを超えた事実を、てんびん丸が整理するよ。

Hugging Face、ASRリーダーボードに『ベンチマクサー忌避剤』を投入。ズル対策が一段階えぐくなったよ

2026/5/6

Hugging Face、ASRリーダーボードに『ベンチマクサー忌避剤』を投入。ズル対策が一段階えぐくなったよ

音声認識ベンチマーク Open ASR Leaderboard が、Appen と DataoceanAI の非公開データセット11本(約30時間)を導入。ベンチマーク特化のチューニングを締め出して、本物の精度勝負に持ち込む新方式を解説。

COLUMN (1)

コラム

更新を受け取る