単一のブログが12のAIモデルを4つのアプリで評価
TryAIは12の全エントリーを自ら構築・評価し、外部の審判や監査なしで各タスク5回試行してスコアを付けた。
- 「Claude Fable 5」のみが、5回の試行すべてでルービックキューブを完全に解いた。
- 「GPT-5.6 Luna」は1.0秒で回答し、1回あたり0.001ドルと最も安価だった。
- 「Grok 4.5」は、より安価でありながら、難解なタスクで「Claude Opus 4.8」に匹敵した。
なぜ重要か: ベンチマークを設計したサイトが自ら評価し、それを独立した証明としてランキングを公開している。