Satu Blog Menilai Dua Belas Model AI pada Empat Aplikasi
TryAI membangun dan menilai sendiri kedua belas entri tersebut, mencetak lima upaya per tugas tanpa wasit atau audit luar.
- Claude Fable 5 saja yang menyelesaikan kubus Rubik dengan bersih dalam kelima percobaan.
- GPT-5.6 Luna menjawab tercepat, pada 1,0 detik, dan termurah, pada $0,001 per putaran.
- Grok 4.5 menyamai Claude Opus 4.8 pada tugas sulit sambil mengenakan biaya yang jauh lebih rendah.
Mengapa ini penting: Situs yang merancang tolok ukur juga menilainya, lalu menerbitkan peringkat sebagai bukti independen.