News, Fast

Atom Brief

10 Jul 2026 · Arsip
Tech

Satu Blog Menilai Dua Belas Model AI pada Empat Aplikasi

TryAI membangun dan menilai sendiri kedua belas entri tersebut, mencetak lima upaya per tugas tanpa wasit atau audit luar.

  • Claude Fable 5 saja yang menyelesaikan kubus Rubik dengan bersih dalam kelima percobaan.
  • GPT-5.6 Luna menjawab tercepat, pada 1,0 detik, dan termurah, pada $0,001 per putaran.
  • Grok 4.5 menyamai Claude Opus 4.8 pada tugas sulit sambil mengenakan biaya yang jauh lebih rendah.

Mengapa ini penting: Situs yang merancang tolok ukur juga menilainya, lalu menerbitkan peringkat sebagai bukti independen.

TryAI blog (official benchmark post) ↗ · 10 Jul 202610/7/26