News, Fast

Atom Brief

10 Tem 2026 · Arşiv
Tech

Tek Bir Blog On İki Yapay Zeka Modelini Dört Uygulamada Puanladı

TryAI, on iki girişin tamamını kendisi oluşturdu ve yargıladı, dışarıdan hakem veya denetim olmadan görev başına beş deneme puanladı.

  • Claude Fable 5, Rubik küpünü beş denemede de temiz bir şekilde çözdü.
  • GPT-5.6 Luna en hızlı 1,0 saniyede ve en ucuz 0,001 dolar/çalıştırma ile yanıt verdi.
  • Grok 4.5, zor görevlerde Claude Opus 4.8 ile eşleşirken belirgin şekilde daha az ücret aldı.

Neden önemli: Kıyaslamayı tasarlayan site aynı zamanda onu yargıladı, ardından sıralamayı bağımsız kanıt olarak yayınladı.

TryAI blog (official benchmark post) ↗ · 10 Tem 202610.07.26