Tek Bir Blog On İki Yapay Zeka Modelini Dört Uygulamada Puanladı
TryAI, on iki girişin tamamını kendisi oluşturdu ve yargıladı, dışarıdan hakem veya denetim olmadan görev başına beş deneme puanladı.
- Claude Fable 5, Rubik küpünü beş denemede de temiz bir şekilde çözdü.
- GPT-5.6 Luna en hızlı 1,0 saniyede ve en ucuz 0,001 dolar/çalıştırma ile yanıt verdi.
- Grok 4.5, zor görevlerde Claude Opus 4.8 ile eşleşirken belirgin şekilde daha az ücret aldı.
Neden önemli: Kıyaslamayı tasarlayan site aynı zamanda onu yargıladı, ardından sıralamayı bağımsız kanıt olarak yayınladı.
TryAI blog (official benchmark post) ↗ · 10 Tem 202610.07.26