Blog beoordeelt twaalf AI-modellen op vier apps
TryAI bouwde en beoordeelde alle twaalf inzendingen zelf, zonder externe scheidsrechter of audit.
- Claude Fable 5 loste als enige de Rubik's kubus op in alle vijf pogingen.
- GPT-5.6 Luna antwoordde het snelst (1,0 seconde) en het goedkoopst ($0,001 per run).
- Grok 4.5 evenaarde Claude Opus 4.8 op moeilijke taken tegen lagere kosten.
Waarom dit ertoe doet: De site die de benchmark ontwierp, beoordeelde deze ook en publiceerde de ranglijst als onafhankelijk bewijs.