Un blog califica doce modelos de IA en cuatro aplicaciones
TryAI construyó y juzgó las doce entradas, puntuando cinco intentos por tarea sin árbitro externo ni auditoría.
- Claude Fable 5 fue el único que resolvió el cubo de Rubik limpiamente en los cinco intentos.
- GPT-5.6 Luna respondió más rápido, a 1.0 segundos, y más barato, a 0.001 dólares por ejecución.
- Grok 4.5 igualó a Claude Opus 4.8 en tareas difíciles mientras cobraba notablemente menos.
Por qué importa: El sitio que diseñó el benchmark también lo juzgó, luego publicó el ranking como prueba independiente.