블로그 하나가 AI 모델 12개 성능 평가
트라이AI(TryAI)는 외부 검증이나 감사 없이 자체적으로 12개 모델을 구축하고 평가했다.
- 클로드 페이블 5만이 5번의 시도 모두에서 루빅스 큐브를 완벽하게 해결했다.
- GPT-5.6 루나는 1.0초 만에 가장 빠르게 답변했고, 실행당 0.001달러로 가장 저렴했다.
- 그록 4.5는 어려운 작업에서 클로드 오퍼스 4.8과 대등한 성능을 보이면서도 비용은 훨씬 낮았다.
왜 중요한가: 벤치마크를 설계한 곳이 직접 평가까지 하고, 이를 독립적인 증거로 발표하고 있다.
TryAI blog (official benchmark post) ↗ · 2026년 7월 10일26. 7. 10.