News, Fast

Atom Brief

10 thg 7, 2026 · Lưu trữ
Tech

Một blog duy nhất chấm điểm mười hai mô hình AI trên bốn ứng dụng

TryAI tự xây dựng và đánh giá tất cả mười hai mục, chấm điểm năm lần thử mỗi tác vụ mà không có trọng tài hay kiểm toán bên ngoài.

  • Claude Fable 5 là mô hình duy nhất giải khối Rubik sạch sẽ trong cả năm lần thử.
  • GPT-5.6 Luna trả lời nhanh nhất, ở mức 1,0 giây, và rẻ nhất, ở mức 0,001 USD mỗi lần chạy.
  • Grok 4.5 ngang bằng Claude Opus 4.8 trên các tác vụ khó trong khi tính phí thấp hơn đáng kể.

Vì sao quan trọng: Trang web thiết kế tiêu chuẩn đánh giá cũng là nơi chấm điểm, sau đó công bố bảng xếp hạng như bằng chứng độc lập.

TryAI blog (official benchmark post) ↗ · 10 thg 7, 202610/7/26