
AI
FrontierCode: Benchmark mới đo chất lượng code AI, Claude Opus 4.8 dẫn đầu
Cognition ra mắt FrontierCode, benchmark đo chất lượng code AI thay vì chỉ kiểm tra tính đúng đắn. Claude Opus 4.8 dẫn đầu với 13,4% trên tập khó nhất, cho thấy AI còn yếu khi viết code sản xuất.
12