Astra của OpenAI đạt điểm tuyệt đối ExploitBench, nhưng benchmark chấm năng lực hack của AI hoạt động ra sao?
Astra của OpenAI đạt điểm tuyệt đối trên ExploitBench và tự khai thác hai lỗ hổng zero-day, vậy các benchmark kiểu CTF này thực ra chấm điểm năng lực hack của AI như thế nào?