Grokking
AMD mua startup Taalas khắc mô hình AI vào silicon, nhưng cách này tăng tốc suy luận ra sao?
AMD thâu tóm startup Taalas, đơn vị khắc thẳng trọng số mô hình AI vào silicon để né bức tường bộ nhớ vốn làm chậm GPU. Vì sao cách này nhanh hơn hàng chục lần nhưng lại đánh đổi sự linh hoạt?