#Mô hình ngôn ngữ lớn

Grokking: Claude Fable 5.1 giảm 75% giá đọc cache, nhưng prompt caching hoạt động ra sao?
Grokking

Claude Fable 5.1 giảm 75% giá đọc cache, nhưng prompt caching hoạt động ra sao?

Claude Fable 5.1 vừa giảm 75% giá đọc cache, và đằng sau con số đó là cơ chế lưu lại các tensor key-value để tránh tính toán lặp lại, giúp các tác nhân AI chạy dài trở nên rẻ hơn đáng kể.

Grokking: Speculative decoding sinh văn bản nhanh hơn bằng model phụ nhỏ
Grokking

Speculative decoding sinh văn bản nhanh hơn bằng model phụ nhỏ

Speculative decoding dùng một model nhỏ phác thảo nhiều token cùng lúc để model lớn kiểm chứng song song, giúp AI sinh văn bản nhanh gấp hai đến ba lần mà đầu ra vẫn giống hệt về mặt xác suất.

Grokking: Chunking strategies chia tài liệu thành mảnh phù hợp cho RAG
Grokking

Chunking strategies chia tài liệu thành mảnh phù hợp cho RAG

So sánh bốn chiến lược chunking phổ biến nhất cho RAG: fixed-size, semantic, recursive character splitting và cách chọn overlap, kích thước chunk sao cho retrieval chính xác nhất.

Grokking

Masked self-attention ngăn model nhìn trước tương lai bằng cách nào?

Grokking

Self-attention tính toán mối quan hệ giữa các từ bằng cách nào?

Grokking

Sparse Attention: Cách Transformer Học Bỏ Bớt Phần Lớn Phép Tính Mà Vẫn Hiểu Được Văn Bản Dài

Cơ chế attention nguyên bản trong AI có một nhược điểm nổi tiếng: chi phí tính toán tăng theo bình phương độ dài chuỗi đầu vào. Văn bản dài gấp đôi th...