DuckDB, một dự án nghiên cứu tại Viện CWI Amsterdam từ năm 2019, đã trở thành một trong những cơ sở dữ liệu được áp dụng rộng rãi nhất thập kỷ này. Không chỉ chạy trên notebook, ETL pipeline hay dashboard, DuckDB còn xuất hiện trong các ứng dụng SaaS nhúng, CI test runner và thậm chí trên iPhone với khả năng xử lý TPC-H scale factor 100.

Tại sao DuckDB lại 'hot' đến vậy?

Đơn giản, DuckDB là một cơ sở dữ liệu SQL phân tích in-process, nghĩa là nó không cần server. Bạn tải nó như một thư viện (giống NumPy hay Polars) và bắt đầu truy vấn ngay trên các file Parquet, CSV hay JSON. Dung lượng chỉ dưới 20 MB, cài đặt bằng lệnh pip install duckdb hay brew install duckdb. Không cluster, không setup, không migration. Người dùng có thể trỏ DuckDB vào file 6 GB và nhận kết quả trong vòng một giây.

Ảnh hưởng đến hệ sinh thái công nghệ

Nhiều startup và công ty lớn đã xây dựng sản phẩm quanh DuckDB. MotherDuck biến nó thành cloud data warehouse. Các nền tảng BI như Hex, Omni, Evidence dùng làm engine thực thi trong ứng dụng. Fivetran tích hợp DuckDB vào Managed Data Lake Service để merge và compaction dữ liệu. Rill xây tool BI mã nguồn mở trên nó. Tại Greybeam, DuckDB xử lý hàng triệu truy vấn BI và phân tích dữ liệu.

Tốc độ đến từ thiết kế thông minh

DuckDB không chỉ dễ dùng mà còn cực nhanh. Loạt bài này (phần 1) giải thích cách DuckDB tối ưu từ khâu parse SQL tới lưu trữ. So với các đối thủ như Snowflake, BigQuery hay Postgres, DuckDB hoạt động in-process nên không mất thời gian serialize/deserialize dữ liệu qua mạng. Mỗi bản ghi chỉ đơn giản là giá trị ở một địa chỉ bộ nhớ cụ thể. Điều này đưa DuckDB lên ngang hàng với các hệ thống cluster đắt đỏ.

Bài tiếp theo sẽ đi sâu vào cách thực thi truy vấn. Hãy đón đọc để hiểu vì sao một DB dưới 20 MB có thể sánh ngang những 'ông lớn' cloud tốn hàng triệu USD mỗi năm. Đây là minh chứng cho xu hướng công nghệ nhúng.