AI Infra Book — Phân tích định lượng & thiết kế hệ thống
"Dữ liệu di chuyển đã định hình nên kiến trúc AI Infra." Cuốn sách của Bo Jie Li (tác giả DeepSeek, KV-Direct, AKG, UB) — bản dịch tiếng Việt đầy đủ, đăng tuần tự 1 chương mỗi ngày.
Cuốn sách lý giải hạ tầng chạy model AI theo phương pháp từ ràng buộc suy ra thiết kế: liệt kê tính toán, lưu trữ, truyền thông và phụ thuộc, đối chiếu với dung lượng, băng thông và sức mạnh của phần cứng, rồi ước lượng theo bậc độ lớn (order-of-magnitude). Xuyên suốt là 5 câu hỏi: chuyển gì, bao nhiêu, mấy lần, qua đâu, ai phải chờ nó.
Mở đầu
Phần I · Model & Khối lượng công việc
Chương 1 · Cái nhìn đầu tiên về AI Infra
Làm sao để ước lượng một lần thực thi model: cần bao nhiêu bộ nhớ, bao nhiêu phép tính, bao nhiêu dữ liệu đọc/ghi?
Chương 2 · Kiến trúc Model
Attention, trạng thái lịch sử và cấu trúc expert làm thay đổi yêu cầu hệ thống như thế nào?
Chương 3 · Khối lượng công việc Inference & Training
Pha chạy, mô hình đến và vòng đời trạng thái ảnh hưởng yêu cầu tài nguyên ra sao?
Phần II · Chip & Hệ thống
Chương 4 · Kiến trúc Accelerator
Đánh đổi giữa tính toán, lưu trữ, băng thông, điện năng và chi phí như thế nào?
Chương 5 · Operator & Runtime
Fusion, tái sử dụng, song song và lập lịch giúp giảm chi phí thực thi ra sao?
Chương 6 · Supernode
Nhiều thiết bị hợp tác cân bằng dung lượng, thông lượng và chi phí đồng bộ như thế nào?
Chương 7 · Mạng trung tâm dữ liệu
Băng thông mạng, cách truyền và tắc nghẽn ảnh hưởng hiệu quả tính toán ra sao?
Phần III · Hệ thống Inference & Training
Chương 8 · Tối ưu Inference
Batching, quản lý KV, offload và speculative decoding hiệu quả khi nào?
Chương 9 · Inference phân tán
Đặt phép tính và trạng thái ở đâu, và xử lý mở rộng/phục hồi như thế nào?
Chương 10 · Hệ thống Training
Sắp xếp bộ nhớ, truyền thông và recompute để training hiệu quả hơn ra sao?
Chương 11 · Lập lịch tài nguyên & môi trường thực thi
Model serving và tool environment chia sẻ tài nguyên, giảm chờ đợi như thế nào?
Chương 12 · Phối hợp End–Edge–Cloud
Đặt tác vụ ở local, edge hay cloud: cân bằng chất lượng, độ trễ và chi phí ra sao?