Bỏ qua điều hướng
chuanweb.com
Sách · AI Infra Book

AI Infra Book — Phân tích định lượng & thiết kế hệ thống

"Dữ liệu di chuyển đã định hình nên kiến trúc AI Infra." Cuốn sách của Bo Jie Li (tác giả DeepSeek, KV-Direct, AKG, UB) — bản dịch tiếng Việt đầy đủ, đăng tuần tự 1 chương mỗi ngày.

13 chương · 2/13 đã đăng Repo gốc (Apache 2.0)

Cuốn sách lý giải hạ tầng chạy model AI theo phương pháp từ ràng buộc suy ra thiết kế: liệt kê tính toán, lưu trữ, truyền thông và phụ thuộc, đối chiếu với dung lượng, băng thông và sức mạnh của phần cứng, rồi ước lượng theo bậc độ lớn (order-of-magnitude). Xuyên suốt là 5 câu hỏi: chuyển gì, bao nhiêu, mấy lần, qua đâu, ai phải chờ nó.

Mở đầu

Lời nói đầu Đã đăng

Lời nói đầu

Vì sao lại viết cuốn sách này, và nên đọc nó như thế nào?

Phần I · Model & Khối lượng công việc

Chương 1 Đã đăng

Chương 1 · Cái nhìn đầu tiên về AI Infra

Làm sao để ước lượng một lần thực thi model: cần bao nhiêu bộ nhớ, bao nhiêu phép tính, bao nhiêu dữ liệu đọc/ghi?

Chương 2 Sắp ra

Chương 2 · Kiến trúc Model

Attention, trạng thái lịch sử và cấu trúc expert làm thay đổi yêu cầu hệ thống như thế nào?

Chương 3 Sắp ra

Chương 3 · Khối lượng công việc Inference & Training

Pha chạy, mô hình đến và vòng đời trạng thái ảnh hưởng yêu cầu tài nguyên ra sao?

Phần II · Chip & Hệ thống

Chương 4 Sắp ra

Chương 4 · Kiến trúc Accelerator

Đánh đổi giữa tính toán, lưu trữ, băng thông, điện năng và chi phí như thế nào?

Chương 5 Sắp ra

Chương 5 · Operator & Runtime

Fusion, tái sử dụng, song song và lập lịch giúp giảm chi phí thực thi ra sao?

Chương 6 Sắp ra

Chương 6 · Supernode

Nhiều thiết bị hợp tác cân bằng dung lượng, thông lượng và chi phí đồng bộ như thế nào?

Chương 7 Sắp ra

Chương 7 · Mạng trung tâm dữ liệu

Băng thông mạng, cách truyền và tắc nghẽn ảnh hưởng hiệu quả tính toán ra sao?

Phần III · Hệ thống Inference & Training

Chương 8 Sắp ra

Chương 8 · Tối ưu Inference

Batching, quản lý KV, offload và speculative decoding hiệu quả khi nào?

Chương 9 Sắp ra

Chương 9 · Inference phân tán

Đặt phép tính và trạng thái ở đâu, và xử lý mở rộng/phục hồi như thế nào?

Chương 10 Sắp ra

Chương 10 · Hệ thống Training

Sắp xếp bộ nhớ, truyền thông và recompute để training hiệu quả hơn ra sao?

Chương 11 Sắp ra

Chương 11 · Lập lịch tài nguyên & môi trường thực thi

Model serving và tool environment chia sẻ tài nguyên, giảm chờ đợi như thế nào?

Chương 12 Sắp ra

Chương 12 · Phối hợp End–Edge–Cloud

Đặt tác vụ ở local, edge hay cloud: cân bằng chất lượng, độ trễ và chi phí ra sao?