Strata 10,960★: chạy AI 125B trên PC gaming của bạn
Nhiều người vẫn nghĩ muốn chạy một mô hình AI 125 tỷ tham số thì phải thuê máy chủ đắt đỏ. Strata phá vỡ định kiến đó: chỉ cần card NVIDIA hoặc AMD từ 12 GB VRAM, model lớn ấy chạy ngay trên PC gaming của bạn. Bài viết này giải thích Strata là gì, tốc độ thực đo ra sao, chọn quantization nào cho vừa máy và cách bắt đầu trong vài phút.
Strata là gì
Strata là một inference engine viết bằng C++, mã nguồn mở theo giấy phép MIT, được tạo ngày 24/09/2026 và cập nhật gần nhất ngày 04/10/2026. Dự án đã thu hút 10,960 sao cùng 960 lượt fork chỉ sau hơn một tuần xuất hiện.
Điểm cốt lõi của Strata là đóng gói Qwen3.8-Flash-Next — model 125 tỷ tham số vốn cần tới server lớn — rồi nạp nó vào GPU máy của bạn. Theo README, engine này trò chuyện, viết code, đọc hình ảnh và làm việc trơn tru với các ứng dụng lẫn coding agent. Mọi dữ liệu đều ở lại PC của bạn: không có gì bị gửi ra ngoài, giúp kiểm soát cả quyền riêng tư lẫn chi phí vận hành so với API trả phí.
Tính năng nổi bật nhất
Điều đáng giá nhất của Strata là phục vụ API tương thích OpenAI và Anthropic ngay trên localhost. Điều này biến PC của bạn thành một endpoint AI tiêu chuẩn mà hầu hết ứng dụng, trợ lý chat hay coding agent đều kết nối được, không cần sửa lại kiến trúc. Ngoài ra, tùy chọn nhận đầu vào hình ảnh mở rộng phạm vi dùng sang tác vụ đa phương thức.
Chọn quantization nào cho vừa máy
Model 125B không vừa thẳng vào VRAM 12 GB, nên Strata cung cấp nhiều mức lượng tử hóa (quantization) để bạn chọn điểm cân bằng giữa tốc độ và độ nén:
- Q2_0 — siêu nhẹ, chạy nhanh nhất, chất lượng thấp nhất. Hợp để làm quen.
- IQ2_XS và IQ3_XXS — nén nhiều hơn, vẫn chạy mượt trên card 12 GB.
- IQ3_S — mức cân bằng, thường là lựa chọn mặc định hợp lý.
- Bản Coder — tinh chỉnh cho viết code, chậm hơn một chút nhưng kết quả code tốt hơn.
Nguyên tắc đơn giản: bắt đầu với Q2_0 để cảm nhận tốc độ, rồi nâng lên IQ3_S khi đã quen cách vận hành. Card càng nhiều VRAM thì càng thoải mái với mức nén cao hơn.
Vì sao Strata đột phá
Lý do Strata bùng nổ nằm ở việc hạ rào cản tiếp cận: model 125B tham số vốn gắn với data center nay chạy được trên máy cá nhân. Benchmarks công bố đo trên hai chiếc PC gaming cho thấy trải nghiệm thực tế khá tốt.
Trên RTX 5070 (12 GB, Ryzen 5 7600, 64 GB RAM), bản Q2_0 viết câu trả lời 94 token/giây và đọc prompt 32K token ở 2,650 token/giây; bản IQ3_S vẫn đạt 53 token/giây và 1,620 token/giây.
Trên RX 9070 XT (16 GB, Ryzen 9 3900X, 47 GB RAM), Strata ghi nhận 60 token/giây khi viết và 1,160 token/giây khi đọc prompt. Bản nén IQ3_XXS trên RTX 5070 vẫn giữ 62 token/giây — đủ nhanh cho hội thoại hằng ngày. Với card 24 GB như RTX 3090, README ước lượng khoảng 100–140 token/giây, cho thấy VRAM càng lớn thì Strata càng mượt.
So sánh với cách làm cũ
Cách làm cũ buộc bạn thuê GPU cloud, lo cước theo giờ và phụ thuộc chính sách API. Với Strata, chi phí nằm ở phần cứng bạn đã có, còn phần mềm miễn phí theo MIT. Bạn tự quyết định model, mức quantization và ngữ cảnh 128K, thay vì bị giới hạn bởi số token của nhà cung cấp.
So với việc tự dựng stack LLM truyền thống nhiều bước, cách tiếp cận của Strata rút gọn quy trình xuống còn một lần cài đặt trên Windows hoặc Linux. Nếu đang cân nhắc giữa tự host và trả phí, bài Ollama hay API trả phí: tiết kiệm bao nhiêu mỗi tháng là góc nhìn chi phí đáng tham khảo trước khi quyết định.
Bắt đầu nhanh với Strata
Con đường ngắn nhất tới Strata là tải bản cài đặt một cú nhấp cho Windows hoặc Linux từ trang Niko1221/Strata trên GitHub, rồi chạy trình cài. README không yêu cầu cấu hình thủ công phức tạp; điều kiện cơ bản là card đồ họa tương thích với ít nhất 12 GB VRAM.
Danh sách card được hỗ trợ khá rộng: NVIDIA GeForce RTX 20, 30, 40 hoặc 50 series, và AMD Radeon RX 7900 XT / XTX, RX 7800 XT, RX 7700 X — tất cả từ 12 GB VRAM trở lên.
Sau khi cài, khởi chạy Strata và gọi API ngay tại localhost theo định dạng OpenAI hoặc Anthropic. Các con số đo sẵn trên RTX 5070 và RX 9070 XT giúp bạn dự đoán trải nghiệm: khoảng 44–94 token/giây khi viết câu trả lời và 1,110–2,650 token/giây khi nạp prompt 32K token, tùy bản nén và phần cứng.
Calibrate sau khi cài
Mỗi PC cho tốc độ khác nhau, nên sau lần chạy đầu bạn nên chạy:
START-HERE.bat --calibrate
Lệnh này đo vài cấu hình trên máy của bạn và giữ lại thiết lập nhanh nhất. Trên máy tác giả, quá trình này giúp bản Coder nhanh hơn khoảng 7%. Đây là bước nên làm nếu bạn cần tốc độ ổn định, đặc biệt khi chạy workflow tự động theo lịch.
Nếu chưa có phần cứng phù hợp nhưng vẫn muốn làm quen quy trình chạy model local, bài Chuyển model LLM sang miễn phí: hướng dẫn thực tế là bước đệm hợp lý trước khi bạn nâng cấp card đồ họa để dùng Strata.
Strata trong ứng dụng thực tế
Với Strata, ứng dụng đầu tiên là trợ lý viết code chạy ngay trên máy. Thay vì đẩy toàn bộ lịch sử dự án lên API ngoài, bạn kết nối coding agent qua API tương thích Anthropic trên localhost; bản Coder vẫn cho 55 token/giây trên RTX 5070 và 44 token/giây trên RX 9070 XT, giữ code nhạy cảm ở chế độ riêng tư.
Ứng dụng thứ hai là xử lý tài liệu dài. Khả năng nạp prompt tới 2,650 token/giây trên RTX 5070 cho phép bạn đưa cả một tài liệu 32K token — mã nguồn, lịch sử chat hay báo cáo — để Strata tóm tắt hoặc phân tích mà không phải chờ đợi lâu.
Ứng dụng thứ ba là demo sáng tạo chạy offline. Trang dự án giới thiệu một khu vườn pagoda voxel sinh từ một prompt, chạy ngay trên RTX 5070 với IQ3_S và ngữ cảnh 128K. Điều này mở ra hướng dùng Strata như một engine tạo nội dung trong trình duyệt, hoàn toàn không phụ thuộc mạng.
Câu hỏi thường gặp về Strata
Strata cần phần cứng tối thiểu nào?
Strata cần card đồ họa NVIDIA hoặc AMD với ít nhất 12 GB VRAM, chạy Windows hoặc Linux. Các bài đo trong README dùng RTX 5070 12 GB và RX 9070 XT 16 GB, RAM hệ thống 47–64 GB.
Strata có lộ dữ liệu ra ngoài không?
Không, nếu bạn không tự cấu hình gửi đi. Strata chạy hoàn toàn trên máy của bạn và chỉ phục vụ API qua localhost, nên mọi cuộc hội thoại, tài liệu và hình ảnh đều không rời khỏi PC. Đây là điểm khác biệt lớn so với API đám mây, đặc biệt hữu ích khi làm việc với dữ liệu nhạy cảm.
Strata có miễn phí không?
Có. Strata phát hành theo giấy phép MIT, mã nguồn mở và miễn phí. Trang dự án chỉ có nút quyên góp cà phê tự nguyện, không giới hạn tính năng sau khi trả phí. Bạn không trả phí API hàng tháng và không bị giới hạn số request theo kiểu dịch vụ cloud.
API của Strata tương thích gì?
API chạy trên localhost và tương thích định dạng OpenAI lẫn Anthropic. Hầu hết ứng dụng chat, coding agent và công cụ automation hiện có có thể chuyển sang Strata local mà không phải viết lại tầng tích hợp.
Model của Strata có hỗ trợ hình ảnh không?
Có, nhưng là tùy chọn. Mặc định hội thoại và viết code là văn bản; khi bật đầu vào hình ảnh, bạn có thể đưa thêm ảnh vào prompt để hỏi đáp đa phương thức ngay trên PC cá nhân cùng Strata.
Kết luận
- Strata đã đạt 10,960★ và 960 forks chỉ sau hơn một tuần, cho thấy nhu cầu tự host model lớn trên phần cứng cá nhân đang bùng phát.
- Tốc độ 44–94 token/giây khi viết câu trả lời trên card 12–16 GB đủ cho chat và lập trình hằng ngày.
- API tương thích OpenAI/Anthropic trên localhost giúp tái dùng công cụ quen thuộc, dữ liệu không rời khỏi máy.
- Chọn quantization từ Q2_0 tới IQ3_S, chạy
--calibratemột lần để lấy tốc độ tối ưu. - Cài một chạm cho Windows/Linux, yêu cầu tối thiểu 12 GB VRAM, giấy phép MIT.
Nếu muốn đi sâu hơn về hạ tầng tự host, hãy đọc thêm sách AI Infra mã nguồn mở và tải thử bản cài đặt chính thức tại github.com/Niko1221/Strata. Hãy trải nghiệm Strata ngay trên chiếc PC gaming của bạn và cảm nhận sự khác biệt.