Strata 6,292★: AI 125B trên PC gaming
Bạn đang tìm cách chạy Strata — một công cụ AI mã nguồn mở — mà không cần thuê server đắt tiền? Bài viết này hướng dẫn bạn đưa model 125 tỷ tham số về chính chiếc PC gaming của mình, kèm bảng tốc độ đo thực tế và các câu hỏi thường gặp.
Strata là gì
Strata là inference engine viết bằng C++, được xây dựng để chạy Qwen3.8-Flash-Next — một model AI 125 tỷ tham số vốn thường cần cả server — ngay trên máy tính cá nhân của bạn. Dự án Niko1221/Strata ra mắt ngày 24/9/2026, cập nhật lần cuối 2/10/2026, giấy phép MIT, miễn phí hoàn toàn. Tính đến 3/10/2026, repo đạt 6,292 sao và 563 fork.
Công cụ này chat, viết code, đọc ảnh và hoạt động tốt với các ứng dụng lẫn coding agent của bạn, trong khi mọi dữ liệu đều ở lại máy — không gửi lên đám mây. Đây chính là điểm khác biệt lớn so với việc phụ thuộc API bên ngoài về quyền riêng tư lẫn chi phí.
Tính năng nổi bật nhất
Điểm đáng chú ý nhất của Strata là hỗ trợ đầu vào hình ảnh tùy chọn ngay trên máy cá nhân, cộng với API tương thích OpenAI và Anthropic chạy trên localhost. Nghĩa là bạn gọi model như một server AI nội bộ, giữ toàn quyền kiểm soát dữ liệu, không cần khóa API trả phí hàng tháng.
Ngoài ra, engine cho phép chọn nhiều mức lượng tử hóa khác nhau — từ Q2_0 nhanh nhất đến IQ3_S tiết kiệm VRAM nhất. Bản Coder tối ưu riêng cho viết mã, và ngữ cảnh demo 128K token chứng minh khả năng đọc tài liệu dài ngay trên card RTX 5070.
Vì sao Strata đột phá
Strata đặt cược hoàn toàn vào phần cứng bạn đã có: card NVIDIA GeForce RTX 20, 30, 40 hoặc 50 series, hoặc AMD Radeon RX 7900 XT / XTX, RX 7800 XT và RX 7700 X, với từ 12 GB VRAM trở lên. Cách cài đặt một cú nhấp chuột cho cả Windows lẫn Linux khiến rào cản kỹ thuật gần như bằng không, so với việc dựng server GPU truyền thống.
Mọi thứ chạy cục bộ nên bạn chủ động về quyền riêng tư, độ trễ và chi phí vận hành. Với ai đang cân nhắc giữa tự host model và trả phí theo token, bài phân tích Ollama hay API trả phí: tiết kiệm bao nhiêu mỗi tháng sẽ cho bạn bức tranh chi phí thực tế.
So sánh với cách làm cũ
Strata giải quyết vấn đề cố hữu của model 125B tham số: trước đây, chạy được nó đồng nghĩa sở hữu server GPU lớn hoặc phụ thuộc API đắt đỏ. Cách cũ khó kiểm soát chi phí dài hạn và tiềm ẩn rủi ro dữ liệu bị gửi ra ngoài. Engine này gói model lại thành bản cài gọn, dùng GPU máy khách, trả lời ở mức 53-94 tokens/s — nhanh hơn tốc độ đọc của người — và hấp thụ prompt 32K token ở 1,620-2,650 tokens/s.
Bắt đầu nhanh với Strata
Strata yêu cầu tối thiểu card đồ họa 12 GB VRAM, Windows hoặc Linux, và bạn cài đặt một lần là dùng ngay. Tải bản phát hành từ trang release của repo, chạy trình cài đặt một chạm, rồi chọn mức quantization phù hợp với VRAM máy mình. Không cần cấu hình server phức tạp hay đăng ký tài khoản trên đám mây.
Tốc độ đo được trên hai cấu hình gaming phổ biến: với RTX 5070 12 GB (Ryzen 5 7600, 64 GB RAM), bản Q2_0 ghi 94 tokens/s khi trả lời và 2,650 tokens/s khi đọc prompt; IQ3_S đạt 53 tokens/s. Với RX 9070 XT 16 GB (Ryzen 9 3900X, 47 GB RAM), Q2_0 đạt 60 tokens/s, bản Coder đạt 44 tokens/s. Card 24 GB như RTX 3090 ước tính 100-140 tokens/s.
Bạn cũng có thể đối chiếu với bài giới thiệu Strata khi mới đạt 4,697★ để thấy dự án tiến hóa nhanh đến mức nào. Nếu muốn tự host hoàn toàn miễn phí, tham khảo thêm Chuyển model LLM sang miễn phí: hướng dẫn thực tế.
Strata trong ứng dụng thực tế
Strata phù hợp với nhiều tình huống dùng ngay trong công việc hằng ngày. Thứ nhất, lập trình viên dùng nó làm coding agent nội bộ qua API tương thích OpenAI/Anthropic trên localhost, mã nguồn không lộ ra ngoài. Thứ hai, nhóm nội dung dùng bản Coder để viết, chỉnh và review bài nhanh hơn. Thứ ba, người dùng cá nhân đọc tài liệu dài, tóm tắt và hỏi đáp nhờ ngữ cảnh lớn ngay trên máy nhà.
Điểm chung của các kịch bản này là bạn không phụ thuộc đường truyền mạng hay giới hạn token của dịch vụ bên thứ ba. Mọi cuộc hội thoại, tài liệu và hình ảnh đều nằm trọn trong PC của bạn, đặc biệt hữu ích khi làm việc với dữ liệu nhạy cảm.
Câu hỏi thường gặp về Strata
Strata là dự án rất trẻ, nên người dùng mới thường có những thắc mắc chung về cài đặt, tốc độ và quyền riêng tư. Dưới đây là các câu hỏi xuất hiện nhiều nhất, trả lời ngắn gọn dựa trên dữ liệu chính thức từ README và trang repo.
Strata cần phần cứng như thế nào?
Strata cần card NVIDIA GeForce RTX 20/30/40/50 series hoặc AMD Radeon RX 7900 XT / XTX, RX 7800 XT và RX 7700 X, dung lượng VRAM từ 12 GB trở lên, chạy trên Windows hoặc Linux. Cấu hình thử nghiệm chính trong README dùng 64 GB RAM với NVIDIA và 47 GB RAM với AMD.
Tốc độ của Strata là bao nhiêu?
Trên RTX 5070 12 GB, bản Q2_0 đạt 94 tokens/s khi trả lời và 2,650 tokens/s khi đọc prompt; bản IQ3_S đạt 53 tokens/s. Trên RX 9070 XT 16 GB, Q2_0 đạt 60 tokens/s. Một card 24 GB như RTX 3090 ước tính 100-140 tokens/s.
Strata có lộ dữ liệu ra ngoài không?
Không. Engine chạy hoàn toàn trên máy cá nhân của bạn, API phục vụ qua localhost, nên toàn bộ prompt, hình ảnh và phản hồi đều ở lại trên PC. Đây chính là lý do công cụ này thu hút người dùng chú trọng quyền riêng tư.
Strata có miễn phí không?
Có. Dự án phát hành dưới giấy phép MIT, mã nguồn mở và miễn phí. Tác giả chỉ đề xuất biếu “một ly cà phê” nếu nó chạy tốt trên máy của bạn, nhằm duy trì phát triển.
Kết luận
- Nếu bạn có GPU từ 12 GB VRAM trở lên, hãy thử Strata ngay: cài một chạm, chạy Qwen3.8-Flash-Next 125B và giữ toàn bộ dữ liệu trên máy.
- Bắt đầu với quantization nhẹ như Q2_0 để cảm nhận tốc độ 53-94 tokens/s, sau đó tăng lên IQ3_S khi đã quen cách vận hành.
- Kết nối app hoặc coding agent sẵn có qua API OpenAI/Anthropic trên localhost để tận dụng model mà không đổi workflow.
Đọc thêm cách tiết kiệm chi phí API nhờ chạy model tự host, hoặc xem mã nguồn tại repo Strata trên GitHub. Biết đâu chiếc PC gaming của bạn mạnh hơn bạn nghĩ — thử một lần tối nay nhé.