Strata 8,484★: AI 125B trên PC gaming
Bạn có muốn một mô hình AI 125 tỷ tham số chạy ngay trên PC gaming thay vì thuê server? Strata biến chiếc máy có card NVIDIA hoặc AMD của bạn thành một trạm AI riêng, với API tương thích OpenAI/Anthropic trên localhost. Bài này giúp bạn nắm rõ phần cứng cần có, tốc độ thực đo và cách bắt đầu nhanh.
Strata là gì
Strata là một inference engine viết bằng C++, được tạo ra để chạy Qwen3.8-Flash-Next trên phần cứng người dùng phổ thông. Dự án bắt đầu ngày 24/9/2026, cập nhật lần cuối 3/10/2026, giấy phép MIT, miễn phí và mã nguồn mở. Tóm tắt cho thấy repo đang có 8,484 sao cùng 750 fork trong thời gian ngắn.
Nó chat, viết code, đọc ảnh và làm việc với các ứng dụng cũng như coding agent của bạn. Quan trọng hơn, mọi thứ ở lại máy tính cá nhân, không gửi dữ liệu ra ngoài. Đây là điểm khác biệt lớn nếu bạn quan tâm quyền riêng tư hoặc muốn kiểm soát chi phí vận hành.
Tính năng nổi bật nhất
Điểm nổi bật của Strata nằm ở khả năng phục vụ API tương thích OpenAI và Anthropic ngay trên localhost. Nhờ đó, các công cụ sẵn có có thể kết nối tới engine này mà không cần đổi lớn ở phía ứng dụng. Tính năng nhập ảnh tùy chọn giúp mở rộng từ văn bản sang hình ảnh — phù hợp khi bạn muốn hỏi về ảnh chụp màn hình hay tài liệu có hình.
Các kích cỡ quantization trong README gồm Q2_0, IQ2_XS, IQ3_XXS, IQ3_S và bản Coder. Trên RTX 5070 12 GB, Q2_0 đạt 94 tokens/s khi viết trả lời và 2,650 tokens/s khi đọc prompt; IQ3_S vẫn giữ 53 tokens/s và 1,620 tokens/s. Trên RX 9070 XT 16 GB, Q2_0 đạt 60 tokens/s và 1,160 tokens/s, trong khi bản Coder đạt 44 tokens/s và 1,420 tokens/s. RTX 3090 24 GB được ước tính khoảng 100-140 tokens/s.
Vì sao Strata đột phá
Strata đột phá vì đưa một model vốn cần server về máy chơi game có 12 GB VRAM trở lên. Trước đây, muốn tự host Qwen3.8-Flash-Next bạn cần cụm GPU đắt đỏ hoặc tự ghép nhiều lớp phần mềm. Giờ chỉ với Windows hoặc Linux, NVIDIA GeForce RTX 20/30/40/50 hoặc AMD Radeon RX 7900 XT/XTX, RX 7800 XT/7700 XT, bạn đã có thể chạy trợ lý AI lớn ngay tại nhà.
Tốc độ cũng thay đổi cách dùng. Máy đo cho RTX 5070 (12 GB), Ryzen 5 7600, 64 GB RAM: Q2_0 viết 94 tokens/s, IQ2_XS 79, IQ3_XXS 62, IQ3_S 53, Coder 55. Máy đo AMD RX 9070 XT (16 GB), Ryzen 9 3900X, 47 GB RAM: Q2_0 60, IQ2_XS 52, Coder 44. RTX 3090 24 GB nên nhanh hơn nhờ nhiều phần model nằm trên GPU.
So sánh với cách làm cũ
Cách làm cũ buộc bạn thuê GPU cloud, lo cước theo giờ và phụ thuộc chính sách API. Với Strata, chi phí nằm ở phần cứng bạn đã có, còn phần mềm miễn phí theo MIT. Bạn vẫn tự quyết định model, kích cỡ quantization và ngữ cảnh 128K, thay vì bị giới hạn bởi số token của nhà cung cấp. Điều này đặc biệt hợp lý cho người dùng dài ngày, lập trình viên hoặc nhóm nội bộ muốn thử nghiệm nhiều lần.
Bắt đầu nhanh với Strata
Strata hỗ trợ cài đặt một chạm cho Windows và Linux. Yêu cầu tối thiểu là card NVIDIA có 12 GB VRAM hoặc card AMD tương đương như RX 7900 XT/XTX, RX 7800 XT/7700 XT, cùng RAM đủ cho máy. Bạn tải release từ repo, chạy tệp khởi động và engine sẽ nhận diện phần cứng để chọn thiết lập phù hợp.
Nếu muốn tối ưu, README cung cấp lệnh START-HERE.bat --calibrate. Lệnh này đo vài cấu hình trên máy của bạn và giữ lại thiết lập nhanh nhất; trên máy tác giả, quá trình giúp bản Coder nhanh hơn 7%. Đây là bước nên làm sau cài đặt nếu bạn cần tốc độ ổn định. Nếu bạn định chạy workflow tự động theo lịch, có thể tham khảo thêm bài Tự động hoá nội dung blog bằng Ollama và cron: dây chuyền viết bài mỗi sáng để gắn engine local vào chu trình làm việc.
Strata trong ứng dụng thực tế
Strata hợp với lập trình viên muốn trợ lý code chạy offline. Với ngữ cảnh 128K, bạn có thể đưa một module lớn, file cấu hình hoặc lịch sử hội thoại vào prompt để phân tích, viết test hay refactor. Bản Coder trên RTX 5070 đạt 55 tokens/s khi viết trả lời và 2,180 tokens/s khi đọc prompt — vẫn nhanh hơn tốc độ đọc thông thường.
Với người làm nội dung, engine này là cỗ máy viết nháp, tóm tắt hoặc biến ý tưởng thành cấu trúc bài mà không tốn API. Tác giả dùng một prompt để tạo voxel pagoda garden viết bằng code model, chạy trên trình duyệt, demo cho thấy năng lực sinh ứng dụng nhỏ thực tế. Với nhà nghiên cứu, tốc độ đọc prompt 2,650 tokens/s ở Q2_0 giúp xử lý tài liệu dài trong vài chục giây. Nếu quan tâm so sánh chi phí với API trả phí, bạn có thể xem Ollama hay API trả phí: tiết kiệm bao nhiêu mỗi tháng.
Câu hỏi thường gặp về Strata
Strata cần phần cứng nào?
Strata chạy trên Windows hoặc Linux với card NVIDIA GeForce RTX 20/30/40/50 hoặc AMD Radeon RX 7900 XT/XTX, RX 7800 XT/7700 XT. README nhấn mạnh cần card có 12 GB VRAM trở lên; máy đo dùng 64 GB RAM cho NVIDIA và 47 GB RAM cho AMD. Card VRAM lớn hơn giúp nhiều phần model nằm trên GPU nên nhanh hơn.
Strata có miễn phí không?
Có. Strata miễn phí, mã nguồn mở với giấy phép MIT. Bạn không trả phí API hàng tháng và không giới hạn số request theo kiểu dịch vụ cloud. Chi phí chính là điện năng, phần cứng và thời gian tối ưu bằng START-HERE.bat --calibrate. Đây là khác biệt lớn nếu bạn chạy nhiều tác vụ mỗi ngày.
Tốc độ đo thực tế ra sao?
Trên RTX 5070 12 GB, Strata với Q2_0 đạt 94 tokens/s viết trả lời và 2,650 tokens/s đọc prompt; IQ3_S đạt 53 và 1,620; bản Coder đạt 55 và 2,180. Trên RX 9070 XT 16 GB, Q2_0 đạt 60 và 1,160; IQ2_XS 52 và 1,110; Coder 44 và 1,420. RTX 3090 24 GB được ước tính khoảng 100-140 tokens/s.
Strata tích hợp app khác thế nào?
Strata phục vụ API tương thích OpenAI và Anthropic trên localhost, có hỗ trợ nhập ảnh tùy chọn. Điều này cho phép app sẵn có gọi engine như một máy chủ AI riêng mà không cần thay đổi lớn. Nếu bạn từng đọc các bản đánh giá liên tiếp về dự án, bài Strata 6,292★: AI 125B trên PC gaming là bản cập nhật gần nhất.
Kết luận
- Chạy AI lớn tại nhà: Strata biến PC gaming 12 GB VRAM+ thành server AI miễn phí.
- Tốc độ đủ dùng: bản nhanh đạt 94 tokens/s trên RTX 5070, đủ cho chat và code hỗ trợ.
- Tương thích API: OpenAI/Anthropic trên localhost giúp tích hợp app sẵn có.
- Tự tối ưu: dùng
START-HERE.bat --calibrateđể giữ cấu hình nhanh nhất trên máy.
Nếu cần lộ trình tiết kiệm hơn khi chuyển mô hình, hãy đọc Chuyển model LLM sang miễn phí: hướng dẫn thực tế. Truy cập github.com/Niko1221/Strata để tải release mới nhất và bắt đầu thử ngay hôm nay.