Cách đội ngũ Deepseek cắt giảm chi phí chạy mô hình suy luận xuống mức khó tin

Mr. Darcy
Mr. Darcy✔
Phản hồi: 0

Mr. Darcy✔

Editor
Thành viên BQT
Một bài phân tích trên trang công nghệ IT Chi Gia của Trung Quốc vừa hé lộ cách đội ngũ DeepSeek (Thâm Cầu), do Lương Văn Phong sáng lập tại Hàng Châu, đưa ra mức giá token thấp hơn nhiều lần so với các mô hình phương Tây. Lương Văn Phong và các cộng sự trẻ của anh ấy thực sự có lối đi rất riêng: thay vì chạy đua gom thật nhiều phần cứng đắt đỏ, họ tập trung vắt kiệt hiệu suất bằng cách nén bộ nhớ đệm và chỉ đánh thức đúng những cụm tham số cần thiết cho từng câu lệnh.
1790413602742.png
Nói cách khác, thay vì mở rộng ồ ạt số lượng máy chủ, nhóm nghiên cứu tập trung vào hai giải pháp kỹ thuật. Thứ nhất là kiến trúc chuyên gia hỗn hợp (mixture of experts), cho phép hệ thống chỉ đánh thức một phần nhỏ tham số cần thiết cho từng câu lệnh, thay vì kích hoạt toàn bộ mô hình. Thứ hai là cơ chế nén bộ nhớ đệm, giúp tái sử dụng dữ liệu đã xử lý và giảm khối lượng tính toán lặp lại.

Chính nhờ cách giải quyết bài toán kỹ thuật từ gốc đó mà biểu phí họ đưa ra khiến cả thị trường phải nhìn lại. Cùng một bài toán suy luận phức tạp, trong khi các mô hình lớn ở phương Tây đang tính khoảng $15 cho một triệu token đầu vào (~381.750 VNĐ) và $60 cho một triệu token đầu ra (~1.527.000 VNĐ), thì bên Thâm Cầu chỉ thu 1 Nhân dân tệ (~3.560 VNĐ) đầu vào khi trúng bộ nhớ đệm và 16 Nhân dân tệ (~56.960 VNĐ) đầu ra. Thậm chí những hôm mình thức khuya chạy xử lý dữ liệu vào khung giờ đêm, họ còn giảm tiếp tới 75%, tính ra chỉ mất vài nghìn đồng tiền Việt.

Bài viết cho biết họ đã thử nghiệm đem một đoạn thuật toán tối ưu cơ sở dữ liệu khá hóc búa lên chạy thử trên cả bản web miễn phí của Thâm Cầu (DeepSeek R1) lẫn các gói thuê bao $20/tháng (~509.000 VNĐ). Cách nó tự lật đi lật lại vấn đề, tự phát hiện chỗ hổng logic rồi mới đưa ra lời giải thực sự rất đáng nể, nhất là khi người dùng phổ thông chẳng phải tốn một đồng nào.

Với chiến lược đó, DeepSeek đang định vị sản phẩm như một lựa chọn tiết kiệm chi phí cho các tác vụ suy luận, giải thuật và xử lý dữ liệu quy mô lớn, trong khi phiên bản web vẫn miễn phí cho người dùng phổ thông.
 
Back
Top