Bỏ qua tới nội dung chính
Quay lại tin tức

DeepSeek-V4 Flash 0731 so sánh với GPT-5.6 Luna trên DeepSWE: Chi phí và Khả năng lập trình

Together AI Blog· 6/8/2026models

Chúng tôi đã thực hiện 900 lượt triển khai DeepSWE trên DeepSeek-V4 Flash và GPT-5.6 Luna. Luna dẫn trước 14 điểm về chỉ số pass@1; DeepSeek mang lại số lượt giải quyết trên mỗi đô la cao gấp 4,8 lần.

Những điểm chính Mặc dù GPT-5.6 Luna là một kỹ sư mạnh hơn về mọi tiêu chí chất lượng, DeepSeek-V4 Flash 0731 có giá thành đủ rẻ để một hệ thống phân tầng ưu tiên DeepSeek đánh bại Luna đơn lẻ về cả độ chính xác và chi phí. GPT-5.6 Luna dẫn trước DeepSWE pass@1 một cách dứt khoát với 67,2% so với 53,3%, chênh lệch 14 điểm, và duy trì vị trí dẫn đầu ở mọi số lần thử bằng nhau. DeepSeek-V4 Flash là mô hình rẻ nhất trên bảng xếp hạng DeepSWE: 0,10 USD cho mỗi lần triển khai so với 0,61 USD, đạt 532 lượt giải quyết trên mỗi 100 USD so với 110 lượt của Luna. DeepSeek-V4 Flash thất bại một cách "sạch sẽ" hơn, làm hỏng bộ kiểm thử hiện có của kho lưu trữ trong 9% số lần thất bại so với 15% của Luna. Chạy DeepSeek-V4 Flash trước và chỉ chuyển sang Luna khi thất bại sẽ giải quyết 78,9% nhiệm vụ với chi phí 0,385 USD mỗi nhiệm vụ: chính xác hơn Luna đơn lẻ và rẻ hơn 37%. Hiện đã có · Mã nguồn mở Chạy DeepSeek-V4 Flash trên Together AI Mô hình rẻ nhất trên bảng xếp hạng DeepSWE, khoảng mười xu cho mỗi nhiệm vụ. Phục vụ giai đoạn đầu giá rẻ ở quy mô sản xuất mà không phải trả giá token cao. Mở sân chơi DeepSeek-V4 Flash 0731 là mô hình rẻ nhất trên toàn bộ bảng xếp hạng DeepSWE: khoảng mười xu cho mỗi nhiệm vụ! GPT-5.6 Luna, một mô hình hàng đầu vững chắc, có giá 0,61 USD cho mỗi nhiệm vụ, đắt gấp khoảng sáu lần so với DeepSeek. Vì vậy, câu hỏi không phải là mô hình nào chiến thắng bảng xếp hạng (Luna, một cách thoải mái) mà là sáu lần rẻ hơn mang lại điều gì, chi phí là bao nhiêu, và liệu hai mô hình kết hợp có tốt hơn một mô hình đơn lẻ hay không. Chúng tôi đã chạy DeepSeek-V4 Flash 0731 (tối đa) so với GPT-5.6 Luna (tối đa) trên tất cả 113 nhiệm vụ DeepSWE: các yêu cầu tính năng thực tế, dài hạn từ các kho lưu trữ mã nguồn mở đang hoạt động, bốn lần thử mỗi nhiệm vụ, được chấm điểm đạt/không đạt bởi một bộ kiểm thử ẩn. Tổng cộng có 900 lượt triển khai từ các bản ghi mỗi lần thử đã công bố (452 lượt của DeepSeek, 448 lượt của Luna). Mọi số liệu dưới đây đều đến từ lần chạy này, vì vậy có thể khác với các bảng điểm công khai khác. Tổng quan DeepSWE · Đối đầu trực tiếp DeepSeek-V4 Flash so với GPT-5.6 Luna trong nháy mắt | Mô hình | Pass@1 | Chi phí trung bình | Out tok | Bước | |---|---|---|---|---| | gpt-5.6-luna [tối đa] | 67% ± 4% | 0,61 USD | 73k | 102 | | deepseek-v4-flash [tối đa] | 53% ± 4% | 0,10 USD | 108k | 153 | Luna có chi phí gấp ~6 lần để đạt độ chính xác cao hơn ~14 điểm; DeepSeek sử dụng nhiều token đầu ra và bước hơn để đạt được ít hơn, nhưng với 0,10 USD, đây là lần chạy rẻ nhất trong bộ dữ liệu với biên độ lớn. Bảng điểm DeepSWE: pass@1 và pass@k Luna chiến thắng rõ ràng trong một lần thử: 67,2% pass@1 so với 53,3% của DeepSeek theo cách tính điểm chính thức của DeepSWE, dẫn trước 14 điểm, hay chính xác hơn khoảng 26% về mặt tương đối. Ở số lần thử bằng nhau, Luna vẫn dẫn trước ở mọi k (81,6 so với 70,1 ở hai lần thử, 90,3 so với 80,5 ở bốn lần thử). Về khả năng giải quyết thô, đây không phải là một cuộc cạnh tranh sát sao. Nhưng DeepSWE chính xác là loại khối lượng công việc mà bạn có thể phân tán nhiều lần thử song song, và ở đó, yếu tố kinh tế đã thay đổi bức tranh. Pass@2 của DeepSeek (70,1%) đã vượt qua lượt thử đầu tiên của Luna (67,2%), và hai lần thử của DeepSeek có giá khoảng 0,20 USD so với 0,61 USD của Luna. Nếu một trình xác minh có thể chọn lần chạy thành công, mô hình giá rẻ sẽ đạt chất lượng thử đầu tiên của mô hình hàng đầu với một phần ba giá, trước khi bất kỳ thủ thuật định tuyến nào dưới đây được áp dụng. So sánh chi phí: Giá của DeepSeek-V4 Flash và GPT-5.6 Luna Với mức giá 0,61 USD cho một tác vụ, Luna đạt 110 lượt giải trên 100 USD, trong khi DeepSeek đạt 532 lượt giải. Điều này cho thấy DeepSeek có lợi thế về giá trị gấp 4,8 lần so với mô hình rẻ hơn. Khoảng cách chi phí trên mỗi lần triển khai là khoảng 6 lần. Điểm mà mô hình giá rẻ không mang lại là tốc độ, và đây là điểm khác biệt so với câu chuyện thông thường về mô hình "flash": DeepSeek chậm hơn trong hai mô hình này, mất trung bình 23 phút và 148 bước so với 16 phút và 92 bước của Luna. DeepSeek hoạt động chậm hơn (và tạo ra nhiều đầu ra hơn, trung bình 104 nghìn token so với 70 nghìn của Luna). Lợi thế của DeepSeek là về tiền bạc, không phải thời gian. Khoảng cách về thời gian thực này một phần là do mô hình còn mới; dự kiến khoảng cách này sẽ giảm khi các công cụ suy luận được điều chỉnh cho phù hợp. Các chế độ lỗi: DeepSeek xử lý lỗi tốt hơn so với mô hình hàng đầu Một điểm khác mà mô hình giá rẻ âm thầm vượt trội là tính kỷ luật. Khi DeepSeek gặp lỗi, nó chỉ phá vỡ bộ kiểm thử hiện có của kho lưu trữ trong 9% trường hợp lỗi. Luna làm như vậy trong 15% trường hợp: đây là đặc điểm hồi quy của dòng GPT, cùng mức 15 đến 20% mà chúng ta thấy ở Sol và các mô hình khác thuộc dòng OpenAI. Cả hai đều chủ yếu thất bại do lỗi nhỏ (DeepSeek 69%, Luna 66%), nhưng mô hình đắt tiền hơn có nhiều khả năng làm xáo trộn mã đã hoạt động. Nếu triển khai Luna, hãy đặt nó sau một lần chạy hồi quy đầy đủ; DeepSeek ít cần hàng rào bảo vệ đó hơn. DeepSeek-V4 Flash so với GPT-5.6 Luna theo lĩnh vực tác vụ Phân loại 113 tác vụ theo bản chất của mã, Luna thắng 7 trong số 8 lĩnh vực. Lợi thế lớn nhất của nó nằm chính xác ở các công việc đòi hỏi nhiều lý luận: phân tích chương trình (69 so với 33), đồng thời và độ bền (70 so với 38), nội bộ ngôn ngữ và thời gian chạy (86 so với 59), khoảng cách khoảng 30 điểm trong mỗi lĩnh vực. Đây là nơi khả năng của mô hình thực sự thể hiện, và DeepSeek tụt lại đáng kể. DeepSeek chỉ giữ được một lĩnh vực, và đó là một lĩnh vực đáng chú ý: ngôn ngữ truy vấn và cấu hình, 78 so với 70. Các trình tạo SQL, hàm cửa sổ, phân trang tập hợp khóa, trình phân tích cú pháp cấu hình. Các công việc có cấu trúc, hình dạng lược đồ, tuân thủ quy ước là nơi mô hình giá rẻ thực sự cạnh tranh, thậm chí dẫn trước. Ở mọi nơi tác vụ đòi hỏi duy trì một bất biến cứng trên toàn bộ hệ thống, khả năng của Luna vượt trội. DeepSeek-V4 Flash so với GPT-5.6 Luna theo ngôn ngữ lập trình Luna thắng cả năm ngôn ngữ, nhưng biên độ cho thấy bạn cần cẩn thận với DeepSeek ở đâu. Nó hoạt động khá tốt trên Rust (55 so với 60) và Go (62 so với 79), nhưng JavaScript của nó lại sụp đổ: 35 so với 60 của Luna, ô yếu nhất trong toàn bộ cuộc đối đầu, và một lỗ hổng 25 điểm. Python của DeepSeek cũng yếu (49 so với 65). Nếu ngăn xếp của bạn nặng về JS, mô hình giá rẻ là một sự tiết kiệm sai lầm; nếu đó là cấu hình, truy vấn hoặc Rust, DeepSeek thu hẹp hầu hết khoảng cách. DeepSeek-V4 Flash và GPT-5.6 Luna giống nhau đến mức nào? Ít hơn so với các cặp cấp thấp. Tương quan trên mỗi tác vụ là 0,50, và sự đa dạng không cân xứng: cả hai đều giải quyết 87 tác vụ, Luna một mình giải quyết 15, và DeepSeek một mình chỉ giải quyết 4. Quan trọng là, không có tác vụ nào DeepSeek giải quyết hoàn toàn mà Luna bỏ lỡ (không có góc bốn-cho-không nào trong DeepSeek).

Nguồn tin: Together AI Blog. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.