Bỏ qua tới nội dung chính
Quay lại tin tức

DeepSeek V4 Pro 0813 so với GPT-5.6 Sol trên DeepSWE: Chi phí, Mã hóa và Định tuyến

Together AI Blog· 18/8/2026models

Chúng tôi đã chạy 904 đợt triển khai DeepSWE trên DeepSeek V4 Pro 0813 và GPT-5.6 Sol. Sol dẫn trước pass@1 10 điểm với chi phí gấp 35 lần; Pro giành được pass@4 và tầng dành cho Pro-first đạt 83,0%.

Bài học chính Đừng chọn một. Chạy DeepSeek V4 Pro 0813 trước, nâng cấp lên GPT-5.6 Sol khi kiểm tra thất bại. Tầng đó giải quyết được 83,0% nhiệm vụ DeepSWE với giá \$3,35 mỗi nhiệm vụ. Chỉ riêng Sol đã giải quyết được 72,7% ở mức \$8,37. Tốt hơn 10 điểm, rẻ hơn 60%. Sol giành chiến thắng trong những lần thử đầu tiên. 72,7% pass@1 so với 62,8% và nó giữ vị trí dẫn đầu ở pass@2 (81,0% so với 78,5%). Pro thắng trận cuối cùng. 88,5% vượt qua @ 4 so với 85,8%. Sau bốn lần thử, mô hình giá rẻ sẽ tìm thấy nhiều bảng hơn. Khoảng cách giá là 35 lần. \$0,24 mỗi lần giới thiệu so với \$8,37. Mỗi \$100 chi tiêu, Pro giải quyết được 261 nhiệm vụ và Sol giải quyết được 9 nhiệm vụ. Sol nhanh hơn và ổn định hơn. 17 phút và 53 bước mỗi lần triển khai so với 35 và 146 của Pro, đồng thời 61 nhiệm vụ giải quyết bốn ăn bốn so với 35. Những thất bại của Sol còn rắc rối hơn. 20% trong số họ phá vỡ các bài kiểm tra đã vượt qua, so với 11% của Pro. Kết quả hồi quy của Gate Sol. Hiện có sẵn · Được lưu trữ tại Hoa Kỳ Chạy DeepSeek-V4 Pro 0813 trên Together AI Ngữ cảnh 1,05M, gọi hàm và chế độ JSON, API tương thích với OpenAI, được cung cấp từ cơ sở hạ tầng của Hoa Kỳ. Xem mô hình ‍ Trong so sánh DeepSeek V4 Pro 0813 với GPT-5.6 Sol của chúng tôi trên DeepSWE, một điểm chuẩn kiểm tra khả năng kỹ thuật phần mềm của mô hình trên nhiều loại tác vụ và ngôn ngữ lập trình, GPT-5.6 Sol là kỹ sư thực hiện một lần tốt nhất trên bảng và DeepSeek V4 Pro 0813 có giá bằng 1/35. Câu hỏi thú vị không phải là cái nào chính xác hơn trong lần thử đầu tiên (rõ ràng là Sol) mà là khoảng cách giá 35x đó thực sự mua được gì và liệu mức trần của mô hình chi phí thấp hơn có đóng lại được hay không. DeepSWE · Đối đầu Sơ lược về DeepSeek-V4 Pro 0813 so với GPT-5.6 Sol người mẫu Vượt qua@1 Chi phí trung bình Giải quyết / $100 Ra ngoài đi bước gpt-5.6-sol [tối đa] 72,7% ± 2,2% 8,37 USD 9 59k 53 deepseek-v4-pro-0813 [tối đa] 62,8% ± 3,1% 0,24 USD 260 101k 146 Chúng tôi đã chạy DeepSeek V4 Pro 0813 (tối đa) với GPT-5.6 Sol (tối đa) trên tất cả 113 nhiệm vụ DeepSWE, mỗi nhiệm vụ bốn lần, từ các bản ghi mỗi lần dùng thử đã xuất bản: tổng cộng 904 lần triển khai (mỗi lần 452). Sol là sản phẩm dẫn đầu về độ chính xác; Pro là giá trị ngoại lệ. Mọi con số bên dưới đều đến từ lần chạy này, vì vậy, nó có thể khác với các thẻ điểm DeepSeek V4 Pro 0813 so với GPT-5.6 Sol công khai khác. Bảng điểm DeepSWE: pass@1 và pass@k Một cú đánh duy nhất, Sol dẫn đầu rõ ràng: 72,7% pass@1 so với 62,8% của Pro (ghi điểm chính thức). Nhưng khoảng cách thu hẹp lại sau mỗi lần thử lại và sau đó đảo ngược: ở hai lần thử, Pro đã gần bằng (78,5 so với 81,0) và ở bốn lần thử, 88,5% của Pro @ 4 đã vượt qua 85,8% của Sol. Mô hình chi phí thấp hơn có phạm vi tiếp cận rộng hơn; nó cần nhiều hơn một lần thử và những lần thử của nó gần như miễn phí. Nếu khối lượng công việc của bạn cho phép bạn chạy best-of-k thì đối số về độ chính xác cho Sol phần lớn sẽ biến mất. So sánh chi phí: Giá DeepSeek V4 Pro 0813 so với GPT-5.6 Sol Với mức giá \$0,24 một lần giới thiệu, DeepSeek V4 Pro 0813 rẻ hơn 35 lần so với Sol (\$8,37), về mặt giá trị là 260 lần giải quyết trên mỗi \$100 so với Sol's 9. Cái giá thấp hơn không mua được là tốc độ hoặc sự ngắn gọn: Pro thực hiện trung bình 146 bước và 35 phút và phát ra 101 nghìn mã thông báo đầu ra, so với 53 bước chặt chẽ của Sol, 17 phút, và 59k token. Sol là chuyên gia nhanh nhẹn, súc tích; Pro đạt được phạm vi phủ sóng tương tự trong suốt chặng đường dài. Nếu một người đang chờ đợi, Sol sẽ kiếm được lợi nhuận cao hơn chỉ nhờ độ trễ; nếu ngân sách hoặc hàng đợi đang chờ thì không có gì ở đây gần bằng Pro. Phạm vi phủ sóng và độ tin cậy: độ chính xác và phạm vi tiếp cận Phân tách pass@1 thành phạm vi bao phủ và độ tin cậy và quá trình phân chia sẽ rõ ràng. Sol là góc chính xác: độ tin cậy 84,5% và 61 nhiệm vụ được giải quyết theo tỷ lệ 4 ăn 4, dấu hiệu của một mô hình có thể xử lý được những gì nó chạm vào. DeepSeek V4 Pro 0813 chuyển sang trục khác: phạm vi phủ sóng rộng hơn (88,5% so với 85,8%) nhưng độ tin cậy thấp hơn nhiều (71,0%) và ít nhiệm vụ vững chắc hơn (35 so với 61). Đó là sự giao nhau của pass@4 nhìn từ bên cạnh: Pro chạm vào điểm chuẩn nhiều hơn Sol nhưng chuyển đổi mỗi lần chạm ít thường xuyên hơn trong mỗi lần chụp. Các chế độ lỗi: mỗi mô hình mắc lỗi như thế nào Cấu hình lỗi khác nhau rõ rệt. Sol phá vỡ bộ thử nghiệm hiện có của kho lưu trữ trong 20% ​​số lỗi của nó, chữ ký hồi quy dòng GPT. DeepSeek V4 Pro 0813 thận trọng hơn nhiều ở mức 11%; khi thất bại, nó thường thất bại với tỷ lệ suýt trượt và đường cơ sở vẫn còn nguyên. Vì vậy, mô hình rẻ hơn cũng là mô hình an toàn hơn để chấp nhận chưa được xem xét: đặt một cổng hồi quy đầy đủ xung quanh Sol trước khi bạn lấy điểm khác biệt của nó và Pro cần ít lan can đó hơn. Nơi mỗi người chiến thắng, theo loại nhiệm vụ Lợi thế về chất lượng của Sol rất rộng: nó giành được 6 trong 8 miền, dẫn đầu nhờ mô hình hóa và tuần tự hóa dữ liệu ở mức 92% (so với Pro 28 điểm), cộng với truy vấn/cấu hình (80), đồng thời (72), xây dựng/hoạt động (73), phân tích chương trình (64) và tuân thủ giao thức (59). Cả hai điều mà nó không yêu cầu đều rất hẹp: ngôn ngữ và nội bộ thời gian chạy là tỷ số hòa 75-75 và DeepSeek V4 Pro 0813 có khả năng phản ứng trạng thái cao (66 so với 64), một miền của nó giành chiến thắng. Ở bất cứ nơi nào nhiệm vụ đòi hỏi phải có một hợp đồng xuất bản chính xác, Sol lại rút lui. DeepSeek V4 Pro 0813 vs GPT-5.6 Sol theo ngôn ngữ lập trình Sol quét bốn trong số năm (Python 74, Go 79, TypeScript 66, JavaScript 75) và lề rộng trên Python và Go. Ngoại lệ là Rust, trong đó DeepSeek V4 Pro 0813 dẫn trước 65 đến 60: một ngôn ngữ Sol hoạt động kém hơn lớp của nó và ngôn ngữ Pro giành chiến thắng hoàn toàn. Nếu ngăn xếp của bạn là Python hoặc Go, thì đây là bảng của Sol với mức chênh lệch vừa phải; nếu là Rust, Pro sẽ tốt hơn một chút và rẻ hơn rất nhiều. DeepSeek V4 Pro 0813 và GPT-5.6 Sol khác nhau như thế nào? Vừa phải. Tương quan giữa mỗi tác vụ là 0,54, mức gần nhất trong các cặp DeepSeek-Pro. Cả hai đều giải được 90 nhiệm vụ; Riêng Pro được 10, riêng Sol được 7, và 6 hạ gục cả hai. Công đoàn của họ bao gồm 107 trên 113 (94,7%). Một vấn đề bất đối xứng quan trọng đối với danh mục đầu tư: DeepSeek V4 Pro 0813 không thực hiện nhiệm vụ nào mà Sol bỏ sót hoàn toàn, trong khi Sol thực hiện bốn bốn nhiệm vụ mà Pro không bao giờ giải quyết được (pebble-độ bền-chờ-apis, văn bản-mèo-phím-giai đoạn). Vì vậy, Pro không bổ sung thêm nhiều phạm vi tiếp cận mới so với Sol; những gì nó bổ sung là khả năng xóa các nhiệm vụ được chia sẻ với chi phí tối thiểu. Định tuyến giữa chúng: chơi danh mục đầu tư Đó chính xác là lý do tại sao tầng chiến thắng. Trước tiên hãy chạy DeepSeek V4 Pro 0813 và chỉ chuyển lên Sol khi

Nguồn tin: Together AI Blog. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.