
DeepSeek V4 Pro 0813 vs Claude Fable 5 trên DeepSWE: Chi phí, Mã hóa và Định tuyến
Chúng tôi đã chạy 904 đợt triển khai DeepSWE trên DeepSeek V4 Pro 0813 và Claude Fable 5. Fable dẫn đầu pass@1 với chi phí gấp 90 lần; Pro giành được pass@4 và tầng dành cho Pro-first đạt 82,7%.
Bài học chính
Chạy DeepSeek V4 Pro 0813 trước, chỉ leo thang lên Claude Fable 5 khi thất bại. Tầng đó giải quyết được 82,7% nhiệm vụ DeepSWE với giá 8,28 \$ mỗi nhiệm vụ. Riêng truyện ngụ ngôn đã giải quyết được 69,7% ở mức 21,63 \$. Tốt hơn 13 điểm, rẻ hơn 62%.
Truyện ngụ ngôn thắng lần thử đầu tiên. 69,7% vượt qua @ 1 so với 62,8%, dẫn trước 7 điểm.
Pro thắng mọi lần thử sau đó. Cấp độ ở pass@2 (78,5% so với 77,1%), dẫn trước ở pass@4 (88,5% so với 84,1%).
Khoảng cách giá là 90 lần. \$0,24 mỗi lần triển khai so với \$21,63. Với mỗi $100 chi tiêu, Pro giải được 260 nhiệm vụ và Fable giải được 3.
Họ thất bại trong các nhiệm vụ khác nhau. Tương quan 0,39 trên mỗi nhiệm vụ, cặp khác nhau nhất mà chúng tôi đã đo được. Giữa chúng bao gồm 107 trong số 113 nhiệm vụ. Sự bất đồng đó là toàn bộ lý do khiến việc định tuyến hoạt động.
Hiện có sẵn · Được lưu trữ tại Hoa Kỳ
Chạy DeepSeek-V4 Pro 0813 trên Together AI
Ngữ cảnh 1,05M, gọi hàm và chế độ JSON, API tương thích với OpenAI, được cung cấp từ cơ sở hạ tầng của Hoa Kỳ.
Xem mô hình
Trong so sánh DeepSeek V4 Pro 0813 và Claude Fable 5 của chúng tôi trên DeepSWE, một điểm chuẩn kiểm tra khả năng kỹ thuật phần mềm của mô hình trên nhiều loại tác vụ và ngôn ngữ lập trình, hai mô hình nằm ở hai đầu đối diện của bảng giá. Claude Fable 5 là phiên bản đắt nhất trên bảng DeepSWE. DeepSeek V4 Pro 0813 là một trong những sản phẩm rẻ nhất. Fable chính xác hơn bảy điểm trong lần thử đầu tiên và có giá gấp chín mươi lần cho mỗi lần triển khai, vì vậy câu hỏi thực sự không phải là mô hình nào tốt hơn mà là mức phí bảo hiểm 90x đó thực sự mua được gì và khi nào nó đáng để trả.
DeepSWE · Đối đầu
Sơ lược về DeepSeek V4 Pro 0813 so với Claude Fable 5
người mẫu
Vượt qua@1
Chi phí trung bình
Giải quyết / $100
Ra ngoài đi
bước
Claude-truyện ngụ ngôn-5 [tối đa]
69,7% ± 2,3%
$21,63
3
115k
79
deepseek-v4-pro-0813 [tối đa]
62,8% ± 3,1%
0,24 USD
260
101k
146
Chúng tôi đã chạy DeepSeek V4 Pro 0813 (tối đa) với Claude Fable 5 (tối đa) trên tất cả 113 nhiệm vụ DeepSWE, mỗi nhiệm vụ bốn lần, từ các bản ghi mỗi lần dùng thử đã được công bố: tổng cộng 904 lần triển khai (mỗi lần 452). Truyện ngụ ngôn là người thợ thủ công đắt tiền; Pro là giá trị ngoại lệ. Cả hai cũng không đồng tình nhiều hơn bất kỳ cặp đôi nào khác trong bộ này, đây hóa ra lại là điều thú vị nhất ở họ. Mọi con số bên dưới đều đến từ lần chạy này, vì vậy nó có thể khác với các thẻ điểm DeepSeek V4 Pro 0813 và Claude Fable 5 công khai khác.
Bảng điểm DeepSWE: pass@1 và pass@k
Bắn một lần, dẫn đầu Truyện ngụ ngôn: 69,7% chuyền@1 đến 62,8% của Pro (điểm chính thức). Nhưng dây dẫn rất mong manh. Ở hai lần thử, Pro kéo được mức (78,5 so với 77,1) và ở bốn lần, 88,5% pass@4 của Pro sẽ vượt qua 84,1% của Fable hơn bốn điểm. Đối với một mô hình có giá cao gấp chín mươi lần, Fable không sở hữu mức trần cũng như không giữ được lợi thế trong lần thử lại. Mô hình chi phí thấp hơn có cả phạm vi tiếp cận rộng hơn và mức giá tốt nhất cao hơn.
So sánh chi phí: Giá DeepSeek V4 Pro 0813 và Claude Fable 5
Với mức giá \$0,24 một lần giới thiệu, DeepSeek V4 Pro 0813 rẻ hơn 90 lần so với Fable (\$21,63): 260 lần giải quyết trên mỗi \$100 so với Fable's 3. Đây là khoảng cách chi phí lớn nhất so với bất kỳ cặp đôi nào mà chúng tôi đã đo lường và Fable là cấu hình đắt nhất trên bảng. Và bất thường, mức giá thấp hơn không đi kèm với hình phạt về tốc độ mà bạn mong đợi: Thời gian triển khai trung bình của Fable là 31 phút so với 35 của Pro, gần như đồng đều, bởi vì Fable cho đến nay là mô hình dài dòng nhất trên bảng (mã thông báo đầu ra 115 nghìn) mặc dù nó thực hiện ít bước hơn (79 so với 146). Pro thực hiện nhiều bước hơn; Fable viết nhiều hơn mỗi bước. Không có mô hình nào nhanh hơn đáng kể.
Các chế độ lỗi: mỗi mô hình mắc lỗi như thế nào
Cả hai đều có kỷ luật về việc không vi phạm mọi thứ: DeepSeek V4 Pro 0813 và Fable đều xử lý bộ thử nghiệm hiện có với tỷ lệ lỗi chỉ 11%, thấp hơn nhiều so với 20% của dòng GPT. Sự khác biệt nằm ở hướng khác: Fable có tỷ lệ sai sót lớn nhất ở đây (18% so với 10% của Pro), nghĩa là khi Fable sai thì nó thường sai nặng hơn, một giải pháp khác xa so với một trường hợp ngắn gọn. Pro không sửa được thường xuyên hơn (66% suýt trượt so với 57% của Fable). Vì vậy, cả hai đều được chấp nhận một cách an toàn mà không cần kiểm tra hồi quy nặng nề, nhưng lỗi của Fable là loại gỡ lỗi tốn kém hơn.
Nơi mỗi người chiến thắng, theo loại nhiệm vụ
Sự khéo léo của Fable thể hiện trong các lĩnh vực hợp đồng chính xác, nặng về lý luận: nó thắng 6 trên 8, dẫn đầu là mô hình hóa dữ liệu và tuần tự hóa ở mức 88% (so với Pro 24 điểm) và nội bộ ngôn ngữ (78). Nhưng DeepSeek V4 Pro 0813 có hai yếu tố và cả hai đều quan trọng: khả năng phản ứng có trạng thái (66 so với 64) và đáng chú ý là tính đồng thời và độ bền (58 so với 45): lợi thế 13 điểm trong miền chính xác nhất của Fable. 45% đồng thời của Fable là phần yếu nhất của nó và là lĩnh vực mà mô hình chi phí thấp hơn chỉ đơn giản là kỹ sư giỏi hơn chứ không chỉ là mô hình rẻ hơn.
DeepSeek V4 Pro 0813 vs Claude Fable 5 theo ngôn ngữ lập trình
Fable thắng bốn trong năm ngôn ngữ, nhưng con số phù hợp với giá của nó là Rust: 85% so với 65 của Pro, chênh lệch 20 điểm và khoảng cách đơn rộng nhất trong trận đấu. Fable rõ ràng là chuyên gia về tuần tự hóa và Rust. Ở những nơi khác, nó gần hơn mức giá ngụ ý (Python 70 so với 60, Go 71 so với 67, JavaScript 75 so với 65) và DeepSeek V4 Pro 0813 thực sự sử dụng TypeScript (61 so với 57). Ngoài Rust và serialization, trường hợp trả 90x rất khó thực hiện.
DeepSeek V4 Pro 0813 và Claude Fable 5 khác nhau như thế nào?
Đây là tính năng đổi quà. Tương quan giữa mỗi nhiệm vụ chỉ là 0,39, mức thấp nhất trong bất kỳ cặp DeepSeek-Pro nào, vì vậy hai điều này thực sự không đồng ý. Cả hai đều giải quyết được 88 nhiệm vụ; Riêng Pro được 12, riêng Fable được 7 và chỉ có 6 đánh bại cả hai. Liên minh của họ bao gồm 107 trong số 113 (94,7%) và những bất đồng diễn ra theo cả hai hướng: DeepSeek V4 Pro 0813 quét awilix-async-container-khởi tạo bốn trong bốn trong khi Fable không bao giờ đạt được nó và Fable bốn bốn nhiệm vụ bốn nhiệm vụ Pro zeros (bao gồm các vị từ truy vấn koota và testem-bail-on-test-failure). Đây là sự bổ sung thực sự chứ không phải dư thừa.
Định tuyến giữa chúng: chơi danh mục đầu tư
Sự đa dạng đó cộng với giá cả làm cho dòng thác trở nên hấp dẫn. Trước tiên hãy chạy DeepSeek V4 Pro 0813 và chỉ chuyển lên Fable khi bộ kiểm tra của bạn từ chối câu trả lời: đã giải quyết được 82,7% tại \$




Nguồn tin: Together AI Blog. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.