
Thử nghiệm Kimi K3 của Moonshot AI bên trong mã nguồn Claude
URL bài viết: https://philippdubach.com/posts/kimi-k3-inside-claude-code/ URL bình luận: https://news.ycombinator.com/item?id=49319610 Điểm: 2 Số bình luận: 0
Tôi đã thử Kimi K3 bên trong Claude Code
Ngày 19/7/2026 · AI
Bên trong Claude Code, Kimi K3 hoạt động đủ tốt đến mức tôi nhanh chóng không còn nghĩ về mô hình nào đang đứng sau giao diện nữa. Mô hình này có cảm giác chậm hơn so với tốc độ xuất ra được đo lường, nhưng nó đã tạo ra một bản tái tạo giao diện người dùng (frontend) gần như hoàn chỉnh từ một lời nhắc chi tiết và gói tài nguyên. Chi phí cho lần chạy đã xuất của tôi là 7,18 USD. Cùng một hỗn hợp token được ghi lại sẽ có giá khoảng 11,96 USD trên Claude Opus 4.8 và 23,92 USD trên Claude Fable 5 theo giá niêm yết công bố. Cơ hội lớn hơn có thể là AI chủ quyền: các trọng số mở được lưu trữ trên cơ sở hạ tầng cục bộ và được bán dựa trên khả năng lưu trú, kiểm soát và kiểm toán thay vì chỉ dựa trên token.
Kimi K3 là mô hình mới 2,8 nghìn tỷ tham số của Moonshot, với khả năng thị giác bản địa và cửa sổ ngữ cảnh một triệu token. Moonshot gọi đây là mô hình mở đầu tiên ở quy mô này và cho biết các trọng số sẽ được phát hành trước ngày 27/7. Bài đăng ra mắt của chính họ cũng thẳng thắn một cách bất thường: họ nói rằng K3 vẫn còn kém Fable 5 và GPT-5.6 Sol về tổng thể, và trải nghiệm người dùng của nó chưa đạt đến cùng cấp độ.
Trong khi tôi đang viết bài này, Alibaba đã công bố Qwen 3.8, một mô hình rất lớn khác sắp được phát hành trọng số mở. Điều này cũng diễn ra ngay sau khi Thinking Machines Lab phát hành Inkling, một mô hình 975 tỷ tham số của Mỹ với 41 tỷ tham số hoạt động và trọng số đầy đủ có sẵn. Kimi không còn là một trường hợp đơn lẻ nữa. Hiện đã có một hàng đợi.
Tôi đã đốt hàng triệu token thông qua Claude Code cho đến nay. Cấu hình của tôi hoạt động, các công cụ ở đúng vị trí tôi mong đợi và tôi đã quen với nhịp điệu của hệ thống.
Vì vậy, tôi vẫn giữ Claude Code và sử dụng OpenRouter, tôi đã định tuyến các yêu cầu đến Kimi K3.
Ấn tượng đầu tiên: chậm
Nó có cảm giác chậm. Rất chậm, lúc đầu. Điều này thật kỳ lạ, vì các con số đo lường lại cho thấy điều ngược lại. Artificial Analysis báo cáo khoảng 62 token đầu ra mỗi giây cho Kimi K3 và 57 token cho Claude Opus 4.8. Nó cũng đo lường thời gian đến token đầu tiên của K3 ngắn hơn nhiều.
Có lẽ sự khác biệt là thời gian dành cho việc suy luận trước khi văn bản hữu ích xuất hiện. Có lẽ đó là nhịp điệu của luồng dữ liệu. Có lẽ tôi chỉ đơn giản là đã sử dụng Claude Code đủ lâu để bất cứ thứ gì có nhịp điệu khác đều cảm thấy sai. (Hoặc có lẽ đó chỉ là vì tôi đang đi qua openrouter.)
Sau đó, trong khoảng một giờ đầu tiên, tôi đã ngừng để ý. Không phải vì K3 đột nhiên trở nên nhanh hơn. Nó xử lý các tệp, chỉnh sửa và các lệnh gọi công cụ đủ tốt đến mức tôi quên mất lưu lượng truy cập đang đi đâu.
Một thử nghiệm giao diện người dùng nhanh
K3 đã nhận được sự chú ý cho công việc giao diện người dùng (hiện đang xếp hạng số 1 trên Code Arena), vì vậy tôi muốn một cái gì đó trực quan hơn là một điểm chuẩn mã hóa khác. Tôi đã sử dụng lại lời nhắc và tài nguyên từ bản dựng Lafys này. Tôi cho rằng tài liệu tham khảo được tạo bằng Fable 5, mặc dù tôi không thể xác minh điều đó.
Tôi biết đây là một lần chạy duy nhất, với các hướng dẫn rất cụ thể và tài sản gốc. Nếu đưa ra một lời nhắc mơ hồ hơn, kết quả có thể sẽ không như mong đợi.
Chi phí
Bản xuất OpenRouter cho lần chạy này bao gồm 115 yêu cầu, 13,64 triệu token đầu vào và 82.307 token đầu ra. Trong số các token đầu vào, 12,95 triệu là các lượt truy cập bộ nhớ đệm. Tổng chi phí: 7,18 USD.
Áp dụng mức giá niêm yết của Anthropic cho hỗn hợp lưu lượng truy cập chính xác đó, chi phí cho Claude Opus 4.8 là khoảng 11,96 USD và cho Claude Fable 5 là 23,92 USD. Trong lần chạy này, Kimi có chi phí thấp hơn khoảng 40% so với Opus và 70% so với Fable.
Liệu đây có phải là một sự thay thế cho Opus?
Không. Đối với tôi thì không.
Opus vẫn mang lại cảm giác đáng tin cậy hơn khi công việc trở nên khó khăn. Nó tốt hơn trong việc biết khi nào nên dừng lại, tốt hơn trong việc xử lý sự mơ hồ và ít có khả năng đưa ra một quyết định mạnh mẽ mà tôi không yêu cầu. Bản thân Moonshot liệt kê tính chủ động quá mức và độ nhạy của bộ điều khiển là những hạn chế của K3, điều này phù hợp với một phần trải nghiệm của tôi.
Tôi cũng sẽ không gọi K3 là một mô hình thuộc phân khúc Fable 5.
Nhưng dưới Fable và Opus, không khí trở nên loãng rất nhanh. K3 đủ gần để nhiều người dùng sẽ không quan tâm đến sự khác biệt còn lại, hoặc sẽ ít quan tâm hơn so với việc quan tâm đến giá cả.
Vậy chúng ta sẽ đi đâu từ đây?
Các quan điểm trong vài ngày qua đã đi theo mọi hướng.
Kimi K3 là dấu chấm hết cho lợi thế mô hình của Mỹ. Kimi K3 là một màn trình diễn trên các điểm chuẩn. Trọng số mở làm cho các mô hình đóng trở nên lỗi thời. Trọng số mở không liên quan nếu việc chạy chúng tốn kém như một trung tâm dữ liệu nhỏ. Trung Quốc đang cố tình thương mại hóa lớp mà một phần lớn thị trường Mỹ hiện đang đặt cược. Hoặc không có kế hoạch tổng thể nào cả và các phòng thí nghiệm Trung Quốc đang phát hành các mô hình tốt vì các mô hình tốt mang lại nhà phát triển, mức độ sử dụng và uy tín.
Một danh sách ít kịch tính hơn (từ ghi chú của tôi) sẽ trông như thế này:
Đơn vị $/token là một thước đo tồi khi các mô hình sử dụng số lượng token rất khác nhau.
Các điểm chuẩn công khai dễ tối ưu hóa hơn và kém hiệu quả hơn trong việc phân loại các mô hình hàng đầu.
Trọng số mở đặt ra một giới hạn cho giá API ngay cả khi hầu hết người dùng không bao giờ tự lưu trữ.
Mô hình đang trở nên có thể thay thế; bộ điều khiển, dữ liệu và quy trình làm việc có thể không.
Giá trị chuyển lên các ứng dụng và chuyển xuống các chip, nguồn điện và cơ sở hạ tầng suy luận.
Trọng số mở giúp kiểm soát và quyền riêng tư, nhưng "mở" không có nghĩa là rẻ để chạy.
Kiểm soát xuất khẩu có thể làm chậm các phòng thí nghiệm Trung Quốc và đồng thời, tạo cho họ lý do để xây dựng xung quanh hệ sinh thái của Mỹ.
Mối đe dọa lớn nhất không nhất thiết là Kimi trở thành số một. Đó là không ai giữ vị trí số một được lâu.
Epoch AI ước tính rằng các mô hình trọng số mở tốt nhất chỉ kém biên giới đóng vài tháng. Khoảng cách chính xác thay đổi theo điểm chuẩn và các đánh giá công khai nên được đọc cẩn thận, nhưng xu hướng rất khó bỏ qua. Độ trễ đủ ngắn để người mua có thể chờ đợi, chuyển đổi hoặc chia nhỏ khối lượng công việc giữa các nhà cung cấp. Cá nhân tôi nghĩ rằng điều này có thể được chắt lọc, vâng, tôi biết, thành một mối đe dọa và một cơ hội.
Mối đe dọa
Mối đe dọa không phải là Kimi K3 tốt hơn mọi mô hình của Mỹ. Nó không phải vậy.
Mối đe dọa là nó có thể đủ tốt để khiến việc bảo vệ mức phí cao cấp trở nên khó khăn hơn.
Các phòng thí nghiệm lớn của Mỹ được định giá không chỉ dựa trên năng lực kỹ thuật. Trường hợp tài chính giả định rằng trí tuệ tiên tiến vẫn khan hiếm, rằng lợi thế dẫn đầu kéo dài và khách hàng tiếp tục trả lợi nhuận cao để truy cập. Một mô hình có thể làm tổn hại đến câu chuyện đó mà không cần giành vị trí đầu tiên. Nó chỉ cần nằm đủ gần.




Nguồn tin: Hacker News AI — Tác giả: 7777777phil. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.