Bỏ qua tới nội dung chính
Quay lại tin tức

7 tính năng của Kimi K3 khiến mọi người mẫu khác cảm thấy lỗi thời

Analytics Vidhya· Riya Bansal· 17/8/2026general

Các nhà phát triển tung ra các mô hình mới mỗi tuần nhưng hầu hết hầu như không thay đổi cách bạn làm việc. Kimi K3 thì khác—không phải vì biểu đồ điểm chuẩn mà vì một vài thay đổi nhỏ về API ảnh hưởng cơ bản đến cách bạn sử dụng nó. Đầu tiên là Reason_effort, mặc định ở mức tối đa, cùng với 131.072 max_completion_tokens. Yêu cầu K3 đổi tên một biến và nó […] Bài đăng 7 tính năng của Kimi K3 khiến mọi người mẫu khác cảm thấy lỗi thời xuất hiện đầu tiên trên Analytics Vidhya.

--> Các tính năng của Kimi K3: 7 bí mật API giúp LLM nhanh hơn, rẻ hơn Hội nghị AI tương lai nhất của Ấn Độ đã trở lại - Lớn hơn, sắc nét hơn, táo bạo hơn --> d : h : tôi : s Nhận thông tin chi tiết --> DeepSeek--> Khóa học miễn phí Các khóa học miễn phí--> Lộ trình học tập--> Chương trình tăng tốc --> Chương trình tăng tốc --> Mới --> Chương trình đỉnh cao GenAI--> GenAI đỉnh cao Plus Tiên phong AI đặc vụ Mới--> DeepSeek--> Hội nghị thượng đỉnh DataHack 2025--> DHS 2026 Các khóa học miễn phí--> Đăng nhập Chuyển đổi chế độ Đăng xuất --> Chuẩn bị phỏng vấn Sự nghiệp GenAI Lời nhắc nhở Trò chuyệnGPT LLM chuỗi lang RAG Đại lý AI Học máy Học sâu Công cụ GenAI LLMOps Python NLP SQL Dự án AIML Danh sách đọc Lộ trình học tập phân tích dữ liệu Cách trở thành Nhà phân tích dữ liệu vào năm 2025: Lộ trình hoàn chỉnh Lộ trình học tập Tableau Lộ trình học tập toàn diện đến Tableau vào năm 2025 Lộ trình học tập NLP Lộ trình học NLP toàn diện 2025 Lộ trình học tập của nhà khoa học dữ liệu Lộ trình học tập để trở thành nhà khoa học dữ liệu vào năm 2025 Lộ trình học tập kỹ sư dữ liệu Lộ trình từng bước để trở thành Kỹ sư dữ liệu vào năm 2025 Lộ trình học tập MLOps Lộ trình học tập MLOps toàn diện: Phiên bản 2025 Lộ trình học tập kỹ sư AI Lộ trình trở thành Kỹ sư AI vào năm 2025 Lộ trình học tập thị giác máy tính Lộ trình học tập toàn diện để làm chủ thị giác máy tính vào năm 2025 Lộ trình học tập AI sáng tạo Lộ trình tốt nhất để học Generative AI vào năm 2025 Lộ trình AI sáng tạo cho doanh nghiệp Lộ trình GenAI cho doanh nghiệp Lộ trình LLM Các mô hình ngôn ngữ lớn được làm sáng tỏ: Lộ trình cho người mới bắt đầu Con đường nghiêng của kỹ sư nhanh chóng Lộ trình học tập để trở thành Chuyên gia Kỹ thuật nhanh chóng Trang chủ LLM 7 tính năng của Kimi K3 khiến mọi người mẫu khác cảm thấy lỗi thời 7 tính năng của Kimi K3 khiến mọi người mẫu khác cảm thấy lỗi thời Riya Bansal Cập nhật lần cuối: 17 tháng 8 năm 2026 đọc 9 phút Các nhà phát triển tung ra các mô hình mới mỗi tuần nhưng hầu hết hầu như không thay đổi cách bạn làm việc. Kimi K3 thì khác—không phải vì biểu đồ điểm chuẩn mà vì một vài thay đổi nhỏ về API ảnh hưởng cơ bản đến cách bạn sử dụng nó. Đầu tiên là Reason_effort, mặc định ở mức tối đa, cùng với 131.072 max_completion_tokens. Yêu cầu K3 đổi tên một biến và nó có thể dẫn đến các điều kiện tương tranh. Bài học quan trọng: Các tính năng của K3 đi kèm với cài đặt. Bỏ qua chúng thì bạn sẽ phải trả giá quá cao, nhưng hãy hiểu chúng và bạn sẽ khai thác được giá trị của chúng. Trong bài viết này, chúng ta sẽ khám phá tất cả bảy. Mục lục Về mặt kỹ thuật, Kimi K3 là gì? Đầu tiên, hãy xây dựng cho mình một chiếc đồng hồ đo chi phíTính năng 1: Nỗ lực lý luận mà bạn thực sự có thể quay số Tính năng 2: Bộ nhớ đệm tiền tố giúp cắt giảm 90% chi phí đầu vào Tính năng 3: Cửa sổ ngữ cảnh dài 1M mà bạn thực sự sẽ điền vào Tính năng 4: Chế độ một phần, Chế độ không ai nhắc đến Tính năng 5: Gọi công cụ với sự thực thi thực sự Tính năng 6: Tầm nhìn bản địa, Không có mô hình thứ hai Tính năng 7: Quả cân mở, có dấu hoa thị trung thực Thực hành: Người đánh giá mã Kimi K3 nhận thức được chi phí Những sai lầm thường gặp và vấn đề Kết luận Câu hỏi thường gặp Về mặt kỹ thuật, Kimi K3 là gì? Kimi K3 là một loại mô hình Hỗn hợp các chuyên gia bao gồm 2,8 nghìn tỷ tham số. Trong số khoảng 896 chuyên gia được định tuyến, chỉ có 16 chuyên gia hoạt động trên mỗi đầu vào. Do đó, mặc dù phức tạp nhưng nó vẫn có giá cả phải chăng về mặt suy luận. Các trọng số sử dụng MXFP4 được lượng tử hóa. Cuối cùng, cửa sổ ngữ cảnh hỗ trợ tới 1.048.576 mã thông báo. Giá là 3,00 USD cho mỗi triệu mã thông báo đầu vào và 15,00 USD cho mỗi triệu mã thông báo đầu ra. Ngoài ra, bộ đệm giúp giảm chi phí xuống còn 0,30 USD trên một triệu mã thông báo và mở khóa quyền truy cập sau khi nạp thêm 1 USD. Đầu tiên, hãy xây dựng cho mình một thước đo chi phí Bỏ qua lời chào thế giới và viết điều gì đó thông báo cho bạn về chi phí của bạn. cài đặt pip openai xuất MOONSHOT_API_KEY="sk-your-key" Chức năng tính toán chi phí/chi phí: hệ điều hành nhập khẩu từ openai nhập OpenAI client = OpenAI(api_key=os.environ["MOONSHOT_API_KEY"], base_url="https://api.moonshot.ai/v1") cuộc gọi def(tin nhắn, **kw): r = client.chat.completions.create(model="kimi-k3", messages=messages, **kw) u = sử dụng lại đã lưu vào bộ nhớ đệm = (u.prompt_tokens_details hoặc {}).get("cached_tokens", 0) Fresh = u.Prompt_tokens - đã lưu vào bộ nhớ đệm chi phí = tươi/1e6*3 + đã lưu vào bộ nhớ đệm/1e6*0.3 + u.completion_tokens/1e6*15 print(f"[fresh {fresh} | được lưu vào bộ nhớ đệm {cached} | out {u.completion_tokens} | ${cost:.4f}]") trả về r.choices[0].message Tất cả các ví dụ dưới đây sẽ sử dụng phương thức call(). Vì vậy, bạn sẽ thấy chi phí của từng tính năng đã học trong quá trình thực hiện. Thói quen đơn giản này đã giúp tôi kiếm được nhiều tiền hơn bất kỳ thủ thuật nhắc nhở nào khác. Vì vậy, hãy bắt đầu. Tính năng 1: Nỗ lực lý luận mà bạn thực sự có thể thực hiện được Ở K3, chế độ suy nghĩ luôn được bật. Không có nút chuyển đổi để bật/tắt chế độ này. Hơn nữa, giao diện còn cung cấp cho bạn một trường cấp cao cung cấp ba tùy chọn: thấp, cao và tối đa. Tùy chọn mặc định là tối đa. Đây là tùy chọn mặc định đắt nhất mà chúng tôi có trong API. Bạn có nhớ việc đổi tên biến của tôi không? Đó là nó. nhắc = [{"role": "user", "content": "Đổi tên `d` thành thứ gì đó có thể đọc được: d = {}"}] nỗ lực trong ("thấp", "cao", "tối đa"): print(nỗ lực, "->", end=" ") gọi(nhắc, lý luận_effort=nỗ lực, max_completion_tokens=256) Quy tắc rất đơn giản: sử dụng mức thấp khi thực hiện các chỉnh sửa cơ học và mức cao khi thực hiện công việc thực tế. Max dành cho việc gỡ lỗi đầy thử thách thực tế. Luôn đặt max_completion_tokens thành giá trị mong muốn của bạn, vì mặc định là 131.072, điều này có thể làm tăng chi phí của bạn lên rất nhiều. Tính năng 2: Bộ nhớ đệm tiền tố giúp cắt giảm 90% chi phí đầu vào Khía cạnh này là điều được thảo luận ít nhất. K3 lưu trữ tiền tố của lời nhắc mà không cần chuẩn bị gì. Không có yêu cầu về ID bộ đệm, giá trị TTL hoặc cuộc gọi ban đầu. Hai điều kiện có hiệu lực.

Nguồn tin: Analytics Vidhya — Tác giả: Riya Bansal. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.