7 tính năng của Kimi K3 khiến mọi người mẫu khác cảm thấy lỗi thời
Các nhà phát triển tung ra các mô hình mới mỗi tuần nhưng hầu hết hầu như không thay đổi cách bạn làm việc. Kimi K3 thì khác—không phải vì biểu đồ điểm chuẩn mà vì một vài thay đổi nhỏ về API ảnh hưởng cơ bản đến cách bạn sử dụng nó. Đầu tiên là Reason_effort, mặc định ở mức tối đa, cùng với 131.072 max_completion_tokens. Yêu cầu K3 đổi tên một biến và nó […] Bài đăng 7 tính năng của Kimi K3 khiến mọi người mẫu khác cảm thấy lỗi thời xuất hiện đầu tiên trên Analytics Vidhya.
-->
Các tính năng của Kimi K3: 7 bí mật API giúp LLM nhanh hơn, rẻ hơn
Hội nghị AI tương lai nhất của Ấn Độ đã trở lại - Lớn hơn, sắc nét hơn, táo bạo hơn
-->
d
:
h
:
tôi
:
s
Nhận thông tin chi tiết
-->
DeepSeek-->
Khóa học miễn phí
Các khóa học miễn phí-->
Lộ trình học tập-->
Chương trình tăng tốc -->
Chương trình tăng tốc -->
Mới -->
Chương trình đỉnh cao GenAI-->
GenAI đỉnh cao Plus
Tiên phong AI đặc vụ
Mới-->
DeepSeek-->
Hội nghị thượng đỉnh DataHack 2025-->
DHS 2026
Các khóa học miễn phí-->
Đăng nhập
Chuyển đổi chế độ
Đăng xuất
-->
Chuẩn bị phỏng vấn
Sự nghiệp
GenAI
Lời nhắc nhở
Trò chuyệnGPT
LLM
chuỗi lang
RAG
Đại lý AI
Học máy
Học sâu
Công cụ GenAI
LLMOps
Python
NLP
SQL
Dự án AIML
Danh sách đọc
Lộ trình học tập phân tích dữ liệu
Cách trở thành Nhà phân tích dữ liệu vào năm 2025: Lộ trình hoàn chỉnh
Lộ trình học tập Tableau
Lộ trình học tập toàn diện đến Tableau vào năm 2025
Lộ trình học tập NLP
Lộ trình học NLP toàn diện 2025
Lộ trình học tập của nhà khoa học dữ liệu
Lộ trình học tập để trở thành nhà khoa học dữ liệu vào năm 2025
Lộ trình học tập kỹ sư dữ liệu
Lộ trình từng bước để trở thành Kỹ sư dữ liệu vào năm 2025
Lộ trình học tập MLOps
Lộ trình học tập MLOps toàn diện: Phiên bản 2025
Lộ trình học tập kỹ sư AI
Lộ trình trở thành Kỹ sư AI vào năm 2025
Lộ trình học tập thị giác máy tính
Lộ trình học tập toàn diện để làm chủ thị giác máy tính vào năm 2025
Lộ trình học tập AI sáng tạo
Lộ trình tốt nhất để học Generative AI vào năm 2025
Lộ trình AI sáng tạo cho doanh nghiệp
Lộ trình GenAI cho doanh nghiệp
Lộ trình LLM
Các mô hình ngôn ngữ lớn được làm sáng tỏ: Lộ trình cho người mới bắt đầu
Con đường nghiêng của kỹ sư nhanh chóng
Lộ trình học tập để trở thành Chuyên gia Kỹ thuật nhanh chóng
Trang chủ
LLM
7 tính năng của Kimi K3 khiến mọi người mẫu khác cảm thấy lỗi thời
7 tính năng của Kimi K3 khiến mọi người mẫu khác cảm thấy lỗi thời
Riya Bansal
Cập nhật lần cuối:
17 tháng 8 năm 2026
đọc 9 phút
Các nhà phát triển tung ra các mô hình mới mỗi tuần nhưng hầu hết hầu như không thay đổi cách bạn làm việc. Kimi K3 thì khác—không phải vì biểu đồ điểm chuẩn mà vì một vài thay đổi nhỏ về API ảnh hưởng cơ bản đến cách bạn sử dụng nó.
Đầu tiên là Reason_effort, mặc định ở mức tối đa, cùng với 131.072 max_completion_tokens. Yêu cầu K3 đổi tên một biến và nó có thể dẫn đến các điều kiện tương tranh. Bài học quan trọng: Các tính năng của K3 đi kèm với cài đặt. Bỏ qua chúng thì bạn sẽ phải trả giá quá cao, nhưng hãy hiểu chúng và bạn sẽ khai thác được giá trị của chúng. Trong bài viết này, chúng ta sẽ khám phá tất cả bảy.
Mục lục
Về mặt kỹ thuật, Kimi K3 là gì?
Đầu tiên, hãy xây dựng cho mình một chiếc đồng hồ đo chi phíTính năng 1: Nỗ lực lý luận mà bạn thực sự có thể quay số
Tính năng 2: Bộ nhớ đệm tiền tố giúp cắt giảm 90% chi phí đầu vào
Tính năng 3: Cửa sổ ngữ cảnh dài 1M mà bạn thực sự sẽ điền vào
Tính năng 4: Chế độ một phần, Chế độ không ai nhắc đến
Tính năng 5: Gọi công cụ với sự thực thi thực sự
Tính năng 6: Tầm nhìn bản địa, Không có mô hình thứ hai
Tính năng 7: Quả cân mở, có dấu hoa thị trung thực
Thực hành: Người đánh giá mã Kimi K3 nhận thức được chi phí
Những sai lầm thường gặp và vấn đề
Kết luận
Câu hỏi thường gặp
Về mặt kỹ thuật, Kimi K3 là gì?
Kimi K3 là một loại mô hình Hỗn hợp các chuyên gia bao gồm 2,8 nghìn tỷ tham số. Trong số khoảng 896 chuyên gia được định tuyến, chỉ có 16 chuyên gia hoạt động trên mỗi đầu vào. Do đó, mặc dù phức tạp nhưng nó vẫn có giá cả phải chăng về mặt suy luận. Các trọng số sử dụng MXFP4 được lượng tử hóa.
Cuối cùng, cửa sổ ngữ cảnh hỗ trợ tới 1.048.576 mã thông báo. Giá là 3,00 USD cho mỗi triệu mã thông báo đầu vào và 15,00 USD cho mỗi triệu mã thông báo đầu ra. Ngoài ra, bộ đệm giúp giảm chi phí xuống còn 0,30 USD trên một triệu mã thông báo và mở khóa quyền truy cập sau khi nạp thêm 1 USD.
Đầu tiên, hãy xây dựng cho mình một thước đo chi phí
Bỏ qua lời chào thế giới và viết điều gì đó thông báo cho bạn về chi phí của bạn.
cài đặt pip openai
xuất MOONSHOT_API_KEY="sk-your-key"
Chức năng tính toán chi phí/chi phí:
hệ điều hành nhập khẩu
từ openai nhập OpenAI
client = OpenAI(api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1")
cuộc gọi def(tin nhắn, **kw):
r = client.chat.completions.create(model="kimi-k3", messages=messages, **kw)
u = sử dụng lại
đã lưu vào bộ nhớ đệm = (u.prompt_tokens_details hoặc {}).get("cached_tokens", 0)
Fresh = u.Prompt_tokens - đã lưu vào bộ nhớ đệm
chi phí = tươi/1e6*3 + đã lưu vào bộ nhớ đệm/1e6*0.3 + u.completion_tokens/1e6*15
print(f"[fresh {fresh} | được lưu vào bộ nhớ đệm {cached} | out {u.completion_tokens} | ${cost:.4f}]")
trả về r.choices[0].message
Tất cả các ví dụ dưới đây sẽ sử dụng phương thức call(). Vì vậy, bạn sẽ thấy chi phí của từng tính năng đã học trong quá trình thực hiện. Thói quen đơn giản này đã giúp tôi kiếm được nhiều tiền hơn bất kỳ thủ thuật nhắc nhở nào khác. Vì vậy, hãy bắt đầu.
Tính năng 1: Nỗ lực lý luận mà bạn thực sự có thể thực hiện được
Ở K3, chế độ suy nghĩ luôn được bật. Không có nút chuyển đổi để bật/tắt chế độ này. Hơn nữa, giao diện còn cung cấp cho bạn một trường cấp cao cung cấp ba tùy chọn: thấp, cao và tối đa.
Tùy chọn mặc định là tối đa. Đây là tùy chọn mặc định đắt nhất mà chúng tôi có trong API. Bạn có nhớ việc đổi tên biến của tôi không? Đó là nó.
nhắc = [{"role": "user", "content": "Đổi tên `d` thành thứ gì đó có thể đọc được: d = {}"}]
nỗ lực trong ("thấp", "cao", "tối đa"):
print(nỗ lực, "->", end=" ")
gọi(nhắc, lý luận_effort=nỗ lực, max_completion_tokens=256)
Quy tắc rất đơn giản: sử dụng mức thấp khi thực hiện các chỉnh sửa cơ học và mức cao khi thực hiện công việc thực tế. Max dành cho việc gỡ lỗi đầy thử thách thực tế. Luôn đặt max_completion_tokens thành giá trị mong muốn của bạn, vì mặc định là 131.072, điều này có thể làm tăng chi phí của bạn lên rất nhiều.
Tính năng 2: Bộ nhớ đệm tiền tố giúp cắt giảm 90% chi phí đầu vào
Khía cạnh này là điều được thảo luận ít nhất. K3 lưu trữ tiền tố của lời nhắc mà không cần chuẩn bị gì. Không có yêu cầu về ID bộ đệm, giá trị TTL hoặc cuộc gọi ban đầu.
Hai điều kiện có hiệu lực.



Nguồn tin: Analytics Vidhya — Tác giả: Riya Bansal. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.