Bỏ qua tới nội dung chính
Quay lại tin tức

Ngoài các Bot: Tái định hình hỗ trợ AI bằng kiến trúc AI lai

KDnuggets· Alakh Sharma· 6/8/2026general

Tìm hiểu cách kết hợp RAG và tinh chỉnh giúp tạo ra trải nghiệm hỗ trợ AI hiệu quả hơn.

Vượt xa các Bot: Suy nghĩ lại về hỗ trợ AI với kiến trúc AI lai - KDnuggets Blog Bài viết hàng đầu Giới thiệu Chủ đề AI Lời khuyên nghề nghiệp Thị giác máy tính Kỹ thuật dữ liệu Khoa học dữ liệu Mô hình ngôn ngữ Học máy MLOps NLP Lập trình Python SQL Bộ dữ liệu Sự kiện Tài nguyên Bảng tóm tắt Đề xuất Bản tin công nghệ Quảng cáo Tham gia bản tin Vượt xa các Bot: Suy nghĩ lại về hỗ trợ AI với kiến trúc AI lai Tìm hiểu cách kết hợp RAG và tinh chỉnh tạo ra trải nghiệm hỗ trợ AI hiệu quả hơn. Bởi Alakh Sharma, Nhà khoa học dữ liệu tại Talentica Software vào ngày 6/8/2026 trong lĩnh vực Trí tuệ nhân tạo # Vượt xa các Bot Gần đây, một khách hàng cần phát triển một chatbot an toàn, chính xác và có khả năng phản hồi gần như theo thời gian thực. Nói một cách đơn giản, họ cần một hệ thống AI có thể trả lời các truy vấn hỗ trợ một cách hoàn hảo, mà không làm lộ dữ liệu nhạy cảm hoặc đi chệch khỏi giọng điệu của công ty. Các yêu cầu như thế này hiện nay thường xuyên hơn, vì bảo mật dữ liệu, độ trễ và chất lượng phản hồi ảnh hưởng trực tiếp đến lợi nhuận của công ty. Các hệ thống AI mắc lỗi trong các yêu cầu này sẽ nhanh chóng mất lòng tin và gây thiệt hại về tiền bạc cho doanh nghiệp. Báo cáo năm 2025 của IBM ước tính chi phí trung bình toàn cầu của một vụ vi phạm dữ liệu là 4,44 triệu USD. Tuy nhiên, các chatbot chung chung và các mô hình ngôn ngữ lớn (LLM) có sẵn thường không đáp ứng được kỳ vọng của doanh nghiệp. Không thể phủ nhận rằng LLM rất mạnh mẽ. Nhưng các mô hình này phải đối mặt với những hạn chế thực sự về giới hạn token, việc sử dụng ngữ cảnh và hiện tượng "ảo giác" (hallucinations). Những hạn chế này càng rõ ràng hơn với nhu cầu ngày càng tăng về kiến thức chuyên biệt theo lĩnh vực và các định dạng phản hồi nghiêm ngặt. Khi tất cả các khía cạnh này đang hoạt động, làm thế nào để xây dựng một AI biết cách trả lời như một chuyên gia, biết phải trả lời gì dựa trên dữ liệu thực và vẫn nhanh chóng, an toàn và có thể kiểm soát được? Từ kinh nghiệm phát triển mô hình của tôi, tôi có thể nói rằng câu trả lời không phải là một mô hình hoặc kỹ thuật duy nhất. Nó đòi hỏi một cách tiếp cận kiến trúc rộng hơn, tách biệt những gì mô hình biết khỏi cách nó phản hồi, đồng thời kết hợp học hỏi với truy xuất. # Những thách thức cốt lõi Trong giai đoạn thiết kế ban đầu, bốn thách thức cơ bản đã trở nên rõ ràng. // Giới hạn ngữ cảnh hiệu quả (Vượt xa số lượng token) Các LLM hiện đại quảng cáo cửa sổ ngữ cảnh 16K, 32K hoặc thậm chí 128K token. Nhưng trong sử dụng thực tế, bất kỳ ai làm việc chặt chẽ với các mô hình này đều biết rằng sự chú ý của chúng bắt đầu suy giảm sớm hơn nhiều. Khi một lượng lớn văn bản được truyền làm ngữ cảnh, các mô hình thường sử dụng thông tin ở giữa lời nhắc không hiệu quả – một hiện tượng được gọi là thiên vị ưu tiên-gần đây (primacy-recency bias). Tăng kích thước ngữ cảnh không đảm bảo câu trả lời tốt hơn. Đối với môi trường doanh nghiệp, nơi các cơ sở tri thức có thể trải rộng hàng triệu token, đây không phải là một giải pháp. // Sử dụng kém thông tin "đuôi dài" (long-tail information) LLM có thể bỏ qua thông tin liên quan, hiểu sai hoặc đánh giá quá cao các phần không liên quan ngay cả khi nội dung chính xác có trong lời nhắc. Các công trình như "Lost in the Middle" ủng hộ lý thuyết này. Bài báo đó nhấn mạnh cách các đầu vào ngữ cảnh dài thường dẫn đến suy luận không đầy đủ nếu không được kiểm soát cẩn thận. Điều này làm cho các chiến lược "đổ mọi thứ vào lời nhắc" đơn giản trở nên không đáng tin cậy đối với các hệ thống hỗ trợ phức tạp, chuyên sâu về lĩnh vực. // Sự đánh đổi giữa độ chính xác và hiệu suất trong truy xuất Truy xuất dữ liệu gây ra độ trễ và chi phí tính toán trong thực tế. Nếu truy xuất quá nhiều, ngữ cảnh tăng lên sẽ làm tăng thời gian phản hồi và làm loãng sự chú ý của mô hình. Nếu truy xuất quá ít, nguy cơ "ảo giác" sẽ tăng lên. Thách thức thực sự không phải là bản thân việc truy xuất, mà là truy xuất chính xác – đảm bảo ngữ cảnh tối thiểu đủ cần thiết cho tính đúng đắn mà không làm quá tải hệ thống hoặc mô hình. // "Ảo giác" khi thiếu ngữ cảnh Các mô hình ngôn ngữ lớn (LLM) hiếm khi từ chối tạo phản hồi ngay cả khi thiếu thông tin liên quan. Thay vào đó, chúng tự tin phản hồi bằng các câu trả lời chung chung hoặc bịa đặt. Trong môi trường hỗ trợ, hành vi này là không thể chấp nhận được. Nó ảnh hưởng trực tiếp đến sự tin cậy, tính đúng đắn và sự tuân thủ. Một nghiên cứu kỹ lưỡng về những hạn chế này đã làm rõ một điều: việc truyền thêm ngữ cảnh không phải là giải pháp. Chúng tôi cần một kiến trúc thông minh hơn. # Giải pháp: Kiến trúc lai Công việc của chúng tôi liên tục chỉ ra một phương pháp tiếp cận lai kết hợp tạo sinh tăng cường truy xuất (RAG) với các mô hình ngôn ngữ được tinh chỉnh. Điểm mấu chốt là tinh chỉnh và truy xuất giải quyết các vấn đề khác nhau. Tinh chỉnh dạy mô hình cách trả lời, và truy xuất cung cấp nội dung để trả lời. Chúng tôi nhận thấy rằng việc buộc một phương pháp phải làm cả hai dẫn đến sự kém hiệu quả, không ổn định hoặc chi phí cao. Do đó, chúng tôi đã thiết kế một hệ thống cho phép cả hai thành phần hoạt động từ những thế mạnh riêng của chúng. # Sử dụng RAG để đạt độ chính xác thông qua truy xuất Chúng tôi đã nỗ lực có chủ đích để tránh làm ngập mô hình bằng một lượng lớn tài liệu thô. Thay vào đó, chúng tôi đã xây dựng một cơ sở tri thức có thể tìm kiếm, được tuyển chọn từ các cặp hỏi đáp nội bộ, hướng dẫn sản phẩm, tài liệu kỹ thuật và tài liệu tham khảo về chính sách và cấu hình. Tại thời điểm suy luận, bộ truy xuất chỉ chọn các đoạn nội dung liên quan nhất và chèn chúng vào lời nhắc. Điều này đảm bảo các câu trả lời được dựa trên dữ liệu thực, đã được xác minh. Chúng tôi nhận thấy rằng phương pháp này đã giảm đáng kể tỷ lệ "ảo giác", cải thiện độ chính xác về mặt thực tế và tăng tốc độ phản hồi bằng cách giữ các cửa sổ ngữ cảnh nhỏ và cụ thể theo truy vấn. Tuy nhiên, chỉ dựa vào RAG là không đủ. Ngay cả khi độ chính xác truy xuất rất cao, các đầu ra vẫn cho thấy sự biến đổi lớn về giọng điệu, cấu trúc, định dạng và mức độ chi tiết thủ tục được bao gồm. Các đầu ra này chỉ ra rằng mặc dù chính xác về mặt thực tế, các phản hồi không được cấu trúc nhất quán cũng như không được định dạng đáng tin cậy. Trong một trường hợp sử dụng chatbot được thiết kế đặc biệt để cải thiện sự hội tụ trong các yêu cầu, đánh giá

Nguồn tin: KDnuggets — Tác giả: Alakh Sharma. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.