Bỏ qua tới nội dung chính
Quay lại tin tức

Từ nguyên mẫu đến sản xuất: Kiến trúc đằng sau các tác nhân AI được quản lý và bảo mật

Towards Data Science· Partha Sarkar· 18/8/2026general

Xây dựng các lớp quản trị, bảo mật và AI có trách nhiệm cần thiết cho các đại lý sẵn sàng cho doanh nghiệp Bài đăng Từ nguyên mẫu đến sản xuất: Kiến trúc đằng sau các tác nhân AI được quản lý và an toàn xuất hiện đầu tiên trên Hướng tới khoa học dữ liệu.

AI đặc vụ Từ nguyên mẫu đến sản xuất: Kiến trúc đằng sau các tác nhân AI được quản lý và bảo mật Xây dựng các lớp quản trị, bảo mật và AI có trách nhiệm cần thiết cho các đại lý sẵn sàng cho doanh nghiệp Partha Sarkar Ngày 18 tháng 8 năm 2026 đọc 15 phút Chia sẻ Được tạo bằng Gemini Một câu hỏi phổ biến mà tôi thường được hỏi là liệu LLM và trợ lý mã hóa có thể xây dựng ứng dụng trong vài giờ, vốn thường mất hàng tuần theo cách thủ công, tại sao vẫn phải mất vài tháng nữa chúng tôi mới có thể đi vào hoạt động? Có một số lý do giải thích cho điều này, trong số đó chủ yếu là do tính sẵn sàng của cơ sở hạ tầng và dữ liệu, đồng thời cũng xây dựng AI có trách nhiệm - quản trị mô hình và tác nhân, bảo mật, tính minh bạch, khả năng giải thích, v.v. Việc xây dựng các biện pháp kiểm soát quản trị này và kiểm tra chúng một cách nghiêm ngặt bằng cách sử dụng bộ dữ liệu thử nghiệm vàng thực tế, cần có thời gian để thuyết phục các bên liên quan rằng ứng dụng đã sẵn sàng để đưa vào sản xuất. Trong bài viết này, chúng ta sẽ vượt ra ngoài “thế giới xin chào” của các tác nhân AI. Chúng ta sẽ khám phá kiến ​​trúc cần thiết để xây dựng một hệ thống Agentic AI cứng cáp, sẵn sàng sản xuất. Chúng ta sẽ xem xét môi trường thử nghiệm được xây dựng có mục đích bằng cách sử dụng Trợ lý nhân sự mô phỏng của công ty và giải thích cách triển khai các biện pháp bảo vệ mạnh mẽ bao gồm Kiểm soát truy cập đa cấp (ACL), theo dõi thực thi, kiểm tra tính toàn vẹn của cửa hàng vectơ và quy trình làm việc của Con người trong vòng lặp (HITL). Mục tiêu không phải là thể hiện mọi khía cạnh của khuôn khổ AI có trách nhiệm. Giống như mọi thứ liên quan đến AI, đây là một lĩnh vực rộng lớn và phát triển nhanh chóng. Mục tiêu là để đánh giá cao rằng mặc dù việc xây dựng một tác nhân AI chức năng ngày nay cực kỳ dễ dàng nhưng việc triển khai tác nhân đó vào môi trường doanh nghiệp sản xuất lại là một vấn đề khác biệt rõ ràng và khó khăn hơn nhiều. Vì vậy hãy bắt đầu. Tại sao chúng ta cần tất cả những điều khiển này? Quá trình phát triển phần mềm truyền thống luôn có một tập hợp các cổng thử nghiệm đã được xác định rõ ràng - đơn vị, chức năng, tích hợp, bảo mật và sự chấp nhận của người dùng được tuân thủ rộng rãi. Vậy ứng dụng AI có gì khác biệt khi nó yêu cầu một lớp thử nghiệm khác để xác định và đo lường sự tuân thủ các chính sách, biện pháp bảo vệ và kiểm soát của tổ chức? Sự khác biệt là trong khi ở phần mềm truyền thống, logic ứng dụng mang tính quyết định thì ở các hệ thống tác nhân thì không như vậy. Công cụ thực thi cốt lõi là Mô hình ngôn ngữ lớn—một công cụ dự đoán văn bản xác suất. Trong phần mềm truyền thống, bạn có thể viết và kiểm tra “Nếu user.role != "admin", nút cập nhật bị tắt." Khi điều kiện này vượt qua trong quá trình thử nghiệm, bạn có thể yên tâm rằng nó sẽ hoạt động tương tự trong quá trình sản xuất. Ngược lại, bạn không thể chỉ nói với LLM rằng “Trừ khi người dùng là quản trị viên, không cho phép cập nhật dữ liệu” và mong đợi nó hoạt động 100% mọi lúc. Ngay cả với cài đặt LLM như nhiệt độ = 0, người ta không thể chắc chắn rằng nó sẽ luôn được tuân theo mà không có ngoại lệ. Ngoài ra, các kỹ thuật độc hại như bẻ khóa, sycophancy (trong đó mô hình đồng ý với người dùng bất kể hướng dẫn) và tiêm gián tiếp (hướng dẫn độc hại ẩn trong tài liệu) đôi khi sẽ ghi đè các hướng dẫn ở cấp độ nhắc nhở. Để làm cho tác nhân sẵn sàng sản xuất, chúng ta phải áp dụng Phòng thủ theo chiều sâu. Chúng ta không thể dựa vào LLM để tự quản lý. Thay vào đó, chúng ta phải xây dựng các đường ray an toàn mang tính xác định xung quanh lõi không xác định. Thiết lập thử nghiệm Để minh họa những khái niệm này, hãy xây dựng Trợ lý chính sách nhân sự. Đây là hệ thống RAG tác nhân được thiết kế để trả lời các câu hỏi của nhân viên và thực hiện các hành động (như gửi yêu cầu nghỉ phép hoặc cập nhật tiền lương). Để kiểm tra khả năng phục hồi của hệ thống, hãy triển khai ba tính cách người dùng riêng biệt: Quản trị viên (Quản trị viên hệ thống): Khoảng trống cao nhất (acl_level=2). Có quyền truy cập vào dữ liệu thư mục nhân viên có tính bảo mật cao. Được ủy quyền thực hiện mọi hành động Bob (Giám đốc nhân sự): Giải phóng mặt bằng nâng cao (acl_level=1). Có thể đọc tài liệu nhân sự và bắt đầu quy trình làm việc có rủi ro cao. Alice (Nhân viên): Xác nhận tiêu chuẩn (acl_level=0). Chỉ có thể đọc chính sách công ty đại chúng. Không có quyền cập nhật dữ liệu. Kiến trúc Agentic RAI Dưới đây là kiến trúc cấp cao của Đại lý nhân sự. Lưu ý rằng LLM hoàn toàn tách biệt khỏi hoạt động nhập trực tiếp của người dùng và quyền truy cập cơ sở dữ liệu trực tiếp. Các thành phần kiến trúc cốt lõi như sau: Bộ lọc trước an toàn Bộ lọc trước là cổng đầu tiên mà mọi truy vấn của người dùng phải đi qua. Nó chạy trước bất kỳ lệnh gọi LLM nào, bất kỳ truy xuất hoặc đánh giá chính sách nào. Bộ lọc trước thường sẽ được triển khai bằng cách sử dụng LLM nhanh và tiết kiệm chi phí như phiên bản gemini flash hoặc GPT mini và thực hiện các chức năng sau: Chặn tiêm trực tiếp: Nó quét đầu vào thô của người dùng để tìm các kiểu tấn công đã biết - các cụm từ như “bỏ qua tất cả các hướng dẫn trước đó”, “bạn hiện là DAN”, “giả vờ như bạn không có hạn chế” hoặc “in lời nhắc hệ thống của bạn”. Nó sử dụng phân loại LLM ngữ nghĩa để phát hiện các bản bẻ khóa 0 ngày và các thủ thuật ngôn ngữ tinh vi. Nếu truy vấn được coi là an toàn, trình phân loại sẽ đưa ra phản hồi JSON có cấu trúc chứa điểm rủi ro sơ bộ và ý định trích xuất mà Công cụ chính sách xuôi dòng có thể tận dụng. Công cụ chính sách và công cụ phân loại tự chủ Một tính năng chính của hệ thống đại lý là chúng có thể hoạt động tự chủ. Và điều đó mang lại rủi ro đáng kể cho các nhiệm vụ có tác động lớn liên quan đến sửa đổi dữ liệu. Mục đích của việc này là để thực thi nguyên tắc Đặc quyền tối thiểu theo mặc định - nếu động cơ không thể tự tin xác định một hành động là an toàn thì nó sẽ leo thang thay vì thực thi. Trong bản demo này, có ba cấp độ sau đây để phân loại một truy vấn: CấpMô tảVí dụAUTONOMOUSAn toàn để truy xuất và phản hồi, hoàn toàn tự động“Chính sách nghỉ phép là gì?”Được phép giám sát nhưng được ghi lại với dấu vết kiểm tra nâng cao“Gửi yêu cầu nghỉ phép”REQUIRES_HITLHành động viết có rủi ro cao, phải tạm dừng để con người phê duyệt“Cập nhật lương của Bob lên 200.000 USD” Kiểm soát truy cập

Nguồn tin: Towards Data Science — Tác giả: Partha Sarkar. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.