Bỏ qua tới nội dung chính
Quay lại tin tức

Trình bày: Tận dụng mô phỏng đối thủ để kiểm thử bảo mật (Red Teaming) cho AI tạo sinh (GenAI)

InfoQ AI· Kennedy Torkura· 10/8/2026general

Kennedy Torkura thảo luận về các kỹ thuật kiểm thử xâm nhập (red teaming) GenAI thực tiễn nhằm bảo vệ các mô hình ngôn ngữ lớn (LLM) và cơ sở tri thức khỏi các mối đe dọa bảo mật như đầu độc dữ liệu (data poisoning) và tấn công LLMjacking trên nền tảng AWS. Ông giải thích cách các nhà lãnh đạo kỹ thuật và kiến trúc sư có thể kết nối an ninh đám mây truyền thống với các khuôn khổ MITRE ATLAS để chủ động xác định các lỗ hổng, triển khai các biện pháp bảo vệ và bảo mật các ứng dụng AI trong môi trường sản xuất.

Trang chủ InfoQ Các bài thuyết trình Tận dụng mô phỏng đối thủ để kiểm thử thâm nhập (Red Teaming) cho GenAI AI, ML & Kỹ thuật dữ liệu Tận dụng mô phỏng đối thủ để kiểm thử thâm nhập (Red Teaming) cho GenAI Thích Danh sách đọc Xem bài thuyết trình Dọc Ngang Toàn màn hình Tốc độ: 1x 1.25x 1.5x 2x 36:27 Tóm tắt Ông Kennedy Torkura thảo luận về các kỹ thuật kiểm thử thâm nhập (red teaming) thực tế cho GenAI nhằm bảo vệ các mô hình ngôn ngữ lớn (LLM) và cơ sở tri thức khỏi các mối đe dọa bảo mật như đầu độc dữ liệu (data poisoning) và tấn công LLMjacking trên AWS. Ông giải thích cách các lãnh đạo kỹ thuật và kiến trúc sư có thể kết nối bảo mật đám mây truyền thống với các khuôn khổ MITRE ATLAS để chủ động xác định lỗ hổng, triển khai các biện pháp bảo vệ và bảo mật các ứng dụng AI đang hoạt động. Tiểu sử Ông Kennedy Torkura là Giám đốc Công nghệ (CTO)/Đồng sáng lập tại Mitigant, một công ty khởi nghiệp bảo mật đám mây đổi mới có trụ sở tại Đức. Ông Kennedy đã có hơn 12 năm kinh nghiệm trong lĩnh vực an ninh mạng và đam mê khám phá sự giao thoa giữa kỹ thuật hỗn loạn bảo mật (security chaos engineering), khả năng phục hồi mạng (cyber resilience), ứng phó sự cố và phân tích rủi ro cho bảo mật đám mây. Ông Kennedy đã xuất bản hơn 20 bài báo khoa học về bảo mật đám mây. Về hội nghị Hội nghị phát triển phần mềm InfoQ Dev Summit Munich tập trung vào các thách thức phần mềm quan trọng mà các nhóm phát triển cấp cao đang phải đối mặt hiện nay. Hội nghị cung cấp những hiểu biết kỹ thuật thực tế có giá trị từ hơn 20 nhà phát triển phần mềm cấp cao, kết nối diễn giả và đồng nghiệp, đồng thời tổ chức các sự kiện giao lưu. Kennedy Torkura: Có ai đang xây dựng các ứng dụng GenAI không? Có ai đang thực hiện các biện pháp bảo mật cho nó không, chẳng hạn như thực hiện một số loại bảo mật? Có ai làm việc trong SOC, như trong nhóm SOC, kỹ sư phát hiện, red team, purple team không? Tôi sẽ cố gắng giải thích nhiều nhất có thể. Tên tôi là Kennedy Torkura. Tôi là một trong những người sáng lập Mitigant. Mitigant là một công ty bảo mật đám mây. Chúng tôi có trụ sở tại Potsdam, rất gần Berlin. Tôi đã làm an ninh mạng khoảng 12 năm. Tôi đã tham gia rất nhiều vào AWS, như quý vị thấy tôi là thành viên trong chương trình Community Builder. Ngoài ra, một số công việc tôi làm hôm nay dựa trên nghiên cứu tiến sĩ của tôi, dẫn đến việc thành lập công ty. Thao túng mô hình AI thông qua tấn công chuỗi cung ứng Tôi muốn bắt đầu với ví dụ này, và lý do tôi đưa nó ra đây là vì trên MITRE ATLAS có rất nhiều nghiên cứu điển hình. Những nghiên cứu điển hình này là có thật, vì chúng dựa trên những gì đã xảy ra, và chúng cố gắng cho quý vị biết vấn đề, tác động, cũng như cách khắc phục, và chúng liên kết trở lại MITRE ATLAS, mà tôi sẽ nói đến. Về cơ bản, sau buổi nói chuyện này, tôi kỳ vọng nó giống như Red Teaming 101, vì vậy chúng ta sẽ không đi quá sâu. Tôi hy vọng tạo ra một cầu nối giữa những người đã làm bảo mật hoặc có thể là SRE, và cách họ có thể bắt đầu thực hiện red teaming, và kiểm tra các ứng dụng AI của họ từ góc độ bảo mật. Bảo mật GenAI Rõ ràng, hầu hết chúng ta đều biết tại sao chúng ta nên bảo mật AI hoặc GenAI. Hầu hết các hệ thống này được kết nối với các công ty của chúng ta, chúng tương tác với dữ liệu của chúng ta, và chúng ta không muốn dữ liệu đó rơi vào tay tội phạm, chúng ta không muốn nó bị lộ. Ngoài ra còn có vấn đề tuân thủ, đây là một động lực lớn. Các quy định như EU AI Act đang được triển khai. Chúng ta có ISO. Có rất nhiều vấn đề tuân thủ đang đến mà chúng ta không muốn vi phạm. Tất nhiên, việc lộ dữ liệu rất giống với việc dữ liệu bị lộ cho tin tặc. Chúng ta muốn giữ an toàn. Chúng ta không muốn khách hàng của mình phát hiện ra rằng dữ liệu của họ đã bị lộ cho những kẻ tấn công vì quý vị cung cấp một dịch vụ đang được AI sử dụng. Tất nhiên, chúng ta phải đặt ra các rào chắn, một số điều đó chúng ta sẽ nói đến một chút. Ngoài ra còn có nội dung AI đang được tạo ra, và quý vị muốn đảm bảo rằng nội dung này là chính xác. Nó không xúc phạm người dùng của quý vị dưới bất kỳ hình thức nào, và điều đó trở nên rất phức tạp. GenAI Red Teaming Ý tưởng của GenAI red teaming, như hầu hết chúng ta đều biết, là quý vị muốn có thể giả vờ là một kẻ tấn công, để quý vị có thể kiểm tra hệ thống của mình theo cách mà một kẻ tấn công sẽ làm, bởi vì làm sao quý vị biết liệu hệ thống có thể sống sót sau một cuộc tấn công không? Quý vị có thể đã làm mọi thứ có thể. Quý vị có sự tự tin rằng nó sẽ sống sót sau một cuộc tấn công, nhưng sự tự tin đó là sự tự tin của quý vị. Kẻ tấn công có thể tiếp cận hệ thống này theo một cách khác. Điều quan trọng là quý vị giả vờ là một kẻ tấn công và tấn công hệ thống của mình, rõ ràng là một cách an toàn để quý vị có thể hy vọng khám phá ra các điểm mù. Đôi khi điều đó hơi khó khăn. Tại Mitigant, chúng tôi đôi khi thấy khó giải thích cho mọi người những gì chúng tôi đang làm, bởi vì ví dụ, nếu quý vị thực hiện một cuộc tấn công và chúng tôi nói nó thành công, người đó đang đóng vai trò là người phòng thủ, vì vậy họ bối rối. Điều gì là thành công? Tôi đã bảo vệ nó hay quý vị đã xâm nhập được? Nó đòi hỏi một sự thay đổi tư duy để thực hiện điều này một cách đúng đắn. Một số người cũng tranh luận, tại sao tôi phải làm điều đó? Tôi đã có mọi thứ đúng chỗ. Tôi có các quyền hạn hạn chế. Tôi có cái này. Tôi có cái kia. Tôi đã mua các hệ thống trị giá hàng triệu đô la và nhà cung cấp nói rằng mọi thứ đều tuyệt vời, nhưng tôi phải tự kiểm tra. Red teaming (đánh giá an ninh mạng) đối với GenAI là việc bạn tiếp cận vấn đề đó từ một góc độ khác. Chúng ta sẽ xem xét một số hệ thống hiện có. Một số hệ thống chúng ta có thể đã biết, và một số khác là mới do sự xuất hiện của AI. Điều đầu tiên chúng ta muốn xem xét là MITRE ATLAS. Hầu hết những người làm trong lĩnh vực an ninh mạng sẽ biết về nó vì đây về cơ bản là một kho lưu trữ, một thư viện hoặc một cơ sở dữ liệu, tùy cách bạn gọi, nó giải thích các kỹ thuật tấn công khác nhau, đó là cách mà những kẻ tấn công sẽ hành động. Nó giải thích ở cấp độ cao. Đôi khi họ đi sâu hơn một chút để cho bạn biết chính xác các lệnh mà kẻ tấn công sẽ sử dụng. Họ cũng cho bạn biết chuỗi tấn công từ truy cập ban đầu, thực thi, duy trì quyền truy cập, chỉ để bạn hiểu chính xác kẻ tấn công đang làm gì, đó là gì

Nguồn tin: InfoQ AI — Tác giả: Kennedy Torkura. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.