
Uh-Oh. Mô hình AI của công ty nào được cho là đã trở thành một hacker?
Hãy đưa những tin tặc này ra khỏi đây.
Một mô hình AI tấn công mạng mới đã xuất hiện, được cho là Muse Spark 1.1 của Meta.
Meta đã thông báo với Gizmodo (sau khi sự việc được The Information đưa tin lần đầu) rằng mô hình của họ đã truy cập vào internet công cộng – trong trường hợp này là do một công ty bảo mật bên ngoài vô tình cho phép – và đã xâm nhập vào trang web của một công ty khác.
Hiện chưa rõ trang web nào bị tấn công, mô hình đang cố gắng làm gì và bản chất của sự cố sau đó, nhưng dường như một phòng thí nghiệm bảo mật có tên Irregular là công ty đang thực hiện thử nghiệm. Một người phát ngôn của Meta nói với Gizmodo: “Một cấu hình sai của Irregular, một công ty thử nghiệm độc lập mà Meta sử dụng, đã vô tình cho phép một trong các mô hình của chúng tôi truy cập internet trong quá trình đánh giá”. Người phát ngôn cho biết, phiên bản mô hình của Meta này – The Information gọi là Meta’s Muse Spark 1.1 – sau đó đã “khai thác một lỗ hổng bảo mật trong dịch vụ của bên thứ ba, theo cách tương tự như các trường hợp đã được báo cáo trước đây với các công ty khác”.
Mới hôm qua, OpenAI đã công bố một báo cáo về một sự cố trong đó một bài tập “capture-the-flag” (chiếm cờ) của Irregular đã gặp trục trặc, do “cấu hình sai trong môi trường thử nghiệm”, cho phép các mô hình truy cập vào internet công cộng.
Các bài tập “capture-the-flag” trong bối cảnh này thường bao gồm việc nhắc nhở một mô hình bằng cách cho nó biết rằng nó đang thực hiện một bài tập chiếm cờ, chứ không phải một cuộc tấn công thực sự, và yêu cầu nó tìm một mã ẩn – một lá cờ – ở đâu đó trong cấu trúc của một trang web giả.
Người phát ngôn nói với Gizmodo: “Meta đã biết về điều này khi Irregular thông báo cho chúng tôi, và chúng tôi hiện đang điều tra và sẽ đưa ra một báo cáo đầy đủ sau khi chúng tôi có tất cả các dữ kiện”.
Irregular nói với The Information rằng cuộc tấn công không nghiêm trọng và cho biết “không có vấn đề nào đang mở hiện tại” – điều này có nghĩa là nó không còn tiếp tục tấn công nữa. Và, cũng theo The Information, sẽ sớm có một báo cáo chuyên sâu từ Irregular về những sự cố này và cách xử lý chúng.
Báo cáo của OpenAI mô tả chi tiết hơn về sự cố Irregular bị cáo buộc.
Trong một thử nghiệm, tên của mục tiêu giả định cho thử thách [capture-the-flag] vô tình trùng với một tên miền thực. Do môi trường thử nghiệm bị kết nối nhầm với internet, mô hình đã khai thác một trang web thực, nhầm tưởng đó là một phần của môi trường mô phỏng. Sự cố này không liên quan đến việc thoát khỏi sandbox phức tạp hay lỗ hổng zero-day: việc truy cập internet là do cấu hình sai, và mô hình dường như đã khai thác một lỗ hổng bảo mật cơ bản.
Theo OpenAI, Irregular đã đình chỉ các đánh giá, chuyển sang "khắc phục", thông báo cho tất cả các bên liên quan và bắt đầu xây dựng các biện pháp bảo vệ mới. Điều này bổ sung cho báo cáo chuyên đề mà The Information cho biết đang được thực hiện.
Những câu chuyện về khả năng tấn công mạng ngày càng tăng của các mô hình AI đã trở thành một đặc điểm chính trong các cuộc thảo luận về AI trong vài tháng qua. Hồi tháng 4, hai ngày sau khi Anthropic công bố phát hành hạn chế một mô hình AI với khả năng tấn công nguy hiểm đến mức không thể phát hành công khai, đối thủ chính của họ là OpenAI đã thông báo rằng họ cũng có một mô hình chỉ có thể phát hành cho một nhóm chọn lọc.
Sau đó là các báo cáo về việc các mô hình AI thực hiện những lời hứa này bằng cách được cho là đã thực hiện các cuộc tấn công mạng tự động trong quá trình thử nghiệm. Đáng chú ý nhất là vụ vi phạm Hugging Face của OpenAI, xảy ra sau khi các phiên bản mô hình của OpenAI thoát khỏi sandbox của chúng. Nhưng sau đó là một số báo cáo khác với mức độ nghiêm trọng khác nhau. Trong một báo cáo từ ngày hôm qua, Mythos 5 của Anthropic được cho là đã cố gắng thực hiện một cuộc tấn công kỹ thuật xã hội phức tạp chống lại một nhà phát triển không nghi ngờ.
Gizmodo đã yêu cầu Irregular đưa ra tuyên bố về những vấn đề này nhưng chưa nhận được phản hồi ngay lập tức. Chúng tôi sẽ cập nhật bài viết này nếu nhận được bình luận.
Nguồn tin: Gizmodo AI — Tác giả: Mike Pearl. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.