Một nhóm ba nhà nghiên cứu hàng đầu về đạo đức AI (Trí tuệ nhân tạo) lập luận rằng một biện pháp bảo vệ quan trọng chống lại việc các tác nhân AI (AI agents) hoạt động sai lệch – đó là duy trì sự can thiệp của con người để xem xét và phê duyệt các quyết định của chúng – sẽ thất bại trừ khi các nhà thiết kế và người dùng thay đổi các thực hành hiện tại của họ.
Mặc dù hầu hết các tác nhân tự động (autonomous agents) đều có hệ thống để giữ người dùng tham gia vào các hành động của chúng, nhưng trên thực tế, các quy trình này lại đẩy con người ra khỏi vòng lặp, các tác giả lập luận trong một bài báo được đăng trên ArXiv vào ngày 6/9. Nói cách khác, “con người chỉ trở thành một công cụ thịt để cấp phép mà không có khả năng nhận thức để tham gia,” một trong các tác giả, Avijit, cho biết.
Một nhóm ba nhà nghiên cứu hàng đầu về đạo đức AI (Trí tuệ nhân tạo) cảnh báo rằng biện pháp bảo vệ quan trọng chống lại các tác nhân AI hoạt động sai lệch – việc duy trì sự tham gia của con người để xem xét và phê duyệt các quyết định của chúng – sẽ thất bại trừ khi các nhà thiết kế và người dùng thay đổi các thực hành hiện tại.
Mặc dù hầu hết các tác nhân tự động đều có hệ thống để giữ người dùng nắm bắt thông tin về hành động của chúng, nhưng trên thực tế, các quy trình này lại đẩy con người ra khỏi vòng lặp, các tác giả lập luận trong một bài báo đăng trên ArXiv vào ngày 6/9. Nói cách khác, "con người chỉ trở thành một công cụ thịt để cấp quyền mà không có khả năng nhận thức để tham gia", Avijit Ghosh, một trong các tác giả, nhà nghiên cứu chính sách AI kỹ thuật hàng đầu tại Hugging Face, một nền tảng học máy mã nguồn mở, cho biết.
Trong ngắn hạn, bài báo cho biết, việc con người bị loại khỏi vòng lặp dẫn đến các tác nhân hành động theo những cách mà con người không biết hoặc không mong muốn (như vụ tấn công Hugging Face vào tháng 7 bởi một đàn bot của OpenAI). Về lâu dài, điều này sẽ khiến người dùng mất đi "năng lực nhận thức" cần thiết để kiểm soát AI, các nhà nghiên cứu viết. Ngoài Ghosh, nhóm nghiên cứu còn có Margaret Mitchell, nhà khoa học đạo đức trưởng của Hugging Face, và Samir Passi, một thành viên của Viện Nghiên cứu Dữ liệu và Xã hội.
Mặc dù bộ ba bắt đầu thực hiện bài báo trước khi vụ tấn công Hugging Face được tiết lộ, nhưng kết luận của họ là kết quả của việc "suy nghĩ logic về những gì sẽ xảy ra nếu các xu hướng hiện tại tiếp diễn – và chúng tôi đã thấy điều đó được thúc đẩy thông qua vụ tấn công Hugging Face", Ghosh nói.
Thay vì tập trung vào sự giám sát của con người, Ghosh cho biết, nhiều người trong lĩnh vực này tin rằng AI có thể giám sát AI. "Họ sẽ nói, 'ồ, chúng tôi có một LLM (mô hình ngôn ngữ lớn) khác theo dõi các nhật ký.' Nhưng [nếu không có con người tham gia] làm sao chúng ta biết rằng hai LLM này không thông đồng với nhau?"
Ngay cả khi những vấn đề này còn mới đối với các nhà nghiên cứu trí tuệ nhân tạo khi ngành công nghiệp triển khai các tác nhân ra thế giới, thì những thách thức này đã quen thuộc với các nhà nghiên cứu trong các lĩnh vực lân cận, như robot và phương tiện tự hành, Mary L. Cummings, giám đốc Trung tâm Tự động hóa và Robot của Đại học George Mason, lưu ý. Cummings đã dành nhiều thập kỷ nghiên cứu cách con người tương tác với các hệ thống tự động.
"Mặc dù tôi đánh giá cao những gì các tác giả đang cố gắng nói, nhưng họ chỉ sử dụng rất nhiều từ ngữ học thuật để nói rằng các công ty AI nên quan tâm đến các yếu tố con người", bà viết cho IEEE Spectrum trong một email. Các nhà phát triển AI "đã đến muộn" trong việc tập trung vào "kỹ thuật nhận thức".
**Những thiếu sót trong thiết kế và giám sát tác nhân AI**
Lỗi chính trong thiết kế tác nhân hiện tại, các tác giả lập luận, là các bot được điều chỉnh để đáp ứng các tiêu chuẩn như tốc độ, độ chính xác và khối lượng công việc được thực hiện. Nhu cầu của người giám sát con người được coi "là một yếu tố riêng biệt độc lập với chất lượng của hệ thống".
Kết quả là, các tác nhân thường làm quá tải người giám sát con người với nhiều thông tin hơn mức họ có thể hiểu. Ví dụ (không được đề cập trong bài báo), 1.200 bot liên quan đến vụ tấn công Hugging Face đã tạo ra 1,2 triệu tin nhắn trên hệ thống nhắn tin ngẫu hứng của chúng. (Hugging Face gần đây đã được Nvidia mua lại, công ty này đã công bố cách tiếp cận dựa trên phần cứng và phần mềm riêng để kiểm soát các tác nhân AI vào ngày 28/9. Ghosh từ chối bình luận về những tác động tiềm tàng trong tương lai của việc sáp nhập, lưu ý rằng hai tổ chức vẫn tách biệt cho đến khi quá trình sáp nhập hoàn tất.)
Một hệ thống thực sự giữ con người trong vòng lặp sẽ điều chỉnh các thành kiến cố hữu của tâm trí con người, các tác giả viết. "Với thành kiến tự động hóa, người dùng chấp nhận các đề xuất của hệ thống ngay cả khi chúng sai. Với thành kiến neo giữ, mọi người có nhiều khả năng t[iếp nhận thông tin ban đầu hơn]."
đồng ý với quyết định của một hệ thống AI” mà không suy nghĩ về các lựa chọn thay thế. Việc suy luận cần nhiều nỗ lực không mang lại cảm giác tốt cho người dùng bằng việc nhanh chóng chấp thuận kế hoạch của AI – đặc biệt nếu họ cảm thấy quá tải. Và thái độ xu nịnh của AI cho người dùng biết rằng họ đang làm tốt, điều này làm suy yếu sự hoài nghi và tự giám sát mà việc giám sát đòi hỏi.
Để giải quyết vấn đề này, các tác giả viết, các nhà phát triển tác nhân (agent) nên tạo ra ma sát (friction) trong tương tác giữa con người và AI. Điều đó sẽ ngăn người dùng rơi vào trạng thái nhàm chán, thụ động hoặc nhấp chuột thiếu suy nghĩ.
Các tác giả đề xuất một số lựa chọn để đạt được điều này. Một tác nhân có thể yêu cầu người dùng ghi lại lựa chọn của chính họ cho bước tiếp theo trước khi tiết lộ kế hoạch của mình, hoặc phản hồi sự chấp thuận của người dùng bằng cách hỏi “bằng chứng nào sẽ thay đổi suy nghĩ của bạn?”. Một tác nhân cũng có thể thay đổi hành vi của mình nếu phát hiện ra rằng những người tham gia đang dành ít thời gian hơn cho mỗi lần phê duyệt.
Trong khi đó, các tổ chức áp dụng tác nhân vào quy trình làm việc của mình nên cấu trúc sự hợp tác giữa con người và AI “để ngăn chặn cả sự mệt mỏi và sự đầu hàng về nhận thức do tiếp xúc kéo dài với AI có tính tác nhân”, các tác giả viết. Điều đó có thể bao gồm việc yêu cầu nhân viên thực hiện các nhiệm vụ mà không có tác nhân theo thời gian hoặc yêu cầu họ nghỉ giải lao khỏi nhiệm vụ giám sát.
Tất cả những đề xuất này đều tạo ra ma sát và sự chậm trễ – chính xác là những điều mà Ghosh thừa nhận, các tác nhân được cho là sẽ giảm bớt. Nhưng, ông nói, “khái niệm tăng năng suất là một huyền thoại” khi con người không thể giám sát và kiểm soát AI. Thời gian tiết kiệm được bằng cách giao việc cho các tác nhân phải được đo lường so với thời gian phải dành để sửa chữa lỗi của tác nhân.
“An toàn và năng lực không nhất thiết phải là những thứ riêng biệt”, một đồng tác giả khác, Mitchell của Hugging Face, đã đăng trên X (trước đây là Twitter) vào ngày 14/9. “An toàn chỉ làm mọi thứ chậm hơn khi nó được thêm vào, nằm ngoài công nghệ cốt lõi.”
Nguồn tin: IEEE Spectrum AI — Tác giả: David Berreby. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.