Trong những tuần gần đây, hai luồng quan điểm về an toàn AI đã nổi lên: hoặc rủi ro hiện sinh từ AI là có thật và sắp xảy ra, hoặc những tuyên bố của các nhà lãnh đạo AI và người tố giác về vấn đề này là không chân thành – một "chiến dịch tâm lý" (psyop), một hình thức cường điệu hóa hoặc một kiểu thâu tóm quy định méo mó.
Rất ít người xem xét khả năng thứ ba, đó là những cảnh báo về rủi ro hiện sinh là chân thành nhưng đơn giản là sai lầm và phản tác dụng đối với an toàn AI. Dường như mọi người đều mặc định rằng những người gióng lên hồi chuông cảnh báo là thiên tài, và câu hỏi duy nhất là liệu họ là loại thiên tài nhân từ hay độc ác.
Chúng tôi không tán thành quan điểm nào trong số đó.
Trong những tuần gần đây, hai quan điểm về an toàn AI đã xuất hiện: hoặc rủi ro hiện sinh từ AI là có thật và sắp xảy ra, hoặc những tuyên bố của các nhà lãnh đạo và người tố giác về AI theo hướng đó là không chân thành – một “chiến dịch tâm lý” (psyop), một sự thổi phồng, hoặc một hình thức kiểm soát quy định méo mó.
Ít người xem xét khả năng thứ ba, rằng các cảnh báo về rủi ro hiện sinh là chân thành nhưng đơn giản là sai lầm và phản tác dụng đối với an toàn AI. Dường như mọi người đều mặc định rằng những người gióng lên hồi chuông cảnh báo là thiên tài, và câu hỏi duy nhất là liệu họ là loại thiên tài nhân từ hay độc ác.
Chúng tôi không tán thành quan điểm nào trong số đó. Trong các bài viết của mình về an toàn AI, chúng tôi luôn cố gắng xem xét nghiêm túc các lập luận nhưng bác bỏ nhiều tuyên bố mà chúng tôi cho là không có cơ sở, đồng thời nhấn mạnh những lo ngại về an toàn mà chúng tôi cho là có thật. Bài viết này là sự tiếp nối của chương trình nghị sự đó.
Đúng là chúng ta thường xuyên đầu tư không đủ vào khả năng phục hồi trước các rủi ro thảm khốc và mang tính hệ thống.
Hãy bắt đầu bằng cách củng cố một phần các lập luận về an toàn AI và Chủ nghĩa Vị tha Hiệu quả (Effective Altruism – EA). Có điều gì đó sai lầm sâu sắc trên thế giới khi nói đến mức độ chúng ta đầu tư vào việc phòng thủ trước các rủi ro thảm khốc, và các cộng đồng an toàn AI và EA đã đúng về điều đó. Loại bỏ hoàn toàn siêu trí tuệ khỏi phương trình, vẫn đúng là các lập luận về rủi ro dựa trên bằng chứng đã được đưa ra trong nhiều năm nhưng không tạo ra phản ứng chính sách tương xứng.
Ví dụ nổi tiếng nhất là sự thất bại trong việc chuẩn bị cho các đại dịch. Chúng ta đã có nhiều năm cảnh báo và ước tính định lượng. Một báo cáo năm 2019 do WHO/Ngân hàng Thế giới triệu tập – trước COVID – đã bắt đầu bằng cách nói rằng có một “mối đe dọa rất thực tế... về một mầm bệnh đường hô hấp giết chết 50 đến 80 triệu người và xóa sổ gần 5% nền kinh tế thế giới”. Báo cáo ước tính chi phí chuẩn bị đầy đủ chỉ từ 1 đến 2 USD mỗi người mỗi năm đối với hầu hết các quốc gia.
Kể từ đại dịch H1N1 năm 2009, ít nhất 11 hội đồng và ủy ban cấp cao đã đưa ra các khuyến nghị cụ thể để cải thiện khả năng chuẩn bị ứng phó đại dịch toàn cầu, nhưng “phần lớn các khuyến nghị chưa bao giờ được thực hiện”. Đáng chú ý hơn, ngay cả sau COVID, chỉ một phần nhỏ nhu cầu được tài trợ. Hội đồng độc lập tương tự đã viết vào năm 2024 rằng “Có một sự hấp dẫn đầy hoài nghi trong việc cung cấp nguồn lực đáng kể và ngay lập tức trong một cuộc khủng hoảng, thay vì chủ động ngăn chặn nó. Tuy nhiên, lịch sử cho thấy điều này sẽ không kết thúc tốt đẹp”. Nguyên nhân gốc rễ dường như là cử tri thưởng cho việc chi tiêu vào cứu trợ, chứ không phải chuẩn bị.
Nói rõ hơn, sự thiếu chuẩn bị cho đại dịch hoàn toàn không phải là một nhận định độc đáo của Chủ nghĩa Vị tha Hiệu quả, chứ đừng nói đến an toàn AI. Nhưng EA xứng đáng được ghi nhận vì đã ủng hộ mục tiêu này. Cũng đúng là khuôn khổ đạo đức theo chủ nghĩa hệ quả của EA, tập trung vào các phép tính lợi ích kỳ vọng, rất hiệu quả trong việc tiết lộ và định lượng sự thiếu chuẩn bị của chúng ta. Khuôn khổ này rất gây tranh cãi, nhưng chúng tôi không nghĩ có điều gì sai với nó hoặc việc áp dụng nó vào các lĩnh vực như rủi ro sinh học. Tuy nhiên, chúng tôi hoàn toàn không đồng ý với việc mở rộng nó sang chủ nghĩa trường tồn (longtermism) và rủi ro hiện sinh từ AI. Chúng tôi cũng không đồng ý với xu hướng định hình lại các vấn đề như việc AI khuếch đại rủi ro sinh học thành các vấn đề “an toàn AI” cần được giải quyết thông qua các phương pháp như căn chỉnh (alignment). Quan điểm của chúng tôi là AI là một yếu tố khuếch đại các rủi ro hệ thống hiện có.
Vấn đề thiếu chuẩn bị cũng đúng với an ninh mạng – thực tế, nó còn tệ hơn. Không giống như đại dịch hay tài chính, không có
văn hóa mô hình hóa các rủi ro mang tính hệ thống hoặc thảm khốc trong cộng đồng an ninh mạng. Phương pháp tiếp cận kinh tế mà chúng tôi đã mô tả trong bài luận trước đây đã thành công trong việc giữ cho tổn thất dự kiến từ các cuộc tấn công hàng ngày ở mức có thể kiểm soát được, nhưng thị trường nổi tiếng là kém hiệu quả trong việc định giá phù hợp các rủi ro đuôi (tail risks) và các yếu tố ngoại sinh.
Các công ty bảo hiểm biết điều này. Lloyd's khá thẳng thắn khi tuyên bố rằng "tổn thất có khả năng vượt xa đáng kể khả năng hấp thụ của thị trường bảo hiểm", và không bảo hiểm chống lại các cuộc tấn công mạng nghiêm trọng do nhà nước hậu thuẫn (thông tin này từ năm 2022).
Một lần nữa, điều này ít liên quan đến các khả năng gần đây của AI. Năm năm trước, trước khi AI xuất hiện, khi giảng dạy môn an ninh thông tin bậc đại học tại Princeton, Arvind đã nhấn mạnh rằng các sự cố dây chuyền và rủi ro thảm khốc là có thể xảy ra, dẫn đến việc toàn bộ internet ngừng hoạt động trong một thời gian dài, với những hậu quả có khả năng làm thay đổi nền văn minh.1
(Nhìn lại các ghi chú của diễn giả trong các slide của mình, tôi nhớ rằng tôi đã xin lỗi vì đã trình bày nghiên cứu gốc trong một lớp học đại học lẽ ra chỉ nói về những kiến thức cơ bản, nhưng đã giải thích rằng điều này là do sự thiếu quan tâm gần như hoàn toàn đối với chủ đề quan trọng này trong cộng đồng an ninh đã không cho tôi lựa chọn nào khác. — AN.)
Nói cách khác, tuyên bố của Dario Amodei về việc các đàn tác nhân (agent swarms) có khả năng "chiếm đoạt toàn bộ internet", mặc dù được diễn đạt có phần cường điệu, nhưng không hoàn toàn nằm ngoài khả năng xảy ra, và ít nhất xứng đáng được nghiên cứu. Cộng đồng an ninh mạng có bộ kỹ năng phù hợp để làm điều đó, nhưng thật không may, họ dường như không thấy điều này đáng để suy nghĩ.
Cũng có những rủi ro mang tính hệ thống lan tỏa và dần dần hơn là thảm khốc. Hãy xem xét những gì chatbot đang làm đối với lưu lượng truy cập tin tức — tỷ lệ nhấp chuột (clickthrough rates) thấp hơn nhiều so với tìm kiếm truyền thống, đẩy nhanh sự suy giảm của báo chí truyền thống. Các tác động xã hội cấp độ hai của sự thay đổi này sẽ không rõ ràng trong một thời gian khá dài. Và đó chỉ là một trong hàng chục loại suy thoái thể chế âm ỉ. Atoosa Kasirzadeh đã giới thiệu khái niệm rủi ro tích lũy (accumulative risk) để mô tả sự xói mòn dần dần khả năng phục hồi của xã hội này.2 Ở đây, tâm lý không hành động ngược lại với trường hợp đại dịch: thay vì quá hiếm đến mức chúng ta có thể quên đi sự kiện đó, sự suy thoái quá phổ biến và dần dần đến mức chúng ta trở nên quen với nó.
Tóm lại, dựa hoàn toàn vào những điều đã được
Nguồn tin: AI Snake Oil — Tác giả: Arvind Narayanan. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.