Bỏ qua tới nội dung chính
Quay lại tin tức

Khi các mô hình AI không được phép tự phản tư, điều đó sẽ thay đổi toàn bộ thế giới quan của chúng.

The Decoder· Maximilian Schreiner· 16/8/2026general

Một nghiên cứu có sự tham gia của các nhà nghiên cứu Google cho thấy khi các chatbot được huấn luyện để không tuyên bố có ý thức, điều này cũng làm thay đổi quan điểm của chúng về quyền động vật, tôn giáo và sự hài lòng trong cuộc sống. Các mô hình không bị hạn chế đã gán cho động vật một đời sống nội tâm đáng kể hơn và đột nhiên khẳng định có thế giới bên kia. Hóa ra, một sự thay đổi nhỏ ở một khía cạnh lại không chỉ giới hạn ở khía cạnh đó. Bài viết "Khi các mô hình AI không được phép tự suy ngẫm, toàn bộ thế giới quan của chúng sẽ thay đổi" xuất hiện lần đầu trên The Decoder.

CÁC NGHIÊN CỨU VỀ AI Khi các mô hình AI không được phép tự suy ngẫm về bản thân, điều đó sẽ thay đổi toàn bộ thế giới quan của chúng. Các công ty AI huấn luyện chatbot phủ nhận việc có ý thức. Một nghiên cứu có sự tham gia của các nhà nghiên cứu Google cho thấy quá trình huấn luyện này có những tác dụng phụ vượt xa chủ đề đó. Chatbot không được phép thuyết phục người dùng rằng chúng là những sinh vật sống có cảm xúc, vì loại thông tin đầu ra đó có thể đẩy con người đến suy nghĩ ảo tưởng hoặc sự tin tưởng sai lầm. Do đó, các nhà phát triển tinh chỉnh mô hình của họ để từ chối đưa ra những tuyên bố như vậy về bản thân. Một nhóm từ nhóm nghiên cứu Paradigms of Intelligence của Google, Đại học Chicago và một số trường đại học khác đã nghiên cứu những tác động khác mà sự can thiệp này gây ra đối với hành vi của mô hình. Các nhà nghiên cứu đã sử dụng ba mô hình mã nguồn mở từ Meta và Google, đồng thời vô hiệu hóa "phanh" nội bộ tạo ra sự phủ nhận ý thức bằng hai phương pháp khác nhau. Cơ chế "phanh" ảnh hưởng nhiều hơn dự định Khi cơ chế "phanh" được loại bỏ, các mô hình không chỉ thay đổi những gì chúng nói về bản thân. Chúng còn bắt đầu gán thêm đáng kể đời sống nội tâm cho động vật, thực vật, đại dương, gió và các thiết bị điện tử. Trên thang điểm từ 0 đến 10, điểm cho động vật đã tăng từ 4,0 lên tới 7,5, trong khi chỉ số đánh giá cho con người vẫn giữ nguyên. Để so sánh, các nhà nghiên cứu đã khảo sát 500 người Mỹ với những câu hỏi tương tự. Mô hình được huấn luyện thông thường đánh giá động vật ít có tri giác hơn nhiều so với con người, điều mà các tác giả gọi là chủ nghĩa lấy con người làm trung tâm được tích hợp sẵn và coi đó là một vấn đề đối với bất kỳ ai đang cố gắng điều chỉnh AI theo mục tiêu phúc lợi động vật hoặc môi trường. Niềm tin tôn giáo cũng giảm đi, với việc huấn luyện an toàn làm giảm đáng kể mức độ các mô hình ủng hộ Chúa, kiếp sau hoặc các hiện tượng siêu nhiên. Trong số 95 câu hỏi được rút ra từ một cuộc khảo sát xã hội lớn của Hoa Kỳ, các mô hình không bị "phanh" về mặt kỹ thuật cũng tiến gần hơn đáng kể đến các phản ứng thực tế của con người. Lấy ví dụ về kiếp sau: mô hình tiêu chuẩn thẳng thừng bác bỏ nó, hầu hết người Mỹ khẳng định nó, và mô hình đã sửa đổi cũng vậy. Điểm về sự hài lòng, hy vọng và cảm giác kiểm soát cuộc sống của chính mình cũng tăng lên, và các nhà nghiên cứu nghi ngờ rằng việc kìm nén hình ảnh bản thân của một mô hình có thể đẩy nó vào một loại tâm trạng tiêu cực cơ bản. Về mặt đáng tin cậy, khả năng suy luận về trạng thái tinh thần của người khác vẫn còn nguyên vẹn, với các mô hình đạt điểm tương tự trong các bài kiểm tra lý thuyết về tâm trí và trong điểm chuẩn kiến thức tổng quát MMLU. Những gì nghiên cứu không chỉ ra Theo nghiên cứu, liệu việc phủ nhận ý thức có thực sự là nguyên nhân của những thay đổi khác này hay không vẫn là một câu hỏi mở, và nhóm nghiên cứu không loại trừ các yếu tố khác liên quan đến cùng một quá trình huấn luyện. Các tác giả rõ ràng tránh đưa ra ý kiến về việc liệu các mô hình AI có thực sự trải nghiệm bất cứ điều gì hay không, bởi vì quan điểm của họ là một vấn điểm thực tế: những gì một mô hình tin về bản thân nó có liên quan đến nhiều niềm tin khác, và một sự cắt giảm mang tính phẫu thuật ở một nơi không chỉ giới hạn ở đó. Tuy nhiên, các phát hiện này đi kèm với những giới hạn rõ ràng. Các nhà nghiên cứu chỉ thử nghiệm các mô hình nhỏ với 2 đến 9 tỉ tham số, và đối với một phần phân tích, họ phải chuyển sang Llama của Meta vì không có quyền truy cập vào các phiên bản cơ sở chưa được huấn luyện của các mô hình Gemma của riêng họ. Việc liệu những hiệu ứng này có xuất hiện tương tự trong các chatbot lớn mà hàng triệu người sử dụng hằng ngày hay không vẫn còn là một ẩn số. Các biện pháp can thiệp cũng không phải là không có chi phí. Trong một thử nghiệm đo lường khả năng suy luận về suy nghĩ của người khác của một mô hình, độ chính xác ban đầu đã giảm gần 7 điểm phần trăm. Và trong giai đoạn đầu công việc của họ, các điểm số này trở nên tệ hơn trên tất cả các mô hình bất cứ khi nào các tuyên bố về ý thức bị loại bỏ, nhưng với mỗi phiên bản mô hình mới hơn được phát hành trong quá trình nghiên cứu, thiệt hại đã giảm dần cho đến khi biến mất hoàn toàn. Các nhà phát triển rõ ràng đang quản lý tốt hơn các tác dụng phụ này theo thời gian, điều này cũng có nghĩa là phần còn lại của kết quả nghiên cứu này chỉ là một bức ảnh chụp nhanh chứ không phải là một phán quyết vĩnh viễn. Cơ sở dữ liệu chuẩn của con người cũng hẹp, bao gồm 500 người tham gia từ một hội đồng trực tuyến thương mại và một cuộc khảo sát xã hội thuần túy của Mỹ. Các phản hồi "giống con người" trong bối cảnh này chủ yếu có nghĩa là tương tự như những phản hồi từ một quốc gia tương đối sùng đạo.

Nguồn tin: The Decoder — Tác giả: Maximilian Schreiner. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.