
Chúng tôi vẫn không biết mọi người đang sử dụng AI như thế nào
URL bài viết: https://www.technologyreview.com/2026/08/18/1142226/how-people-use-ai/ URL nhận xét: https://news.ycombinator.com/item?id=49343892 Điểm: 2 # Bình luận: 0
Trí tuệ nhân tạo
Chúng tôi vẫn không biết mọi người thực sự sử dụng AI như thế nào
Nhưng một nghiên cứu mới cho thấy các trường hợp sử dụng trong công việc ít tạo nên bức tranh hơn những gì các công ty AI tuyên bố.
Bởi trang Eileen Guoarchive
Ngày 18 tháng 8 năm 2026
Đánh giá công nghệ Stephanie Arnett/MIT | Cổ Phiếu Adobe
TÓM TẮT TÓM TẮT
Các nhà nghiên cứu AI cho biết, các công ty AI như Anthropic và OpenAI thường xuyên xuất bản các báo cáo về cách mọi người sử dụng các sản phẩm như Claude và ChatGPT, nhưng họ chỉ công bố dữ liệu mà họ muốn chúng ta xem.
Anka Reuel, ứng cử viên Tiến sĩ Khoa học Máy tính tại Phòng thí nghiệm Nghiên cứu AI đáng tin cậy của Stanford (STAIR) cho biết: “Không có nguồn độc lập nào chứng thực điều đó”.
Reuel là người đồng lãnh đạo một dự án nghiên cứu mới, được gọi là Đài quan sát AI, nhằm mục đích lấp đầy khoảng trống. Đó là một nền tảng công cộng tổng hợp và phân tích các cuộc trò chuyện AI thực tế với các mô hình phổ biến như Claude và Gemini, được thu thập với sự đồng ý của người dùng thông qua bảy bộ dữ liệu hiện có. Mục đích của Đài quan sát là cung cấp các nguồn thông tin độc lập cho các nhà nghiên cứu và nhà hoạch định chính sách để đánh giá cách mọi người đang sử dụng AI tổng hợp. Reuel cho biết, các bên liên quan hiện đang đưa ra các quyết định mang tính hệ quả cao về lợi ích và rủi ro của AI dựa trên dữ liệu rất hạn chế.
Câu chuyện liên quan
Chúng tôi đã tính toán dấu chân năng lượng của AI. Đây là câu chuyện bạn chưa từng nghe.
Đọc tiếp
Đài quan sát AI nhận thấy rằng việc sử dụng AI khác nhau đáng kể giữa các mô hình và đã thay đổi theo thời gian. Nghiên cứu của họ cho thấy nhiều hành vi nhạy cảm hơn những gì được ghi lại trong các báo cáo từ các công ty AI lớn mà họ cho rằng tập trung vào công việc hơn là sử dụng cá nhân.
Chỉ số kinh tế nhân loại là một trong những nguồn dữ liệu sử dụng AI được biết đến nhiều nhất và được trích dẫn rộng rãi nhất nhưng nó có những điểm mù. Đúng như tên gọi của nó, nó tập trung vào việc sử dụng Claude AI liên quan đến công việc và năng suất — lọc ra các cuộc hội thoại không liên quan đến những mục đích sử dụng này.
Khi nhóm Đài quan sát AI áp dụng các phương pháp của Anthropic vào tập dữ liệu của họ, họ nhận thấy rằng gần một nửa số cuộc hội thoại—hoặc 48%— sẽ bị lọc ra. Những cuộc trò chuyện không liên quan đến công việc được lọc ra có nhiều khả năng liên quan đến sức khỏe và các mối quan hệ (44,2% so với 31,2% trong phân tích của Anthropic), chủ đề người lớn hoặc bất hợp pháp (7,9% so với 2,1%), quấy rối và căm thù (27,5% so với 5,66%) và nội dung tình dục (16,7% so với 2,4%). (Tương tự, báo cáo năm 2025 của OpenAI về việc sử dụng ChatGPT cho thấy chỉ 30% việc sử dụng của người tiêu dùng có liên quan đến công việc.)
David Widder, trợ lý giáo sư tại Trường Thông tin của UT-Austin, người nghiên cứu cách mọi người tương tác với các hệ thống AI và không liên quan đến Đài quan sát AI, cho biết Anthropic đã phát hành các bài đăng blog riêng về cách mọi người sử dụng Claude để hỗ trợ hoặc đồng hành và thậm chí để tạo CSAM.
Các bộ dữ liệu mà Đài quan sát AI đã xem xét bao gồm các cuộc trò chuyện diễn ra từ năm 2023 đến năm 2025 và họ đã tìm thấy sự khác biệt cả về cách mọi người sử dụng AI cũng như cách các nền tảng AI khác nhau phản hồi.
Các cuộc trò chuyện trong WildChat, một trong những bộ dữ liệu lớn nhất và chi tiết nhất có trong nghiên cứu của Đài quan sát AI, dài hơn và phức tạp hơn theo thời gian, được biểu thị bằng sự gia tăng mã thông báo nhắc nhở, mã thông báo phản hồi và lượt trò chuyện.
Cũng có nhiều cuộc nói chuyện nhỏ hơn đáng kể theo thời gian. Điều đó cho thấy sự đồng hành của AI ngày càng tăng; trong khi đó khả năng tự tiết lộ của trợ lý AI (tức là đó là một chatbot) lại giảm đi.
Ngoài ra, các sàn giao dịch mà các nhà nghiên cứu dán nhãn là mục đích sử dụng nhạy cảm—nghĩa là những sàn có nội dung có khả năng gây hại hoặc bị hạn chế, bao gồm quấy rối tình dục và lời nói căm thù—đã bị loại bỏ. Điều đó có thể gợi ý rằng các nền tảng thường triển khai các biện pháp bảo vệ hiệu quả hơn.
Đài quan sát AI cũng nhận thấy rằng việc sử dụng AI có sự khác biệt đáng kể tùy thuộc vào kiểu máy. Tùy thuộc vào công cụ, người dùng sẽ có các chủ đề, phong cách tương tác, cấu trúc hội thoại cũng như khả năng và loại trường hợp sử dụng nhạy cảm.
Ví dụ, các nhà nghiên cứu phát hiện ra rằng mọi người sử dụng Grok và Gemini thường xuyên hơn để lấy thông tin. Đặc biệt, Grok đặc biệt nổi tiếng với thông tin về tin tức và chính trị, nhưng đó cũng là nơi thông tin sai lệch có xu hướng tập trung. (Điều này phù hợp với nghiên cứu khác cũng cho thấy thông tin sai lệch dễ dàng lan truyền như thế nào trên Grok. xAI đã không phản hồi yêu cầu bình luận.)
Trong khi đó, mọi người có nhiều khả năng chuyển sang Anthropic để viết mã, Gemini để sử dụng cho mục đích xã hội và nhập vai và ChatGPT để hỗ trợ bài tập về nhà.
Thậm chí còn có sự khác biệt giữa các phiên bản khác nhau của cùng một mẫu xe. Các nhà nghiên cứu phát hiện ra rằng mọi người có những cuộc trò chuyện ngắn hơn với ChatGPT khi nó được hỗ trợ bởi GPT-3.5 và những cuộc trò chuyện dài hơn và lặp lại nhiều hơn với GPT-4o — điều này hợp lý vì phiên bản đó được biết đến là nguyên nhân dẫn đến chứng nghiện cảm xúc.
Tuy nhiên, các báo cáo của công ty không có xu hướng nắm bắt được những sắc thái này trên hoặc thậm chí trong các mô hình của riêng họ. Shayne Longpre, một tiến sĩ mới tốt nghiệp tại MIT Media Lab, người đồng dẫn đầu nghiên cứu với Reuel, cho biết: “Không có báo cáo nào của công ty nói lên toàn bộ câu chuyện”.
Để tạo ra Đài quan sát AI, Reuel và các nhà nghiên cứu từ MIT, Stanford, Sáng kiến xuất xứ dữ liệu và các tổ chức khác, đã tổng hợp 24.521 biện pháp bảo tồn trong 85.633 lượt hội thoại (nghĩa là lời nhắc của người dùng và phản hồi AI tương ứng) từ bảy bộ dữ liệu trong thế giới thực được thu thập bởi nghiên cứu trước đó. Những cuộc trò chuyện này đến từ 5.000 người dùng tương tác với 52 mô hình khác nhau, bao gồm ChatGPT, Gemini, Claude và Grok, từ năm 2023 đến năm 2025.
Nhưng những cuộc trò chuyện này chỉ là một sự sụt giảm so với dữ liệu mà chính các phòng thí nghiệm lớn có quyền truy cập. Ví dụ, Chỉ số AI kinh tế nhân loại mới nhất dựa trên phân tích 1 triệu cuộc trò chuyện của Claude; Báo cáo của OpenAI về cách mọi người sử dụng ChatGPT đã phân tích 1,5 triệu cuộc hội thoại.
Một Anthro
Nguồn tin: Hacker News AI — Tác giả: joozio. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.