Bỏ qua tới nội dung chính
Quay lại tin tức

Đây có phải là nội dung kém chất lượng? Phát hiện nội dung do AI tạo ra mà không cần mô hình

Towards Data Science· Sam Black· 5/8/2026general

Các dấu hiệu được nghiên cứu chứng minh để phát hiện văn bản do LLM tạo ra cùng với cơ sở toán học giải thích "tại sao". Bài viết Is This Slop? Detecting AI-Generated Content Without a Model xuất hiện lần đầu trên Towards Data Science.

Các mô hình ngôn ngữ lớn Đây có phải là nội dung kém chất lượng? Phát hiện nội dung do AI tạo ra mà không cần mô hình Các dấu hiệu được nghiên cứu chứng minh để phát hiện văn bản do LLM tạo ra cùng với trực giác toán học về "lý do" Sam Black Ngày 5/8/2026 16 phút đọc Chia sẻ Hình ảnh được tạo bởi ChatGPT Vì vậy, bạn nghĩ rằng mình là một chuyên gia trong việc phát hiện nội dung LLM. Bạn lướt Reddit, khao khát cơ hội để "đánh" những tác giả mà bạn nghi ngờ là AI. Thực tế, bạn không phải vậy, và nghiên cứu đã chứng minh điều đó. Gần đây, tôi đã bị cấm vĩnh viễn khỏi một subreddit không tên vì đăng một bài báo. Các kiểm duyệt viên đã gắn cờ nó là nội dung do AI tạo ra và tôi đã bị cấm ngay lập tức. Điều mà các kiểm duyệt viên đã không nhận thấy là ngày tạo bài báo: Hai năm trước khi ChatGPT được công chúng biết đến. Đây không phải là nội dung kém chất lượng — Đó là bài viết của tôi. Độ chính xác thấp, độ bao phủ cao Vấn đề với phản ứng dữ dội hiện tại đối với nội dung do LLM tạo ra là các công cụ tự động để phát hiện AI thường có độ chính xác thấp và độ bao phủ cao: phân loại mọi thứ là do AI viết để đạt được số lượng "bắt lỗi" tối đa. Để minh họa, đây là một đoạn văn của tôi (trước thời kỳ chatbot): Mỗi ý tưởng sẽ cần được ưu tiên dựa trên hai yếu tố đã đề cập, dễ thực hiện và khả năng thành công. Thật không may, không có cách dễ dàng để xác định mức độ dễ thực hiện hoặc khả năng, vì mỗi nhà nghiên cứu và nhóm đều khác nhau. Một số cân nhắc: - Phương pháp hoặc ý tưởng này phức tạp đến mức nào? - Phương pháp này có cho thấy thành công ở một lĩnh vực khác không? - Tôi/chúng ta có chuyên môn trong việc áp dụng phương pháp này không? Vào cuối quá trình ưu tiên của bạn, bạn sẽ có những ý tưởng có khả năng cho thấy kết quả cao nhất, tiếp theo là mức độ dễ thực hiện. Nếu bạn tạo một điểm số cho điều này (để sắp xếp), nó sẽ được ưu tiên hơn về khả năng thành công so với mức độ dễ thực hiện. Đây là báo cáo liên quan từ một công cụ phát hiện AI phổ biến. Rõ ràng, tôi đã tạo ra nội dung kém chất lượng trước khi nội dung kém chất lượng trở thành một xu hướng. Phân tích chuyên sâu đã chứng minh rằng tôi là một LLM. Hình ảnh của Tác giả Điều này không có nghĩa là các dấu hiệu hoặc mô hình là vô dụng. Mục tiêu ở đây không nên, và có lẽ sẽ không bao giờ là, sự chắc chắn. Nhưng, được trang bị thêm thông tin, bạn có thể chuyển từ một phỏng đoán ngẫu nhiên sang một kết quả tốt hơn một chút so với tung đồng xu. Trong bài viết này, tôi đề cập đến nghiên cứu làm nổi bật các mẫu đặc trưng của nội dung do LLM tạo ra, bao gồm: Dấu hiệu từ vựng Dấu hiệu về hùng biện và cấu trúc câu Dấu hiệu về dấu câu Tại sao ngay cả những độc giả tự tin cũng mắc lỗi Cách các mô hình ngôn ngữ phát triển những dấu hiệu này (toán học) Sau khi đọc, bạn sẽ được trang bị tốt hơn để phát hiện nội dung kém chất lượng trong thực tế, cùng với trực giác toán học đằng sau lý do tồn tại của những mẫu này. Dấu hiệu từ vựng "Delve" (đi sâu vào) Nó không phải lúc nào cũng đáng ngờ. Đó là một từ hơi trang trọng xuất hiện thỉnh thoảng. Khi ChatGPT ra đời, nó bùng nổ. Bây giờ, mọi người đều "delve" vào một cái gì đó. Có một số nghiên cứu thú vị đằng sau cái gọi là "từ vựng dư thừa". Những từ hiếm khi xuất hiện trong văn bản của con người nhưng thường xuyên xuất hiện trong nội dung do AI tạo ra. Trong "Delving into ChatGPT usage in academic writing through excess vocabulary" của Kobak và cộng sự, các nhà nghiên cứu đã xem xét khoảng 15 triệu tóm tắt PubMed từ năm 2010–2024, và chứng minh rằng sự xuất hiện của LLM đã dẫn đến sự gia tăng đột ngột của "một số từ phong cách nhất định". Khi chạy trên các bản tóm tắt khoa học, các nhà nghiên cứu nhận thấy từ "delves" (đi sâu vào) có sự gia tăng đáng kể trong hai năm sau khi ChatGPT ra mắt, cùng với sự tăng lên của các từ "intricate" (phức tạp) và "meticulous" (tỉ mỉ). Hình ảnh từ Kobak, D., González-Márquez, R., Horvát, E.-Á., & Lause, J. (2024). Delving into ChatGPT usage in academic writing through excess vocabulary. arXiv:2406.07016. Được cấp phép theo CC BY-SA 4.0. https://creativecommons.org/licenses/by/4.0/ Chúng ta không chỉ bắt đầu "đi sâu vào". Các mô hình ngôn ngữ lớn (LLM) đã bắt đầu "đi sâu vào" thay cho chúng ta. Các nhà nghiên cứu đã thực hiện một phiên bản khác của cùng một thử nghiệm. Trong bài "Why Does ChatGPT ‘Delve’ So Much? Exploring the Sources of Lexical Overrepresentation in Large Language Models" của Juzek và Ward, các nhà nghiên cứu đã xác định "từ trọng tâm" bằng cách so sánh hai tập dữ liệu. Tập dữ liệu thứ nhất là các bản tóm tắt trên PubMed được viết từ năm 2020-2024. Tập dữ liệu thứ hai được tạo ra bằng cách yêu cầu ChatGPT viết lại cùng một tập hợp các bản tóm tắt. Các từ giống hệt nhau cho thấy sự gia tăng đột ngột trong việc sử dụng ở cả hai tập dữ liệu, cho thấy rằng các mẫu này là kết quả của việc sử dụng ChatGPT. Điều này cho thấy: Các LLM ưa thích một số từ nhất định. Điều này rất có thể là kết quả của sở thích của con người trong quá trình hậu huấn luyện LLM. "Ồ, 'delve' nghe hay đấy, tôi thích câu trả lời này hơn." Các xác suất mã thông báo (token probabilities) này khác với xác suất sử dụng của con người theo những cách có thể đo lường được. Việc nhận thấy chúng có thể là một chỉ số hữu ích về việc sử dụng LLM. Tóm tắt: Các từ cần chú ý Khi đứng riêng lẻ, không đáng lo ngại, nhưng khi kết hợp hoặc xuất hiện thường xuyên, chắc chắn là một dấu hiệu cảnh báo. delve (đi sâu vào), boast (tự hào), intricate (phức tạp), tapestry (tấm thảm), realm (lĩnh vực), showcase (trưng bày), pivotal (then chốt), underscore (nhấn mạnh), meticulous (tỉ mỉ), leverage (tận dụng), robust (mạnh mẽ), seamless (liền mạch), testament (minh chứng), comprehensive (toàn diện), multifaceted (đa diện), navigate (điều hướng), notably (đáng chú ý), interplay (tương tác) Ưu tiên tên riêng Cũng có một số nghiên cứu nhấn mạnh sự ưu tiên đối với tên riêng, đặc biệt liên quan đến các tên xuất hiện cùng nhau. Trong bài "The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing", Michał Brzozowski và Neo Christopher Chung đã phát hiện ra rằng các mô hình phát triển "ưu tiên tên riêng", liên tục tạo ra cùng một danh tính hư cấu. Những danh tính hư cấu này được trích dẫn là đồng tác giả trong các bài nghiên cứu được viết bởi AI có mã định danh đối tượng số (DOI) thực, cùng với các nội dung do AI tạo ra khác, như mẫu trang web. Các tác giả lập luận rằng các cặp tên này có thể hoạt động như chữ ký cho mô hình cơ bản. Đội ngũ Slop Dream. Chuyển thể từ Brzozowski, M., & Chung, N. C. (2026), The Ghost Couple: Correl

Nguồn tin: Towards Data Science — Tác giả: Sam Black. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.