Ahead of AI· Sebastian Raschka, PhD· 15/8/2026models
Substack gần đây đã ra mắt tính năng phát hiện AI trong giao diện người dùng, điều này rất thú vị.
Ngoài ra, nhiều người đã hỏi về các dự án LLM tự làm (do-it-yourself) thú vị ở địa phương như các bản demo để minh họa khả năng của các mô hình ngôn ngữ nhỏ (SLM).
Kết hợp hai ý tưởng này, tôi nghĩ sẽ rất thú vị khi trình bày cách triển khai một công cụ phát hiện AI. Tôi cũng sẽ sử dụng nó như một bộ xác minh để huấn luyện một mô hình ngôn ngữ nhỏ tạo ra văn bản tránh bị phát hiện. Đây là một dự án giáo dục nhỏ nhằm nghiên cứu những hạn chế của các công cụ phát hiện AI và khám phá một ứng dụng LLM dựa trên bộ xác minh vượt ra ngoài các quy định.
Substack gần đây đã ra mắt tính năng phát hiện AI trong giao diện người dùng, đây là một điểm rất thú vị.
Ngoài ra, nhiều người đã hỏi về các dự án LLM tự làm (do-it-yourself) thú vị tại địa phương như các bản demo để minh họa khả năng của các mô hình ngôn ngữ nhỏ (SLM).
Kết hợp hai điều này, tôi nghĩ sẽ rất thú vị khi trình bày cách triển khai một công cụ phát hiện AI. Tôi cũng sẽ sử dụng nó như một công cụ xác minh để huấn luyện một mô hình ngôn ngữ nhỏ tạo ra văn bản tránh bị phát hiện. Đây là một dự án giáo dục nhỏ nhằm nghiên cứu các giới hạn của công cụ phát hiện AI và khám phá một ứng dụng LLM dựa trên công cụ xác minh, vượt ra ngoài các mô hình suy luận thông thường được huấn luyện về toán học và mã.
Hình 1: Substack hiện có tính năng phát hiện AI tích hợp.
Vì vậy, như đã đề cập ở trên, mục tiêu của hướng dẫn này là giải thích cách các công cụ phát hiện AI hoạt động bằng cách xây dựng một công cụ (đơn giản) như vậy.
Trong thực tế, một công cụ phát hiện như vậy có thể được sử dụng để lọc nội dung spam, nhưng cũng có thể cải thiện khả năng viết cá nhân mà không biến nó thành văn bản do AI tạo ra. Ví dụ, nếu bạn đã viết một bài báo dài và muốn cải thiện chính tả và ngữ pháp, việc sử dụng một công cụ kiểm tra ngữ pháp để trau chuốt và cải thiện khả năng đọc là điều hấp dẫn (và thực sự hữu ích). Có nhiều dịch vụ khác nhau cho việc này, bao gồm các LLM đa năng như ChatGPT. Tuy nhiên, điều này cũng tiềm ẩn rủi ro là các công cụ này biến bài viết của bạn, mặc dù vẫn là bài viết của chính bạn, thành một thứ gì đó được trau chuốt quá mức và giờ đây nghe giống AI, bị gắn cờ là nội dung spam.
Ví dụ, với một công cụ kiểm tra AI, người ta có thể nói: "Sửa ngữ pháp của tôi đồng thời đảm bảo rằng văn bản của tôi vẫn đạt 0% do AI tạo ra."
Dù sao, trong khi chúng ta đang xây dựng một công cụ kiểm tra đầy đủ chức năng ở đây, mục tiêu là giải thích 1) cách các công cụ kiểm tra AI (có thể) hoạt động và 2) sử dụng điều này làm nghiên cứu điển hình cho một chủ đề tổng quát hơn về cách xây dựng một công cụ chấm điểm hoặc xác minh có thể được sử dụng với LLM.
Tuyên bố miễn trừ trách nhiệm: Các công cụ kiểm tra AI về cơ bản là một trò chơi mèo vờn chuột. Các công cụ kiểm tra AI có thể học cách phát hiện một mẫu nhất định cho thấy nội dung do AI tạo ra. Sau đó, LLM tiếp theo có thể vô tình hoặc cố ý không thể hiện mẫu đó và tránh bị phát hiện. Công cụ kiểm tra AI sau đó phải được cập nhật để phát hiện LLM đó, và cứ thế tiếp diễn. Ngoài ra, cũng có khả năng gặp phải các trường hợp dương tính giả (văn bản do con người viết bị gắn cờ là do AI tạo ra), nhưng sẽ nói thêm về điều đó sau.
Mục tiêu dự án
Dự án này có một số mục tiêu. Mục tiêu bao trùm là, tất nhiên, minh họa cách các công cụ phát hiện AI hoạt động và trình bày một dự án LLM đầu cuối ứng dụng bao gồm đánh giá, huấn luyện và triển khai cục bộ để sử dụng trong thế giới thực.
Kết quả của dự án này là một API phát hiện AI có thể được sử dụng bởi con người và tác nhân, cùng với giao diện người dùng thân thiện.
Hình 2: Bản xem trước giao diện trình duyệt cục bộ được phát triển sau này trong dự án. Nó trả về điểm AI của toàn bộ văn bản và cũng có thể làm nổi bật điểm cho từng đoạn văn bản riêng lẻ.
Tổng quan về phương pháp
Tại đây, chúng tôi sẽ phát triển một phương pháp tương tự các mô hình Pangram, vốn là nền tảng của tính năng phát hiện AI của Substack.
Tôi đã viết một bài báo ngắn về phát hiện văn bản AI vào năm 2023: "Các phương pháp khác nhau để phát hiện nội dung do LLM như ChatGPT tạo ra là gì? Và chúng hoạt động và khác biệt như thế nào?"
Về cơ bản, có nhiều cách khác nhau để phát hiện văn bản do AI viết, từ các bộ phân loại có giám sát và kiểm tra xác suất dựa trên nhiễu loạn đến các phép đo độ phức tạp và kỹ thuật thủy vân (watermarking).
Trong hướng dẫn này, chúng tôi sẽ xây dựng một mô hình trả về điểm số từ 0-100. Đây về cơ bản là một bộ phân loại với điểm xác suất ước tính. Điểm xác suất sẽ cho biết khả năng một văn bản được tạo bởi AI theo bộ phân loại. (Hoặc, chính xác hơn, điểm số là xác suất ước tính của bộ phân loại cho lớp được tạo bởi AI dựa trên phân phối huấn luyện của nó. Tuy nhiên, chúng ta không nên diễn giải nó như một xác suất chung rằng văn bản được viết bởi AI.)
Để thực hiện điều này, chúng tôi sẽ tinh chỉnh một bộ phân loại DistilBERT (tương tự như những gì tôi đã mô tả trong một trong những bài viết đầu tiên của mình trên Substack, "Tinh chỉnh các mô hình ngôn ngữ lớn"), nhưng chi tiết hơn sẽ được trình bày sau khi chúng ta đến giai đoạn đó.
Nguồn tin: Ahead of AI — Tác giả: Sebastian Raschka, PhD. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.