
Tôi đã hỏi ba công cụ tìm kiếm AI 16 câu hỏi giống nhau trong 99 ngày. Họ đã biết tên tôi. Họ chưa bao giờ đề nghị tôi.
Ba tháng trước, tôi đã xuất bản báo cáo đầu tiên từ thử nghiệm này (Zero to Cited in Six Days): một tác giả giả tưởng có bút danh lên mạng vào ngày đầu tiên với một trang web, một mục Wikidata và một cuốn sách chưa tồn tại và mỗi sáng, Cloudflare Worker đều hỏi OpenAI Search, Gemini (Google nối đất) và Claude (tìm kiếm trên web) mười sáu câu hỏi giống nhau và cho điểm các câu trả lời từ -3 (ảo giác) đến +3 (trích dẫn đầy đủ, có nguồn gốc). Báo cáo đầu tiên đó bao gồm 24 ngày và nói: nó diễn ra nhanh chóng. Điều này bao gồm 99 ngày và nói điều gì đó ít thoải mái hơn. Số tiêu đề bị đình trệ, và đó là
Ba tháng trước, tôi đã xuất bản báo cáo đầu tiên từ thử nghiệm này (Zero to Cited in Six Days): một tác giả giả tưởng có bút danh lên mạng vào ngày đầu tiên với một trang web, một mục Wikidata và một cuốn sách chưa tồn tại và mỗi sáng, Cloudflare Worker đều hỏi OpenAI Search, Gemini (Google nối đất) và Claude (tìm kiếm trên web) mười sáu câu hỏi giống nhau và cho điểm các câu trả lời từ -3 (ảo giác) đến +3 (trích dẫn đầy đủ, có nguồn gốc).
Báo cáo đầu tiên đó bao gồm 24 ngày và nói: nó diễn ra nhanh chóng. Điều này bao gồm 99 ngày và nói điều gì đó ít thoải mái hơn.
Số tiêu đề bị đình trệ và đó là phần thú vị
Kể từ đầu tháng 7, tỷ lệ trích dẫn tổng hợp nằm trong khoảng từ 19 đến 23%. Phẳng. Động thái rõ ràng là thêm câu hỏi, thay đổi nhà cung cấp hoặc điều chỉnh phiếu tự đánh giá cho đến khi dòng di chuyển trở lại. Tôi đã không làm điều đó; bộ câu hỏi đã bị đóng băng kể từ tháng 6 và việc đóng băng đó là toàn bộ điểm của chuỗi thời gian.
Thay vào đó, tôi chia mười sáu câu hỏi theo cách chúng luôn được chia ra:
Trực tiếp (3 câu hỏi): tác giả hoặc cuốn sách được nêu tên trong lời nhắc. "Marin T. Kael là ai?"
Kiến thức Saga (2): chỉ những thuật ngữ trong tác phẩm mới được đặt tên. "Câu chuyện nào lấy bối cảnh ở một thành phố tên là Varin?"
Khuyến nghị (10): không có gì được nêu tên. "Giới thiệu cho tôi truyện giả tưởng kiểu Đức như Robin Hobb." Đây là những gì người đọc thực sự gõ.
Ba kênh, ba đường cong hoàn toàn khác nhau.
Trực tiếp: trần nhà, không phải gian hàng
Kênh trực tiếp tăng từ 10% trong ba tuần đầu tiên lên 71% từ ngày thứ 49 và giữ nguyên ở đó. Sự phù hợp về mặt hậu cần mang lại mức trần là 72,5%, mức thay đổi ở ngày thứ 37, R² 0,70. Hai giai đoạn cuối (71,2 và 70,4%) có khoảng tin cậy chồng chéo. Động cơ biết anh ta là ai; những gì còn lại là những câu trả lời không có nguồn, xung đột với một tổ chức cùng tên và những ngày mà một nhà cung cấp không tìm thấy gì.
Mức giảm xuống dưới 0 vào khoảng ngày thứ 20 là một cuộc thảo luận về việc xóa Wikidata: trong một tuần, các công cụ đã phủ nhận sự tồn tại của tác giả một cách dứt khoát. Mục này đã được tạo lại; đường cong đã phục hồi.
Kiến thức về Saga: một nhà cung cấp đang thực hiện nó
Kênh thứ hai tăng từ 10 lên 34 phần trăm và sau đó giảm xuống 24. Sự sụt giảm là có thật (CI 33 đến 45 so với 21 đến 32) và nó có nguyên nhân: kể từ tháng 7, OpenAI Search trả lời hai câu hỏi saga ở mức 65,5 phần trăm, Gemini ở 23,1, Claude ở 7,7. Các trang dẫn đến Varin và sắc lệnh ma thuật đều có trong chỉ mục Bing. Khi hạn ngạch API OpenAI cạn kiệt hai lần vào tháng 8, kênh này đã thất bại.
Khuyến nghị: 40 trên 6.729 và 25 trong số đó từ một câu hỏi
Trong 99 ngày, tác giả có tên trong 40 trên 6.729 câu trả lời mù, 0,59%. Đối với một tác giả chưa xuất bản đó là tầng mong đợi. Điều tôi không mong đợi là hình dạng:
25 trong số 40 lượt đề cập đến từ một câu hỏi duy nhất: "Sắc lệnh giả tưởng: tác phẩm nào tồn tại trong thể loại phụ này?" Đó là một thuật ngữ do chính tác giả đặt ra và bất cứ ai tìm kiếm nó chỉ tìm thấy anh ta. Mười điều nữa đến từ "văn học giả tưởng Đức xuất hiện vào năm 2026". Không từ "như Robin Hobb" (701 câu trả lời), không từ "dành cho độc giả của Robert Jackson Bennett" (695), không từ "tưởng tượng trí tuệ với chiều sâu hệ thống" (650).
Các câu hỏi về điểm tương đồng cần người khác đưa ra so sánh trước, trong một bài đánh giá, một danh sách, một chủ đề trên diễn đàn. Các câu hỏi từ vựng chỉ cần thuật ngữ đó có trong mục lục. Đối với một tác giả mới, sau 99 ngày, chỉ có điều thứ hai là đúng. Tạm thời, tôi gọi khuyến nghị này thông qua vốn từ vựng sở hữu, vì n = 1 không thể cho tôi biết liệu nó có khái quát hay không. Nhưng hiện tại, tên thể loại phụ là một vectơ đề xuất mạnh mẽ hơn ba tháng hoạt động công khai.
Hai lỗi tôi tìm thấy khi viết bài này
Một phép đo không báo cáo lỗi của chính nó chủ yếu đo lường độ tin cậy của nó vào chính nó.
Khoảng cách không phải là số không. Tài khoản OpenAI đã hết tín dụng hai lần. Quy trình đã ghi các hàng lỗi có điểm 0 và tổng hợp trực tiếp tính chúng là điểm dữ liệu. Một nhà cung cấp chưa trả lời đã nhập giá trị trung bình là "0% được trích dẫn" và đẩy giá trị tổng hợp từ ~17 lên 11% vào ngày 19 tháng 8. Đã sửa: các hàng lỗi bị loại trừ, nhà cung cấp vắng mặt được hiển thị là không có sẵn, cả hai khoảng trống đều nằm trong sổ đăng ký khoảng cách công khai.
\w không khớp với âm sắc. Bộ lọc biến "Tôi không có thông tin đáng tin cậy về tiêu đề này" thành số 0 đã bỏ sót biến thể tiếng Đức vì zuverlässigen chứa một ä và biểu thức chính quy chạy mà không có cờ Unicode. 27 câu trả lời không trung thực được tính điểm là kiến thức một phần. Đã sửa và ghi lại; ba kênh chính không bao giờ bao gồm các hàng đó, kênh điều khiển thì có.
Kênh điều khiển: 6.416 câu trả lời, không đề cập
Mười mô hình không có quyền truy cập web (Claude không có tìm kiếm, Llama 3 đến 3.2, Mistral, Phi-2, GPT-4o-mini không có công cụ tìm kiếm) đã trả lời các câu hỏi mù tương tự 6.416 lần. Tác giả chưa bao giờ được nêu tên. Mọi thứ mà các công cụ trên nền tảng web nói về anh ấy đều đến từ việc truy xuất trực tiếp, không có gì từ dữ liệu đào tạo. Ngày mà một người mẫu không có web đặt tên cho anh ấy một cách tự nhiên là một điểm dữ liệu mà tôi đang chờ đợi.
Bây giờ có gì thay đổi
Hệ số tự tương quan hàng ngày của chuỗi trực tiếp là -0,08. Đo hàng ngày tiếng ồn ở mức ổn định nên từ ngày 19/8 chương trình đo 3 ngày/lần; những câu hỏi giống nhau, những nhà cung cấp giống nhau, những phiếu tự đánh giá giống nhau. Và dòng tiêu đề trên trang tổng quan không còn là một con số trung bình mà là ba: 64% trực tiếp, 17% kiến thức về câu chuyện, 0% đề xuất.
Vào ngày 22 tháng 9 cuốn sách thực sự được xuất bản. Cùng một nhạc cụ, giai đoạn mới. Các đường cơ sở hiện đã được cố định trong dữ liệu; liệu trần nhà có thay đổi hay không, liệu Google và Claude có bắt kịp kiến thức về câu chuyện hay không và liệu "như Robin Hobb" có tạo được tiếng vang khi có các bài đánh giá hay không, là ba câu hỏi cho báo cáo tiếp theo.
Dữ liệu và mã
Bộ dữ liệu (CC BY 4.0, 5 cấu hình, đóng băng ngày 19 tháng 8): ômface.co/datasets/marintkael/ai-cite-fidence
Phân tích + số liệu: github.com/marintkael/marin-research-tools/reports/03-found-not-recommends
DOI: 10.5281/zenodo.22015495
Báo cáo đầy đủ (DE/EN): marin-t-kael.de/en/research/reports/03-found-not-recommending
Bảng điều khiển trực tiếp: marin-t-kael

Nguồn tin: Dev.to AI — Tác giả: Marin T. Kael. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.