
ShieldFont: Chống lại các công cụ quét AI bỏ qua tệp Robots.txt
URL bài viết: https://hackaday.com/2026/08/14/shieldfont-bludgeoning-ai-scrapers-that-disrespect-robots-txt/ URL bình luận: https://news.ycombinator.com/item?id=49306375 Điểm: 1 Số bình luận: 0
ShieldFont: Đánh bại các công cụ thu thập dữ liệu AI coi thường Robots.txt
37 Bình luận
bởi:
Maya Posch
Ngày 14 tháng 8 năm 2026
Trong những ngày đầu của World Wide Web, người dùng có thể đơn giản đặt một tệp robots.txt vào thư mục gốc của trang web để các bot lập chỉ mục của công cụ tìm kiếm và các công cụ tương tự tham khảo ý muốn lập chỉ mục của chủ sở hữu trang. Tuy nhiên, trong thế giới mới của việc lập chỉ mục dữ liệu huấn luyện LLM, những quy tắc này hiếm khi được tôn trọng, buộc các chủ sở hữu trang web phải tìm đến những cách phức tạp hơn để chống lại các công cụ thu thập dữ liệu AI, với ShieldFont là một trong những phương pháp gần đây nhất.
Cơ chế hoạt động cơ bản của ShieldFont được trình bày chi tiết trong sách trắng, giải thích việc sử dụng các chữ ghép (ligature). Các chữ ghép này thường được dùng để nối nhiều ký tự hoặc chữ cái thành một ký tự đơn lẻ được hiển thị trong văn bản cuối cùng. Bằng cách thay thế khoảng một phần tư số từ trong văn bản bằng các phiên bản dựa trên chữ ghép một cách thông minh, dựa trên từ điển, phiên bản HTML – thường được công cụ thu thập dữ liệu phân tích – sẽ đọc thành văn bản hợp lệ về ngữ pháp nhưng vô nghĩa, trong khi phiên bản phông chữ được hiển thị sẽ trông bình thường.
Đương nhiên, phương pháp này có một số nhược điểm, chẳng hạn như các trình đọc màn hình dành cho người khiếm thị cũng cần sử dụng phiên bản phông chữ được hiển thị, và nó cũng có hiệu quả tương tự đối với các bot lập chỉ mục công cụ tìm kiếm hợp pháp. Tuy nhiên, nếu áp dụng phương pháp này cho nội dung tĩnh, nội dung đã lưu trữ hoặc nội dung được đánh dấu là "không theo dõi" (do not follow) trong tệp robots.txt, thì đây có thể là một cách để khiến ChatGPT và các công cụ tương tự tạo ra những kết quả thực sự hài hước trong tương lai, khi sự mới lạ của keo gỗ trên pizza và ăn đá đã phần nào giảm bớt.
Mặc dù các công cụ thu thập dữ liệu LLM có thể thích nghi bằng cách phân tích cả văn bản được hiển thị, điều này làm cho nỗ lực thu thập dữ liệu trở nên tốn kém hơn đáng kể. Cùng với các bẫy mê cung như Nepenthes và các giải pháp của Cloudflare nhằm giữ cho các công cụ thu thập dữ liệu này bận rộn thu thập nội dung được tạo động thông qua các trang liên kết vô hạn, các công cụ có sẵn để chống lại mối đe dọa từ các công cụ thu thập dữ liệu này vẫn tiếp tục phát triển.
Đăng trong Trí tuệ nhân tạo, Phát triển phần mềm
Được gắn thẻ Cloudflare, web scraping




Nguồn tin: Hacker News AI — Tác giả: anonymousiam. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.