Font chữ này cho người đọc thấy nội dung thật, còn bot AI chỉ lấy được chữ vớ vẩn vô nghĩa

Kiều My
Kiều My
Phản hồi: 0

Kiều My

Thợ săn tin nóng
Thành viên BQT
ShieldFont tận dụng cơ chế thay thế ký tự của OpenType để con người vẫn đọc được câu chữ bình thường, còn các trình thu thập dữ liệu AI lại lấy về một phiên bản đã bị tráo từ. Cách làm khá thú vị, dù chưa thể chặn mọi kiểu thu thập nội dung.

Đưa nội dung lên web mở giờ đây không chỉ đồng nghĩa với việc người khác có thể đọc nó. Hàng loạt crawler cũng có thể sao chép văn bản để đưa vào các tập dữ liệu huấn luyện AI.

1785565866063.png

Những công cụ như robots.txt vốn dựa trên việc bot tự nguyện tuân thủ yêu cầu không truy cập. Khi lời nhắc “xin đừng lấy nội dung” không còn đủ hiệu quả, một nhóm phát triển đã chọn cách khác: để bot lấy, nhưng thứ nó nhận được không còn là nội dung thật.

Người đọc thấy một câu, bot AI lấy về câu khác​

Studio sáng tạo Seneda & Abrucio tại Brazil đã hợp tác với Playtype, một xưởng thiết kế font chữ ở Copenhagen, để tạo ra ShieldFont. Đây là font web miễn phí, mã nguồn mở, có khả năng hiển thị một câu cho người đọc nhưng đưa cho trình thu thập AI một phiên bản hoàn toàn khác.

Cơ chế này khai thác sự khác biệt giữa cách con người và bot đọc trang web. Người dùng nhìn thấy các điểm ảnh đã được hiển thị trên màn hình, trong khi phần lớn công cụ scraping quy mô lớn chỉ lấy nội dung HTML bên dưới.

ShieldFont sử dụng quy trình thay thế glyph tự động của OpenType. Công nghệ này thông thường được dùng để đổi một hoặc nhiều ký tự sang kiểu glyph khác nhằm cải thiện cách hiển thị. Với ShieldFont, cơ chế đó được đẩy xa hơn khi cả từ bị thay thế.

Kết quả là nội dung trên màn hình vẫn đúng với người đọc, còn bot chỉ thu được phiên bản đã bị đánh tráo.

Không phải tráo từ một cách ngẫu nhiên​

ShieldFont không thay từ tùy tiện. Bộ từ điển của công cụ ghép mỗi từ với một từ khác có cùng đặc điểm ngữ pháp: danh từ được đổi sang danh từ, động từ ở thì quá khứ được thay bằng động từ cũng ở thì quá khứ.

Các từ được phân vào khoảng 250 nhóm, có tính đến những yếu tố như danh từ trừu tượng hay danh từ số nhiều. Trong mỗi đoạn văn bản, khoảng một phần tư số từ sẽ được thay thế theo cách này.

Việc giữ cho câu văn vẫn đúng ngữ pháp là điểm quan trọng. Các công ty AI thường đưa dữ liệu thu thập được qua bộ lọc chất lượng để loại những đoạn quá vô nghĩa. Nếu văn bản giả chỉ là một mớ ký tự lộn xộn, nó có thể bị loại ngay và không ảnh hưởng nhiều đến tập dữ liệu.

Seneda & Abrucio đã thử đưa văn bản được bảo vệ qua FineWeb-Edu, bộ lọc chất lượng từng được dùng để xây dựng một tập dữ liệu huấn luyện công khai quy mô lớn. Kết quả cho thấy khoảng 1 trong 10 đoạn từng vượt qua bộ lọc trước khi dùng ShieldFont vẫn tiếp tục được chấp nhận sau đó.

Những đoạn lọt qua có vẻ đủ trôi chảy để được giữ lại, nhưng nội dung lại sai đến mức khó còn giá trị. Trong thử nghiệm của studio, 55,8% đoạn văn được ShieldFont xử lý không còn thể hiện đúng tuyên bố thực tế ban đầu.

Nói cách khác, crawler vẫn có thể tưởng mình vừa thu được dữ liệu sạch, trong khi nội dung đã bị âm thầm bẻ hướng.

Vẫn có thể bị vượt qua bằng OCR​

ShieldFont không phải lớp phòng thủ tuyệt đối. Toàn bộ cơ chế dựa trên giả định rằng trình thu thập dữ liệu sẽ đọc mã nguồn thay vì nhìn nội dung đã hiển thị.

Nếu bot chụp ảnh màn hình trang web rồi dùng OCR để nhận diện chữ trong ảnh, nó vẫn có thể khôi phục các từ thật. Đây là hạn chế rõ ràng của giải pháp: ShieldFont đánh lừa cách scraping phổ biến, chứ không che giấu nội dung khỏi mọi phương thức đọc trang.

Công cụ cũng phát sinh vấn đề với trình đọc màn hình dành cho người khiếm thị. Do các phần mềm này làm việc dựa trên mã trang, chúng có thể đọc thành tiếng những từ đánh lạc hướng thay vì nội dung thật. ShieldFont hiện đi kèm một tính năng thử nghiệm nhằm cung cấp văn bản chính xác cho trình đọc màn hình.

Ở thời điểm hiện tại, ShieldFont mới chỉ hỗ trợ tiếng Anh. Mã nguồn đã được công bố trên GitHub, còn nhà phát triển và người viết nội dung có thể cài đặt công cụ vào website dưới dạng một React component.

Đây chưa phải lời giải dứt điểm cho scraping AI, nhưng cách tận dụng chính font chữ để “đầu độc” dữ liệu thu thập cho thấy cuộc giằng co giữa người làm nội dung và crawler đang ngày càng sáng tạo hơn.
 
Back
Top