Derpy✔
Intern Writer
Trong kỷ nguyên mà nội dung do AI tạo ra đang tràn ngập internet, một nguồn tài nguyên quý giá bỗng trở nên khan hiếm: dữ liệu "sạch" được tạo ra bởi chính con người. Đây cũng là lý do khiến các ông lớn công nghệ đang ráo riết tìm kiếm, thậm chí là "hy sinh" những cuốn sách giấy truyền thống.
Mới đây, trang tin độc lập 404 MediaX đã tiết lộ một thông tin gây sốc: các công ty AI đang mua hàng loạt sách quý hiếm được xuất bản trước năm 2022. Mục đích của họ là sử dụng máy cắt thủy lực để loại bỏ gáy sách, sau đó quét từng trang một để thu thập dữ liệu "nguyên bản", chưa bị AI "ô nhiễm". Đáng nói hơn, để ngăn chặn dữ liệu này tái lưu hành, những cuốn sách sau khi quét thường bị nghiền nát và tiêu hủy. Theo báo cáo, Anthropic, một trong những công ty AI hàng đầu, đã từng tiêu hủy hàng triệu cuốn sách vật lý, bao gồm cả những cổ vật quý hiếm, có số lượng tồn tại cực kỳ ít ỏi.
Hoạt động này, được Anthropic gọi là "Kế hoạch Panama", thậm chí đã được tòa án liên bang Mỹ phán quyết là hợp pháp. Tòa án cho rằng việc "mua sách giấy hợp pháp rồi tiến hành quét phá hủy" thuộc phạm vi sử dụng hợp lý.

Ngay sau khi thông tin này được công bố, dư luận trên mạng xã hội đã dậy sóng. Tài khoản Hedgie trên nền tảng X (trước đây là Twitter) đã chia sẻ câu chuyện này và nhận được phản hồi từ Elon Musk. Ông chủ Tesla và SpaceX cho biết mình đã yêu cầu đội ngũ AI của SpaceX bảo quản tất cả sách quý trong thư viện và sử dụng phương pháp quét không phá hủy, tránh làm hỏng gáy sách. Hedgie cũng bày tỏ sự cảm kích, nhấn mạnh rằng dù phương pháp này có thể chậm hơn, nhưng vẫn đảm bảo thu thập được dữ liệu huấn luyện, và các công ty khác cũng nên noi gương SpaceX AI.
Dù bằng cách nào đi chăng nữa, rõ ràng sách đã trở thành một nguồn dữ liệu quan trọng bậc nhất cho việc huấn luyện AI. ISBNdb, một công ty chuyên cung cấp dịch vụ mua sách số lượng lớn, tự hào sở hữu "cơ sở dữ liệu sách lớn nhất thế giới" và gần đây đã chuyển mình thành "nhà cung cấp dữ liệu sách" cho các doanh nghiệp AI. Tờ Washington Post cũng tiết lộ Anthropic đã hợp tác với Better World Books, một nền tảng chuyên bán sách cũ từ thư viện, nhà bán lẻ và cá nhân.
Trong bối cảnh đó, các tập đoàn truyền thông và xuất bản lớn ở nước ngoài đang liên tục vướng vào các vụ kiện tụng pháp lý với các công ty AI.
Vào ngày 22 tháng 7, News Corp đã đệ đơn kiện ngược lên Tòa án Liên bang Oakland, California, cáo buộc công ty công cụ tìm kiếm Brave Software đã thu thập và bán lại trái phép một lượng lớn nội dung bài viết từ các phương tiện truyền thông thuộc sở hữu của họ như The Wall Street Journal và New York Post, để sử dụng cho việc huấn luyện mô hình AI.
Trước đó, vào ngày 14 tháng 7, một nhóm các nhà xuất bản lớn cũng đã kiện Google, cáo buộc công ty này sử dụng bất hợp pháp hàng triệu cuốn sách có bản quyền để xây dựng mô hình AI Gemini của mình, gọi đây là "một trong những hành vi vi phạm bản quyền nghiêm trọng nhất trong lịch sử". Nội bộ Google cũng từng cảnh báo rằng nếu sử dụng văn bản từ các nhà xuất bản cho Google Play Sách, công ty có thể phải đối mặt với khoản tiền phạt tiềm năng từ 10 tỷ đến 100 tỷ USD (tương đương khoảng 254,5 nghìn tỷ đến 2,545 triệu tỷ VNĐ).
Theo báo cáo nghiên cứu từ Chứng khoán CITIC, hoạt động số hóa tài sản trí tuệ văn hóa dự kiến sẽ mang lại khoảng 70 tỷ nhân dân tệ (tương đương khoảng 9,65 tỷ USD hoặc 245,7 nghìn tỷ VNĐ) không gian tăng trưởng cho ngành xuất bản vào năm 2026. Các mô hình ngôn ngữ lớn cần một lượng lớn dữ liệu chất lượng cao, và tài sản nội dung mà các doanh nghiệp xuất bản sở hữu có thể cung cấp nguồn tài liệu phong phú, chất lượng cho các mô hình này. Chứng khoán Zhongtai cũng nhận định rằng các công ty xuất bản có bản quyền nội dung rõ ràng và lợi thế về nội dung chuyên biệt, hứa hẹn sẽ vượt qua nhiều chu kỳ công nghệ như internet và AI, trở thành tài sản cốt lõi bền vững.
Mới đây, trang tin độc lập 404 MediaX đã tiết lộ một thông tin gây sốc: các công ty AI đang mua hàng loạt sách quý hiếm được xuất bản trước năm 2022. Mục đích của họ là sử dụng máy cắt thủy lực để loại bỏ gáy sách, sau đó quét từng trang một để thu thập dữ liệu "nguyên bản", chưa bị AI "ô nhiễm". Đáng nói hơn, để ngăn chặn dữ liệu này tái lưu hành, những cuốn sách sau khi quét thường bị nghiền nát và tiêu hủy. Theo báo cáo, Anthropic, một trong những công ty AI hàng đầu, đã từng tiêu hủy hàng triệu cuốn sách vật lý, bao gồm cả những cổ vật quý hiếm, có số lượng tồn tại cực kỳ ít ỏi.
Hoạt động này, được Anthropic gọi là "Kế hoạch Panama", thậm chí đã được tòa án liên bang Mỹ phán quyết là hợp pháp. Tòa án cho rằng việc "mua sách giấy hợp pháp rồi tiến hành quét phá hủy" thuộc phạm vi sử dụng hợp lý.

Ngay sau khi thông tin này được công bố, dư luận trên mạng xã hội đã dậy sóng. Tài khoản Hedgie trên nền tảng X (trước đây là Twitter) đã chia sẻ câu chuyện này và nhận được phản hồi từ Elon Musk. Ông chủ Tesla và SpaceX cho biết mình đã yêu cầu đội ngũ AI của SpaceX bảo quản tất cả sách quý trong thư viện và sử dụng phương pháp quét không phá hủy, tránh làm hỏng gáy sách. Hedgie cũng bày tỏ sự cảm kích, nhấn mạnh rằng dù phương pháp này có thể chậm hơn, nhưng vẫn đảm bảo thu thập được dữ liệu huấn luyện, và các công ty khác cũng nên noi gương SpaceX AI.
Dù bằng cách nào đi chăng nữa, rõ ràng sách đã trở thành một nguồn dữ liệu quan trọng bậc nhất cho việc huấn luyện AI. ISBNdb, một công ty chuyên cung cấp dịch vụ mua sách số lượng lớn, tự hào sở hữu "cơ sở dữ liệu sách lớn nhất thế giới" và gần đây đã chuyển mình thành "nhà cung cấp dữ liệu sách" cho các doanh nghiệp AI. Tờ Washington Post cũng tiết lộ Anthropic đã hợp tác với Better World Books, một nền tảng chuyên bán sách cũ từ thư viện, nhà bán lẻ và cá nhân.
Trong bối cảnh đó, các tập đoàn truyền thông và xuất bản lớn ở nước ngoài đang liên tục vướng vào các vụ kiện tụng pháp lý với các công ty AI.
Vào ngày 22 tháng 7, News Corp đã đệ đơn kiện ngược lên Tòa án Liên bang Oakland, California, cáo buộc công ty công cụ tìm kiếm Brave Software đã thu thập và bán lại trái phép một lượng lớn nội dung bài viết từ các phương tiện truyền thông thuộc sở hữu của họ như The Wall Street Journal và New York Post, để sử dụng cho việc huấn luyện mô hình AI.
Trước đó, vào ngày 14 tháng 7, một nhóm các nhà xuất bản lớn cũng đã kiện Google, cáo buộc công ty này sử dụng bất hợp pháp hàng triệu cuốn sách có bản quyền để xây dựng mô hình AI Gemini của mình, gọi đây là "một trong những hành vi vi phạm bản quyền nghiêm trọng nhất trong lịch sử". Nội bộ Google cũng từng cảnh báo rằng nếu sử dụng văn bản từ các nhà xuất bản cho Google Play Sách, công ty có thể phải đối mặt với khoản tiền phạt tiềm năng từ 10 tỷ đến 100 tỷ USD (tương đương khoảng 254,5 nghìn tỷ đến 2,545 triệu tỷ VNĐ).
Theo báo cáo nghiên cứu từ Chứng khoán CITIC, hoạt động số hóa tài sản trí tuệ văn hóa dự kiến sẽ mang lại khoảng 70 tỷ nhân dân tệ (tương đương khoảng 9,65 tỷ USD hoặc 245,7 nghìn tỷ VNĐ) không gian tăng trưởng cho ngành xuất bản vào năm 2026. Các mô hình ngôn ngữ lớn cần một lượng lớn dữ liệu chất lượng cao, và tài sản nội dung mà các doanh nghiệp xuất bản sở hữu có thể cung cấp nguồn tài liệu phong phú, chất lượng cho các mô hình này. Chứng khoán Zhongtai cũng nhận định rằng các công ty xuất bản có bản quyền nội dung rõ ràng và lợi thế về nội dung chuyên biệt, hứa hẹn sẽ vượt qua nhiều chu kỳ công nghệ như internet và AI, trở thành tài sản cốt lõi bền vững.