Lizzie✔
Writer
Các tài liệu nội bộ mới được công khai trong vụ kiện bản quyền giữa The New York Times với OpenAI và Microsoft tiết lộ rằng một giám đốc Microsoft từng mô tả việc các mô hình AI thu thập khối lượng lớn nội dung trên Internet là "vụ trộm lao động lớn nhất trong lịch sử loài người".
Phát ngôn xuất hiện trong tài liệu năm 2023 của Brent Hecht, Giám đốc Khoa học Ứng dụng tại Microsoft. Ông cảnh báo hàng triệu người có thể coi việc các mô hình AI "hút" công sức của họ để huấn luyện là một hành vi chiếm dụng ở quy mô chưa từng có.
Thông tin được hé lộ khi The New York Times và các nhà xuất bản yêu cầu tòa án ra phán quyết tóm tắt trong vụ kiện chống lại OpenAI và Microsoft. Các nguyên đơn cáo buộc hai công ty sử dụng hàng triệu bài báo có bản quyền mà không được phép để huấn luyện các mô hình AI đứng sau những sản phẩm như ChatGPT và Copilot.
Một vấn đề khác được các tài liệu nội bộ đề cập là AI có thể làm suy yếu chính nguồn dữ liệu mà nó phụ thuộc. Hecht gọi đây là một "vòng luẩn quẩn": AI sử dụng nội dung do các nhà xuất bản và người sáng tạo sản xuất, nhưng sản phẩm AI sau đó lại có thể khiến người dùng không còn truy cập các nguồn gốc, làm giảm doanh thu và khả năng tiếp tục tạo ra nội dung mới.

Theo tài liệu được công bố, dữ liệu nội bộ của Microsoft từng cho thấy Copilot có thể làm tỷ lệ người dùng nhấp sang trang The New York Times giảm tới 93% so với tìm kiếm Bing trong một thử nghiệm. Một kỹ sư OpenAI cũng nhận xét nội bộ rằng dù liên kết nguồn được hiển thị nổi bật đến đâu, người dùng vẫn có thể không nhấp vào chúng.
Lo ngại tương tự từng xuất hiện bên trong OpenAI. Nick Turley, người đứng đầu ChatGPT, viết trong một trao đổi nội bộ năm 2023 rằng AI có thể tạo ra "mối đe dọa hiện hữu" đối với các nhà xuất bản vì chatbot ngày càng có khả năng thay thế việc người dùng trực tiếp truy cập nguồn tin.
Các hồ sơ tòa án còn chứa cáo buộc rằng nhân viên OpenAI từng thảo luận cách truy cập nội dung phía sau tường phí của The New York Times. Đây là một trong những vấn đề mà phía các nhà xuất bản sử dụng để củng cố lập luận rằng nội dung của họ đã bị khai thác trái phép.
Microsoft và OpenAI bác bỏ lập luận rằng hoạt động huấn luyện AI của họ vi phạm bản quyền. Hai công ty cho rằng việc sử dụng nội dung để huấn luyện mô hình mang tính biến đổi và được bảo vệ bởi nguyên tắc "fair use" của luật bản quyền Mỹ. Microsoft cũng nhấn mạnh những nhận xét của Brent Hecht là quan điểm cá nhân và không đại diện cho lập trường của công ty.
Vụ kiện vì thế đang đặt ra một câu hỏi có ảnh hưởng lớn tới toàn ngành AI: các công ty có được phép sử dụng khối lượng khổng lồ tác phẩm do con người tạo ra để huấn luyện AI mà không trả tiền cho chủ sở hữu hay không, đặc biệt khi chính AI sau đó có thể trở thành sản phẩm thay thế nguồn nội dung ban đầu? Câu trả lời cuối cùng vẫn phụ thuộc vào phán quyết của tòa án.
Phát ngôn xuất hiện trong tài liệu năm 2023 của Brent Hecht, Giám đốc Khoa học Ứng dụng tại Microsoft. Ông cảnh báo hàng triệu người có thể coi việc các mô hình AI "hút" công sức của họ để huấn luyện là một hành vi chiếm dụng ở quy mô chưa từng có.
Thông tin được hé lộ khi The New York Times và các nhà xuất bản yêu cầu tòa án ra phán quyết tóm tắt trong vụ kiện chống lại OpenAI và Microsoft. Các nguyên đơn cáo buộc hai công ty sử dụng hàng triệu bài báo có bản quyền mà không được phép để huấn luyện các mô hình AI đứng sau những sản phẩm như ChatGPT và Copilot.
Một vấn đề khác được các tài liệu nội bộ đề cập là AI có thể làm suy yếu chính nguồn dữ liệu mà nó phụ thuộc. Hecht gọi đây là một "vòng luẩn quẩn": AI sử dụng nội dung do các nhà xuất bản và người sáng tạo sản xuất, nhưng sản phẩm AI sau đó lại có thể khiến người dùng không còn truy cập các nguồn gốc, làm giảm doanh thu và khả năng tiếp tục tạo ra nội dung mới.

Theo tài liệu được công bố, dữ liệu nội bộ của Microsoft từng cho thấy Copilot có thể làm tỷ lệ người dùng nhấp sang trang The New York Times giảm tới 93% so với tìm kiếm Bing trong một thử nghiệm. Một kỹ sư OpenAI cũng nhận xét nội bộ rằng dù liên kết nguồn được hiển thị nổi bật đến đâu, người dùng vẫn có thể không nhấp vào chúng.
Lo ngại tương tự từng xuất hiện bên trong OpenAI. Nick Turley, người đứng đầu ChatGPT, viết trong một trao đổi nội bộ năm 2023 rằng AI có thể tạo ra "mối đe dọa hiện hữu" đối với các nhà xuất bản vì chatbot ngày càng có khả năng thay thế việc người dùng trực tiếp truy cập nguồn tin.
Các hồ sơ tòa án còn chứa cáo buộc rằng nhân viên OpenAI từng thảo luận cách truy cập nội dung phía sau tường phí của The New York Times. Đây là một trong những vấn đề mà phía các nhà xuất bản sử dụng để củng cố lập luận rằng nội dung của họ đã bị khai thác trái phép.
Microsoft và OpenAI bác bỏ lập luận rằng hoạt động huấn luyện AI của họ vi phạm bản quyền. Hai công ty cho rằng việc sử dụng nội dung để huấn luyện mô hình mang tính biến đổi và được bảo vệ bởi nguyên tắc "fair use" của luật bản quyền Mỹ. Microsoft cũng nhấn mạnh những nhận xét của Brent Hecht là quan điểm cá nhân và không đại diện cho lập trường của công ty.
Vụ kiện vì thế đang đặt ra một câu hỏi có ảnh hưởng lớn tới toàn ngành AI: các công ty có được phép sử dụng khối lượng khổng lồ tác phẩm do con người tạo ra để huấn luyện AI mà không trả tiền cho chủ sở hữu hay không, đặc biệt khi chính AI sau đó có thể trở thành sản phẩm thay thế nguồn nội dung ban đầu? Câu trả lời cuối cùng vẫn phụ thuộc vào phán quyết của tòa án.