AI huấn luyện dữ liệu sách: khi sách bị biến thành nhiên liệu ẩn danh
AI huấn luyện dữ liệu sách là việc các hệ thống trí tuệ nhân tạo thu thập, số hóa và phân tích nội dung từ sách in – thường thông qua quét sách AI hàng loạt – để cải thiện khả năng hiểu ngôn ngữ, tạo văn bản và trả lời câu hỏi, nhưng quá trình này ngày càng bị nghi ngờ vì thiếu minh bạch, không có sự đồng ý của tác giả và đe dọa nghiêm trọng tới vấn đề bản quyền AI lẫn đạo đức dữ liệu AI. Những năm gần đây, nhiều người bán sách cũ nhận ra các đơn đặt hàng số lượng lớn, hỗn tạp về chủ đề, khiến họ nghi ngờ đây là một chiến dịch thu gom dữ liệu có tổ chức cho các hệ thống AI, chứ không phải hoạt động kinh doanh sách thông thường.
AirTag và bí mật ở kho Las Vegas: bằng chứng cho hệ thống quét sách AI
Một AirTag giấu trong một cuốn sách hiếm đã biến hoài nghi thành bằng chứng: thiết bị này dẫn thẳng tới một cơ sở tại Las Vegas, nơi nhân viên tháo gáy và quét từng trang sách rồi hủy bản in sau khi số hóa, phục vụ cho huấn luyện AI. Điều này đi ngược với tuyên bố trước đó rằng sách không bị phá hủy khi quét. Người bán sách tham gia thử nghiệm chỉ ra xu hướng các đơn hàng khoảng nghìn cuốn, không liên quan nội dung và khó có khả năng để bán lại, củng cố nhận định đây là chuỗi thu thập dữ liệu có chủ đích. Việc quét ISBN trước rồi mới quét nội dung cho phép hệ thống lập danh mục chính xác những đầu sách đã được xử lý, mở đường cho việc “lấp đầy” khoảng trống dữ liệu một cách có hệ thống.
Tại sao là sách cũ trước 2022? Nỗi ám ảnh mang tên model collapse
Điểm đáng chú ý là các đơn đặt hàng tập trung mạnh vào sách in trước 2022. Lý do không phải hoài niệm mà là nỗi ám ảnh kỹ thuật mang tên model collapse: khi mô hình AI lặp đi lặp lại tự huấn luyện trên nội dung do chính nó tạo ra, chất lượng và sự đa dạng đầu ra suy giảm rõ rệt. Nội dung xuất bản sau 2022 có nguy cơ chứa văn bản do AI viết hoặc chỉnh sửa, nghĩa là hệ thống sẽ tự ăn lại sản phẩm của mình. Một công ty dữ liệu sách từng chào hàng kho sách in trước 2022 như nguồn văn bản “chưa chạm AI”, đủ sạch để tránh nhiễu, trước khi âm thầm gỡ trang quảng bá này xuống. Cái nhìn thuần kỹ thuật ấy phơi bày cách các nhà phát triển AI xem sách: không phải tác phẩm văn hóa, mà là nguyên liệu càng “nguyên sinh” càng tốt.
Vấn đề bản quyền AI: luật chưa kịp, doanh nghiệp đã đi trước
Phần nguy hiểm nhất của câu chuyện không nằm ở máy quét, mà ở lỗ hổng pháp lý. Một phán quyết tại Mỹ cho rằng việc biến một cuốn sách vật lý mua hợp pháp thành tệp số cho huấn luyện AI là một dạng “fair use” mang tính chuyển đổi. Kết hợp với báo cáo cảnh báo rằng huấn luyện AI thương mại không tự động được xem là fair use trong mọi trường hợp, khung pháp lý hiện tại vẫn đủ lỏng để những cơ sở như VGT3 tiếp tục hoạt động mà không bị coi là vi phạm bản quyền trên đất Mỹ. Trái lại, luật tại Anh yêu cầu phải có sự đồng ý cho cả việc xây dựng bộ dữ liệu huấn luyện lẫn quá trình huấn luyện, và không có khái niệm fair use tương đương. Đức thậm chí xem việc quét sách cho mục tiêu AI là vi phạm bản quyền dù sách được mua hợp pháp. Luật chưa theo kịp, nhưng các công ty AI đã tranh thủ đi trước ranh giới.
Đạo đức dữ liệu AI và tương lai: ai trả giá cho tiến bộ?
Ở tầng đạo đức, bức tranh càng khó chấp nhận: các tác giả có sách bị mua và quét không được thông báo, không nhận bất kỳ khoản đền bù nào sau giao dịch. Làm như vậy mà không có sự đồng ý của người sáng tạo được xem là tối thiểu cũng là phi đạo đức. Người bán sách tham gia thử nghiệm nhấn mạnh rằng sách có nhiều kiểu giá trị – lịch sử, tình cảm – nhưng hệ thống quét chỉ nhìn chúng như dữ liệu cần nghiền nát. Với người dùng bình thường, điều này có nghĩa là những công cụ AI họ sử dụng đang được xây trên nền tảng tác phẩm của người khác mà không có cơ chế chia sẻ lợi ích rõ ràng. Dù có những vụ kiện thắng lợi, như thỏa thuận bản quyền cho hàng trăm nghìn đầu sách với mức khoảng vài nghìn đô la mỗi tác phẩm, hay các hồ sơ kiện liên quan việc xóa thông tin bản quyền khỏi dữ liệu huấn luyện, tất cả mới chỉ là bước đầu. Nếu xã hội không nhanh chóng đặt ra chuẩn mực minh bạch, xin phép và trả công công bằng, tiến bộ AI sẽ tiếp tục được trả giá bằng việc làm xói mòn niềm tin vào mô hình sáng tạo, xuất bản và quyền tác giả trên toàn cầu.







