Cắt sách nuôi AI, vì sao phải là sách trước 2022?
ĐNCT - Khi dữ liệu internet ngày càng bị "ô nhiễm" bởi văn bản do AI viết ra, các tập đoàn công nghệ quay về nguồn dữ liệu "sạch" cuối cùng là sách in. Để khai thác, họ chọn cách làm nhanh chóng và triệt để, đó là cắt gáy, quét từng trang rồi tiêu hủy bản gốc.

Ảnh (minh họa): Alisa Gao / The Atlantic
Một chiếc AirTag giấu trong thùng sách đã vô tình vạch trần cả một đường dây bí mật của ngành AI. Theo điều tra của 404 Media được trang TechCrunch dẫn lại, lô sách này khởi hành từ một hiệu sách hiếm ở California, qua Milwaukee, Colorado Springs, rồi dừng chân tại một nhà kho vô danh của Amazon ở Las Vegas - mã nội bộ VGT3. Tại đây, sách bị xé rời gáy, quét thành dữ liệu số rồi biến mất vĩnh viễn.
Vì sao sách cũ quý giá?
Không chỉ Amazon nhúng tay vào việc này. Theo tài liệu nội bộ mà tạp chí Forbes công bố, Anthropic - công ty đứng sau mô hình Claude - cũng từng âm thầm vận hành một dự án mang tên "Project Panama", với mục tiêu quét và tiêu hủy gần như toàn bộ sách in trên thế giới để lấy dữ liệu huấn luyện AI.
Câu trả lời nằm ở hiện tượng mà giới kỹ thuật AI gọi là "model collapse" - sự suy thoái chất lượng xảy ra khi một mô hình ngôn ngữ được huấn luyện lặp đi lặp lại trên chính văn bản do AI khác tạo ra. Theo Forbes, hiện tượng này khiến đầu ra của mô hình ngày càng kém tự nhiên qua từng thế hệ huấn luyện, giống như việc photocopy một bản photocopy nhiều lần.
Vấn đề là internet ngày nay đã tràn ngập văn bản do máy tạo ra, từ bài báo tự động đến bình luận mạng xã hội. Vì vậy, các công ty AI buộc phải tìm về một mốc thời gian "sạch" - trước khi ChatGPT ra mắt cuối năm 2022. Theo trang The Decoder, sách in trước mốc này gần như chắc chắn không dính văn bản AI, bởi lúc đó công nghệ tạo văn bản tự động chưa xuất hiện.
Sách in còn mang giá trị mà các nguồn dữ liệu ngắn trên mạng như Reddit, Stack Overflow hay GitHub không thể sánh được: cấu trúc lập luận dài, mạch lạc, đã qua biên tập kỹ lưỡng. Theo trang The Next Web, trang dữ liệu ISBNdb - công ty từng công khai môi giới sách cho các hãng AI trước khi gỡ bỏ dịch vụ này - mô tả sách là nguồn tư liệu "dày dặn, đã qua biên tập, có thẩm quyền". Vì vậy, dù các hãng AI vẫn tiếp tục thu thập dữ liệu từ báo chí, diễn đàn lập trình hay mạng xã hội, sách in trước 2022 vẫn được xem là nguồn tin cậy nhất - kho lưu trữ ngôn ngữ con người chưa từng bị máy móc chạm tới.
Cỗ máy hủy sách vận hành
Quy mô của hoạt động này lớn hơn nhiều so với tưởng tượng. Theo 404 Media, các đơn đặt hàng ẩn danh mà giới bán sách cũ nhận được dao động từ 1.000 đến 1 triệu cuốn mỗi lần mua. Riêng với Anthropic, tài liệu tòa án được công bố trong vụ kiện bản quyền cho thấy công ty từng lên kế hoạch quét hủy từ 500.000 đến 2 triệu cuốn sách chỉ trong một hợp đồng sáu tháng với một nhà cung cấp, theo Forbes.
Điều đáng chú ý là tính bí mật của dự án. Một tài liệu nội bộ Anthropic, được chuyên trang kiểm chứng tin tức Snopes trích dẫn từ hồ sơ tòa án, ghi rõ yêu cầu giữ kín tuyệt đối: "Chúng tôi sử dụng một "mật danh nhẹ" cho dự án này vì chúng tôi không muốn việc chúng tôi đang thực hiện bị lộ ra ngoài". Đến tháng 10/2024, công ty đã mua tới hàng triệu cuốn sách, dù con số cụ thể bị che trong tài liệu công khai.
Về mặt pháp lý, cánh cửa cho hoạt động này đã mở từ giữa năm ngoái. Theo Forbes, thẩm phán liên bang William Alsup ra phán quyết vào tháng 6/2025 rằng việc chuyển đổi một cuốn sách in đã mua hợp pháp sang định dạng số để huấn luyện AI nội bộ là hành vi "sử dụng hợp lý mang tính chuyển đổi". Kể từ đó, cũng theo Forbes, không một cơ quan quản lý nào giám sát số sách đã bị mua, quét hay tiêu hủy vì mục đích này.
Tuy nhiên, không phải mọi chi tiết trong làn sóng phẫn nộ trên mạng xã hội đều chính xác. Tạp chí The Atlantic, qua phỏng vấn trực tiếp một người bán sách tại thành phố Houston, cho biết phần lớn sách bị mua gom không phải là sách "hiếm" theo nghĩa cổ điển, mà là sách phi hư cấu xuất bản từ thập niên 1970 đến 1990, thậm chí có cả sách hướng dẫn sử dụng phần mềm cũ.
Đằng sau những cái tên lớn như Amazon hay Anthropic, một mạng lưới trung gian ít được biết đến cũng tham gia cuộc săn lùng sách giấy. Theo The Atlantic, công ty Zoom Books (trụ sở tại Canada) - tự nhận "thu mua, phân loại và bán lại hơn 2 triệu cuốn sách mỗi tháng" - bị nhiều người bán sách ở Mỹ, Đức nêu tên vì quy mô đơn hàng bất thường. Một tổ chức khác, 2077AI (trụ sở tại Singapore), từng gửi email cho các hiệu sách cổ ở Hà Lan kèm danh sách 3.000 đầu sách tiếng Anh muốn mua, theo tin tức Hà Lan NL Times được The Atlantic dẫn lại.
Đáng chú ý, công ty môi giới dữ liệu ISBNdb - vốn từng công khai quảng cáo dịch vụ thu mua sách vật lý cho các hãng AI - đã phủ nhận hoàn toàn liên quan sau khi bị chú ý, họ cũng gỡ bỏ trang quảng cáo dịch vụ này khỏi website công ty. Trong khi danh tính người mua thực sự vẫn mù mờ, nhà phân phối sách lớn nhất nước Mỹ, Ingram, cảnh báo giới xuất bản và cho phép họ từ chối tham gia chuỗi cung ứng đó.
Nguồn Đà Nẵng: https://baodanang.vn/cat-sach-nuoi-ai-vi-sao-phai-la-sach-truoc-2022-3351167.html



