Cuộc chạy đua phát triển AI toàn cầu đang bước vào giai đoạn khốc liệt nhất, lúc này dữ liệu được ví như nguồn tài nguyên quý giá. Khi nguồn dữ liệu trên Internet dần cạn kiệt và đâu đâu cũng là những văn bản vô hồn do chính máy móc tạo ra, các công ty AI đã chuyển hướng sang một kho báu khác: tri thức trong những cuốn sách.
Thay vì đàm phán bản quyền với các nhà xuất bản, nhiều công ty đã quyết định càn quét thị trường sách cũ toàn cầu.
Dự án tuyệt mật Panama
Theo các trang tài liệu nội bộ được tòa án Mỹ công khai, Anthropic từng triển khai một chiến dịch tuyệt mật mang tên "Dự án Panama". Mục tiêu của dự án vô cùng tham vọng: "Quét hủy diệt (destructively scan) tất cả sách trên thế giới." Kèm theo đó là lời lưu ý: "Chúng ta không muốn ai biết rằng mình đang làm việc này."
Để thực hiện chiến dịch, vào tháng 2/2024, Anthropic đã chiêu mộ Tom Turvey, người từng dẫn dắt dự án số hóa sách của Google. Thay vì đàm phán với các nhà xuất bản về vấn đề bản quyền, Turvey được giao nhiệm vụ thu thập sách càng nhanh càng tốt mà không để vướng vào các "thủ tục pháp lý và kinh doanh". Công ty đã chi hàng chục triệu USD để gom mua hàng triệu cuốn sách thông qua những nhà bán lẻ sách như Better World Books hay World of Books.
Công ty đã chi hàng chục triệu USD để gom mua hàng triệu cuốn sách thông qua những nhà bán lẻ sách như Better World Books hay World of Books. Ảnh chụp màn hình từ trang World of Books.
Không mất thời gian quét (scan) từng trang sách, quy trình số hóa của Dự án Panama vận hành hệt như một dây chuyền công nghiệp. Sách sau khi mua về được đưa vào các máy cắt thủy lực công suất lớn để phạt phẳng phần gáy. Những trang sách rời sau đó được chạy qua máy quét sản xuất tốc độ cao, và cuối cùng, công ty quét dữ liệu sẽ lên lịch để các công ty tái chế đến thu gom giấy vụn.
Thị trường sách cũ thế giới bất ngờ lên hương
Cùng lúc đó, thị trường sách cũ trên thế giới cũng ghi nhận những đơn hàng thu mua ồ ạt. Pieter de Vries, một người kinh doanh sách cổ tại Haarlem (Hà Lan), cho biết ông từng nhận được email từ một người tên "Nataly" thuộc công ty 2077AI, đính kèm danh sách yêu cầu mua gom khoảng 3.000 tựa sách. Do thông thường khách hàng chỉ mua lẻ từng cuốn, ông tưởng đây là một vụ lừa đảo.
Tại Úc, các chủ cửa hàng sách cũ cũng nhận được những đơn hàng kỳ lạ. Delfina Manor, chủ cửa hàng Good Reading Secondhand Books, và John Sainsbury, chủ hiệu Sainsburys Books, đều nhận được lượng lớn đơn đặt hàng từ một công ty Canada tên là Zoom Books. Lạ lùng là công ty này mua sách không màng đến giá cả hay phí vận chuyển, và danh mục mua rất ngẫu nhiên, từ sách hướng dẫn cơ học đất thập niên 1970, sách đua xe đạp New Zealand, cho đến thơ ca cổ của Úc.
Khác với những nhà bán lẻ sách đang hoang mang, một công ty có tên ISBNdb, tự hào sở hữu "cơ sở dữ liệu sách lớn nhất thế giới", hiện đang cung cấp dịch vụ thu mua sách số lượng lớn cho các phòng thí nghiệm AI, "lên tới một triệu tựa sách mỗi đơn hàng", bao gồm cả những "ấn bản cũ, quý hiếm và chuyên ngành".
ISBNdb lưu ý rằng sách in từ thời kỳ trước khi có các mô hình ngôn ngữ lớn (pre-LLM) được đảm bảo hoàn toàn không bị ô nhiễm bởi dữ liệu rác do AI tạo ra. "Hàng triệu cuốn sách giá trị nhất chưa bao giờ được số hóa. Chúng chỉ tồn tại dưới dạng vật lý, nằm rải rác trên các kệ thư viện, các hiệu sách cũ và trong các danh mục sách đã ngừng xuất bản. Chúng tôi sẽ thu thập và cung cấp chúng cho bạn với quy mô lớn," công ty tuyên bố.
Hiệp hội Những người bán sách Cổ và Quý hiếm Úc (ANZAAB) đã lên tiếng cảnh báo về nguy cơ những tư liệu lịch sử quan trọng đang biến mất. Ông Pieter de Vries bình luận gay gắt: "Thật man rợ... có khác gì hành vi đốt sách đâu."
Ngay cả tỷ phú Elon Musk cũng lên tiếng phản đối. Ông tuyên bố trên mạng xã hội X rằng ông luôn yêu cầu đội ngũ AI của SpaceX phải tiến hành quét sách thủ công và bảo tồn các ấn bản quý hiếm, thay vì áp dụng phương pháp "cắt gáy" tàn bạo.
Tải và lưu trữ lậu kho sách số hóa
Không chỉ quét sách, các công ty AI như Meta, Google hay OpenAI còn bị cáo buộc có hành vi lén lút tải sách lậu. Nhiều tài liệu nội bộ cho thấy các kỹ sư Meta coi việc tiếp cận các kho sách số là yếu tố sống còn để duy trì vị thế cạnh tranh.
Sách sau khi mua về sẽ được đưa vào các máy cắt thủy lực công suất lớn để phạt phẳng phần gáy. Những tờ giấy rời sau đó được chạy qua máy quét sản xuất tốc độ cao, và cuối cùng, công ty quét dữ liệu sẽ lên lịch để các công ty tái chế đến thu gom giấy vụn. Ảnh: Unsplash
Vào tháng 12/2023, một email nội bộ hé lộ chính CEO Mark Zuckerberg đã trực tiếp phê duyệt việc sử dụng dữ liệu từ LibGen - một kho sách lậu khổng lồ - phục vụ việc huấn luyện mô hình AI Llama 3. Để che đậy dấu vết tải dữ liệu vi phạm bản quyền, các kỹ sư của Meta đã cố tình thuê máy chủ của Amazon thay vì dùng hệ thống nội bộ của Facebook nhằm tránh bị điều tra ngược. Meta hiện vẫn đang phủ nhận các cáo buộc
Anthropic cũng sử dụng những cách thức mờ ám để thu thập dữ liệu. Hồ sơ tòa án ghi nhận Ben Mann, đồng sáng lập công ty, đã dùng phần mềm chia sẻ file để tải xuống hàng loạt sách hư cấu và phi hư cấu từ kho lậu LibGen liên tục trong 11 ngày hồi tháng 6/2021. Một năm sau, Mann tiếp tục chia sẻ đường link đến Pirate Library Mirror - một trang web tuyên bố công khai việc vi phạm luật bản quyền - cho các nhân viên kèm tin nhắn hào hứng "Vừa đúng lúc!!!".
Dù vậy, Anthropic nói dữ liệu LibGen không được dùng để huấn luyện mô hình thương mại tạo doanh thu và dữ liệu từ Pirate Library Mirror không được dùng để huấn luyện bất kỳ mô hình hoàn chỉnh nào.
Chiến thắng chưa trọn vẹn của các tác giả sách
Sau khi phát hiện tác phẩm của mình bị Anthropic sao chép từ các kho sách lậu trên mạng và sử dụng để huấn luyện chatbot Claude, nữ tiểu thuyết gia trinh thám Andrea Bartz cùng hai tác giả khác đã khởi xướng một vụ kiện tập thể vào năm 2024, cáo buộc Anthropic xâm phạm bản quyền.
Cuối tháng Bảy vừa qua, tòa án liên bang đã phê duyệt thỏa thuận dàn xếp trị giá 1,5 tỷ USD giữa Anthropic và nhóm nguyên đơn, mở đường cho việc bồi thường các tác giả thuộc diện được bảo vệ trong vụ kiện. Với khoảng 91% trong tổng số hơn 482.000 cuốn sách bị ảnh hưởng đã được xác nhận yêu cầu bồi thường, trung bình các tác giả sẽ nhận khoảng 3.000 USD cho mỗi đầu sách.
Nhưng đó không phải là một chiến thắng mỹ mãn. Trước đấy, tòa án liên bang đã ra phán quyết rằng việc dùng sách để huấn luyện AI được coi là "sử dụng hợp lý" (fair use) theo luật bản quyền Mỹ.
Các luật sư của Anthropic còn lập luận rằng việc "quét hủy diệt" bản gốc vật lý đã biến quá trình số hóa thành một hành động "thay thế", tạo ra bản sao kỹ thuật số duy nhất, do đó được đánh giá là "sử dụng mang tính chuyển đổi" (transformative use).
Nhờ kẽ hở pháp lý này, tòa án xác định việc dùng sách để huấn luyện và số hóa một-một những cuốn đã mua hợp pháp thuộc phạm vi sử dụng hợp lý, chỉ là việc tải và lưu giữ hàng triệu bản sách lậu trong thư viện trung tâm thì không hợp pháp.
Tiểu thuyết gia Andrea Bartz bức xúc cho rằng lập luận "sử dụng hợp lý" là hoàn toàn vô lý, bởi thuật toán AI đang được dùng để tạo ra các văn bản tự động và "tìm cách cướp đi công việc của chúng tôi".
Ed Newton-Rex - người sáng lập Fairly Trained, một nhóm bảo vệ quyền tác giả - thì khẳng định không thể có chuyện chỉ bỏ ra 1 USD để mua một cuốn sách cũ, bạn lại có quyền phá hủy nó và sử dụng chất xám bên trong để tạo ra một siêu AI thương mại cạnh tranh với chính tác giả.
Hà Trang tổng hợp
---
Tài liệu tham khảo:
Inside an AI start-up’s plan to scan and dispose of millions of books, The Washington Post
https://www.washingtonpost.com/technology/2026/01/27/anthropic-ai-scan-destroy-books/
Judge approves a $1.5B Anthropic settlement over pirated books used to train the Claude chatbot, The Washington Post
https://www.washingtonpost.com/business/2026/07/21/ai-anthropic-copyright-settlement-claude-books-bartz/72331b14-8512-11f1-9cec-0fb26676f07e_story.html
‘More than just objects’: Australian booksellers raise alarm over ‘horrific’ destruction of rare titles to feed AI, The Guardian
https://www.theguardian.com/technology/2026/aug/02/australian-book-sellers-alarm-destruction-rare-titles-ai-supply-chain
Authors have mixed feelings about the $1.5B Anthropic copyright infringement ruling, NPR
https://www.npr.org/2026/07/27/nx-s1-5904606/anthropic-vs-bartz-ai-copyright-lawsuit-pros-cons