Hook
7 ngày qua, một giao dịch im lặng trên bảng cân đối kế toán của ISBNdb đã lộ diện: hợp đồng trị giá “vài triệu USD” để mua và hủy hơn 2 triệu cuốn sách in. Không ai thấy một token nào được mint, không có NFT nào được đúc. Nhưng một loại tài sản mới – dữ liệu huấn luyện AI “sạch” – đang được tạo ra bằng cách… xé xác giấy.
Context
Khi các mô hình ngôn ngữ lớn (LLM) đối mặt với “bức tường dữ liệu” – nguồn văn bản con người trên internet đã bị nhiễm AI sinh ra hoặc bị đầu độc – các công ty AI chuyển hướng sang sách in. Năm 2025, tòa án Hoa Kỳ phán quyết rằng việc số hóa một cuốn sách mua hợp pháp và hủy bản gốc thuộc “sử dụng hợp lý”, miễn là số bản sao không tăng lên. Đây chính là cửa sổ pháp lý mà Anthropic, ISBNdb và các công ty khai thác dữ liệu đang tận dụng.
Core
Dựa trên kinh nghiệm audit dữ liệu on-chain của tôi – dù lần này là “off-chain” – tôi lần theo dấu vết: ISBNdb mua sách theo ISBN, chủ đề, năm xuất bản, sau đó cắt gáy, quét từng trang, và hủy bản giấy. Hợp đồng có điều khoản bảo mật và chứng thực hủy. Anthropic đã chi “vài triệu USD” cho hàng triệu cuốn sách. Tại sao? Bởi sách in trước năm 2022 “ít bị nhiễm AI hơn”, là nguồn “nhân tạo thuần túy” không bị data poisoning.
Nhưng hãy nhìn vào sự chồng chéo: 80% số sách ISBNdb mua là tồn kho, sách hết bản quyền hoặc xuất bản hàng loạt. Chỉ khoảng 2-3% là sách hiếm, bản đặc biệt. Tuy nhiên, không có danh sách công khai nào xác nhận những cuốn hiếm nào đã bị đốt. “Lịch sử không lặp lại, nhưng vần điệu.” – 7 năm trước, tôi đã thấy 12 ICO có token tập trung 80% vào một nhóm ví. Hôm nay, tôi thấy 12 danh mục sách bị xóa sổ vĩnh viễn vì AI.
Dữ liệu on-chain (off-chain) cho thấy: chi phí quét và xử lý (OCR, làm sạch, dán nhãn) có thể gấp 3-4 lần giá mua sách. Một cuốn sách 10 USD, chi phí xử lý 30-40 USD. Nhưng 2 triệu cuốn là 80 triệu USD chỉ cho khâu hậu kỳ. Ai trả? Anthropic, thông qua ISBNdb. Mô hình kinh doanh này là arbitrage bản quyền: mua sách rẻ, biến thành dữ liệu độc quyền, bán lại cho AI. Giá chưa công bố, nhưng có thể ước tính giá mỗi token dữ liệu từ sách in cao gấp 5-10 lần so với web crawl.
Contrarian
“Lịch sử không lặp lại, nhưng vần điệu.” – Một góc nhìn phản trực giác: “Một-đổi-một” về mặt pháp lý là cái bẫy. Bởi vì bản số hóa, một khi được tạo ra, có thể sao chép vô hạn. Tòa án tin rằng hủy bản gốc giữ số bản sao = 1, nhưng thực tế kỹ thuật: chỉ cần một lần copy nhầm, “một-đổi-một” sụp đổ. Hơn nữa, sách hiếm không chỉ là văn bản – nó là vật thể văn hóa: chữ ký tác giả, giấy đặc biệt, bản in đầu tiên. Hủy nó là mất mát không thể đảo ngược, bất kể bản số được lưu giữ thế nào.
Một điểm mù khác: dữ liệu sách in có độ lệch (bias) cao về chủ đề – nghiêng về phương Tây, kinh điển, khoa học tự nhiên. Mô hình được huấn luyện từ sách in có thể thông minh về triết học Aristotle nhưng ngu ngốc về meme internet. Đây không phải là “dữ liệu sạch” mà là “dữ liệu bị lọc chọn lọc”.
Takeaway
Tuần tới, hãy theo dõi hai tín hiệu: (1) liệu các công ty khác (OpenAI, Google) có ký hợp đồng tương tự với ISBNdb? (2) liệu có đơn kiện tập thể từ các nhà sưu tập sách hiếm? Nếu “cơn khát” dữ liệu tiếp diễn, các tủ sách và thư viện khoa học có thể trở thành chiến trường mới. Và câu hỏi lơ lửng: liệu chúng ta đang tạo ra AI thông minh hơn, hay đang thiêu hủy trí tuệ nhân loại trên giấy để nuôi máy?