Khi nghe đến vụ kiện bản quyền của Anthropic với khoản bồi thường 2 tỷ USD, nhiều người trong giới blockchain nghĩ ngay đến câu chuyện của riêng mình. Tôi – Hồ Nhi, auditor DeFi – nhìn thấy một điểm chung: cả AI lẫn DeFi đều đang xây nhà trên cát khi nói đến quyền sở hữu dữ liệu đầu vào.
Câu chuyện bắt đầu từ một phán quyết của tòa án Hoa Kỳ: Anthropic – startup AI đình đám – phải trả 2 tỷ USD để dàn xếp vụ kiện sử dụng sách có bản quyền để huấn luyện mô hình. 15 tỷ? 20 tỷ? Con số dao động nhưng bản chất không đổi: dữ liệu không miễn phí. Trong khi đó, các dự án blockchain đang ào ạt tích hợp AI: oracle thông minh, mô hình sinh lời tự động, NFT generator… Tất cả đều cần dữ liệu huấn luyện. Câu hỏi đặt ra: liệu smart contract có thể chịu trách nhiệm về nguồn gốc dữ liệu mà nó sử dụng?
Hãy nhìn vào cơ chế của một dự án “AI + DeFi” điển hình. Một oracle trên mạng lưới, ví dụ như Chainlink, thường lấy dữ liệu từ API bên ngoài. Nếu API đó trả về một tác phẩm vi phạm bản quyền, smart contract vẫn xử lý nó như dữ liệu hợp lệ. Vấn đề: code không phân biệt được dữ liệu hợp pháp hay vi phạm. Đây là lỗ hổng kiến trúc. Tôi từng audit một nền tảng cho vay DeFi có tích hợp mô hình AI để định giá tài sản thế chấp. Họ lấy dữ liệu từ một nguồn duy nhất – một cơ sở dữ liệu về bất động sản. Khi tôi hỏi: “ai kiểm tra bản quyền của dữ liệu đó?” – họ nhún vai. Kết quả: tôi phát hiện một đoạn code cho phép owner thay đổi nguồn dữ liệu mà không qua vote của DAO. Điểm yếu không nằm ở thuật toán, mà ở quyền quản trị dữ liệu.
Sự thật phản trực giác: không phải AI, mà chính blockchain mới là kẻ dễ bị kiện nhất vì dữ liệu vi phạm bản quyền. Bởi vì mọi giao dịch đều được ghi lại vĩnh viễn. Một NFT chứa hình ảnh vi phạm bản quyền có thể bị truy tố ngay cả khi người mint không biết. Trong khi đó, AI có thể xóa dữ liệu khỏi bộ nhớ đệm; blockchain thì không. Đó là lý do vì sao vụ Anthropic là hồi chuông cảnh tỉnh cho toàn bộ ngành crypto.
Điểm mù lớn nhất mà tôi thấy trong các dự án AI+Blockchain hiện tại: họ dành 90% thời gian để tối ưu hóa gas fee, chạy zero-knowledge proofs, nhưng không ai kiểm tra giấy phép của bộ dữ liệu huấn luyện. Một số dự án công khai rằng họ dùng dữ liệu từ Reddit, Twitter, sách điện tử miễn phí… Liệu có giấy phép thương mại không? Hầu hết là không. Và khi một tổ chức bản quyền kiện lên tòa, DAO sẽ phải chịu trách nhiệm. Nhưng DAO không có tư cách pháp nhân – ai sẽ trả tiền? Cộng đồng? Token holder? Một kịch bản tương tự vụ The DAO hack, nhưng lần này là về dữ liệu.
Kinh nghiệm audit của tôi chỉ ra rằng: bất kỳ smart contract nào gọi hàm từ bên ngoài mà không xác thực nguồn dữ liệu đều tiềm ẩn rủi ro pháp lý. Nếu bạn là một developer đang build sản phẩm AI-on-chain, hãy thêm một bước: kiểm tra license của dataset trước khi đưa vào mô hình. Tôi đã fork một repo của dự án nọ, thêm một module check bản quyền dựa trên Content ID của YouTube – nó không hoàn hảo, nhưng ít nhất cho thấy hướng đi.
Tương lai? Tôi dự đoán trong vòng 12 tháng tới, sẽ xuất hiện một tiêu chuẩn mới: “Data Provenance Audit” – kiểm toán nguồn gốc dữ liệu, song song với smart contract audit. Các quỹ đầu tư sẽ yêu cầu điều này trước khi rót vốn. Và những ai không chuẩn bị sẽ phải trả giá đắt – giống như Anthropic vừa làm mẫu.
An toàn không chỉ là không có bug trong code. An toàn còn là không có rủi ro pháp lý từ dữ liệu đầu vào. Và rủi ro đó, trên blockchain, là vĩnh viễn.