Ngành xuất bản thế giới vừa chứng kiến thêm một vụ kiện có sức nặng biểu tượng: một nhóm nhà xuất bản lớn đưa Google ra tòa với cáo buộc đã sử dụng trái phép hàng triệu cuốn sách có bản quyền để huấn luyện mô hình trí tuệ nhân tạo Gemini. Câu chuyện không mới về bản chất — nhưng quy mô, đối tượng bị kiện và thời điểm khiến nó trở thành một trong những tranh chấp bản quyền xuất bản đáng chú ý nhất năm 2026.
Tóm gọn — đọc 30 giây
Vụ kiện: Một nhóm nhà xuất bản lớn kiện Google vì cáo buộc dùng trái phép hàng triệu cuốn sách có bản quyền để huấn luyện Gemini.
Tranh cãi cốt lõi: Chủ sở hữu quyền cho rằng đó là sao chép cần cấp phép, còn phía công nghệ cho rằng đó là 'học' thống kê có thể thuộc phạm vi sử dụng hợp lý.
Không cấm gì: Luật bản quyền hiện hành ở hầu hết các quốc gia, kể cả Việt Nam, chưa có quy định chuyên biệt cấm hay cho phép rõ ràng việc dùng tác phẩm làm dữ liệu huấn luyện AI.
Vì sao lúc này: Sách là dữ liệu 'cao cấp' với văn bản dài, mạch lạc, giàu tri thức nên có giá trị huấn luyện AI vượt trội, khiến việc sử dụng không phép trở nên nhạy cảm về kinh tế.
Xu hướng: Các vụ kiện tương tự thường dẫn tới án lệ, đàm phán cấp phép hàng loạt và quy tắc minh bạch dữ liệu, chuyển từ khai thác tự do sang thị trường dữ liệu có giấy phép.
Hàm ý Việt Nam: Việt Nam cần cập nhật hợp đồng xuất bản, xây dựng mô hình quản lý tập thể quyền và chuẩn bị khung pháp lý trước khi tác phẩm tiếng Việt bị thu thập ngoài kiểm soát.
Một vụ kiện, hai cách nhìn về "dữ liệu huấn luyện"
Theo theguardian.com, các nhà xuất bản cho rằng Google đã đưa hàng triệu tác phẩm được bảo hộ vào tập dữ liệu huấn luyện Gemini mà không xin phép, không thỏa thuận cấp quyền và không trả thù lao cho chủ sở hữu quyền tác giả.
Tranh chấp này phản chiếu đúng hai hệ quy chiếu đang va nhau trên toàn cầu:
Góc nhìn của chủ sở hữu quyền: sách là tài sản trí tuệ được bảo hộ. Việc sao chép toàn văn để đưa vào quy trình huấn luyện là hành vi sao chép — một trong những quyền tài sản cốt lõi của tác giả và nhà xuất bản — nên phải có cấp phép và trả tiền.
Góc nhìn của các công ty công nghệ: huấn luyện mô hình là quá trình "học" thống kê từ dữ liệu, không nhằm tái tạo hay phân phối lại tác phẩm, và vì vậy có thể thuộc phạm vi sử dụng hợp lý (fair use) hoặc ngoại lệ khai thác văn bản và dữ liệu.
Điểm mấu chốt là luật bản quyền hiện hành ở hầu hết các quốc gia được thiết kế cho hành vi sao chép để đọc, để phổ biến, chứ chưa được thiết kế cho hành vi sao chép để máy học. Khoảng trống này là nơi các vụ kiện như trên đang cố lấp đầy bằng án lệ, trong khi cơ quan lập pháp còn đang cân nhắc.
Vì sao ngành sách đặc biệt dễ tổn thương?
So với hình ảnh hay âm nhạc, sách là loại dữ liệu "cao cấp" đối với mô hình ngôn ngữ lớn: văn bản dài, mạch lạc, có cấu trúc lập luận, được biên tập kỹ và giàu tri thức chuyên ngành. Chính chất lượng đó khiến kho sách trở thành nguồn huấn luyện có giá trị vượt trội — và cũng khiến việc sử dụng không phép trở nên nhạy cảm hơn về mặt kinh tế.
Rủi ro với ngành xuất bản không chỉ nằm ở chuyện "bị lấy dữ liệu". Nó nằm ở chuỗi giá trị:
Cạnh tranh thay thế: một mô hình có thể tóm tắt, diễn giải, trả lời thay cho việc người dùng tìm đến cuốn sách gốc.
Mất nguồn thu cấp quyền: nếu dữ liệu có thể lấy miễn phí, thị trường license nội dung cho AI khó hình thành với giá hợp lý.
Suy giảm động lực sáng tạo: tác giả và nhà xuất bản đầu tư biên tập, thẩm định, xuất bản nhưng không được chia sẻ lợi ích từ giá trị mà tác phẩm tạo ra cho hệ thống AI.
Xu hướng: từ đối đầu pháp lý đến thị trường cấp quyền
Kinh nghiệm quốc tế cho thấy các làn sóng kiện tụng bản quyền công nghệ hiếm khi kết thúc bằng việc một bên bị xóa sổ. Chúng thường dẫn tới ba kết quả song song: hình thành án lệ làm rõ ranh giới pháp lý; thúc đẩy đàm phán cấp phép hàng loạt; và tạo áp lực để cơ quan quản lý ban hành quy tắc minh bạch dữ liệu huấn luyện.
Sách có bản quyền được xem là nguồn dữ liệu huấn luyện AI giá trị nhưng gây tranh cãi khi sử dụng không phép. Ảnh minh hoạ. — Ảnh: Dafadllyn, CC0, Wikimedia Commons.
Nói cách khác, những vụ kiện như vụ kiện Google nêu trên nhiều khả năng là bước chuyển từ giai đoạn "khai thác dữ liệu tự do" sang giai đoạn thị trường dữ liệu có giấy phép. Ở đó, ba yếu tố sẽ quyết định: minh bạch về nguồn dữ liệu, cơ chế opt-in/opt-out rõ ràng, và công thức phân chia lợi ích giữa nền tảng — nhà xuất bản — tác giả.
Hàm ý cho Việt Nam
Việt Nam là thành viên Công ước Berne và có hệ thống pháp luật sở hữu trí tuệ đã được sửa đổi, bổ sung theo hướng tiệm cận chuẩn mực quốc tế. Tuy nhiên, giống như phần lớn các nước, pháp luật hiện hành chưa có quy định chuyên biệt cho việc sử dụng tác phẩm làm dữ liệu huấn luyện AI. Điều này đặt ra một số vấn đề thực tiễn:
Dữ liệu văn bản được đưa vào hệ thống máy chủ để huấn luyện các mô hình trí tuệ nhân tạo như Gemini. Ảnh minh hoạ. — Ảnh: Derrick Coetzee from Berkeley, CA, USA, CC0, Wikimedia Commons.
Tác phẩm tiếng Việt đang bị thu thập ở đâu, bởi ai? Sách, báo, học liệu, tài liệu số hóa tiếng Việt hoàn toàn có thể nằm trong các tập dữ liệu quốc tế mà chủ sở hữu quyền không hay biết.
Năng lực đàm phán phân tán: nếu từng tác giả, từng nhà xuất bản đơn lẻ thương lượng với nền tảng toàn cầu, vị thế sẽ rất yếu. Mô hình quản lý tập thể quyền và cấp phép theo gói là hướng đi thực tế hơn.
Chuẩn hợp đồng xuất bản cần cập nhật: nhiều hợp đồng cũ không hề đề cập quyền sử dụng tác phẩm cho mục đích huấn luyện máy, dẫn tới tranh chấp nội bộ giữa tác giả và nhà xuất bản khi có nguồn thu mới.
Vai trò của VCDI
Với chức năng nghiên cứu phát triển sáng tạo và bản quyền, Viện Nghiên cứu Phát triển Sáng tạo và Bản quyền Việt Nam (VCDI) xác định đây là nhóm vấn đề cần theo dõi liên tục và chuyển hóa thành khuyến nghị chính sách. Cụ thể, VCDI hướng tới:
Theo dõi và phân tích án lệ quốc tế về AI và bản quyền, rút ra bài học áp dụng cho bối cảnh Việt Nam.
Góp ý xây dựng khung pháp lý về ngoại lệ khai thác văn bản – dữ liệu, nghĩa vụ minh bạch dữ liệu huấn luyện và cơ chế bồi hoàn cho chủ sở hữu quyền.
Nâng cao nhận thức cho tác giả, nhà xuất bản về việc rà soát hợp đồng, đăng ký quyền tác giả, lưu trữ bằng chứng và quản trị tài sản trí tuệ số.
Thúc đẩy mô hình cấp phép công bằng, thay vì chỉ dừng ở đối đầu pháp lý.
Kết luận
Vụ kiện nhắm vào Gemini không chỉ là chuyện của một tập đoàn công nghệ và một nhóm nhà xuất bản. Đó là câu hỏi lớn của thời đại: khi tri thức tích lũy hàng thế kỷ trở thành "nhiên liệu" cho máy móc, ai được hưởng lợi và ai phải trả giá? Một hệ sinh thái AI bền vững chỉ có thể tồn tại nếu người sáng tạo ra nguyên liệu đầu vào được thừa nhận và được chia sẻ giá trị. Với Việt Nam, chuẩn bị sớm về pháp lý, hợp đồng và năng lực đàm phán tập thể là cách hiệu quả nhất để không đứng ngoài cuộc chơi đó.
Ghi chú của VCDI
Bài viết được VCDI tổng hợp và biên soạn từ nguồn tin quốc tế về vụ kiện của nhóm nhà xuất bản chống lại Google liên quan đến việc huấn luyện mô hình trí tuệ nhân tạo Gemini bằng sách có bản quyền. Toàn bộ nội dung mang tính
tham khảo, không phải văn bản pháp lý.
Chia sẻ:2 lượt xem
Bản quyền tác giả
Nhà xuất bản kiện Google vì huấn luyện Gemini bằng sách có bản quyền: Bài toán chưa có lời giải chung
Một nhóm nhà xuất bản lớn cáo buộc Google dùng trái phép hàng triệu cuốn sách có bản quyền để huấn luyện Gemini. Vụ kiện đặt ra câu hỏi cốt lõi: dữ liệu huấn luyện AI có phải trả tiền bản quyền? Và Việt Nam cần chuẩn bị gì trước làn sóng này?