Bỏ qua điều hướng
•

OpenAI thử nghiệm gắn 'dấu ấn vô hình' vào văn bản do ChatGPT tạo ra

OpenAI thử nghiệm gắn 'dấu ấn vô hình' vào văn bản do ChatGPT tạo ra
Nguồn ảnh: Thanh Niên

Công nghệ watermark vô hình mang tên textGrain sẽ được OpenAI tích hợp vào văn bản tạo bởi ChatGPT và Codex.

Trong vài tuần tới, người dùng ChatGPT và Codex đủ điều kiện tại Liên minh châu Âu (EU) sẽ bắt đầu nhận được văn bản có gắn watermark (dấu ấn bản quyền) ẩn mang tên 'textGrain'. OpenAI nhúng dấu này vào quy luật thống kê khi mô hình chọn từ, nên không có biểu ngữ hay dấu vết nào mà mắt thường có thể nhìn thấy.

OpenAI thử nghiệm gắn dấu ấn nhận diện ẩn vào văn bản do AI tạo ra

Động thái này nhằm đáp ứng yêu cầu minh bạch của Đạo luật Trí tuệ nhân tạo của EU (EU AI Act). Anthropic cũng đã công bố giải pháp tương tự cho Claude, dựa trên phương pháp SynthID của Google DeepMind. Để tránh nhận diện sai, textGrain hiện chỉ cấp quyền truy cập hạn chế cho các nhà nghiên cứu và tổ chức chuyên môn được phê duyệt.

OpenAI thử nghiệm gắn 'dấu ấn vô hình' vào văn bản do ChatGPT tạo ra - Ảnh 1.

OpenAI sắp gắn watermark ẩn vào nội dung của ChatGPT

ẢNH: CHATGPT

Theo thử nghiệm của OpenAI do unite.ai dẫn lại, ở mức nhận diện sai 1%, công cụ phát hiện được khoảng 80% đoạn văn 200 token và 95% đoạn 400 token. Tuy nhiên, hiệu quả giảm mạnh khi văn bản bị chỉnh sửa: nếu thay 10% từ bằng từ đồng nghĩa, tỷ lệ phát hiện đoạn 400 token còn 66%; thay 25% thì chỉ còn khoảng 17%.

OpenAI thừa nhận textGrain không đảm bảo phát hiện một cách tuyệt đối. Công nghệ này cũng không thể xác minh độ chính xác của nội dung, xác định ai là người tạo ra văn bản hay đo mức độ chỉnh sửa của con người. Vì vậy, giáo viên, nhà tuyển dụng và nhà xuất bản chỉ nên xem kết quả phát hiện là một dữ liệu tham khảo, không phải kết luận cuối cùng về quyền tác giả.

Hiện watermark của mỗi nhà cung cấp hoạt động độc lập và chưa thể kiểm tra chéo, nên thị trường vẫn chưa có công cụ kiểm tra văn bản AI dùng chung. textGrain giúp thúc đẩy việc truy xuất nguồn gốc nội dung số, nhưng kết quả phát hiện chỉ giống lời khai của một nhân chứng, không phải bằng chứng quyết định.

OpenAI đang bắt đầu thử nghiệm công nghệ watermark ẩn mang tên textGrain trên ChatGPT và Codex dành cho người dùng đủ điều kiện tại Liên minh châu Âu (EU). Giải pháp này nhúng dấu ấn vào quy luật thống kê khi mô hình lựa chọn từ ngữ, hoàn toàn vô hình trước mắt thường nhằm đáp ứng yêu cầu minh bạch từ Đạo luật Trí tuệ nhân tạo của EU (EU AI Act). Để hạn chế nguy cơ nhận diện sai, quyền truy cập công cụ hiện chỉ mở giới hạn cho các tổ chức chuyên môn và nhà nghiên cứu được phê duyệt. Dữ liệu thử nghiệm cho thấy textGrain đạt tỷ lệ phát hiện 80% đối với đoạn văn 200 token và lên tới 95% ở đoạn 400 token với biên độ sai lệch 1%. Dẫu vậy, hiệu năng của hệ thống suy giảm đáng kể khi nội dung bị can thiệp biên tập; tỷ lệ phát hiện đoạn 400 token giảm xuống 66% nếu thay thế 10% từ đồng nghĩa, và chỉ còn 17% nếu mức độ chỉnh sửa đạt 25%. Thực tế này phản ánh thách thức kỹ thuật lớn trong việc duy trì dấu ấn bản quyền trước các thao tác diễn giải tự nhiên của con người. OpenAI cũng thừa nhận textGrain không thể đảm bảo độ chính xác tuyệt đối, không xác minh danh tính người tạo lập hay đo lường mức độ chỉnh sửa. Tương tự giải pháp của Anthropic dựa trên SynthID từ Google DeepMind, mỗi cơ chế hiện vận hành độc lập và chưa thể kiểm tra chéo lẫn nhau. Do đó, giới học thuật và các nhà xuất bản chỉ nên coi kết quả phát hiện như một nguồn tham khảo bổ trợ thay vì bằng chứng quyết định về quyền tác giả.
amung