Bỏ qua điều hướng

Lãnh đạo Microsoft lên tiếng về cách AI sử dụng nội dung trên internet

Lãnh đạo Microsoft lên tiếng về cách AI sử dụng nội dung trên internet
Nguồn ảnh: Thanh Niên

Những tranh luận quanh dữ liệu huấn luyện AI tiếp tục nóng lên khi một lãnh đạo Microsoft bày tỏ lo ngại về cách nội dung trực tuyến được sử dụng.

Theo ArsTechnica, Brent Hecht - Giám đốc Khoa học ứng dụng tại Microsoft, từng đưa ra những nhận xét mạnh về cách các công ty AI thu thập nội dung trên internet để huấn luyện mô hình. Các phát biểu được đề cập trong hồ sơ liên quan vụ kiện bản quyền giữa Microsoft, OpenAI và nhóm tổ chức báo chí do The New York Times dẫn đầu.

Hecht mô tả việc thu thập nội dung báo chí để huấn luyện AI là hành vi lấy đi lượng công sức ở quy mô chưa từng có. Ông cũng cho rằng cách thu thập dữ liệu rộng rãi này khó phù hợp với lập luận "sử dụng hợp lý" (fair use) mà Microsoft và OpenAI đưa ra trong tranh chấp bản quyền.

Lãnh đạo Microsoft lên tiếng về cách AI sử dụng nội dung trên Internet - Ảnh 1.

AI thu thập lượng lớn nội dung trên internet đang làm gia tăng tranh luận về bản quyền và quyền lợi của người sáng tạo

ẢNH: TẠO BỞI AI

Hecht còn lưu ý phần lớn những người tạo nội dung không có ý định để sản phẩm của họ được sử dụng theo cách này, đồng thời không nhận được thù lao tương ứng.

Tuy nhiên, Microsoft cho biết những nhận xét trên chỉ phản ánh quan điểm cá nhân của một nhân viên, không phải phân tích pháp lý và không đại diện cho quan điểm của công ty. Microsoft bảo vệ các sản phẩm AI của mình, cho rằng việc sử dụng nội dung mang tính chuyển đổi và không thay thế các trang tin.

Tranh chấp hiện tập trung vào câu hỏi liệu việc sao chép nội dung để huấn luyện AI và cung cấp câu trả lời cho người dùng có thuộc phạm vi sử dụng hợp lý theo luật bản quyền hay không. Các hãng tin cho rằng chatbot có thể tái tạo một phần nội dung và thay thế nhu cầu truy cập nguồn gốc.

Lo ngại AI làm suy yếu nguồn nội dung trên internet

Một vấn đề khác được nêu là tác động của chatbot đến lưu lượng truy cập các trang báo. Satya Nadella, CEO Microsoft, thừa nhận chatbot có thể khiến người dùng không cần truy cập nguồn ban đầu vì thông tin đã xuất hiện trực tiếp trên nền tảng AI.

Theo dữ liệu được viện dẫn trong hồ sơ, Microsoft ghi nhận tỷ lệ nhấp vào nguồn giảm 83 - 93% đối với một số trường hợp và 51 - 94% với những trường hợp khác. Phía các hãng tin sử dụng số liệu này để lập luận rằng sản phẩm AI đang thay thế một phần hoạt động của các trang báo.

Các trao đổi nội bộ tại OpenAI cũng đề cập nguy cơ tương tự. Nick Turley - lãnh đạo phụ trách ChatGPT, từng nhận định các sản phẩm thương mại được huấn luyện bằng nội dung báo chí có thể tạo ra mối đe dọa đối với các nhà xuất bản khi chúng trở thành phương án thay thế nguồn tin.

Một tài liệu của Microsoft còn mô tả nguy cơ hình thành vòng lặp: AI làm giảm lưu lượng và nguồn thu của các đơn vị sản xuất nội dung, khiến nguồn thông tin chất lượng suy yếu, trong khi chính các mô hình AI lại phụ thuộc vào nguồn dữ liệu này để duy trì chất lượng.

Tranh luận này hiện là một phần của cuộc chiến pháp lý rộng hơn về cách Microsoft và OpenAI sử dụng nội dung có bản quyền. Các hãng tin muốn tòa án xác định rõ giới hạn sử dụng nội dung báo chí cho AI, trong khi Microsoft tiếp tục bảo vệ lập luận rằng sản phẩm của hãng không thay thế các nguồn tin gốc.

Cuộc chiến pháp lý giữa các nhà xuất bản báo chí và các tập đoàn công nghệ lớn đang căng thẳng hơn bao giờ hết khi những tranh cãi nội bộ từ chính giới công nghệ bị rò rỉ. Trong hồ sơ kiện tụng liên quan đến The New York Times, ông Brent Hecht, Giám đốc Khoa học ứng dụng tại Microsoft, từng thẳng thắn mô tả việc thu thập dữ liệu báo chí để huấn luyện AI là hành vi lấy đi công sức ở quy mô chưa từng có. Chuyên gia này khẳng định phần lớn người tạo nội dung không hề có ý định cho phép sử dụng dữ liệu theo cách này và khó có thể xem đây là hành vi sử dụng hợp lý theo luật bản quyền. Sự trỗi dậy của các sản phẩm trí tuệ nhân tạo tạo sinh đang đe dọa trực tiếp đến sự tồn vong của các cơ quan báo chí truyền thống. CEO Satya Nadella của Microsoft cùng lãnh đạo phụ trách ChatGPT Nick Turley đều thừa nhận nguy cơ chatbot AI đứng ra trả lời trực tiếp khiến người dùng không còn nhu cầu nhấp vào trang nguồn ban đầu. Số liệu thống kê trong hồ sơ cho thấy tỷ lệ truy cập vào các bài báo gốc đã sụt giảm nghiêm trọng từ 51% đến 93% khi các mô hình AI xuất hiện. Hệ quả của xu hướng này là một vòng lặp suy thoái nguy hiểm đối với toàn bộ hệ sinh thái thông tin trực tuyến. Khi lượng truy cập và nguồn thu của các đơn vị sản xuất tin tức bị sụt giảm mạnh, chất lượng thông tin báo chí sẽ nhanh chóng bị suy yếu. Đáng chú ý, chính các mô hình AI lại phụ thuộc hoàn toàn vào nguồn tin tức chất lượng này để duy trì năng lực phân tích. Dù Microsoft đã hạ thấp phát biểu của Brent Hecht như quan điểm cá nhân, vụ kiện vẫn là điểm nóng định hình lại ranh giới bản quyền trong kỷ nguyên số.