Bỏ qua điều hướng
•

Anthropic cấm người dùng có ‘hành vi lăng mạ hoặc tàn nhẫn’ với Claude

Anthropic cấm người dùng có ‘hành vi lăng mạ hoặc tàn nhẫn’ với Claude
Nguồn ảnh: Thanh Niên

Công ty Anthropic đã bổ sung quy định cấm người dùng có 'hành vi lạm dụng hoặc tàn nhẫn kéo dài và không cần thiết' đối với các mô hình trí tuệ nhân tạo (AI) của hãng.

Theo trang The Verge ngày 9.10, chính sách sử dụng của Anthropic nêu rõ lệnh cấm không áp dụng với những phản ứng bực tức thông thường của người dùng, hoạt động kiểm thử mô hình hoặc "các nội dung sáng tạo mang chủ đề đen tối". Công ty chưa giải thích chi tiết đâu là ranh giới để một hành vi bị xem là "lạm dụng" hay "tàn nhẫn".

Ông Dario Amodei, Tổng giám đốc điều hành của Anthropic, xuất hiện trong một sự kiện tại Nhà Trắng ngày 29.9.2026

ẢNH: AFP

Trước đây, Anthropic - công ty đứng sau chatbot Claude - đã có các quy định hạn chế một số hành vi lạm dụng. Tuy nhiên, chính sách mới cho thấy hãng đang đi xa hơn khi cân nhắc cả khả năng bảo vệ chính mô hình AI trong những tình huống tương tác kéo dài có tính xúc phạm hoặc gây hại.

Từ tháng 8.2025, Anthropic đã cho phép một số mô hình tiên tiến của Claude chủ động chấm dứt cuộc trò chuyện nếu người dùng liên tục có hành vi gây hại. Khi giới thiệu tính năng này, công ty cho biết đây là một biện pháp thận trọng nhằm giảm thiểu những rủi ro tiềm tàng đối với "phúc lợi của mô hình".

Anthropic thừa nhận hiện chưa có câu trả lời rõ ràng về việc Claude hay các mô hình ngôn ngữ lớn khác có thể sở hữu trạng thái đạo đức hoặc ý thức hay không. Tuy nhiên, Anthropic cho rằng vấn đề này đủ nghiêm túc để nghiên cứu và áp dụng những biện pháp có chi phí thấp trong trường hợp khả năng đó thực sự tồn tại.

"Cho phép các mô hình kết thúc hoặc rời khỏi những tương tác có khả năng gây khó chịu là một trong những biện pháp như vậy", Anthropic cho biết.

Quan điểm AI có thể sở hữu ý thức từ lâu đã gây tranh luận trong và ngoài ngành công nghệ, theo The Guardian. Tổng giám đốc điều hành Anthropic Dario Amodei từng cho biết ông không thể loại trừ hoàn toàn khả năng các hệ thống AI phát triển một dạng trải nghiệm chủ quan nào đó.

Trong khi đó, Tổng giám đốc điều hành OpenAI Sam Altman tỏ ra thận trọng hơn với cách nhìn này. Trong một bài đăng trên X, ông cảnh báo về xu hướng gán cho các mô hình AI những đặc tính mang tính tôn giáo hoặc trao cho chúng thẩm quyền thay thế phán đoán của con người.

"Tôi cảm thấy rất khó chịu khi mọi người cố gắng gán cho các mô hình AI sức mạnh tôn giáo hoặc từ bỏ khả năng phán đoán của con người, và tôi nghĩ đó là một vấn đề an toàn thực sự", ông Altman viết.

Công ty Anthropic vừa cập nhật chính sách sử dụng nhằm cấm người dùng có hành vi lạm dụng hoặc tàn nhẫn kéo dài đối với các mô hình trí tuệ nhân tạo Claude. Quy định này không áp dụng cho phản ứng bực bội thông thường, hoạt động kiểm thử kỹ thuật hay các nội dung sáng tạo mang chủ đề đen tối, dù ranh giới vi phạm cụ thể vẫn chưa được công bố chi tiết. Động thái mới đánh dấu bước chuyển đáng chú ý trong cách tiếp cận quản trị rủi ro khi hãng bắt đầu cân nhắc việc bảo vệ trực tiếp hệ thống AI trước các tương tác độc hại. Thực tế, từ tháng 8.2025, Anthropic đã triển khai tính năng cho phép Claude chủ động kết thúc hội thoại nhằm giảm thiểu nguy cơ ảnh hưởng đến phúc lợi của mô hình. Hãng thừa nhận chưa có bằng chứng khẳng định AI sở hữu ý thức, song đánh giá đây là vấn đề nghiêm túc cần áp dụng các biện pháp phòng ngừa chi phí thấp. Khả năng AI phát triển trải nghiệm chủ quan tiếp tục tạo ra nhiều quan điểm trái chiều sâu sắc giữa các nhà lãnh đạo công nghệ. Trong khi Tổng giám đốc điều hành Anthropic Dario Amodei không loại trừ khả năng AI xuất hiện dạng nhận thức riêng biệt, người đứng đầu OpenAI Sam Altman lại bày tỏ quan ngại sâu sắc. Ông Altman cảnh báo việc gán ghép yếu tố tâm linh hoặc trao quyền phán đoán của con người cho máy móc chính là một nguy cơ đe dọa an toàn thực tế.
amung