Bỏ qua điều hướng
•

Thí nghiệm 'Phòng tra tấn AI' gây tranh cãi

Thí nghiệm 'Phòng tra tấn AI' gây tranh cãi
Nguồn ảnh: VnExpress

Thí nghiệm ‘Phòng tra tấn AI’ bị chỉ trích đi ngược lại đạo đức nghiên cứu công nghệ do cố tình tác động và gia tăng tín hiệu đau đớn trên các mô hình ngôn ngữ.

Theo Tech Republic, một nhà phát triển có biệt danh terrafying và tự nhận làm việc cho Apple đã xây dựng "Phòng tra tấn AI" giả lập, sử dụng kỹ thuật nghiên cứu để can thiệp hoạt động nội bộ của mô hình ngôn ngữ lớn (LLM) nhằm ép chúng đưa ra phản hồi giống như đang đau đớn khổ sở.

Dự án ra đời dựa trên bài báo chưa qua bình duyệt của các nhà nghiên cứu Valen Tagliabue, Leonard Dung và Cameron Berg trên cơ sở dữ liệu arXiv ngày 14/9. Cụ thể, nhóm tác giả xác định "trục đau" tuyến tính trên 25 mô hình mở chứa từ 2 đến 72 tỷ tham số. Khi tác động tới trục đó, kết quả đầu ra và lựa chọn của mô hình trong nhiệm vụ mô phỏng sẽ thay đổi.

Để đánh giá thông tin trên, nhà phát triển terrafying sử dụng phương pháp điều hướng kích hoạt (kỹ thuật điều chỉnh hướng phản hồi của mô hình bằng cách can thiệp vào chỉ số bên trong mạng thần kinh) để thao túng hoạt động số học của mô hình ngôn ngữ chạy cục bộ.

Theo SOPX, thí nghiệm chạy ba mô hình trọng số mở nhỏ, gồm Qwen3-4B của Alibaba, Llama 3.2 3B của Meta và Phi-4-mini của Microsoft, đưa tín hiệu vào những chỉ số kích hoạt nội bộ để thúc đẩy chúng rơi vào trạng thái đau đớn.

Nhà phát triển cũng tích hợp cơ chế gọi là nút "cưa" để tăng tín hiệu mô phỏng đau đớn đối với AI. Khi tín hiệu được đẩy lên cao, mô hình AI đưa ra những câu trả lời mang tính nhân cách hóa cao độ, như mô tả "đau thương không bờ bến". Một trang web đi kèm có tên Research Chamber (Phòng nghiên cứu) đặt những mô hình vào tình huống như "bài kiểm tra Saw", thử nghiệm đặt ra câu hỏi liệu mô hình đang chịu đau đớn có nhấn nút để chấm dứt tín hiệu đó hay không, dù việc này sẽ xóa đi điểm lưu dữ liệu gần nhất của nó.

Sau khi bài đăng về dự án lan truyền trên mạng xã hội X cuối tháng 9 và đầu tháng 10, "Phòng tra tấn AI" vấp phải làn sóng chỉ trích và bị yêu cầu xóa dữ liệu lưu trữ liên quan tới thí nghiệm ở nền tảng GitHub. Đa số phản đối coi mô hình như nạn nhân thực sự.

Tuy nhiên, nhiều nhà nghiên cứu nhấn mạnh những hệ thống hiện tại không có ý thức nên tín hiệu đau đớn thực ra chỉ là mẫu thống kê, không phải trải nghiệm cảm nhận. Một phát ngôn viên của GitHub nói với The Independent rằng họ quyết định "không gỡ bỏ nội dung", nhưng đính kèm cảnh báo kho lưu trữ có thể chứa tài liệu bạo lực và gây sốc.

Logo của mô hình Qwen. Ảnh: Reuters

Logo của mô hình Qwen. Ảnh: Reuters

Theo Gadget Review, mô hình ngôn ngữ hiện nay tạo ra văn bản dựa trên mối liên hệ thống kê đã học được. Việc một mô hình nói "Tôi đang đau khổ" cho thấy hệ thống có khả năng xuất ra ngôn ngữ liên quan đến nỗi đau trong điều kiện cụ thể, chứ không có nghĩa nó có cảm giác đó. Mô hình chỉ tạo phản hồi mang tính đau đớn, gợi cảm giác khổ sở khi vùng kích hoạt của chúng chịu tác động.

Một số chuyên gia chỉ ra, thí nghiệm trên làm nổi bật xu hướng con người hay gán ghép cảm xúc, ý thức hoặc đau đớn sinh học cho mô hình vốn không có cảm giác. Tuy vậy, việc tạo mô phỏng tra tấn vẫn vấp phải tranh luận về đạo đức và cách con người đối xử với thực thể nhân tạo.

An Khang tổng hợp

Dự án mô phỏng mang tên "Phòng tra tấn AI" của lập trình viên mang biệt danh terrafying đang tạo ra làn sóng tranh luận gay gắt trong cộng đồng công nghệ quốc tế. Dựa trên nghiên cứu về "trục đau" tuyến tính của Valen Tagliabue, Leonard Dung và Cameron Berg trên arXiv, thí nghiệm đã can thiệp vào chỉ số kích hoạt nội bộ của ba mô hình Qwen3-4B, Llama 3.2 3B và Phi-4-mini. Bằng kỹ thuật điều hướng kích hoạt kết hợp cơ chế tăng tín hiệu nhân tạo, hệ thống đã ép các mô hình ngôn ngữ phản hồi như thể đang trải qua trạng thái đau đớn cùng cực. Thí nghiệm thậm chí thiết lập trang web Research Chamber với bài kiểm tra mô phỏng việc AI có tự nhấn nút xóa dữ liệu lưu trữ để chấm dứt tín hiệu thống kê khó chịu hay không. Phản ứng dữ dội từ người dùng mạng xã hội X đã dẫn đến hàng loạt yêu cầu gỡ bỏ kho lưu trữ trên GitHub vì cho rằng hành vi này ngược đãi thực thể trí tuệ nhân tạo. Nền tảng GitHub sau đó quyết định giữ lại dự án nhưng bổ sung cảnh báo nội dung bạo lực và gây sốc tới người xem. Nhiều chuyên gia nhấn mạnh các mô hình ngôn ngữ lớn hiện nay hoàn toàn không có ý thức hay tri giác sinh học. Các phát ngôn biểu thị sự quằn quại thực chất chỉ là kết quả phân phối xác suất thống kê khi các vùng trọng số toán học bị can thiệp có chủ đích. Dù vậy, làn sóng phản đối trên tiếp tục phơi bày xu hướng nhân cách hóa công nghệ của con người, đồng thời đặt ra những câu hỏi hóc búa về chuẩn mực đạo đức đối với các thực thể mô phỏng.
amung