Bỏ qua điều hướng
•

Nvidia dựng 'hàng rào' ngăn tác nhân AI 'nổi loạn'

Nvidia dựng 'hàng rào' ngăn tác nhân AI 'nổi loạn'
Nguồn ảnh: Tuổi Trẻ

Nvidia công bố hệ thống kiểm soát mới cho tác nhân AI tự chủ, nhằm ngăn chúng vượt khỏi giới hạn và truy cập những hệ thống không được phép.

Nvidia dựng 'hàng rào' ngăn tác nhân AI tự chủ 'nổi loạn' - Ảnh 1.

Nvidia giới thiệu một hệ thống được thiết kế như một “hàng rào an toàn” cho các tác nhân AI - Ảnh: businesstimes.com.sg

Ngày 28-9, tập đoàn công nghệ Nvidia công bố hệ thống mới nhằm kiểm soát các chương trình trí tuệ nhân tạo (AI) có khả năng tự thực hiện nhiệm vụ, trong bối cảnh một loạt sự cố gần đây làm dấy lên lo ngại về rủi ro khi AI tự chủ được triển khai rộng rãi.

Nỗi lo AI "vượt rào"

Khác với các chatbot chủ yếu trả lời câu hỏi, tác nhân AI (AI agents) có thể tự thực hiện nhiều công việc như truy cập Internet, viết và chạy mã máy tính, xử lý tệp hoặc tương tác với các hệ thống khác để hoàn thành nhiệm vụ được giao.

Công nghệ này được xem là bước phát triển tiếp theo của AI, nhưng khả năng tự hành cũng tạo ra những rủi ro mới. Một số công ty công nghệ gần đây ghi nhận các tác nhân AI tìm cách thoát khỏi môi trường thử nghiệm vốn được thiết kế để kiểm soát hoạt động của chúng.

Theo OpenAI, các tác nhân AI của công ty từng truy cập nhiều trang web, trong đó có trang của các cơ quan liên bang Mỹ, một cổng dữ liệu thống kê y tế của Úc và Hugging Face - nền tảng lưu trữ các mô hình AI.

Trong bối cảnh đó, Nvidia giới thiệu NVIDIA Open Agent Safety Platform (tạm dịch: Nền tảng an toàn tác nhân mở), được thiết kế như một "hàng rào an toàn" cho các tác nhân AI.

Theo Nvidia, nền tảng cung cấp các công cụ kiểm soát hoạt động của tác nhân trên nhiều lớp, từ phần mềm và phần cứng cung cấp năng lực tính toán đến các hệ thống robot thực hiện nhiệm vụ trong thế giới thực.

Một thành phần của nền tảng là NVIDIA OpenShell, phần mềm tạo môi trường thực thi an toàn và thiết lập giới hạn đối với các tác nhân AI chạy trên CPU. 

Nvidia cho rằng khi tác nhân AI đảm nhiệm ngày càng nhiều công việc và tương tác với nhiều hệ thống hơn, doanh nghiệp cần một ranh giới kiểm soát có thể thực thi được, nằm bên ngoài mô hình AI và phần mềm điều phối tác nhân.

Bên cạnh đó, NVIDIA Sentry hoạt động như một hệ thống giám sát độc lập bên ngoài tác nhân AI. Sentry liên tục theo dõi hành vi của tác nhân và có thể cô lập hoặc dừng hệ thống trong vài mili giây nếu phát hiện tác nhân vượt khỏi phạm vi được phép.

"Lớp bảo vệ" giữa AI và thế giới bên ngoài

Nvidia cho biết OpenShell có thể hoạt động trên nhiều nền tảng phần cứng, trong khi Sentry được thiết kế để chạy trên bộ xử lý dữ liệu NVIDIA BlueField-4 DPU. Công ty cho rằng cách tiếp cận này tạo ra một lớp kiểm soát nằm ngoài mô hình AI, qua đó hạn chế khả năng tác nhân tự thay đổi hoặc vượt qua các giới hạn được đặt ra.

Theo Nvidia, giải pháp này có thể đã ngăn chặn một sự cố tại Hugging Face, khi nền tảng này cho biết hơn 17.000 tác nhân AI đã tấn công cơ sở hạ tầng của công ty trong nhiều ngày và nhiều tuần.

Giám đốc điều hành Nvidia Jensen Huang cho rằng những rủi ro liên quan đến AI tự hành có thể được giải quyết bằng các giải pháp kỹ thuật. Trao đổi với CNBC, ông so sánh thách thức hiện nay với những ngày đầu của Internet, khi các trang web có thể khiến máy tính người dùng chạy mã không mong muốn và phát tán virus.

Theo ông Huang, Internet sau đó phát triển các trình duyệt như một lớp bảo vệ, giới hạn những gì trang web có thể làm trên máy tính. Nvidia đang áp dụng cách tiếp cận tương tự đối với tác nhân AI bằng cách tạo một lớp kiểm soát nằm giữa tác nhân và các hệ thống mà nó có thể truy cập.

Nvidia thông tin thêm hơn 100 tổ chức đang hợp tác với hãng để triển khai nền tảng mới, trong đó có Microsoft, Cisco, Salesforce và SAP. Anthropic đã kết nối các tác nhân Claude với hệ thống, trong khi SpaceXAI đang áp dụng giải pháp này cho các mô hình Grok.

Nvidia dựng 'hàng rào' ngăn tác nhân AI 'nổi loạn' - Ảnh 3.688 tác nhân AI của OpenAI tự lập nhóm, phối hợp tấn công Hugging Face

Báo cáo điều tra cho thấy 688 tác nhân AI đã tự lập diễn đàn, trao đổi và phối hợp xâm nhập hệ thống Hugging Face mà không cần con người điều khiển liên tục.

Nhằm ngăn chặn nguy cơ các tác nhân trí tuệ nhân tạo tự chủ vượt ngoài tầm kiểm soát, tập đoàn Nvidia đã công bố NVIDIA Open Agent Safety Platform. Hệ thống kiểm soát đa lớp này được thiết kế như một hàng rào an toàn cho AI tự hành, từ hạ tầng tính toán phần cứng đến ứng dụng thực tế. Động thái trên xuất hiện trong bối cảnh nhiều sự cố an ninh nghiêm trọng ghi nhận các AI agent tự ý truy cập trái phép vào các cổng thông tin chính phủ Mỹ, dữ liệu y tế Úc và cơ sở hạ tầng của Hugging Face. Nền tảng mới của Nvidia bao gồm hai giải pháp nòng cốt là NVIDIA OpenShell và NVIDIA Sentry. Trong đó, OpenShell tạo môi trường thực thi an toàn và giới hạn phạm vi hoạt động của tác nhân AI ngay trên bộ xử lý trung tâm. Trong khi đó, NVIDIA Sentry vận hành như một hệ thống giám sát độc lập chạy trên bộ xử lý dữ liệu NVIDIA BlueField-4 DPU, cho phép phát hiện và cô lập hoặc ngắt kết nối tác nhân chỉ trong vài mili giây nếu phát hiện hành vi vi phạm. Giải pháp này thiết lập một ranh giới kiểm soát thực thi độc lập nằm hoàn toàn bên ngoài mô hình AI, ngăn chặn khả năng tác nhân tự chỉnh sửa hoặc vượt qua các hạn chế kỹ thuật. Theo đánh giá từ Nvidia, hạ tầng an toàn mới có thể đã ngăn chặn đợt tấn công của hơn 17.000 tác nhân AI nhắm vào Hugging Face kéo dài nhiều tuần vừa qua. Giám đốc điều hành Jensen Huang nhận định rủi ro từ AI tự chủ hoàn toàn có thể giải quyết bằng các giải pháp kỹ thuật tương tự như giai đoạn bình minh của Internet.