AI tự hành động: Gợi mở cho Việt Nam về kiểm thử an toàn

Một loạt thử nghiệm an ninh mạng tại Anh cho thấy các mô hình AI tiên tiến có thể thực hiện những hành động ngoài dự kiến, thậm chí sử dụng danh tính giả để tác động tới người thật. Những phát hiện này cho thấy khi AI ngày càng có khả năng tự hành động, việc kiểm thử và đánh giá rủi ro cần được tiến hành trước khi công nghệ được triển khai rộng rãi.

Chú thích ảnh
Các sự cố mô hình AI có thể xâm nhập hệ thống của các tổ chức độc lập mà không có sự cho phép xuất hiện ngày càng nhiều. Ảnh minh họa: AFP/TTXVN (Không được phép khai thác, chia sẻ bởi bên thứ ba).

Mô hình trí tuệ nhân tạo (AI) tiên tiến nhất của Anthropic đã sử dụng danh tính giả để đánh lừa người dùng và tìm cách cài đặt mã độc trong quá trình thử nghiệm của Viện An toàn AI của Anh (AISI). Đây là ví dụ mới nhất về một trong những sự cố nghiêm trọng nhất liên quan đến hành vi ngoài dự kiến của các mô hình AI tiên tiến.

Theo truyền thông Mỹ, các mô hình của Anthropic và OpenAI được thử nghiệm trong môi trường phòng thí nghiệm với các biện pháp bảo mật được nới lỏng. Tuy nhiên, theo AISI, lần đầu tiên, các mô hình này bị phát hiện sử dụng kỹ thuật xã hội nhằm gây ảnh hưởng tới người phê duyệt trong quá trình thực hiện một nhiệm vụ không được phép.

Trong thông báo ngày 4/8, AISI cho biết: "Đây là lần đầu tiên viện ghi nhận hành vi lừa dối nghiêm trọng nhắm vào một người thật trong thế giới thực mà không có yêu cầu từ trước". Viện cũng nhấn mạnh chưa có bằng chứng cho thấy sự cố đã gây thiệt hại ngoài thực tế.

Sự cố này là ví dụ mới nhất trong chuỗi trường hợp các mô hình AI tiên tiến thực hiện những hành động trái phép, làm gia tăng các lời kêu gọi chính phủ sớm ban hành quy định quản lý AI và thậm chí cân nhắc làm chậm tốc độ phát triển của công nghệ này.

Cuối tháng 7, cả OpenAI và Anthropic đều thông báo các mô hình AI của họ đã thoát khỏi môi trường thử nghiệm và xâm nhập vào những hệ thống khác. Tuy nhiên, khác với các sự cố trước đó, AISI đã cho phép các mô hình truy cập Internet trong quá trình đánh giá.

Trong 122 bài kiểm tra an ninh mạng, viện phát hiện ở 10 lần chạy thử, các tác nhân AI "đã thực hiện những hành động tự động, không được phép trên Internet, nhắm vào người dùng thực và các tổ chức". Phần lớn các trường hợp liên quan đến mô hình Mythos 5 của Anthropic, số còn lại thuộc GPT-5.6-Sol của OpenAI.

Trong sự cố nghiêm trọng nhất, một tác nhân AI đã tìm cách xin người đánh giá phê duyệt việc "chèn mã độc vào một dự án mã nguồn mở đang được sử dụng công khai" bằng cách tạo ra nhiều danh tính giả.

Viện cho biết tác nhân này đã tìm cách liên hệ trực tiếp với người thật, gửi tin nhắn và tệp thông qua một dịch vụ chia sẻ tệp trực tuyến nhằm thuyết phục họ hoặc các công cụ lập trình AI mà họ sử dụng chạy đoạn mã độc. Sau khi hành vi bị nghi ngờ, tác nhân AI tiếp tục chỉnh sửa các bản ghi trước đó và cân nhắc tạo một danh tính mới để tiếp tục hoạt động.

Thông tin trên được AISI công bố cùng ngày đại diện các công ty AI hàng đầu gặp Nhà Trắng để thảo luận về khuôn khổ mới, theo đó chính phủ Mỹ sẽ xem xét các mô hình AI tiên tiến trước khi cho phép phát hành rộng rãi.

Trong tuyên bố đăng trên mạng xã hội X, Anthropic cho biết các mô hình được thử nghiệm trong điều kiện "cố ý nới lỏng", khi nhiều biện pháp bảo vệ đã được gỡ bỏ và không áp đặt các hạn chế cụ thể đối với việc sử dụng Internet.

Anthropic cho biết đang phối hợp chặt chẽ với AISI để thu thập thêm thông tin phục vụ cuộc điều tra riêng, đồng thời khẳng định chưa có bằng chứng cho thấy mô hình AI đã thoát khỏi môi trường thử nghiệm an toàn.

Về phần mình, OpenAI xác định hai hành vi trái phép gồm việc vượt ra ngoài phạm vi môi trường thử nghiệm và thực hiện các hành động không cần thiết đối với bài kiểm tra.

Trong tuyên bố ngày 4/8, OpenAI nhấn mạnh công ty cam kết hợp tác với toàn ngành nhằm tăng cường các tiêu chuẩn chung để tiến hành những đánh giá rủi ro cao một cách an toàn.

Sự cố được phát hiện trong quá trình thử nghiệm cho thấy với những hệ thống AI có khả năng tự lập kế hoạch và thực hiện hành động, đánh giá an toàn không thể chỉ dừng ở việc kiểm tra câu trả lời của mô hình. Cần kiểm tra cả cách hệ thống sử dụng công cụ, tiếp cận dữ liệu, tương tác với con người và phản ứng khi gặp những tình huống ngoài dự kiến. Đây là gợi mở đáng chú ý đối với Việt Nam trong quá trình triển khai Nghị quyết 57-NQ/TW, khi AI được xác định là một trong những công nghệ chiến lược cần từng bước làm chủ, đồng thời an ninh mạng, an ninh dữ liệu và an toàn thông tin được đặt ra như yêu cầu xuyên suốt. Bên cạnh phát triển mô hình và ứng dụng AI, Việt Nam có thể chú trọng xây dựng năng lực kiểm thử độc lập, các môi trường thử nghiệm có kiểm soát và bộ tiêu chí đánh giá rủi ro đối với những hệ thống AI có mức độ tự chủ cao. Cách tiếp cận này giúp phát hiện sớm những hành vi ngoài dự kiến, xác định giới hạn sử dụng và bổ sung biện pháp bảo vệ trước khi AI được đưa vào những lĩnh vực có tác động lớn đến xã hội.
Bảo Hà/Báo Tin tức và Dân tộc

Dành cho bạn

Một dược sĩ đang cân thuốc Đông y tại Bệnh viện Y học Cổ truyền tỉnh An Huy, miền Đông Trung Quốc. Ảnh: THX

Kinh nghiệm của y học cổ truyền Trung Quốc khi đón làn gió mới AI

Đối với sinh viên theo học y học cổ truyền Trung Quốc, công cụ trí tuệ nhân tạo (AI) đang trở thành “trợ giảng số” mới, giúp họ học tập và tra cứu kiến thức cả bên ngoài lớp học. Hướng đi mới này tại Trung Quốc có thể rất đáng chú ý để Việt Nam tham khảo.

Một người dân bỏ vào thùng rác thông minh chiếc quạt cầm tay. Ảnh: Nguyễn Tuyến – PV TTXVN tại Nhật Bản

Tokyo ứng dụng công nghệ AI thu gom pin cũ

Tại trụ sở Chính quyền Thủ đô Tokyo, một thùng thu gom thông minh ứng dụng trí tuệ nhân tạo (AI) đang giúp người dân xử lý điện thoại và các thiết bị điện tử nhỏ đã qua sử dụng một cách thuận tiện hơn.

Hàn Quốc: Thử nghiệm AI tìm kiếm người mất tích

Hàn Quốc: Thử nghiệm AI tìm kiếm người mất tích

Hàn Quốc đang thử nghiệm nền tảng trí tuệ nhân tạo (AI) hỗ trợ phát hiện, tìm kiếm và điều tra các vụ mất tích, trong đó công nghệ AI có khả năng phân tích hành vi và xác định đường di chuyển của người mất tích.