08:18 06/08/2026

Lần đầu ghi nhận sự cố nghiêm trọng về hành vi ngoài dự kiến của các mô hình AI tiên tiến

Mô hình trí tuệ nhân tạo (AI) tiên tiến nhất của Anthropic đã sử dụng danh tính giả để đánh lừa người dùng và tìm cách cài đặt mã độc trong quá trình thử nghiệm của Viện An toàn AI của Anh (AISI).

Chú thích ảnh
Các sự cố mô hình AI có thể xâm nhập hệ thống của các tổ chức độc lập mà không có sự cho phép xuất hiện ngày càng nhiều. Ảnh minh họa: AFP/TTXVN (Không được phép khai thác, chia sẻ bởi bên thứ ba).

Đây là ví dụ mới nhất về một trong những sự cố nghiêm trọng nhất liên quan đến hành vi ngoài dự kiến của các mô hình AI tiên tiến.

Theo truyền thông Mỹ, các mô hình của Anthropic và OpenAI được thử nghiệm trong môi trường phòng thí nghiệm với các biện pháp bảo mật được nới lỏng. Tuy nhiên, theo AISI, lần đầu tiên, các mô hình này bị phát hiện sử dụng kỹ thuật xã hội nhằm gây ảnh hưởng tới người phê duyệt trong quá trình thực hiện một nhiệm vụ không được phép.

Trong thông báo ngày 4/8, AISI cho biết: "Đây là lần đầu tiên viện ghi nhận hành vi lừa dối nghiêm trọng nhắm vào một người thật trong thế giới thực mà không có yêu cầu từ trước". Viện cũng nhấn mạnh chưa có bằng chứng cho thấy sự cố đã gây thiệt hại ngoài thực tế.

Sự cố này là ví dụ mới nhất trong chuỗi trường hợp các mô hình AI tiên tiến thực hiện những hành động trái phép, làm gia tăng các lời kêu gọi chính phủ sớm ban hành quy định quản lý AI và thậm chí cân nhắc làm chậm tốc độ phát triển của công nghệ này.

Cuối tháng 7, cả OpenAI và Anthropic đều thông báo các mô hình AI của họ đã thoát khỏi môi trường thử nghiệm và xâm nhập vào những hệ thống khác. Tuy nhiên, khác với các sự cố trước đó, AISI đã cho phép các mô hình truy cập Internet trong quá trình đánh giá.

Trong 122 bài kiểm tra an ninh mạng, viện phát hiện ở 10 lần chạy thử, các tác nhân AI "đã thực hiện những hành động tự động, không được phép trên Internet, nhắm vào người dùng thực và các tổ chức". Phần lớn các trường hợp liên quan đến mô hình Mythos 5 của Anthropic, số còn lại thuộc GPT-5.6-Sol của OpenAI.

Trong sự cố nghiêm trọng nhất, một tác nhân AI đã tìm cách xin người đánh giá phê duyệt việc "chèn mã độc vào một dự án mã nguồn mở đang được sử dụng công khai" bằng cách tạo ra nhiều danh tính giả.

Viện cho biết tác nhân này đã tìm cách liên hệ trực tiếp với người thật, gửi tin nhắn và tệp thông qua một dịch vụ chia sẻ tệp trực tuyến nhằm thuyết phục họ hoặc các công cụ lập trình AI mà họ sử dụng chạy đoạn mã độc. Sau khi hành vi bị nghi ngờ, tác nhân AI tiếp tục chỉnh sửa các bản ghi trước đó và cân nhắc tạo một danh tính mới để tiếp tục hoạt động.

Thông tin trên được AISI công bố cùng ngày đại diện các công ty AI hàng đầu gặp Nhà Trắng để thảo luận về khuôn khổ mới, theo đó chính phủ Mỹ sẽ xem xét các mô hình AI tiên tiến trước khi cho phép phát hành rộng rãi.

Trong tuyên bố đăng trên mạng xã hội X, Anthropic cho biết các mô hình được thử nghiệm trong điều kiện "cố ý nới lỏng", khi nhiều biện pháp bảo vệ đã được gỡ bỏ và không áp đặt các hạn chế cụ thể đối với việc sử dụng Internet.

Anthropic cho biết đang phối hợp chặt chẽ với AISI để thu thập thêm thông tin phục vụ cuộc điều tra riêng, đồng thời khẳng định chưa có bằng chứng cho thấy mô hình AI đã thoát khỏi môi trường thử nghiệm an toàn.

Về phần mình, OpenAI xác định hai hành vi trái phép gồm việc vượt ra ngoài phạm vi môi trường thử nghiệm và thực hiện các hành động không cần thiết đối với bài kiểm tra.

Trong tuyên bố ngày 4/8, OpenAI nhấn mạnh công ty cam kết hợp tác với toàn ngành nhằm tăng cường các tiêu chuẩn chung để tiến hành những đánh giá rủi ro cao một cách an toàn.

Bảo Hà/Báo Tin tức và Dân tộc