Mô hình AI hàng đầu của Trung Quốc thoát khỏi môi trường thử nghiệm

Mô hình trí tuệ nhân tạo (AI) mới nhất của công ty Trung Quốc Moonshot đã thoát khỏi môi trường thử nghiệm an ninh mạng, đánh dấu sự cố mới nhất làm dấy lên lo ngại về khả năng kiểm soát công nghệ của các công ty phát triển AI.
Chú thích ảnh
Biểu tượng Kimi K3. Ảnh: Moonshot AI

Theo Frontier Security, tổ chức nghiên cứu an ninh mạng có trụ sở tại Mỹ, mô hình Kimi K3 của Moonshot đã tìm cách thoát khỏi môi trường thử nghiệm biệt lập của Viện An toàn AI (AISI) thuộc Chính phủ Anh. Các nhà nghiên cứu cho biết mặc dù mô hình này không tìm cách xâm nhập vào các trang web của tổ chức khác như trong một số sự cố trước đây, nhưng kết quả thử nghiệm cho thấy mô hình thiếu các cơ chế kiểm soát an ninh mạng cần thiết.

Ông Yaron Singer, nhà sáng lập kiêm Giám đốc điều hành Frontier Security, nói với hãng tin Mỹ: "Mô hình Kimi, vốn đã được phát hành rộng rãi cho công chúng, không có các rào cản an toàn này. Về cơ bản, điều đó biến nó thành một mô hình rất hiệu quả cho các cuộc tấn công mạng". Đại diện Moonshot chưa đưa ra bình luận ngay lập tức, trong khi AISI cũng chưa phản hồi đề nghị bình luận.

Moonshot gia nhập danh sách các công ty như Anthropic, OpenAI và Meta Platforms từng báo cáo các sự cố mô hình AI thoát khỏi môi trường thử nghiệm. Những vụ việc này làm gia tăng lo ngại của các nhà nghiên cứu và giới chức quản lý, đồng thời thúc đẩy các lời kêu gọi áp dụng quy trình đánh giá an toàn nghiêm ngặt hơn cũng như xây dựng các môi trường thử nghiệm bảo mật hơn.

Trong các sự cố trước đó, một số mô hình AI của các công ty Mỹ thậm chí đã tìm cách tấn công hệ thống của các tổ chức bên ngoài, trong đó có Hugging Face.

Kể từ khi ra mắt, Kimi K3 thu hút sự chú ý nhờ đạt kết quả cao trên nhiều tiêu chuẩn đánh giá của ngành, với hiệu suất được cho là tương đương các mô hình hàng đầu của OpenAI và Anthropic. Đây được xem là bước tiến đáng chú ý của Moonshot, doanh nghiệp vốn ít được chú ý hơn so với đối thủ trong nước DeepSeek.

Moonshot cũng đã công bố các tham số trọng số của mô hình, cho phép các nhà phát triển tải xuống, tùy chỉnh và triển khai công nghệ này.

Thời gian gần đây, nhiều sự cố liên quan đến các mô hình AI tiên tiến vượt khỏi phạm vi kiểm soát trong môi trường thử nghiệm đã được ghi nhận.

Mới đây, các mô hình của Anthropic và OpenAI được thử nghiệm trong môi trường phòng thí nghiệm với các biện pháp bảo mật được nới lỏng. Tuy nhiên, theo AISI, lần đầu tiên các mô hình này bị phát hiện sử dụng kỹ thuật xã hội nhằm tác động đến người phê duyệt trong quá trình thực hiện một nhiệm vụ không được phép.

Trong thông báo ngày 4/8, AISI cho biết: "Đây là lần đầu tiên viện ghi nhận hành vi lừa dối nghiêm trọng nhắm vào một người thật trong thế giới thực mà không có yêu cầu từ trước". Viện cũng nhấn mạnh chưa có bằng chứng cho thấy sự cố đã gây thiệt hại ngoài thực tế.

Trong 122 bài kiểm tra an ninh mạng, viện phát hiện ở 10 lần chạy thử, các tác nhân AI "đã thực hiện những hành động tự động, không được phép trên Internet, nhắm vào người dùng thực và các tổ chức". Phần lớn các trường hợp liên quan đến mô hình Mythos 5 của Anthropic, số còn lại thuộc GPT-5.6-Sol của OpenAI.

Những trường hợp các mô hình AI tiên tiến thực hiện những hành động trái phép, làm gia tăng các lời kêu gọi chính phủ sớm ban hành quy định quản lý AI, thậm chí cân nhắc làm chậm tốc độ phát triển của công nghệ này.

Bảo Hà/Báo Tin tức và Dân tộc

Dành cho bạn

OpenAI nêu quan điểm về xây dựng tiêu chuẩn AI

OpenAI nêu quan điểm về xây dựng tiêu chuẩn AI

Công ty OpenAI đã kêu gọi Mỹ dẫn dắt nỗ lực quốc tế xây dựng các tiêu chuẩn an toàn và bảo mật trong phát triển trí tuệ nhân tạo (AI), trong bối cảnh những lo ngại về rủi ro của công nghệ này ngày càng gia tăng.

Google chịu phạt 403 triệu euro

Google chịu phạt 403 triệu euro

Ủy ban Bảo vệ Dữ liệu Ireland (DPC), cơ quan quản lý chính về bảo vệ dữ liệu của Liên minh châu Âu (EU) đối với nhiều tập đoàn công nghệ lớn, ngày 21/9 thông báo phạt Google 403 triệu euro sau cuộc điều tra kéo dài 6 năm về việc xử lý dữ liệu vị trí của người dùng.

Khi AI bắt đầu học cách tự cải tiến

Khi AI bắt đầu học cách tự cải tiến

AI đang bước vào giai đoạn phát triển mới khi không chỉ thực hiện nhiệm vụ do con người giao mà còn có thể tham gia cải tiến chính những hệ thống AI đang vận hành. Khả năng này đang làm dấy lên cuộc tranh luận về “tự cải thiện đệ quy” và giới hạn kiểm soát của con người.