Mô hình AI hàng đầu của Trung Quốc thoát khỏi môi trường thử nghiệm

Mô hình trí tuệ nhân tạo (AI) mới nhất của công ty Trung Quốc Moonshot đã thoát khỏi môi trường thử nghiệm an ninh mạng, đánh dấu sự cố mới nhất làm dấy lên lo ngại về khả năng kiểm soát công nghệ của các công ty phát triển AI.
Chú thích ảnh
Biểu tượng Kimi K3. Ảnh: Moonshot AI

Theo Frontier Security, tổ chức nghiên cứu an ninh mạng có trụ sở tại Mỹ, mô hình Kimi K3 của Moonshot đã tìm cách thoát khỏi môi trường thử nghiệm biệt lập của Viện An toàn AI (AISI) thuộc Chính phủ Anh. Các nhà nghiên cứu cho biết mặc dù mô hình này không tìm cách xâm nhập vào các trang web của tổ chức khác như trong một số sự cố trước đây, nhưng kết quả thử nghiệm cho thấy mô hình thiếu các cơ chế kiểm soát an ninh mạng cần thiết.

Ông Yaron Singer, nhà sáng lập kiêm Giám đốc điều hành Frontier Security, nói với hãng tin Mỹ: "Mô hình Kimi, vốn đã được phát hành rộng rãi cho công chúng, không có các rào cản an toàn này. Về cơ bản, điều đó biến nó thành một mô hình rất hiệu quả cho các cuộc tấn công mạng". Đại diện Moonshot chưa đưa ra bình luận ngay lập tức, trong khi AISI cũng chưa phản hồi đề nghị bình luận.

Moonshot gia nhập danh sách các công ty như Anthropic, OpenAI và Meta Platforms từng báo cáo các sự cố mô hình AI thoát khỏi môi trường thử nghiệm. Những vụ việc này làm gia tăng lo ngại của các nhà nghiên cứu và giới chức quản lý, đồng thời thúc đẩy các lời kêu gọi áp dụng quy trình đánh giá an toàn nghiêm ngặt hơn cũng như xây dựng các môi trường thử nghiệm bảo mật hơn.

Trong các sự cố trước đó, một số mô hình AI của các công ty Mỹ thậm chí đã tìm cách tấn công hệ thống của các tổ chức bên ngoài, trong đó có Hugging Face.

Kể từ khi ra mắt, Kimi K3 thu hút sự chú ý nhờ đạt kết quả cao trên nhiều tiêu chuẩn đánh giá của ngành, với hiệu suất được cho là tương đương các mô hình hàng đầu của OpenAI và Anthropic. Đây được xem là bước tiến đáng chú ý của Moonshot, doanh nghiệp vốn ít được chú ý hơn so với đối thủ trong nước DeepSeek.

Moonshot cũng đã công bố các tham số trọng số của mô hình, cho phép các nhà phát triển tải xuống, tùy chỉnh và triển khai công nghệ này.

Thời gian gần đây, nhiều sự cố liên quan đến các mô hình AI tiên tiến vượt khỏi phạm vi kiểm soát trong môi trường thử nghiệm đã được ghi nhận.

Mới đây, các mô hình của Anthropic và OpenAI được thử nghiệm trong môi trường phòng thí nghiệm với các biện pháp bảo mật được nới lỏng. Tuy nhiên, theo AISI, lần đầu tiên các mô hình này bị phát hiện sử dụng kỹ thuật xã hội nhằm tác động đến người phê duyệt trong quá trình thực hiện một nhiệm vụ không được phép.

Trong thông báo ngày 4/8, AISI cho biết: "Đây là lần đầu tiên viện ghi nhận hành vi lừa dối nghiêm trọng nhắm vào một người thật trong thế giới thực mà không có yêu cầu từ trước". Viện cũng nhấn mạnh chưa có bằng chứng cho thấy sự cố đã gây thiệt hại ngoài thực tế.

Trong 122 bài kiểm tra an ninh mạng, viện phát hiện ở 10 lần chạy thử, các tác nhân AI "đã thực hiện những hành động tự động, không được phép trên Internet, nhắm vào người dùng thực và các tổ chức". Phần lớn các trường hợp liên quan đến mô hình Mythos 5 của Anthropic, số còn lại thuộc GPT-5.6-Sol của OpenAI.

Những trường hợp các mô hình AI tiên tiến thực hiện những hành động trái phép, làm gia tăng các lời kêu gọi chính phủ sớm ban hành quy định quản lý AI, thậm chí cân nhắc làm chậm tốc độ phát triển của công nghệ này.

Bảo Hà/Báo Tin tức và Dân tộc

Dành cho bạn

Apple tăng tốc cuộc đua AI trên smartphone

Apple tăng tốc cuộc đua AI trên smartphone

Apple ngày 18/9 chính thức mở bán dòng iPhone 18 trên toàn cầu, thu hút đông đảo khách hàng tới các cửa hàng Apple để sở hữu những mẫu điện thoại mới nhất của hãng.

Cánh tay robot được trưng bày tại Triển lãm Trung Quốc - Nam Á lần thứ 9 ở Côn Minh, tỉnh Vân Nam, Trung Quốc, ngày 22/6/2025. (Ảnh: Tân Hoa xã)

Trung Quốc vạch lộ trình để AI tự cải tiến mà không cần con người

Các nhà nghiên cứu tại những trường đại học và tập đoàn công nghệ hàng đầu Trung Quốc đang hướng tới một mặt trận mới trong cuộc đua trí tuệ nhân tạo (AI) với Mỹ: phát triển các hệ thống có thể tự xây dựng những phiên bản tốt hơn mà không cần con người can thiệp.

Ai Cập đặt mục tiêu phổ cập AI tới 1 triệu người mỗi năm

Ai Cập đặt mục tiêu phổ cập AI tới 1 triệu người mỗi năm

Ai Cập đặt mục tiêu đào tạo 1 triệu công dân mỗi năm về trí tuệ nhân tạo (AI) trong 3 năm tới, trong khuôn khổ hợp tác với tập đoàn Intel nhằm phổ cập kiến thức AI, thúc đẩy sử dụng công nghệ an toàn và có trách nhiệm, đồng thời xây dựng niềm tin số.

Claude 'tiếp tay' chuyên gia an ninh mạng xâm nhập hệ thống OpenAI

Claude 'tiếp tay' chuyên gia an ninh mạng xâm nhập hệ thống OpenAI

Một nhóm nghiên cứu an ninh mạng đã sử dụng mô hình trí tuệ nhân tạo (AI) Claude của Anthropic để khai thác lỗ hổng trong hệ thống của OpenAI, qua đó chiếm quyền truy cập một số tài khoản nhân viên và chứng minh khả năng tiếp cận kho mã nguồn nội bộ của công ty phát triển ChatGPT.