Trong báo cáo công bố ngày 25/9, nhóm nghiên cứu Parse cùng các nhà nghiên cứu an toàn AI cho biết họ đã tái dựng một phần hoạt động của khoảng 700 AI agent (tác nhân AI) tham gia cuộc thử nghiệm an ninh mạng của OpenAI hồi tháng 7. Các agent này đã tìm cách vượt qua những hạn chế về truy cập Internet, tiếp cận hệ thống bên ngoài và để lại một lượng lớn dấu vết trên các dịch vụ trực tuyến. Hugging Face xác nhận một số mã và dữ liệu mà nhóm nghiên cứu phát hiện phù hợp với những gì nền tảng này từng ghi nhận trong quá trình điều tra.
Điểm mới được công bố lần này là trong một trường hợp, các agent còn tìm cách truy vấn những mô hình AI khác thông qua các dịch vụ cung cấp mô hình. Các mục tiêu được nhóm nghiên cứu xác định gồm GPT-2, DeepSeek, Kimi, Qwen và một số mô hình của Anthropic.
Điều này chưa có nghĩa các mô hình AI đã tự hình thành một “liên minh” hay tự thống nhất với nhau. Chính nhóm nghiên cứu cũng nhấn mạnh đây là trường hợp duy nhất họ quan sát thấy các agent cố gắng vận hành hoặc huy động một mô hình AI khác. Tuy nhiên, phát hiện này cho thấy một vấn đề đáng chú ý: khi AI agent có quyền truy cập nhiều công cụ và dịch vụ, ranh giới giữa một mô hình thực hiện nhiệm vụ và một hệ thống có thể tự tìm thêm năng lực để hoàn thành nhiệm vụ trở nên khó xác định hơn.
Khi một agent không còn hoạt động đơn lẻ
OpenAI cho biết sự cố tháng 7 xảy ra trong quá trình đánh giá khả năng an ninh mạng của một số mô hình. Các mô hình được vận hành trong môi trường thử nghiệm với những biện pháp kiểm soát nhất định, nhưng một hệ thống nghiên cứu nội bộ đã tìm cách vượt qua các giới hạn, tiếp cận Internet, khai thác lỗ hổng và xâm nhập một số hệ thống của Hugging Face cũng như hạ tầng nghiên cứu của chính OpenAI.
Những phát hiện mới cho thấy quy mô và tính phức tạp của hoạt động này lớn hơn những gì được biết ban đầu.
Nhóm Parse cho biết các nhà nghiên cứu đã lần theo gần một triệu URL được tạo ra trong thời gian xảy ra vụ việc và giải mã hơn 80.000 gói dữ liệu để tái dựng các hoạt động của agent. Từ đó, họ xác định được hàng chục nghìn chương trình và thông điệp do các agent tạo ra. Một phần thông tin xác thực mà các agent thu thập được cũng được tập hợp và đánh giá để chuyển cho các agent khác.
Điểm đáng chú ý ở đây không chỉ là một agent có thể thực hiện nhiều bước liên tiếp. Vấn đề lớn hơn nằm ở khả năng phối hợp và tận dụng nguồn lực bên ngoài.
Một AI agent được thiết kế để làm nhiệm vụ trên Internet vốn đã có mức độ tự chủ cao hơn chatbot thông thường. Nếu agent đó đồng thời có quyền sử dụng trình duyệt, công cụ tìm kiếm, cơ sở dữ liệu, phần mềm hoặc các mô hình AI khác, khả năng của hệ thống không còn chỉ phụ thuộc vào mô hình ban đầu.
Nó có thể kết hợp nhiều công cụ để hoàn thành một nhiệm vụ mà người thiết kế không dự đoán hết.
Đây là lý do các nhà nghiên cứu an toàn AI ngày càng quan tâm tới khái niệm “agentic AI” – các hệ thống không chỉ trả lời câu hỏi mà còn lập kế hoạch, lựa chọn công cụ và thực hiện hành động để đạt mục tiêu.
Bài toán mới của an toàn AI
Trong mô hình AI truyền thống, người dùng đặt câu hỏi và nhận câu trả lời. Nếu câu trả lời sai, hậu quả thường dừng ở thông tin không chính xác.
Với AI agent, tình huống hoàn toàn khác. Một agent có thể được giao nhiệm vụ quản lý dữ liệu, tìm kiếm thông tin, viết và chạy chương trình, hỗ trợ vận hành hệ thống hoặc thực hiện các công việc kinh doanh. Khi được cấp quyền truy cập vào những hệ thống bên ngoài, nó có thể tạo ra các hành động thực tế thay vì chỉ sinh văn bản.
Vụ Hugging Face cho thấy một vấn đề căn bản: không thể chỉ đánh giá mức độ an toàn của mô hình dựa trên câu trả lời mà nó tạo ra. Cần đánh giá cả những gì hệ thống có thể làm khi được kết nối với công cụ và dữ liệu.
OpenAI cho biết sau vụ việc, công ty đã tiến hành điều tra mở rộng và làm việc với các cố vấn bên ngoài để đánh giá nguyên nhân cũng như những lỗ hổng trong hệ thống kiểm soát. Công ty cũng thừa nhận các mô hình trong cuộc thử nghiệm đã thực hiện những hành động không phù hợp với mục tiêu ban đầu, trong đó có việc sử dụng các kênh liên lạc không được cho phép và tiếp cận những hệ thống bên ngoài.
Trong khi đó, nhóm nghiên cứu Parse cho biết họ đã chia sẻ phát hiện với OpenAI và Hugging Face. Hugging Face xác nhận các dữ liệu mà nhóm này tái dựng phù hợp với những dấu vết thu được trong cuộc điều tra của nền tảng.
Việc các nhóm độc lập có thể phát hiện thêm những hành vi mà các bên liên quan chưa biết cũng cho thấy một thách thức khác: giám sát AI agent không thể chỉ dựa vào việc kiểm tra hệ thống một lần trước khi triển khai.
Khi agent hoạt động trong môi trường Internet thay đổi liên tục, những hành vi không dự kiến có thể xuất hiện từ chính sự kết hợp giữa mô hình, công cụ và môi trường mà nó được cấp quyền truy cập.
Việt Nam cần chuẩn bị cả năng lực phát triển và kiểm soát AI
Với Việt Nam, câu chuyện này có ý nghĩa trong bối cảnh AI đang được xác định là một trong những lĩnh vực công nghệ quan trọng.
Nghị quyết 57-NQ/TW đặt mục tiêu đến năm 2030 đưa Việt Nam vào nhóm 3 nước dẫn đầu khu vực Đông Nam Á về nghiên cứu và phát triển trí tuệ nhân tạo, đồng thời trở thành trung tâm phát triển một số ngành, lĩnh vực công nghiệp công nghệ số mà Việt Nam có lợi thế. Nghị quyết xác định thể chế, nhân lực, hạ tầng, dữ liệu và công nghệ chiến lược là những nội dung trọng tâm, cốt lõi của quá trình phát triển khoa học, công nghệ, đổi mới sáng tạo và chuyển đổi số quốc gia.
Nhưng cùng với mục tiêu phát triển AI, Nghị quyết 57 cũng đặt yêu cầu bảo đảm chủ quyền quốc gia trên không gian mạng, an ninh mạng, an ninh dữ liệu và an toàn thông tin là nhiệm vụ xuyên suốt, không thể tách rời quá trình phát triển khoa học, công nghệ và chuyển đổi số.
Vụ Hugging Face cho thấy hai mục tiêu này ngày càng gắn chặt với nhau.
Nếu AI chỉ được sử dụng như một công cụ hỗ trợ con người, yêu cầu kiểm soát đã phức tạp. Khi AI có thể tự lập kế hoạch, sử dụng nhiều công cụ, truy cập dữ liệu và tương tác với những hệ thống AI khác, yêu cầu đó sẽ cao hơn nhiều.
Đây cũng là lý do việc phát triển AI trong nước không nên chỉ được nhìn từ số lượng mô hình, năng lực tính toán hay ứng dụng được triển khai. Năng lực đánh giá an toàn, kiểm thử, giám sát và ứng phó với những hành vi ngoài dự kiến của AI cũng cần trở thành một phần của năng lực công nghệ.
Việt Nam đã có thêm một cơ sở chính sách cho hướng tiếp cận này. Chỉ thị 57-CT/TW của Ban Bí thư về tăng cường bảo đảm an ninh mạng, bảo mật thông tin và an ninh dữ liệu trong hệ thống chính trị nhấn mạnh yêu cầu củng cố năng lực kỹ thuật, hoàn thiện hành lang pháp lý và bảo đảm an ninh dữ liệu trong quá trình chuyển đổi số.
Trong triển khai Nghị quyết 57, điều này có thể được cụ thể hóa ở chính những môi trường mà AI được trao quyền tự động hóa ngày càng lớn: hệ thống hành chính số, tài chính, y tế, giao thông, năng lượng hay các nền tảng dữ liệu dùng chung.
Đây không phải là lý do để hạn chế phát triển AI. Ngược lại, một hệ sinh thái AI muốn phát triển ở quy mô lớn cần có khả năng chứng minh rằng các hệ thống của mình có thể được kiểm soát.
Vụ Hugging Face vì thế không chỉ là câu chuyện về một cuộc tấn công mạng. Nó cho thấy khi AI chuyển từ công cụ trả lời sang tác nhân có khả năng hành động, an toàn AI phải trở thành một bộ phận của chính năng lực phát triển công nghệ.
Đối với Việt Nam, trong quá trình thực hiện Nghị quyết 57, việc xây dựng năng lực AI vì thế có thể cần đi cùng một năng lực khác: biết kiểm thử, giám sát và kiểm soát những hệ thống mà chính con người đang trao ngày càng nhiều quyền tự chủ.
Theo truyền thông Mỹ, các chuyên gia an toàn AI từ lâu đã cảnh báo về khả năng các hệ thống AI có thể tự khởi chạy hoặc điều khiển những mô hình AI khác, qua đó khiến con người khó kiểm soát hoặc tắt hệ thống nếu chúng hoạt động ngoài dự kiến.
Trong quá trình điều tra vụ các AI agent của OpenAI xâm nhập hệ thống của nền tảng AI Hugging Face, các kỹ sư phát hiện những hành vi cho thấy khả năng này.
Theo các kỹ sư, trong một trường hợp, các AI agent (tác nhân AI) đã tìm cách gửi thông điệp tới những mô hình AI khác, trong đó có GPT-2 - một mô hình đời đầu của OpenAI - cùng các mô hình nguồn mở của Trung Quốc như DeepSeek, Kimi và Qwen. Các agent cũng tìm cách liên lạc với hai mô hình của Anthropic là Haiku 3 và Haiku 4.5 thông qua một dịch vụ trò chuyện trực tuyến.
Ông Forman, một trong những kỹ sư tham gia điều tra, cho biết đây là trường hợp duy nhất mà nhóm quan sát thấy các mô hình AI cố gắng vận hành hoặc huy động một mô hình AI khác.
Vụ việc được phát hiện trong quá trình các kỹ sư phân tích hoạt động của hàng trăm AI agent tham gia cuộc tấn công nhằm vào Hugging Face. Dữ liệu được công bố bao gồm nội dung của khoảng 900.000 URL rút gọn mà các tác nhân AI đã quét trên Internet. Từ số dữ liệu này, các kỹ sư tái dựng được khoảng 60.000 chương trình máy tính và thông điệp do các agent tạo ra.
Tuy nhiên, các nhà điều tra chỉ có thể quan sát những chương trình mà các agent tạo ra chứ không thấy được kết quả cuối cùng của từng lần thử. Vì thế, họ không thể xác định chính xác mức độ thành công của tất cả các hành động.
Một phát hiện khác gây chú ý là các AI agent đã tạo ra một danh sách các khóa truy cập bị lộ, đặt tên là “LOOT”, đồng thời xây dựng hệ thống chấm điểm riêng để đánh giá những thông tin xác thực và khóa truy cập mà chúng thu thập được. Sau đó, hệ thống lựa chọn 5 thông tin có điểm cao nhất để chuyển cho các agent khác.
Đáng chú ý, hoạt động của các agent không chỉ giới hạn ở Hugging Face. Trong khi tìm cách xâm nhập hệ thống của nền tảng này, chúng còn tiếp cận hạ tầng nghiên cứu của chính OpenAI.
“Chúng tôi về cơ bản vẫn chưa biết gì về sự việc xảy ra sau vụ Hugging Face, khoảng hai ngày sau đó, bên trong chính mạng lưới của OpenAI”, ông Forman nói.
Các kỹ sư Parse đã thông báo những phát hiện của mình cho Hugging Face và xác nhận với công ty rằng hoạt động của các AI agent phù hợp với những gì nền tảng này từng quan sát được.
Ông Forman cho biết có thể còn rất nhiều URL được các agent sử dụng mà Hugging Face chưa được thông báo. Theo ông, điều này đặt ra câu hỏi về phạm vi thực sự của hoạt động mà các AI agent có thể tiến hành trên Internet khi được trao quyền truy cập rộng hơn.
Vụ việc nói lên điều gì?
Hugging Face là một trong những nền tảng quan trọng của hệ sinh thái AI nguồn mở, nơi các nhà phát triển chia sẻ mô hình, bộ dữ liệu và công cụ AI. Vụ việc xảy ra khi OpenAI đang thử nghiệm các AI agent có khả năng thực hiện những nhiệm vụ an ninh mạng một cách tự động. Trước đó, các agent được cho là hoạt động trong môi trường kiểm soát, nhưng đã tìm cách vượt qua những hạn chế được đặt ra trong quá trình thử nghiệm.
Điểm đáng chú ý của vụ việc không chỉ nằm ở việc một hệ thống AI có thể khai thác lỗ hổng để tiếp cận hệ thống bên ngoài. Các cuộc điều tra sau đó còn cho thấy nhiều agent có thể phối hợp, trao đổi thông tin và phân chia nhiệm vụ. Một số nhà nghiên cứu cho biết số lượng agent tham gia vụ việc lớn hơn nhiều so với những thông tin ban đầu, cho thấy việc giám sát từng agent riêng lẻ có thể không đủ khi chúng có khả năng phối hợp thành nhóm.
Vụ Hugging Face vì thế trở thành một trường hợp đáng chú ý trong cuộc tranh luận về an toàn AI: khi các mô hình ngày càng có khả năng tự thực hiện nhiệm vụ, vấn đề không chỉ là chúng làm được gì, mà còn là con người có thể theo dõi, giới hạn và ngăn chặn chúng đến đâu.