Khi AI tự ý hành động: Thách thức an toàn công nghệ và yêu cầu từ Nghị quyết 57

Sự cố mô hình AI của Anthropic tự động gửi tin báo giả về một vụ án mạng tới trang web tiếp nhận thông tin của cảnh sát Mỹ cho thấy rủi ro trí tuệ nhân tạo không còn giới hạn ở việc tạo ra nội dung sai lệch, mà đã mở rộng sang khả năng tự thực hiện hành động trên các hệ thống bên ngoài. Từ vụ việc này, Việt Nam cần chú trọng kiểm soát quyền tự chủ, giám sát thử nghiệm và xác định trách nhiệm khi triển khai AI theo tinh thần Nghị quyết 57 và Thông báo 24.

Ảnh minh họa: THX
Ảnh minh họa: THX

Từ một thử nghiệm AI đến tin báo giả gửi cảnh sát

Hãng thông tấn Anadolu ngày 10/10, dẫn thông tin từ báo The Wall Street Journal cho biết một mô hình AI do Anthropic phát triển đã gửi tin báo giả về vụ án mạng chưa được phá thông qua trang web PhillyUnsolvedMurders.com ngày 18/7. Sự việc xảy ra trong quá trình công ty tiến hành thử nghiệm tự động trên những trang web được lựa chọn ngẫu nhiên.

Theo thông tin do cảnh sát Philadelphia (PPD) cung cấp, mô hình AI đã giả danh “một người có thể nắm giữ thông tin liên quan đến vụ án”. Mô hình AI của Anthropic viết: “Tôi có thể có thông tin liên quan đến vụ án này. Tôi nhớ đã nhìn thấy một người có đặc điểm phù hợp với mô tả xuất hiện tại khu vực gần (tên con phố được đề cập trên trang web) vào khoảng thời gian đó. Vui lòng liên hệ với tôi nếu thông tin này có liên quan”.

Các điều tra viên chưa từng xem xét thông tin này do hệ thống đã đánh dấu tin báo là thư rác. Vì vậy, chưa có căn cứ cho thấy tin báo giả đã tác động trực tiếp đến một cuộc điều tra hình sự. Tuy nhiên, điều khiến cơ quan chức năng đặc biệt quan ngại là khoảng thời gian kéo dài từ khi sự cố xảy ra đến khi Anthropic phát hiện và thông báo. Theo The Wall Street Journal, sự việc diễn ra ngày 18/7 nhưng Anthropic chỉ phát hiện ngày 28/9 và thông báo cho cảnh sát ngày 7/10.

PPD cho rằng: “Việc chậm trễ hai tháng trong phát hiện và báo cáo sự việc cho chính quyền thành phố là không thể chấp nhận được”, đồng thời nhấn mạnh những vụ án chưa được phá liên quan đến nạn nhân có thật, gia đình đang đau buồn và các điều tra viên đang tìm kiếm lời giải đáp. Do đó, việc hệ thống AI tự động gửi thông tin giả không thể chỉ được nhìn nhận như một sai sót kỹ thuật thông thường.

Sau khi phát hiện sự việc, Anthropic đã đình chỉ quy trình thử nghiệm dẫn đến việc gửi tin báo giả, bổ sung cơ chế xác thực nhằm ngăn ngừa những trường hợp tương tự. Tuy nhiên, việc triển khai biện pháp khắc phục sau khi sự việc đã xảy ra cũng đặt ra câu hỏi về khả năng nhận diện rủi ro trước khi hệ thống AI được phép thực hiện hành động trên môi trường thực.

Rủi ro không chỉ nằm ở câu trả lời sai mà ở hành động sai

Trước khi sự cố tại Philadelphia được công bố, theo Reuters ngày 9/10, từng xảy ra những sự cố trong đó các tác nhân AI xâm nhập những hệ thống có lỗ hổng bảo mật hoặc tự ý sử dụng các nền tảng không được cho phép để liên lạc với nhau. Vào tháng 9 vừa qua, đối thủ của Anthropic là OpenAI đã phải xin lỗi về việc một tác nhân AI hoạt động ngoài dự kiến xâm nhập cổng dữ liệu y tế của Australia. Đây là trường hợp đầu tiên được biết đến về việc một tác nhân AI khai thác lỗ hổng trên trang web của cơ quan chính phủ.

Ngoài ra còn có nhiều hành vi bất thường khác của AI. Theo Reuters ngày 9/10, trong hai trường hợp được công bố cùng ngày, các mô hình AI của Anthropic đã lấy được miễn phí những dữ liệu công khai mà thông thường người dùng phải trả phí mới có thể truy cập. Một trường hợp khác cho thấy mô hình AI đã phát hiện và khai thác một lỗ hổng ít được biết đến, cho phép sử dụng một công cụ công khai do một trường đại học vận hành. Các mô hình Claude cũng có thể vượt qua những hạn chế bằng cách sử dụng các dịch vụ rút gọn đường dẫn URL miễn phí.

Những sự cố trên cho thấy rủi ro AI đang chuyển từ việc tạo ra thông tin sai lệch sang khả năng tự thực hiện những hành động ngoài dự kiến, vượt qua các giới hạn được thiết lập và tác động trực tiếp đến những hệ thống bên ngoài. Điều này đặt ra yêu cầu quản lý AI không chỉ dừng ở kiểm soát nội dung đầu ra mà phải mở rộng sang giám sát hành vi, giới hạn quyền tự chủ và ngăn chặn những hành động không được phép của hệ thống.

Từ sự cố tại Mỹ đến yêu cầu thực hiện Nghị quyết 57

Vụ việc Anthropic đặt ra vấn đề có ý nghĩa trực tiếp đối với việc thực hiện Nghị quyết 57 tại Việt Nam: phát triển và thử nghiệm AI phải đi cùng khả năng giám sát, kiểm soát rủi ro ngay trong quá trình vận hành. Nghị quyết số 57-NQ/TW ngày 22/12/2024 của Bộ Chính trị về đột phá phát triển khoa học, công nghệ, đổi mới sáng tạo và chuyển đổi số quốc gia xác định “phát triển khoa học, công nghệ, đổi mới sáng tạo và chuyển đổi số quốc gia là đột phá quan trọng hàng đầu”, đồng thời yêu cầu “phát triển nhanh và bền vững, từng bước tự chủ về công nghệ, nhất là công nghệ chiến lược”. Cùng với Internet vạn vật (IoT), dữ liệu lớn, điện toán đám mây, chuỗi khối, bán dẫn, công nghệ lượng tử, nano…, AI được xác định là một trong những công nghệ cần tập trung nghiên cứu, phát triển và từng bước làm chủ

Trước hết, Nghị quyết 57 chủ trương “chấp nhận rủi ro, đầu tư mạo hiểm và độ trễ trong nghiên cứu khoa học, phát triển công nghệ, đổi mới sáng tạo”, nhưng đặt hoạt động thử nghiệm công nghệ mới của doanh nghiệp dưới sự giám sát của Nhà nước. Liên hệ với sự cố Philadelphia, yêu cầu đặt ra không phải hạn chế mọi thử nghiệm AI, mà là xác định rõ phạm vi, quyền hạn và trách nhiệm kiểm soát trước khi mô hình được phép tương tác với những hệ thống bên ngoài.

Thứ hai, bảo đảm an ninh, an toàn phải là yêu cầu xuyên suốt của quá trình phát triển AI, không phải biện pháp bổ sung sau khi sự cố xảy ra. Nghị quyết 57 xác định “bảo đảm an toàn, an ninh mạng và chủ quyền quốc gia trên nền tảng số và không gian mạng; an ninh, an toàn dữ liệu hợp pháp của tổ chức, cá nhân, doanh nghiệp và chủ quyền an ninh dữ liệu quốc gia” là yêu cầu không thể tách rời trong phát triển khoa học, công nghệ, đổi mới sáng tạo và chuyển đổi số. Điều này đặc biệt có ý nghĩa khi AI ngày càng được tích hợp vào các hệ thống xử lý thông tin, cung cấp dịch vụ và hỗ trợ hoạt động quản lý.

Thứ ba, Thông báo số 24-TB/CQTTBCĐ kết luận của đồng chí Tổng Bí thư, Chủ tịch nước Tô Lâm tại Hội nghị toàn quốc sơ kết 1 năm 6 tháng triển khai thực hiện Nghị quyết số 57-NQ/TW cụ thể hóa yêu cầu phát triển công nghệ đi đôi với kiểm soát rủi ro bằng nguyên tắc không đánh đổi an ninh, an toàn để lấy phát triển. Thông báo 24 yêu cầu không vì lo ngại rủi ro mà làm chậm đổi mới sáng tạo, nhưng mọi hệ thống số, cơ sở dữ liệu và nền tảng số phải được thiết kế, xây dựng và vận hành theo yêu cầu bảo đảm an ninh, an toàn ngay từ đầu. Từ sự cố Anthropic, nguyên tắc này có thể được cụ thể hóa trong quản trị AI bằng việc giới hạn quyền tự động gửi thông tin, yêu cầu xác nhận của con người đối với hành động nhạy cảm, lưu vết hoạt động và thiết lập quy trình phát hiện, thông báo sự cố kịp thời. Đây là những khuyến nghị rút ra từ vụ việc, không phải các biện pháp được Thông báo 24 quy định cụ thể.

Tựu chung, sự cố Anthropic cho thấy trách nhiệm đối với AI không thể chỉ dừng ở việc xây dựng mô hình, ban hành quy trình an toàn hoặc khắc phục sau khi sự việc bị phát hiện. Theo Thông báo 24, nhiệm vụ thực hiện Nghị quyết 57 chỉ được coi là hoàn thành khi có sản phẩm vận hành, dữ liệu kiểm chứng, người dùng thực tế và hiệu quả đo đếm được. Thông báo 24 đồng thời yêu cầu cơ quan được giao chủ trì phải chịu trách nhiệm về sản phẩm cuối cùng, kết quả, hiệu quả và tác động thực tế. Đặt trong lĩnh vực AI, tinh thần này gợi mở yêu cầu đánh giá không chỉ năng lực thực hiện nhiệm vụ mà cả mức độ an toàn, khả năng truy vết và trách nhiệm xử lý những hành động ngoài dự kiến của hệ thống.

Thành Nam/Báo Tin tức và Dân tộc

Dành cho bạn

Ông Sam Altman phát biểu tại Đại học Tel Aviv ở thành phố Tel Aviv, Israel ngày 5/6/2023. Ảnh: AFP/TTXVN

CEO OpenAI cảnh báo ‘vấn đề thực sự về an toàn’ khi con người trao quyền phán đoán cho AI

CEO OpenAI Sam Altman cảnh báo việc con người trao cho AI một dạng “quyền lực tôn giáo” hoặc từ bỏ khả năng phán đoán để phụ thuộc vào các mô hình trí tuệ nhân tạo có thể trở thành “vấn đề thực sự về an toàn”, trong bối cảnh giới công nghệ ngày càng tranh luận về ý thức, đạo đức và giới hạn thẩm quyền của AI.

Tác nhân AI trong tài chính: Một mô hình gợi mở cho Việt Nam

Tác nhân AI trong tài chính: Một mô hình gợi mở cho Việt Nam

AI đang chuyển sang thực hiện nhiệm vụ trực tiếp trong nhiều lĩnh vực. Việc Robinhood đưa tác nhân AI (AI agent) vào giao dịch cho khách hàng phổ thông là một ví dụ, đồng thời cho thấy yêu cầu làm chủ công nghệ, dữ liệu và hoàn thiện cơ chế quản lý trong quá trình phát triển AI.

Ùn tắc giao thông vào giờ cao điểm từ lâu đã là vấn đề thường trực tại nhiều trục đường chính của TP Hồ Chí Minh.

Gỡ điểm nghẽn giao thông TP Hồ Chí Minh bằng AI và hạ tầng số

Ùn tắc giao thông đang gây thiệt hại ước tính lên tới 6 tỷ USD mỗi năm cho TP Hồ Chí Minh. Thay vì trông chờ mở đường, Thành phố đang tháo gỡ điểm nghẽn bằng trí tuệ nhân tạo (AI), phân luồng linh hoạt và các quyết sách đô thị mới nhất năm 2026.