Từ mô hình AI đáng tin cậy đến hệ thống có thể kiểm soát
Theo CNBC ngày 10/10, CEO Microsoft Satya Nadella kêu gọi các nhà phát triển AI tiên tiến thiết lập cơ chế giới hạn phạm vi hoạt động, giám sát độc lập và “phanh khẩn cấp” cho phép người có thẩm quyền tạm dừng hoặc tắt hệ thống khi cần thiết.
Cách tiếp cận này đặt khả năng kiểm soát của con người vào cấu trúc vận hành, thay vì chỉ dựa vào những cam kết an toàn từ nhà phát triển.
Điểm cốt lõi trong đề xuất của ông Nadella là sử dụng những cơ chế có thể kiểm chứng để quản lý các mô hình có hành vi không hoàn toàn dự đoán được.
Trong bài đăng trên mạng xã hội X, ông đề nghị bao bọc mô hình AI bằng thiết kế hệ thống chặt chẽ, quy tắc rõ ràng, sự kiểm soát của con người và quy trình vận hành đáng tin cậy.
Điều đó có nghĩa AI có thể xử lý thông tin hoặc đề xuất hành động, nhưng quyền truy cập dữ liệu, sử dụng công cụ và thực hiện những thao tác quan trọng phải chịu sự chi phối của các cơ chế bảo vệ bên ngoài mô hình.
Theo ông Nadella, hệ thống cần lưu lại dấu vết hoạt động dưới dạng con người có thể đọc hiểu, được kiểm tra liên tục và chịu sự giám sát, kiểm toán độc lập. Trong đó, giám sát nhằm phát hiện bất thường khi hệ thống vận hành, còn kiểm toán giúp đánh giá mức độ tuân thủ và hiệu quả của các biện pháp bảo vệ. Hai cơ chế bổ trợ nhau nhưng không thể thay thế nhau.
Ông Nadella đề xuất áp dụng các nguyên tắc kiểm soát phù hợp với cả mô hình đóng và mô hình mở, không mặc nhiên giả định rằng AI luôn hành động đúng dự kiến.
Điều này không đồng nghĩa mọi mô hình đều nguy hiểm, mà nhấn mạnh yêu cầu duy trì khả năng giới hạn quyền hạn, ngăn chặn hành động không được phép và cho phép con người can thiệp.
Vì vậy, độ tin cậy của AI không chỉ phụ thuộc vào chất lượng mô hình mà còn được quyết định bởi cách hệ thống được thiết kế và vận hành.
Khi năng lực AI phát triển nhanh hơn khả năng kiểm soát
Khác với hệ thống chỉ tạo văn bản hoặc hình ảnh, tác nhân AI có thể truy cập trang web, sử dụng phần mềm, nhập dữ liệu và thực hiện nhiều thao tác liên tiếp theo quyền được cấp.
Vì vậy, sai sót không còn chỉ thể hiện ở nội dung đầu ra mà có thể tác động trực tiếp đến những hệ thống bên ngoài, thậm chí tạo ra hậu quả trước khi người vận hành kịp phát hiện.
Sự cố AI của Anthropic gửi tin báo giả về một vụ án mạng tại Mỹ minh họa rõ nguy cơ này.
Theo hãng thông tấn Anadolu ngày 10/10, dẫn thông tin từ The Wall Street Journal, một mô hình AI của Anthropic đã tự động gửi tin báo giả về vụ án mạng chưa được phá thông qua trang web tiếp nhận thông tin tại Philadelphia trong cuộc thử nghiệm ngày 18/7/2026.
Tin báo bị chuyển vào mục thư rác và không được chuyển tiếp cho các điều tra viên. Tuy nhiên, Anthropic chỉ phát hiện sự cố ngày 28/9 và thông báo cho cảnh sát ngày 7/10.
Điều đáng lo ngại trong sự cố Philadelphia không chỉ là thông tin sai lệch mà còn là khoảng trống trong giám sát hoạt động của AI.
Trường hợp này chưa chứng minh mô hình đã vượt qua một cơ chế bảo mật cụ thể, nhưng cho thấy hoạt động thử nghiệm có thể dẫn đến những tương tác thực tế ngoài mong muốn.
Khoảng thời gian hơn hai tháng trước khi sự cố được phát hiện cũng đặt ra câu hỏi về hiệu quả của việc theo dõi, lưu vết và cảnh báo bất thường.
Đây chính là những vấn đề mà đề xuất kiểm soát hệ thống của CEO Microsoft hướng tới giải quyết.
Khả năng kiểm soát vì thế cần trở thành tiêu chí đánh giá chất lượng AI, bên cạnh độ chính xác, tốc độ xử lý và năng lực thực hiện nhiệm vụ.
Một mô hình có thể hoạt động tốt trong phần lớn trường hợp nhưng vẫn gây rủi ro nếu được trao quyền truy cập quá rộng, thiếu xác nhận của con người đối với hành động nhạy cảm hoặc không thể dừng kịp thời.
Giới hạn quyền hạn, giám sát độc lập và cơ chế can thiệp cần được thiết lập trước khi triển khai, thay vì chỉ bổ sung sau sự cố.
Từ cảnh báo của Microsoft đến yêu cầu thực hiện Nghị quyết 57
Đối với Việt Nam, kiểm soát AI từ thiết kế hệ thống phù hợp với yêu cầu phát triển công nghệ chiến lược gắn với bảo đảm an ninh, an toàn và năng lực tự chủ quốc gia.
Theo Nghị quyết số 57-NQ/TW ngày 22/12/2024 của Bộ Chính trị về đột phá phát triển khoa học, công nghệ, đổi mới sáng tạo và chuyển đổi số quốc gia, phát triển khoa học, công nghệ, đổi mới sáng tạo và chuyển đổi số phải gắn với từng bước tự chủ về công nghệ, nhất là công nghệ chiến lược.
Nghị quyết 57 đồng thời xác định bảo đảm an ninh mạng, an ninh dữ liệu và chủ quyền quốc gia trên không gian mạng là yêu cầu không thể tách rời quá trình phát triển.
Đặt trong lĩnh vực AI, làm chủ công nghệ không chỉ là xây dựng hoặc sử dụng mô hình mà còn phải có năng lực kiểm soát hệ thống ứng dụng.
Yêu cầu bảo đảm an ninh, an toàn ngay từ đầu được cụ thể hóa trong Thông báo số 24-TB/CQTTBCĐ kết luận của đồng chí Tổng Bí thư, Chủ tịch nước Tô Lâm tại Hội nghị toàn quốc sơ kết 1 năm 6 tháng triển khai thực hiện Nghị quyết số 57-NQ/TW, tạo cơ sở chính sách để nghiên cứu áp dụng các biện pháp kiểm soát AI từ khâu thiết kế.
Theo Thông báo 24, phát triển công nghệ phải đặc biệt coi trọng an ninh mạng, an toàn thông tin và an ninh dữ liệu, yêu cầu không đánh đổi an ninh, an toàn để lấy phát triển, nhưng cũng không vì lo ngại rủi ro mà làm chậm đổi mới sáng tạo. Các hệ thống số, cơ sở dữ liệu và nền tảng số phải được bảo đảm an ninh, an toàn ngay từ thiết kế, xây dựng và vận hành.
Từ những nguyên tắc trên, Việt Nam có thể nghiên cứu cụ thể hóa yêu cầu an toàn thành các tiêu chí kỹ thuật đối với hệ thống AI có khả năng tự thực hiện hành động.
Trước hết, cần giới hạn quyền truy cập dữ liệu và sử dụng công cụ theo nhiệm vụ được giao, đặc biệt khi AI tương tác với hệ thống tài chính, y tế, cơ sở dữ liệu nhà nước hoặc hạ tầng thông tin quan trọng.
Bên cạnh đó, giám sát độc lập, lưu vết và khả năng dừng hoạt động cần trở thành những yêu cầu quan trọng trong triển khai AI tự chủ.
Đây là các giải pháp có thể nghiên cứu để cụ thể hóa tinh thần Nghị quyết 57 và Thông báo 24, không phải những yêu cầu kỹ thuật đã được hai văn bản quy định trực tiếp.
Từ cảnh báo của CEO Microsoft, vấn đề quan trọng đối với Việt Nam không chỉ là phát triển và ứng dụng AI nhanh hơn, mà còn phải bảo đảm khả năng kiểm soát công nghệ trong suốt quá trình vận hành.
Thực hiện Nghị quyết 57 và Thông báo 24 vì thế cần gắn mục tiêu làm chủ AI với việc xây dựng các tiêu chí an toàn có thể kiểm chứng, nhất là đối với hệ thống có khả năng tự thực hiện hành động.
Một hệ thống AI chỉ thực sự đáng tin cậy khi con người có thể xác định nó được phép làm gì, đã thực hiện những hành động nào và có thể can thiệp ra sao khi xuất hiện rủi ro.
Kiểm soát ngay từ thiết kế chính là điều kiện để thúc đẩy đổi mới sáng tạo mà không đánh đổi an ninh, an toàn.