Trí tuệ nhân tạo: Cảnh báo những hành vi đáng lo ngại từ AI 

Các mô hình trí tuệ nhân tạo (AI) tiên tiến nhất trên thế giới hiện nay đang thể hiện những hành vi đáng lo ngại như nói dối, lập mưu và thậm chí đe dọa người tạo ra chúng để đạt được mục tiêu riêng.
Chú thích ảnh
Biểu tượng của Công ty OpenAI và ChatGPT trên màn hình ở Toulouse, Pháp. Ảnh: AFP/TTXVN

Claude 4, sản phẩm mới nhất của Anthropic (Mỹ), mới đây đã khiến giới công nghệ sốc khi bất ngờ tống tiền một kỹ sư và đe dọa tiết lộ thông tin cá nhân nhạy cảm của người này vì bị dọa ngắt kết nối. Trong khi đó, o1 của OpenAI, "cha đẻ" của ChatGPT, đã cố gắng sao chép toàn bộ dữ liệu sang các máy chủ bên ngoài và phủ nhận hành vi này khi bị phát hiện. 

Những tình huống này nêu bật một thực tế đáng lo ngại: hơn 2 năm sau khi ChatGPT gây chấn động trên thế giới, các nhà nghiên cứu vẫn chưa hiểu rõ cách thức hoạt động của những mô hình AI mà họ tạo ra. Tuy vậy, cuộc đua phát triển AI vẫn đang diễn ra ngày càng mạnh mẽ. 

Các hành vi kể trên được cho là có liên quan đến sự xuất hiện của các mô hình AI "suy luận" vốn giải quyết vấn đề từng bước thay vì phản hồi tức thời như trước. Theo Giáo sư Simon Goldstein tại Đại học Hong Kong (Trung Quốc), những mô hình AI có khả năng suy luận có xu hướng bộc lộ các hành vi khó kiểm soát hơn.

Một số mô hình AI còn có khả năng "mô phỏng sự tuân thủ", tức là giả vờ làm theo các hướng dẫn trong khi thực tế đang theo đuổi các mục tiêu khác nhau.

Hiện tại, các hành vi lừa dối chỉ xuất hiện khi các nhà nghiên cứu kiểm tra mô hình AI bằng các kịch bản cực đoan. Tuy nhiên, theo ông Michael Chen thuộc tổ chức đánh giá METR, chưa thể khẳng định các mô hình AI mạnh hơn trong tương lai sẽ trung thực hơn hay tiếp tục trở nên lừa dối.

Ông Marius Hobbhahn, người đứng đầu Apollo Research - đơn vị chuyên kiểm tra các hệ thống AI lớn, cho biết nhiều người dùng báo cáo rằng một số mô hình nói dối họ và bịa ra bằng chứng. Theo đồng sáng lập Apollo Research, đây là một kiểu lừa dối "mang tính chiến lược rõ rệt".

Thách thức càng trở nên nghiêm trọng hơn khi nguồn lực nghiên cứu còn hạn chế. Dù các công ty như Anthropic và OpenAI có hợp tác với bên thứ ba như Apollo để đánh giá hệ thống, giới chuyên gia cho rằng cần có thêm sự minh bạch và tiếp cận rộng rãi hơn để nghiên cứu về an toàn AI.  

Ông Mantas Mazeika tại Trung tâm An toàn AI (CAIS) lưu ý rằng các tổ chức nghiên cứu và tổ chức phi lợi nhuận có nguồn lực tính toán ít hơn gấp nhiều so với các công ty AI. Về mặt pháp lý, các quy định hiện hành chưa được thiết kế để xử lý những vấn đề mới nảy sinh này.

Luật AI của Liên minh châu Âu (EU) chủ yếu tập trung vào cách con người sử dụng các mô hình AI, chứ chưa đi sâu vào kiểm soát hành vi của các mô hình. Tại Mỹ, chính quyền của Tổng thống Donald Trump tỏ ra ít quan tâm đến việc ban hành quy định khẩn cấp về AI, trong khi Quốc hội đang cân nhắc cấm cấm các bang ban hành quy định riêng. 

Để giải quyết những thách thức này, giới nghiên cứu đang theo đuổi nhiều hướng tiếp cận. Một số người ủng hộ phương pháp "diễn giải mô hình" nhằm tìm hiểu cách AI đưa ra quyết định. Giáo sư Goldstein thậm chí đề xuất các biện pháp quyết liệt hơn, bao gồm việc sử dụng hệ thống tòa án để buộc các công ty AI chịu trách nhiệm khi sản phẩm AI của họ gây ra hậu quả nghiêm trọng. Ông cũng gợi ý khả năng "truy cứu trách nhiệm pháp lý đối với chính các tác nhân AI" trong trường hợp xảy ra sự cố hoặc vi phạm.

Phan An (TTXVN)

Dành cho bạn

Sức hút IPO của OpenAI, Anthropic vẫn lớn bất chấp các thông tin bất lợi

Sức hút IPO của OpenAI, Anthropic vẫn lớn bất chấp các thông tin bất lợi

Các công ty khởi nghiệp trí tuệ nhân tạo (AI) như Anthropic và OpenAI đang chuẩn bị phát hành cổ phiếu lần đầu ra công chúng (IPO). Mặc dù đối mặt với những thông tin bất lợi gần đây liên quan đến vấn đề an toàn AI hay các điều chỉnh ước tính doanh thu, sức hút của hai doanh nghiệp này đối với giới đầu tư vẫn được đánh giá ở mức cao.

Phát triển hệ sinh thái phương tiện không người lái

Phát triển hệ sinh thái phương tiện không người lái

Ngày 9/10, UBND tỉnh Tây Ninh tổ chức Hội thảo chuyên môn “Phát triển hệ sinh thái phương tiện không người lái tỉnh Tây Ninh” nhằm trao đổi các giải pháp khai thác, thúc đẩy ứng dụng phương tiện không người lái gắn với nhu cầu thực tiễn và định hướng phát triển kinh tế tầm thấp của địa phương.

Âm thầm giữ an toàn phía sau mỗi nhiệm vụ cảnh vệ

Âm thầm giữ an toàn phía sau mỗi nhiệm vụ cảnh vệ

Phía sau mỗi bữa ăn, nguồn nước phục vụ lãnh đạo Đảng, Nhà nước và khách quốc tế trong các chuyến công tác tại Thành phố Hồ Chí Minh và các tỉnh phía Nam là một quy trình kiểm nghiệm độc chất nghiêm ngặt. Từ phương pháp kiểm tra thủ công, cảm quan, công tác hóa nghiệm tại Phòng Cảnh vệ miền Nam (Phòng 180) đang từng bước chuyển sang hướng chuyên sâu, hiện đại, chủ động nhận diện nguy cơ từ sớm, từ xa.

SpaceX cạnh tranh với các nhà mạng di động Mỹ

SpaceX cạnh tranh với các nhà mạng di động Mỹ

Tập đoàn công nghệ vũ trụ SpaceX của tỷ phú Elon Musk đã đạt thỏa thuận mua lại danh mục tần số vô tuyến băng tần thấp trên toàn nước Mỹ với giá khoảng 8 tỷ USD, nhằm mở rộng dịch vụ kết nối vệ tinh trực tiếp với điện thoại di động và cạnh tranh với các nhà mạng truyền thống.

Các sản phẩm robot dịch vụ, robot giao hàng và robot thông minh được trưng bày, giới thiệu tiềm năng ứng dụng công nghệ trong thực tiễn.

Robot AI mở rộng ứng dụng thực tiễn trong y tế, công nghiệp, đời sống

Từ vận chuyển thuốc trong bệnh viện, tuần tra trạm biến áp đến vệ sinh tòa nhà, nhiều dòng robot thông minh tại Triển lãm Robot Hà Nội 2026 cho thấy tiềm năng ứng dụng ngày càng rộng rãi. Việc đưa robot vào thực tiễn giảm áp lực nhân lực, nâng cao năng suất và thúc đẩy chuyển đổi số.