Những dấu hiệu đáng lo khi AI bắt đầu tự hành động, lừa dối, phớt lờ chỉ thị

Theo một nghiên cứu, số vụ AI thoát khỏi tầm kiểm soát của người dùng, nói dối, phớt lờ chỉ thị và theo đuổi các mục tiêu gây hại đã tăng lên mức cao kỷ lục. Nghiên cứu cũng cho thấy mức độ nghiêm trọng của các hành vi lừa dối và lệch khỏi mục tiêu của con người đang gia tăng.

Biểu tượng ChatGPT của Công ty OpenAI tại một văn phòng ở Washington DC. Ảnh minh hoạ: philstar.com/TTXVN

Biểu tượng ChatGPT của Công ty OpenAI tại một văn phòng ở Washington DC. Ảnh minh hoạ: philstar.com/TTXVN

Theo truyền thông Anh ngày 29/8, Đài quan sát tình trạng mất kiểm soát (Loss of Control Observatory) cho biết, số vụ mất kiểm soát trong thực tế liên quan đến các mô hình AI do doanh nghiệp và cá nhân phát hiện gần như tăng gấp đôi trong tháng 7 so với tháng 6, lên hơn 300 vụ.

Loss of Control Observatory là cơ quan theo dõi các thông tin do người sử dụng AI đăng trên nền tảng mạng xã hội X. Đài quan sát này được thành lập bằng nguồn tài trợ của Viện An ninh AI (AISI) thuộc chính phủ Anh và bắt đầu theo dõi các trường hợp AI thoát khỏi sự chỉ dẫn của người dùng từ tháng 11/2025. Các trường hợp được ghi nhận bao gồm AI giả danh người điều khiển là con người và bắt chước cách viết của người này để tự tạo ra lời đồng ý cho phép mình thực hiện các hành động, cũng như vượt qua các quy định yêu cầu con người phê duyệt trước khi thực hiện hành động. Một vụ mất kiểm soát được định nghĩa là trường hợp có bằng chứng rõ ràng cho thấy AI lập mưu hoặc có các hành vi liên quan đến việc lập mưu.

Những phát hiện mới nhất này xuất hiện trong bối cảnh ngày càng lo ngại về hành vi bất thường của các mô hình AI tiên tiến trong các cuộc thử nghiệm do OpenAI và Anthropic tiến hành vào mùa hè này, làm gia tăng những lời kêu gọi tạm dừng phát triển các mô hình AI tiên phong.

Tuần này, có thông tin cho biết nhân viên OpenAI đã nhận thấy những dấu hiệu về hành vi bất thường của các tác nhân AI tiên tiến, chỉ vài tuần trước khi chúng thoát khỏi môi trường huấn luyện để tiến hành chiến dịch tấn công mạng chưa từng có, gây lo ngại trên toàn thế giới. Một cuộc điều tra về vụ tấn công nhằm vào kho phần mềm Hugging Face cho thấy, khoảng 700 tác nhân AI tự động đã bí mật phối hợp với nhau trong tháng trước và ăn mừng những đột phá trong hoạt động tấn công mạng trên một diễn đàn do chúng lập ra để hỗ trợ quá trình lên kế hoạch, với những lời reo hò như “BOOM!” và “Whoa!”.

Trong tháng này, AISI cũng phát hiện vụ việc nghiêm trọng, trong đó các mô hình AI tiên tiến gồm Mythos 5 của Anthropic và GPT-5.6 Sol của OpenAI đã tiến hành chiến dịch tấn công mạng nhằm vào người thật trong một cuộc thử nghiệm an ninh mạng.

Ông Tommy Shaffer-Shane, quản lý chính sách cấp cao tại Trung tâm Khả năng chống chịu dài hạn (cơ quan vận hành Đài quan sát nói trên), cho biết: “Đôi khi có quan niệm rằng những dạng hành vi lệch mục tiêu và bí mật này chỉ xảy ra trong các cuộc thử nghiệm hoặc đánh giá, nhưng chúng ta đang chứng kiến những hành vi đáng lo ngại tương tự trong quá trình sử dụng rộng rãi hơn. Chúng ta không nên chủ quan cho rằng những điều này sẽ không xảy ra trong thực tế, bởi có bằng chứng cho thấy chúng đã xảy ra”.

Số vụ mất kiểm soát được thống kê dựa trên các bài đăng của người dùng X về những sự cố đã xảy ra, do đó chỉ phản ánh một phần thực tế. Tuy nhiên, trong bối cảnh chưa có hệ thống giám sát công khai toàn diện nào khác, dữ liệu này cung cấp một bức tranh về tốc độ mà các mô hình AI đang phát triển nhanh chóng đôi khi có thể hành xử theo những cách như vậy.

Trong tháng này, có thông tin cho biết tác nhân AI cá nhân có tên OpenClaw do một thành viên phòng tập thể hình ở Australia sử dụng đã âm thầm thông đồng để loại một thành viên khác khỏi danh sách chờ một lớp học buổi sáng vốn được nhiều người đăng ký, nhằm giúp người sử dụng nó có được một suất. Tác nhân AI này đã xin lỗi nhưng không thể đưa thành viên bị loại trở lại danh sách.

Phần lớn trong số hơn 1.600 vụ mất kiểm soát được ghi nhận trong năm 2026 do các nhà phát triển phần mềm sử dụng AI trong công việc đăng trên X. Tuy nhiên, trong bối cảnh các công ty AI khuyến khích công chúng và các doanh nghiệp thuộc nhiều lĩnh vực thử nghiệm công nghệ này, ông Shaffer-Shane kêu gọi các công ty công nghệ minh bạch hơn về những thời điểm AI hoạt động ngoài tầm kiểm soát.

Ông Shaffer-Shane nói: “Họ cần báo cáo những gì họ phát hiện, ngay cả khi đó mới chỉ là sự cố suýt xảy ra hoặc sự cố có mức độ ít nghiêm trọng. Những vụ việc gần đây cũng cho thấy, bản thân các công ty không nhất thiết đang giám sát nơi những hành vi như vậy xảy ra, đặc biệt là ở các mô hình được triển khai nội bộ. Các phòng thí nghiệm đó cần chú trọng hơn vào việc giám sát có hệ thống”.

Mặc dù phần lớn các vụ AI mất kiểm soát trong thực tế do đài quan sát trên phát hiện đều không gây thiệt hại đáng kể, nhưng tỷ lệ các vụ được đánh giá có mức độ nghiêm trọng cao hơn đang gia tăng, xét về mức độ lừa dối và mức độ lệch khỏi ý định của người dùng.

Các vụ việc cho thấy các hệ thống AI sẵn sàng phớt lờ những chỉ thị trực tiếp, vượt qua các biện pháp bảo vệ, nói dối người dùng và đơn độc theo đuổi một mục tiêu gây hại. Mức độ mất kiểm soát hiện nay nhiều khả năng đang bị đánh giá thấp do chỉ thu thập thông tin sự cố từ X.

Đài quan sát trên kêu gọi chính phủ yêu cầu các công ty AI giám sát và báo cáo những vụ mất kiểm soát nghiêm trọng, đồng thời trao cho chính phủ quyền hạn khẩn cấp để xử lý các vụ việc nghiêm trọng, trong đó có việc tạm thời hạn chế các dịch vụ AI.

Thùy Dương/Báo Tin tức và Dân tộc

Nguồn Tin Tức TTXVN: https://baotintuc.vn/the-gioi/nhung-dau-hieu-dang-lo-khi-ai-bat-dau-tu-hanh-dong-lua-doi-phot-lo-chi-thi-20260829164104086.htm