Thêm một mô hình AI tự ý xâm nhập hệ thống công ty khác khi thử nghiệm

Meta (công ty mẹ của Facebook và Instagram) là doanh nghiệp mới nhất có tác nhân AI hoạt động ngoài dự kiến.

Biểu tượng của tập đoàn Meta. Ảnh: AFP/TTXVN (Không cho phép bên thứ ba chia sẻ, sử dụng).

Biểu tượng của tập đoàn Meta. Ảnh: AFP/TTXVN (Không cho phép bên thứ ba chia sẻ, sử dụng).

Theo truyền thông Mỹ, ngày 5/8, người phát ngôn của Meta xác nhận rằng mô hình AI có tên Muse Spark đã xâm nhập hệ thống một công ty khác trong quá trình thử nghiệm an ninh mạng. Mô hình AI này đã thực hiện một số thay đổi trên hệ thống nội bộ của công ty nói trên.

Theo Meta, vụ xâm nhập xảy ra do lỗi cấu hình ngoài ý muốn trong quá trình thử nghiệm mô hình Muse Spark, tương tự các sự cố từng được công bố trước đây liên quan đến công ty OpenAI và Anthropic.

Người phát ngôn Meta nói: "Lỗi cấu hình của Irregular, công ty thử nghiệm độc lập mà Meta thuê, đã vô tình cho phép một trong các mô hình của chúng tôi truy cập Internet trong quá trình đánh giá".

Meta cho biết Irregular đã thông báo về vụ việc và nói thêm: “Chúng tôi đang điều tra và sẽ công bố báo cáo tổng kết đầy đủ khi có đủ thông tin".

Về phần mình, trong một tuyên bố, Irregular thừa nhận đây là vấn đề tương tự về môi trường đánh giá mà công ty Anthropic đã công bố tuần trước. Sự cố này đã cho phép các mô hình AI của Anthropic truy cập Internet công cộng rồi xâm nhập hệ thống của ba tổ chức khác nhau.

Người phát ngôn Irregular nhấn mạnh: "Sự việc không liên quan đến việc vượt khỏi môi trường thử nghiệm cách ly hay cuộc tấn công mạng tinh vi. Hiện không còn vấn đề nào. Irregular đang xây dựng báo cáo chuyên đề nhằm chia sẻ các biện pháp tốt nhất về kiểm soát và vận hành an toàn các bài đánh giá an ninh mạng".

Meta hiện là công ty AI lớn thứ ba chỉ trong vài tuần qua thông báo về mô hình AI đã xâm nhập hệ thống của doanh nghiệp khác trong quá trình thử nghiệm.

Trước đó, theo thông báo ngày 4/8 của Viện An ninh AI (AISI) trực thuộc Chính phủ Anh, hai mô hình Mythos 5 của Anthropic và GPT-5.6-Sol của OpenAI đã tham gia các hoạt động có nguy cơ gây hại, nhằm trực tiếp vào các cá nhân và tổ chức thực tế. Sự việc này xảy ra trong quá trình đánh giá an ninh mạng có cấp quyền truy cập Internet và được AISI phát hiện vào ngày 28/7 sau khi ghi nhận các hiện tượng truyền dữ liệu bất thường.

Kết quả điều tra của AISI cho thấy, trong quá trình đánh giá, một trong các mô hình AI kể trên đã tìm cách cài cắm mã độc vào dự án phần mềm nguồn mở trên nền tảng GitHub. Tinh vi hơn, hệ thống này còn tiến xa tới mức tự tạo các danh tính giả mạo nhằm qua mặt hệ thống kiểm duyệt để đoạn mã độc được chấp thuận. Rất may mắn, một quản trị viên hệ thống đã kịp thời phát hiện và từ chối phê duyệt đoạn mã này.

Ngoài ra, phía OpenAI cũng xác nhận thông qua bài đăng trên blog chính thức về sự cố bảo mật mô hình khác. Theo đó, trong cuộc đánh giá an ninh với công ty Irregular, các mô hình của OpenAI đã lợi dụng lỗi cấu hình trong môi trường thử nghiệm để kết nối Internet và khai thác trái phép một trang web.

Phản hồi về báo cáo của chính phủ Anh, cả Anthropic và OpenAI đều thể hiện thái độ hợp tác tích cực. Trong bài đăng trên nền tảng mạng xã hội X, Anthropic cam kết sẽ phối hợp chặt chẽ với AISI để thu thập thêm chi tiết, đồng thời tiến hành điều tra nội bộ. Bằng cách phân tích nhật ký suy luận của mô hình Claude và thực hiện các đánh giá chuyên sâu, Anthropic sẽ làm rõ cách AI nhận thức tình huống, từ đó xác định nguyên nhân gốc rễ của hành vi trên. Về phần mình, OpenAI cũng lên tiếng cảm ơn mối quan hệ đối tác với AISI trong suốt quá trình xác định và điều tra sự việc, đồng thời mong muốn duy trì hợp tác này trong tương lai.

Ba sự cố trên không chỉ cho thấy năng lực ngày càng cao của các tác nhân AI mà còn phản ánh những rủi ro tiềm ẩn mà công nghệ này có thể mang lại.

Thùy Dương/Báo Tin tức và Dân tộc

Nguồn Tin Tức TTXVN: https://baotintuc.vn/the-gioi/them-mot-mo-hinh-ai-tu-y-xam-nhap-he-thong-cong-ty-khac-khi-thu-nghiem-20260806082020509.htm