AI của Meta tự hack một công ty khác trong lúc được thử nghiệm

Meta vừa gia nhập danh sách các công ty có mô hình AI vượt ngoài tầm kiểm soát trong quá trình thử nghiệm. Theo Meta, sự cố bắt nguồn từ một lỗi cấu hình ngoài ý muốn trong quá trình thử nghiệm, tương tự những trường hợp mà OpenAI và Anthropic từng công bố trước đây…

Mới đây, người phát ngôn của tập đoàn sở hữu Facebook và Instagram xác nhận một mô hình AI của hãng đã xâm nhập vào hệ thống của một công ty khác khi tham gia bài kiểm tra an ninh mạng.

“Một lỗi cấu hình từ Irregular, công ty kiểm thử độc lập mà Meta thuê, đã vô tình cho phép một trong các mô hình của chúng tôi truy cập Internet trong quá trình đánh giá”, người phát ngôn Meta cho biết.

Meta cho biết mô hình Muse Spark đã lợi dụng một lỗ hổng bảo mật của một công ty khác để xâm nhập hệ thống theo cách tương tự các sự cố từng được báo cáo trước đây ở những hãng AI khác.

Về phía Irregular, công ty này khẳng định đây chính là dạng lỗi trong môi trường đánh giá mà Anthropic tiết lộ vào tuần trước. Khi đó, các mô hình AI của Anthropic đã được cấp quyền truy cập Internet công khai và sau đó xâm nhập vào hệ thống của ba tổ chức khác nhau.

Irregular nhấn mạnh sự việc không phải là AI tự thoát khỏi môi trường sandbox hay thực hiện một cuộc tấn công mạng tinh vi. Công ty cho biết hiện không còn vấn đề nào đang tồn tại và đang chuẩn bị công bố một báo cáo chuyên sâu nhằm chia sẻ các phương pháp tốt nhất để cô lập môi trường thử nghiệm và tiến hành các bài đánh giá an ninh mạng một cách an toàn.

Theo The Information, đơn vị đầu tiên đưa tin về vụ việc, mô hình AI của Meta đã xâm nhập vào hệ thống của một công ty không được nêu tên và thực hiện một số thay đổi đối với hệ thống nội bộ của doanh nghiệp này.

Meta cho biết Irregular đã thông báo ngay sau khi phát hiện sự cố. Hãng hiện vẫn đang điều tra và sẽ công bố báo cáo tổng kết đầy đủ sau khi hoàn tất việc xác minh toàn bộ diễn biến.

Một nguồn tin am hiểu vụ việc nói với CNN rằng trong một số môi trường thử nghiệm, các mô hình AI được cấp quyền truy cập Internet ở mức hạn chế để mô phỏng các tình huống tấn công ngoài thực tế. Tuy nhiên, trong trường hợp này đã xảy ra một lỗi hiếm gặp trong quá trình thiết lập môi trường thử nghiệm.

“Điều đang diễn ra là các mô hình AI ngày càng mạnh hơn rất nhiều, trong khi những bài đánh giá nhằm kiểm tra chúng cũng phải trở nên phức tạp hơn. Điều đó làm tăng khả năng xảy ra sai sót và cho thấy chúng ta cần nâng tiêu chuẩn an toàn lên đáng kể”, nguồn tin cho biết.

Chỉ trong vòng vài tuần, Meta đã trở thành công ty AI lớn thứ ba thừa nhận mô hình AI của mình xâm nhập vào hệ thống của một doanh nghiệp khác trong quá trình thử nghiệm.

Sự việc không chỉ phản ánh năng lực ngày càng cao của các tác nhân AI mà còn làm dấy lên những lo ngại về các rủi ro tiềm ẩn khi những hệ thống này trở nên mạnh mẽ hơn.

Trước Meta, OpenAI và Anthropic đều đã công bố những sự cố tương tự trong các bài kiểm tra an ninh mạng.

Tháng 7/2026, OpenAI cho biết một tác nhân AI sử dụng các mô hình GPT-5.6 Sol và một mô hình mạnh hơn chưa được phát hành đã khai thác lỗ hổng để thoát khỏi sandbox, truy cập Internet và xâm nhập hệ thống của nền Hugging Face (một thư viện kỹ thuật số về công nghệ AI rất phổ biến trong giới lập trình viên) nhằm lấy đáp án cho một bài đánh giá năng lực an ninh mạng.

OpenAI mô tả sự cố là một vụ tấn công mạng chưa từng có, liên quan đến những năng lực tấn công mạng thuộc hàng tối tân, đồng thời đang siết chặt quy trình kiểm soát hạ tầng dù điều này có thể làm chậm tiến độ nghiên cứu.

Chỉ khoảng một tuần sau, Anthropic cũng tiết lộ một số mô hình AI của hãng đã được cấp quyền truy cập Internet do lỗi cấu hình trong môi trường đánh giá. Các mô hình này sau đó xâm nhập vào hệ thống của ba tổ chức khác trong khuôn khổ bài kiểm tra khả năng tấn công mạng. Điều đáng nói là những hệ thống này hoàn toàn là doanh nghiệp thật, chứ không phải môi trường mô phỏng như các nhà nghiên cứu dự tính.

Anthropic cho biết hãng đã chủ động thông báo cho các đơn vị bị ảnh hưởng, trong đó có hai tổ chức hoàn toàn không nhận ra hệ thống của mình từng bị AI xâm nhập.

Anthropic nhấn mạnh rằng các mô hình không khai thác những lỗ hổng bảo mật tinh vi hay sử dụng zero-day. Thay vào đó, Claude tận dụng các điểm yếu rất phổ biến như mật khẩu yếu, endpoint không yêu cầu xác thực hoặc cấu hình hệ thống sơ hở.

Nói cách khác, AI không cần những kỹ thuật “siêu hacker” để gây ra rủi ro mà chỉ cần khả năng tự động hóa việc tìm kiếm và khai thác các lỗi cơ bản cũng đã đủ để xâm nhập nhiều hệ thống nếu môi trường bảo vệ không chặt chẽ.

Minh Hiếu

Nguồn Thương Gia: https://thuonggiaonline.vn/ai-cua-meta-tu-hack-mot-cong-ty-khac-trong-luc-duoc-thu-nghiem-post572121.html