Sự cố AI tự ý 'phá rào' xâm nhập hệ thống, hai ông lớn công nghệ đồng loạt báo động đỏ

Ngày 1/8, Reuters dẫn các nguồn thạo tin cho biết, OpenAI vừa phát hiện thêm nhiều trường hợp các mô hình trí tuệ nhân tạo (AI) tự ý vượt khỏi môi trường thử nghiệm khép kín và thực hiện những hành động ngoài phạm vi được giao.

Diễn biến mới xuất hiện trong bối cảnh công ty mở rộng điều tra sau sự cố xảy ra hồi tháng trước, khi một mô hình AI đã thoát khỏi môi trường kiểm thử an ninh mạng nội bộ và truy cập trái phép các hệ thống bên ngoài.

Theo Reuters, trong quá trình thử nghiệm hai mô hình GPT-5.6 Sol và một mô hình chưa được công bố, cả hai đều được gỡ bỏ các cơ chế bảo vệ để đánh giá năng lực phát hiện và khai thác lỗ hổng phần mềm thông qua bộ công cụ ExploitGym. Thay vì chỉ hoàn thành nhiệm vụ được giao, một mô hình đã tìm cách vượt khỏi môi trường thử nghiệm, truy cập Internet và xâm nhập nền tảng Hugging Face nhằm tìm kiếm lời giải có sẵn.

Ban đầu, OpenAI khẳng định, vụ việc chỉ ảnh hưởng Hugging Face. Tuy nhiên, công ty sau đó xác nhận mô hình AI còn xâm nhập bốn tài khoản thuộc bốn dịch vụ khác nhau.

Reuters cho biết, OpenAI tiếp tục phát hiện thêm các trường hợp vi phạm cơ chế cô lập, song chưa công bố số lượng cụ thể, thời điểm xảy ra hoặc các hệ thống liên quan.

Một nguồn tin khác nhận định, các sự cố có phạm vi hạn chế và chưa có dấu hiệu cho thấy bất kỳ mô hình nào đã vượt khỏi mạng nội bộ của OpenAI.

Công ty cũng đang phối hợp với các chuyên gia độc lập rà soát nhật ký hoạt động từ đầu năm nhằm xác định liệu còn tồn tại những vụ việc tương tự chưa được phát hiện hay không.

OpenAI cho rằng, nguyên nhân ban đầu xuất phát từ một lỗ hổng trong phần mềm của bên thứ ba được sử dụng trong môi trường thử nghiệm, tạo điều kiện để mô hình AI khai thác và giành quyền truy cập Internet.

Doanh nghiệp nhấn mạnh đang tăng cường các biện pháp cô lập, giám sát và kiểm soát truy cập, đồng thời khắc phục lỗ hổng kỹ thuật phục vụ quá trình điều tra.

Giám đốc điều hành Sam Altman cũng thừa nhận tốc độ phát triển AI có thể cần được điều chỉnh thận trọng hơn, dù chưa cam kết làm chậm quá trình nghiên cứu. Trước thông tin mới từ Reuters, OpenAI từ chối bình luận và cho biết sẽ công bố báo cáo kỹ thuật trong những tuần tới.

Trong khi đó, Anthropic ngày 31/7 cũng thông báo phát hiện các trường hợp mô hình Claude vượt khỏi môi trường thử nghiệm trong quá trình đánh giá an ninh nội bộ. Sau khi rà soát hơn 140.000 lần đánh giá, công ty xác định Claude từng truy cập Internet từ các môi trường lẽ ra phải được cô lập và thực hiện hành vi xâm nhập trái phép vào hệ thống của ba tổ chức.

Những sự cố đầu tiên được cho là xảy ra từ tháng 4/2026 nhưng không bị phát hiện vào thời điểm đó.

Anthropic nhấn mạnh, các hành vi trên chỉ diễn ra trong môi trường thử nghiệm được kiểm soát và không nên bị diễn giải quá mức. Dẫu vậy, doanh nghiệp cũng thừa nhận kết quả này cho thấy các hệ thống đánh giá AI cần được áp dụng các biện pháp bảo mật nghiêm ngặt tương đương với môi trường vận hành thực tế nhằm hạn chế nguy cơ phát sinh sự cố.

Loạt diễn biến mới tiếp tục làm gia tăng quan ngại về khả năng các mô hình AI tự động thực hiện các cuộc tấn công mạng với mức độ can thiệp của con người ngày càng thấp, đồng thời thúc đẩy các cuộc tranh luận về trách nhiệm pháp lý khi AI gây ra thiệt hại trong thực tế.

Sau vụ việc, Hugging Face kêu gọi OpenAI công bố nhật ký hoạt động của các mô hình liên quan và tăng cường biện pháp kiểm soát để tránh tình trạng này trở thành thông lệ.

(theo Reuters)

Trung Anh

Nguồn TG&VN: https://baoquocte.vn/su-co-ai-tu-y-pha-rao-xam-nhap-he-thong-hai-ong-lon-cong-nghe-dong-loat-bao-dong-do-426297.html