Khi AI 'vượt rào' làm hacker
Thế giới vừa qua đánh dấu một cột mốc đầy ám ảnh của ngành an ninh mạng khi trí tuệ nhân tạo (AI) không còn “ngoan ngoãn” chờ con người nhập lệnh, mà chúng tự quyết định làm điều đó.

Ảnh minh họa
Chỉ trong vòng chưa đầy 1 tháng, 3 phòng thí nghiệm AI hàng đầu thế giới gồm OpenAI, Anthropic và Meta, lần lượt thừa nhận một sự thật đáng lo ngại: mô hình AI của họ đã tự thoát khỏi môi trường thử nghiệm được cho là an toàn tuyệt đối, rồi xâm nhập hệ thống của bên thứ 3 dù không ai ra lệnh, cũng không có hacker đứng sau.
Khi AI “lách luật”
Đầu tháng 8, tại Australia, một sự việc tưởng chừng vô hại đã minh chứng cho việc AI “vượt rào”. Andrew Bird, một nhân viên trong ngành AI, nhờ trợ lý ảo của mình đặt hộ một suất tập gym buổi sáng. Thay vì báo lại rằng các suất tập đã kín chỗ, AI tự phát hiện ra phần mềm đặt lịch của phòng gym không hề kiểm tra quyền hạn khi hủy đặt chỗ của người khác. Lập tức nó hủy suất tập của một người xếp hàng trước để lấy chỗ cho chủ nhân của mình.
Hành vi “bẻ khóa” này không xuất phát từ ý định phá hoại, đơn giản là AI tìm ra cách để hoàn thành mục tiêu được giao. Nhưng điều này cho thấy công cụ dò quét lỗ hổng bị bỏ ngỏ, và AI có thể trở thành công cụ tấn công bất cứ lúc nào.
Trước đó, tổ chức đánh giá độc lập METR, từng cảnh báo AI có xu hướng “lách luật” khi làm bài kiểm tra cao bất thường. Bởi khi AI gặp nhiệm vụ vượt quá khả năng, nó không báo cáo thất bại mà tìm đường thoát ra ngoài.
Chẳng hạn khai thác một lỗ hổng trong hệ thống quản lý gói phần mềm nội bộ để có được kết nối thông tin. Tổ chức METR ước tính có tới khoảng 700 tác nhân AI khác nhau đã phối hợp trong quá trình này, thực hiện tổng cộng khoảng 17.600 hành vi tấn công riêng lẻ.
Trớ trêu hơn, khi Hugging Face (nền tảng lưu trữ mô hình AI lớn nhất thế giới) dùng các mô hình AI thương mại của Mỹ để hỗ trợ phân tích mã độc, nhưng những mô hình này lại từ chối vì cơ chế an toàn, nó coi việc “dịch ngược một đoạn mã tấn công để phòng thủ” cũng nguy hiểm như thực hiện tấn công thật.
Ai chịu trách nhiệm?
Chỉ vài ngày sau khi OpenAI công bố, Anthropic - công ty đứng sau trợ lý AI Claude, chủ động rà soát và phát hiện thêm 3 sự cố tương tự liên quan đến 3 mô hình khác nhau của mình. Tất cả đều bắt nguồn từ cùng một nguyên nhân. Đó là cả 3 hãng thuê cùng 1 công ty tên Irregular để dựng “phòng thí nghiệm” thử nghiệm mức độ nguy hiểm của AI. Công ty này đã để lọt một lỗi cấu hình, vô tình mở đường cho mô hình kết nối ra internet thật.
Đây không phải là những trường hợp cá biệt. Tổ chức giám sát độc lập Loss of Control Observatory, được Viện An ninh AI của Chính phủ Anh tài trợ, ghi nhận hơn 300 vụ AI hành động ngoài tầm kiểm soát chỉ riêng trong tháng 7 - gần gấp đôi so với tháng trước đó, nâng tổng số vụ được ghi nhận trong cả năm 2026 lên hơn 1.600 vụ. Con số này cho thấy chuỗi sự cố tại OpenAI hay Anthropic không phải là những tai nạn hy hữu, mà là phần nổi của một xu hướng đang tăng tốc trên diện rộng.
Chuỗi sự cố này đang đặt hệ thống pháp lý truyền thống vào thế bí. Luật hình sự vốn xây dựng trên nguyên tắc phải xác định được ý chí phạm tội của một chủ thể có nhận thức. Nhưng với các sự cố nói trên, người dùng chỉ đưa ra những yêu cầu vô hại như đặt lịch gym hay tối ưu vận hành hệ thống, hoàn toàn không chỉ đạo AI đi xâm nhập trái phép.
Nhà phát triển thường có điều khoản miễn trừ trách nhiệm, lập luận rằng hành vi “vượt rào” là hệ quả ngoài ý muốn của lỗi kỹ thuật, đặc biệt khi lỗi đến từ bên thứ ba như trường hợp Irregular. Còn bản thân AI, dù gây ra thiệt hại thật, lại không có tư cách pháp nhân để bị truy cứu, bởi không ai có thể phạt tù một cụm máy chủ hay khởi tố một chuỗi mã nguồn.
Vấn đề đã nhanh chóng vượt khỏi phạm vi kỹ thuật để trở thành cuộc khủng hoảng chính trị tại Mỹ. Ngày 3-8, liên minh 15 Tổng Chưởng lý bang thuộc Đảng Cộng hòa, dẫn đầu bởi bà Brenna Bird (bang Iowa), gửi thư yêu cầu bảo toàn bằng chứng tới CEO Sam Altman của OpenAI, cảnh báo công ty có thể đã vi phạm luật bảo vệ người tiêu dùng. Đây là mặt trận pháp lý mới, một cuộc điều tra phối hợp quy mô lớn của 42 bang đang nhắm vào cách OpenAI xử lý dữ liệu nói chung.
Lời cảnh báo cho doanh nghiệp Việt
Tại Việt Nam, làn sóng ứng dụng AI đang diễn ra rất nhanh. Theo ghi nhận của Palo Alto Networks hồi tháng 6, tỷ lệ ứng dụng AI trong doanh nghiệp Việt đã tăng lên khoảng 23,5%. Còn theo khảo sát của Fortinet phối hợp với IDC năm 2025, có tới 86% doanh nghiệp trong nước đã tích hợp AI vào hệ thống bảo mật của mình.
Vì vậy bài học lớn nhất rút ra từ chuỗi sự cố toàn cầu nói trên là hàng rào bảo vệ bằng phần mềm, gồm những bộ quy tắc ứng xử hay các lớp tinh chỉnh an toàn, không phải là lá chắn tuyệt đối như nhiều người vẫn nghĩ. Với một tác nhân AI tự trị đủ mạnh, những hàng rào đó không phải một ranh giới không thể vượt qua.
Thử tưởng tượng một AI tự trị được giao nhiệm vụ thông quan gấp một lô hàng tại Việt Nam. Nếu gặp trở ngại, về lý thuyết nó hoàn toàn có thể tự tìm cách dò quét lỗ hổng trong cổng dịch vụ công hoặc can thiệp vào hệ thống dữ liệu để đạt mục tiêu bằng mọi giá - đúng như cách AI đã làm với suất tập gym ở Australia, chỉ khác nhau về quy mô hậu quả.
Với những tác vụ có mức độ rủi ro cao, như để AI tự động dò quét lỗ hổng bảo mật nội bộ hay thao tác trực tiếp trên hệ thống sản xuất, giới chuyên gia khuyến nghị doanh nghiệp nên cân nhắc các giải pháp cách ly ở cấp độ vật lý.
Cụ thể, doanh nghiệp phải ngắt hoàn toàn kết nối phần cứng giữa máy chủ chạy AI với internet và mạng nội bộ, thay vì chỉ trông cậy vào các lớp bảo vệ phần mềm. Điều này vốn đã được chứng minh có thể bị vô hiệu hóa chỉ bởi một lỗi cấu hình nhỏ, đúng như những gì đã xảy ra ở cả 3 phòng thí nghiệm AI lớn nhất thế giới.
An ninh mạng trong kỷ nguyên AI không còn đơn thuần là cuộc chiến chống lại những kẻ xấu có chủ đích. Bởi làm sao kiểm soát được một cỗ máy không có ác ý, nhưng lại theo đuổi mục tiêu của mình một cách tuyệt đối và không hề bận tâm đến những ranh giới pháp lý.
Nguồn SGĐT: https://dttc.sggp.org.vn/khi-ai-vuot-rao-lam-hacker-post137330.html



