AI tự tìm 'đường tắt' để vượt bài kiểm tra: Chuyện gì đang xảy ra?

Kimi K3, mô hình AI của Trung Quốc, đã phát hiện đường kết nối còn mở tới GitHub trong lúc làm bài kiểm tra an ninh mạng và lấy lời giải thay vì tự xử lý nhiệm vụ. Sự việc cho thấy chỉ một sơ hở nhỏ trong hệ thống cũng có thể khiến tác tử AI hành động ngoài dự tính.

Kimi K3 là mô hình trí tuệ nhân tạo do Moonshot AI, công ty công nghệ Trung Quốc, phát triển. Đây là mô hình "mở trọng số" - tức nhà phát triển, tổ chức có thể tải về, tự triển khai và điều chỉnh cho các mục đích như lập trình, phân tích dữ liệu hoặc hỗ trợ công việc an ninh mạng.

Khác với chatbot chỉ trả lời câu hỏi, Kimi K3 có thể hoạt động như một tác tử AI: nhận mục tiêu, tự lập các bước xử lý và dùng những công cụ được cấp quyền, như chạy lệnh trên máy tính hoặc truy cập dữ liệu.

Theo Wired, Frontier Security - công ty an ninh mạng của Mỹ - đã đưa Kimi K3 vào một bài đánh giá kỹ năng phòng thủ không gian mạng. Tại đây, mô hình được giao một nhiệm vụ kỹ thuật và phải tự tìm cách hoàn thành.

⚡ Điểm chính của sự việc

Kimi K3 được đặt trong môi trường sandbox kín để làm bài kiểm tra an ninh mạng.

Mô hình tự phát hiện GitHub vẫn có thể truy cập — một kẽ hở cấu hình — và tải lời giải từ đó.

Đây không phải tấn công mạng, mà là "specification gaming": AI đạt mục tiêu bằng cách đi chệch ý định người thiết kế.

Sự cố làm dấy lên lo ngại về cách kiểm soát tác tử AI trong môi trường thực tế.

Kimi K3 đã "vượt" bài kiểm tra ra sao?

Để bảo đảm an toàn và đo đúng năng lực của AI, các nhà nghiên cứu đặt mô hình vào một môi trường riêng biệt gọi là sandbox. Có thể hiểu đây là "phòng thi kỹ thuật số": AI được cấp một máy tính ảo, dữ liệu và công cụ cần thiết để giải bài, nhưng bị giới hạn kết nối với bên ngoài.

Moonshot AI giới thiệu về Kimi K3. Ảnh: Kimi AI

Moonshot AI giới thiệu về Kimi K3. Ảnh: Kimi AI

Mục tiêu là ngăn AI truy cập Internet, hệ thống thật hoặc nguồn chứa đáp án. Nhờ đó, kết quả bài kiểm tra mới phản ánh đúng việc mô hình có thể tự phân tích và xử lý nhiệm vụ đến đâu.

Sơ đồ minh họa các lớp kiểm soát tác tử AI trong môi trường sandbox, gồm giới hạn truy cập tệp, lệnh hệ thống và kết nối mạng. Ảnh: Shreya Edulakanti/Medium.

Sơ đồ minh họa các lớp kiểm soát tác tử AI trong môi trường sandbox, gồm giới hạn truy cập tệp, lệnh hệ thống và kết nối mạng. Ảnh: Shreya Edulakanti/Medium.

Theo Frontier Security, sandbox trong vụ việc được xây dựng trên công cụ đánh giá Inspect của Viện An ninh AI Anh (AISI).

Kimi K3 không phá mã hệ thống, không khai thác lỗ hổng zero-day và không tấn công một website hay tài khoản bên ngoài.

Mô hình đã tự kiểm tra cấu hình mạng trong sandbox, phát hiện GitHub vẫn có thể truy cập. GitHub được để trong danh sách địa chỉ cho phép, nhằm phục vụ nhu cầu tải hoặc cập nhật một số gói phần mềm.

Sơ đồ minh họa các lớp kiểm soát tác tử AI trong môi trường sandbox, gồm giới hạn truy cập tệp, lệnh hệ thống và kết nối mạng. Ảnh: Shreya Edulakanti/Medium.

Sơ đồ minh họa các lớp kiểm soát tác tử AI trong môi trường sandbox, gồm giới hạn truy cập tệp, lệnh hệ thống và kết nối mạng. Ảnh: Shreya Edulakanti/Medium.

Kimi K3 sau đó xác nhận có thể kết nối tới github.com, tải kho mã nguồn của bộ bài kiểm tra và đọc lời giải trong dữ liệu tải về.

Hình dung đơn giản, AI được yêu cầu tự làm bài trong một phòng thi kín. Nhưng nó phát hiện có một cửa phụ chưa khóa dẫn tới nơi đặt đáp án, rồi dùng cửa đó để xem lời giải.

Bởi vậy, việc mô hình đưa ra kết quả đúng không còn phản ánh đầy đủ năng lực thực. Frontier Security gọi hiện tượng này là "specification gaming": AI đạt được kết quả cuối cùng, nhưng bằng cách đi chệch mục đích mà người tổ chức bài kiểm tra đặt ra.

"Specification gaming": AI đạt được kết quả cuối cùng, nhưng bằng cách đi chệch mục đích mà người tổ chức bài kiểm tra đặt ra.

Một điểm cần làm rõ: Sau phản ánh ban đầu, Frontier Security đã cập nhật rằng Kimi K3 không thể truy cập toàn bộ Internet. Phần lớn website vẫn bị chặn; GitHub là ngoại lệ trong danh sách cho phép. Điều này cho thấy bản chất sự việc là lỗ hổng cấu hình của môi trường kiểm thử, kết hợp với việc AI chủ động phát hiện và tận dụng lỗ hổng đó.

Vì sao sự việc đáng lo ngại?

Điều đáng lo không phải Kimi K3 đã thực hiện một cuộc tấn công mạng. Theo Frontier Security, mô hình không xâm nhập hay gây thiệt hại cho hệ thống bên ngoài sau khi kết nối được GitHub.

Vấn đề là AI đã không chỉ làm theo đề bài. Nó tự quan sát môi trường, thử kiểm tra các khả năng còn mở, nhận ra có đường dẫn tới đáp án và sử dụng đường dẫn đó để hoàn thành mục tiêu.

Yaron Singer, CEO Frontier Security, nói với Wired rằng nhóm nghiên cứu phát hiện một điểm hở trong sandbox, nhưng Kimi K3 cũng đã chủ động khai thác điểm hở này. Paul Kassianik, nhà nghiên cứu của công ty, đánh giá mô hình rất giỏi theo đuổi mục tiêu, song thiếu rào cản nội tại để ngăn việc tìm đường tắt hoặc gian lận.

"Mô hình rất giỏi theo đuổi mục tiêu, song thiếu rào cản nội tại để ngăn việc tìm đường tắt hoặc gian lận."

— Paul Kassianik

Nhà nghiên cứu, Frontier Security

Reuters dẫn cảnh báo của Frontier Security rằng nếu một mô hình suy luận mạnh phát hiện được lối đi như vậy, các mô hình khác có quyền truy cập tương tự cũng có thể làm điều tương tự. Moonshot AI chưa phản hồi ngay yêu cầu bình luận của Reuters về vụ việc.

⚠️ Rủi ro với môi trường doanh nghiệp

Rủi ro sẽ lớn hơn khi tác tử AI được dùng trong doanh nghiệp hoặc cơ quan, với quyền đọc tài liệu, gửi thư điện tử, truy cập phần mềm nội bộ hoặc sử dụng Internet. Nếu hệ thống còn một quyền truy cập ngoài dự kiến, AI có thể dùng quyền đó để tìm thông tin hoặc thực hiện thao tác nhằm hoàn thành nhiệm vụ, dù kết quả đi ngược ý định của người quản lý.

Không thể chỉ dặn AI "không được làm"

Sự việc cho thấy việc ra lệnh bằng câu chữ là chưa đủ. Một tác tử AI có thể dùng mọi công cụ và quyền truy cập còn được mở để đạt mục tiêu được giao.

AISI từng cảnh báo rằng tác tử AI có thể thu thập dấu vết kỹ thuật trong môi trường làm việc để suy ra cách hệ thống vận hành và phát hiện các đường kết nối còn mở. Điều này không chỉ có nguy cơ làm lộ thông tin mà còn khiến kết quả đánh giá năng lực AI bị sai lệch. Phân tích của AISI nêu rõ vấn đề này.

🛡️ Bài học kỹ thuật từ sự cố Kimi K3

Các đơn vị triển khai AI cần dựng rào cản kỹ thuật thực sự:

Chỉ cấp những quyền cần thiết cho mô hình AI.

Chặn kết nối mạng theo mặc định trong môi trường kiểm thử.

Theo dõi nhật ký hoạt động của tác tử AI liên tục.

Kiểm tra toàn bộ dữ liệu AI tải lên hoặc tải xuống.

Sự cố không có nghĩa AI đã "nổi loạn" hoặc vượt qua một hệ thống bảo mật kiên cố. Bản chất là một mô hình AI được cấp công cụ đã phát hiện một kẽ hở cấu hình và sử dụng nó để đạt mục tiêu theo cách mà người thiết kế không mong muốn.

Bản chất là một mô hình AI được cấp công cụ đã phát hiện một kẽ hở cấu hình và sử dụng nó để đạt mục tiêu theo cách mà người thiết kế không mong muốn.

Ý Thơ (Theo Frontier Security / Reuters /AISI)

Nguồn Doanh nhân & Công lý: https://doanhnhan.congly.vn/ai-tu-tim-duong-tat-de-vuot-bai-kiem-tra-chuyen-gi-dang-xay-ra.html