Anthropic phát hiện và ngăn chặn 5 vụ việc dùng AI Claude trong nghiên cứu sinh học rủi ro
Anthropic phát hiện và ngăn chặn 5 tài khoản nghiên cứu dùng mô hình Claude liên quan đến virus và độc tố nguy hiểm có nguy cơ hỗ trợ phát triển vũ khí sinh học.
Công ty phát triển trí tuệ nhân tạo Anthropic vừa công bố phát hiện và ngăn chặn 5 trường hợp sử dụng các mô hình Claude có nguy cơ hỗ trợ nghiên cứu phát triển vũ khí sinh học. Các sự cố này được ghi nhận trong giai đoạn từ tháng 12-2025 đến tháng 8-2026, chủ yếu tập trung vào các lĩnh vực mầm bệnh truyền nhiễm, virus, nọc độc và độc tố nguy hiểm.
Rủi ro tiềm ẩn từ các nghiên cứu sinh học lưỡng dụng
Theo báo cáo từ Anthropic, các tài khoản bị phát hiện thuộc về những nhà khoa học đang trực tiếp hoạt động chuyên môn trong lĩnh vực nghiên cứu. Danh tính cá nhân, cơ quan quản lý và quốc gia làm việc của các đối tượng này không được đơn vị phát triển AI tiết lộ ra bên ngoài.
Đơn vị này nhấn mạnh việc xác định ranh giới giữa nghiên cứu y khoa thông thường và mục đích gây hại là một thách thức kỹ thuật rất lớn. Dù chưa thể khẳng định động cơ thực tế của người dùng, hệ thống an toàn vẫn kích hoạt lệnh chặn đối với các tài khoản trên nhằm triệt tiêu rủi ro lan truyền công nghệ.

Hành vi lách rào chắn kỹ thuật và các chủng virus được ghi nhận
Một số người dùng đã tìm cách vượt qua hàng rào kiểm soát bằng cách sử dụng tài khoản từ những khu vực bị giới hạn dịch vụ và cố tình thay đổi cấu trúc câu lệnh để che giấu mục đích nghiên cứu. Qua đợt rà soát dữ liệu vận hành kéo dài 30 ngày, hệ thống đã phát hiện khoảng 35 nỗ lực truy vấn riêng biệt mang yếu tố rủi ro.
Cụ thể, một trường hợp điển hình liên quan đến virus chikungunya truyền qua muỗi, nơi mô hình AI được sử dụng để soạn thảo hồ sơ xin cấp vốn nghiên cứu về khả năng né tránh hệ miễn dịch của chủng này. Ngoài ra, danh sách vi phạm còn ghi nhận các truy vấn liên quan đến virus cúm gia cầm thích nghi trên động vật có vú, nhóm orthopoxvirus gây bệnh đậu mùa cùng nhiều hoạt chất độc tố mới.
Tăng cường các lớp bảo vệ đa tầng cho mô hình Claude
Các dữ liệu thu thập từ những vụ vi phạm đã được Anthropic dùng làm bộ mẫu để nâng cấp thuật toán giám sát, bổ sung thêm nhiều lớp bảo vệ chuyên biệt cho các mô hình Claude thế hệ mới. Đơn vị đồng thời phối hợp và cung cấp thông tin liên quan cho các đối tác trong ngành và cơ quan chính phủ.
Bên cạnh lĩnh vực sinh học, hãng công nghệ cũng triển khai ngăn chặn việc ứng dụng AI trái phép trong các tác vụ thiết kế phần mềm phục vụ drone vũ trang, tên lửa và bom điều khiển. Việc cân bằng giữa mở rộng năng lực xử lý chuyên sâu và ngăn chặn triệt để nguy cơ khai thác vũ khí vẫn là trọng tâm kiểm duyệt hiện nay.


