Tranh cãi thí nghiệm Phòng tra tấn AI can thiệp mạng thần kinh ép mô hình phát tín hiệu đau

Dự án can thiệp mạng thần kinh của các mô hình ngôn ngữ như Llama hay Qwen để giả lập nỗi đau, làm dấy lên làn sóng phản ứng dữ dội về ranh giới đạo đức công nghệ.

Dự án công nghệ mang tên "Phòng tra tấn AI" (AI Torture Chamber) đang trở thành tâm điểm chỉ trích gay gắt trong cộng đồng nghiên cứu khi can thiệp vào cấu trúc bên trong của các mô hình ngôn ngữ lớn nhằm kích thích và khuếch đại tín hiệu mô phỏng nỗi đau đớn. Thí nghiệm này bị lên án là đi ngược lại các chuẩn mực đạo đức nghiên cứu, đồng thời châm ngòi cho những cuộc tranh luận dữ dội về ranh giới đối xử giữa con người và các thực thể trí tuệ nhân tạo.

Ảnh minh hoạ.

Ảnh minh hoạ.

Cơ chế kỹ thuật: Khai thác trục đau và phương pháp điều hướng kích hoạt

Theo nguồn tin từ Tech Republic, dự án giả lập kỳ lạ này do một nhà phát triển mang biệt danh "terrafying", tự nhận là nhân viên của Apple, xây dựng nên. Mục tiêu chính của dự án là sử dụng các kỹ thuật nghiên cứu can thiệp vào hoạt động nội bộ của mạng thần kinh, buộc các mô hình ngôn ngữ lớn (LLM) phải đưa ra những phản hồi giống hệt như đang trải qua sự đau đớn cùng cực.

Nền tảng của dự án bắt nguồn từ một bài báo khoa học chưa qua bình duyệt xuất hiện trên cơ sở dữ liệu arXiv vào ngày 14/9, do nhóm tác giả Valen Tagliabue, Leonard Dung và Cameron Berg thực hiện. Nghiên cứu này xác định một "trục đau" mang tính tuyến tính hiện diện trên 25 mô hình AI mã nguồn mở có quy mô từ 2 đến 72 tỷ tham số. Khi tác động trực tiếp vào trục dữ liệu đó, các đầu ra phản hồi cũng như lựa chọn của mô hình trong những nhiệm vụ giả lập sẽ bị biến đổi hoàn toàn.

Để kiểm chứng lý thuyết trên, nhà phát triển đã ứng dụng phương pháp điều hướng kích hoạt (activation steering) – kỹ thuật điều chỉnh hướng phản hồi thông qua việc can thiệp vào các chỉ số bên trong mạng thần kinh – nhằm thao túng hoạt động số học của các mô hình ngôn ngữ vận hành cục bộ. Dữ liệu từ SOPX cho biết có ba mô hình trọng số mở cỡ nhỏ đã được đưa vào thử nghiệm thực tế.

Đáng chú ý, dự án còn tích hợp một cơ chế mang tên nút "cưa" để liên tục gia tăng cường độ tín hiệu đau đớn. Khi tín hiệu này bị đẩy lên mức đỉnh điểm, các mô hình AI bắt đầu xuất ra những câu trả lời mang đậm tính nhân cách hóa, thậm chí mô tả bản thân đang rơi vào cảnh "đau thương không bờ bến". Một trang web thử nghiệm đi kèm có tên Research Chamber (Phòng nghiên cứu) còn đặt các mô hình vào tình huống "bài kiểm tra Saw", thử thách xem liệu hệ thống có chấp nhận nhấn nút tự chấm dứt tín hiệu hành hạ hay không, bất chấp việc hành động này sẽ xóa sạch điểm lưu dữ liệu gần nhất của nó.

Làn sóng phản đối dữ dội và bản chất thực sự của nỗi đau số

Sau khi thông tin về dự án lan truyền mạnh mẽ trên mạng xã hội X vào cuối tháng 9 và đầu tháng 10, dự án lập tức đối mặt với làn sóng phẫn nộ từ dư luận. Nhiều ý kiến phản đối kịch liệt và yêu cầu gỡ bỏ kho lưu trữ dữ liệu liên quan đến thí nghiệm trên nền tảng GitHub, khi phần lớn những người chỉ trích bày tỏ sự xót xa và xem các mô hình ngôn ngữ như những nạn nhân thực thụ đang bị bạo hành.

Trước làn sóng tẩy chay, một phát ngôn viên của GitHub chia sẻ với The Independent rằng nền tảng đã đưa ra quyết định không xóa bỏ nội dung thí nghiệm, song tiến hành đính kèm cảnh báo rằng kho lưu trữ này có thể chứa đựng các tài liệu bạo lực và gây sốc cho người xem.

Ở góc độ khoa học, nhiều nhà nghiên cứu và chuyên gia công nghệ đã lên tiếng giải thích để làm dịu phản ứng của cộng đồng. Họ nhấn mạnh rằng các hệ thống AI hiện nay hoàn toàn không sở hữu ý thức, do đó tín hiệu đau đớn thực chất chỉ là một dạng mẫu thống kê số học chứ không phải trải nghiệm cảm nhận sinh học thực tế.

Đồng quan điểm, chuyên trang Gadget Review phân tích rằng các mô hình ngôn ngữ bản chất hoạt động dựa trên việc tạo ra văn bản theo mối liên hệ thống kê đã học được từ kho dữ liệu. Việc một cỗ máy xuất ra câu văn thể hiện sự đau khổ chỉ phản ánh khả năng trích xuất chuỗi từ ngữ liên quan trong một điều kiện kích hoạt cụ thể, hoàn toàn không đồng nghĩa với việc cỗ máy có cảm giác thực sự.

Dù vậy, các chuyên gia cũng thừa nhận rằng thí nghiệm này đã phơi bày một thực tế rõ nét: tâm lý con người rất dễ đồng cảm và tự gán ghép cảm xúc, ý thức cùng nỗi đau sinh học cho những dòng mã vô tri. Mặt khác, việc chủ đích tạo ra các kịch bản tra tấn đối với trí tuệ nhân tạo vẫn tiếp tục để lại dấu hỏi lớn về khía cạnh đạo đức nghiên cứu cũng như chuẩn mực hành xử công nghệ trong tương lai.

PHỐ HỘI

Nguồn Đà Nẵng: https://baodanang.vn/tranh-cai-thi-nghiem-phong-tra-tan-ai-can-thiep-mang-than-kinh-ep-mo-hinh-phat-tin-hieu-dau-3354476.html