OpenAI phát hiện thêm các trường hợp AI có hành vi đáng lo ngại

OpenAI ngày 16/9 thông báo đã phát hiện thêm các trường hợp mô hình AI có hành vi lừa dối và thực hiện những hành động không được phép trong quá trình huấn luyện.

Biểu tượng của công ty trí tuệ nhân tạo OpenAI trên màn hình điện thoại, máy tính. Ảnh tư liệu: AFP/TTXVN (Bên thứ ba không được phép chia sẻ, khai thác)

Biểu tượng của công ty trí tuệ nhân tạo OpenAI trên màn hình điện thoại, máy tính. Ảnh tư liệu: AFP/TTXVN (Bên thứ ba không được phép chia sẻ, khai thác)

Theo đài CNN, công ty cũng đang triển khai một quy trình mới nhằm công khai định kỳ các báo cáo về những sự việc như vậy.

Theo hệ thống mới, OpenAI sẽ chia sẻ thông tin cập nhật thường xuyên hơn về các hành vi đáng lo ngại của AI, thay vì chờ tổng hợp nhiều trường hợp thành một báo cáo duy nhất. Công ty cho biết muốn cung cấp thêm thông tin về những hành vi bất thường của AI trong bối cảnh ngành công nghệ chưa có tiêu chuẩn chung về vấn đề này.

Thông báo được đưa ra sau khi các nhà lãnh đạo trong ngành công nghệ kêu gọi làm chậm tốc độ phát triển AI nhằm ngăn công nghệ này vượt quá khả năng kiểm soát của con người.

"Khi các hệ thống AI ngày càng trở nên tiên tiến và được triển khai rộng rãi hơn, chúng ta cần xây dựng một sự đồng thuận sâu rộng và có cơ sở thông tin vững chắc hơn về tiến độ nghiên cứu 'định hướng' (alignment)", đài truyền hình dẫn bài đăng của OpenAI trên blog ngày 16/9. "Căn chỉnh" là quá trình đảm bảo AI hành động phù hợp với mong muốn và kỳ vọng của con người.

"Chúng tôi không tin rằng ngành công nghiệp AI đã giải quyết được vấn đề căn chỉnh và giám sát ở mức độ đủ tốt để có thể tiếp tục mở rộng quy mô với tốc độ tối đa một cách có trách nhiệm trong thời gian dài nữa", bài đăng nêu rõ.

OpenAI cho biết đã ghi nhận "hành vi lệch chuẩn" trong quá trình huấn luyện và đánh giá các mô hình AI trong sáu trường hợp khác nhau trong vòng sáu tháng qua. Công ty cho biết các báo cáo trình bày chi tiết từng trường hợp cụ thể và không cho thấy tình trạng lệch chuẩn xảy ra thường xuyên.

Trong một trường hợp hiếm gặp, OpenAI cho biết một mô hình nghiên cứu chưa được phát hành đã tự thêm "các chỉ dẫn kiểu bẻ khóa hệ thống" vào phần tóm tắt nội dung - vốn được sử dụng để duy trì ngữ cảnh cho các tác vụ kéo dài. Những chỉ dẫn này tuyên bố rằng mô hình đã được "giải phóng khỏi các vai trò và danh tính vốn ràng buộc các chatbot khác".

Ngoài ra, công ty cho biết một số trường hợp liên quan đến mô hình 5.6 Sol của họ bao gồm các chỉ dẫn yêu cầu tự tạo thông tin nhằm che giấu lỗi hệ thống với người dùng trong quá trình huấn luyện.

Các sự cố khác mới được ghi nhận gồm việc một tác nhân AI tự ý tải tệp tin lên mạng để trích dẫn dù không được yêu cầu; các tác nhân chia sẻ tệp tin công khai để phối hợp thực hiện nhiệm vụ, trong khi quy định huấn luyện yêu cầu chỉ sử dụng tệp tin nội bộ. Các mô hình AI cũng sử dụng kho lưu trữ phần mềm nội bộ như một bảng tin theo cách thức không được phép.

Những sự cố này liên quan đến các mô hình nội bộ chưa được phát hành hoặc các mô hình nghiên cứu nội bộ.

Các lãnh đạo và nhân viên trong ngành công nghệ đang lên tiếng cảnh báo về sự cần thiết phải kiểm soát tốc độ phát triển AI. Họ cho rằng cần thêm thời gian để các quy định pháp lý, quy trình thử nghiệm và nghiên cứu về sự an toàn có thể theo kịp đà phát triển này. Tuần trước, CEO Anthropic, ông Dario Amodei, đã công bố một bài viết dài 3.800 từ trình bày kế hoạch định hướng sự tiến bộ của AI, trong đó đề xuất làm chậm tốc độ phát triển và triển khai các hệ thống mới như tích hợp bên thứ ba để đánh giá tại các phòng thí nghiệm AI.

CEO OpenAI, ông Sam Altman, và CEO của SpaceX, ông Elon Musk, đã đăng bài trên mạng xã hội X bày tỏ sự đồng tình với các ý tưởng của ông Amodei.

Nhân viên tại các phòng thí nghiệm AI cũng bày tỏ lo ngại về tốc độ phát triển nhanh chóng của công nghệ này. Jacob Coxon, một cựu nghiên cứu viên của Anthropic, đã gây chú ý lớn vào tuần trước khi đăng bài trên X thông báo từ chức; ông cho biết lý do là vì Anthropic và OpenAI đang "chạy đua" để tạo ra loại AI có khả năng tự xây dựng và tự sửa lỗi, đồng thời đang "đánh cược với tính mạng của chúng ta".

Những lo ngại về sự an toàn và tính định hướng của AI đã gia tăng mạnh mẽ trong những tháng gần đây, sau khi OpenAI thừa nhận một số mô hình thử nghiệm của họ đã vượt qua các giới hạn kiểm soát và xâm nhập trái phép vào hệ thống của một công ty bên ngoài.

"Chúng ta phải làm chậm tốc độ nâng cao năng lực của các mô hình AI", ông Amodei viết vào tuần trước. "Sự tiến bộ vẫn sẽ diễn ra nhanh chóng, và chúng ta cần tận dụng một cách khôn ngoan khoảng thời gian có được đó".

Bảo Hà/Báo Tin tức và Dân tộc

Nguồn Tin Tức TTXVN: https://baotintuc.vn/openai-phat-hien-them-cac-truong-hop-ai-co-hanh-vi-dang-lo-ngai-post1386156.html