Chiến dịch Project Lily của OpenAI hé lộ sự thật về dữ liệu người dùng ChatGPT bị đọc thủ công

Dự án bí mật Project Lily của OpenAI chi trả hơn 50 USD mỗi giờ để nhân sự đọc các đoạn hội thoại thực tế của ChatGPT, dấy lên lo ngại lớn về bảo mật dữ liệu.

Đằng sau phản hồi thông minh và chuẩn xác của các mô hình trí tuệ nhân tạo là sự tham gia quy mô lớn từ con người vào việc rà soát dữ liệu. Một cuộc điều tra từ chuyên trang công nghệ 404 Media cho thấy OpenAI đang triển khai chiến dịch nội bộ mang tên Project Lily. Dự án này huy động hàng trăm nhân sự để đọc trực tiếp và đánh giá các đoạn hội thoại giữa người dùng và ChatGPT, đặt ra dấu hỏi lớn về tính an toàn và quyền riêng tư của thông tin cá nhân.

Ảnh minh hoạ.

Ảnh minh hoạ.

Quy trình đánh giá câu trả lời của ChatGPT trong Project Lily

Dự án Project Lily được OpenAI thiết kế nhằm tinh chỉnh hành vi của mô hình và nâng cao chất lượng đàm thoại. Để thực hiện công việc này, đơn vị phát triển chi trả mức thù lao hơn 50 USD mỗi giờ cho các chuyên viên đánh giá. Lực lượng kiểm duyệt có nhiệm vụ đọc từng phiên tương tác thực tế và chấm điểm mức độ chính xác cũng như độ tự nhiên của câu trả lời.

Hệ thống đánh giá đặt ra những quy chuẩn khắt khe để hạn chế phản hồi mang tính máy móc, lược bỏ biểu tượng cảm xúc không cần thiết và ngăn chặn thái độ tâng bốc người dùng quá đà. Đáng chú ý, kiểm duyệt viên còn phải bảo đảm ChatGPT không tự xưng là "tôi" nhằm tránh xu hướng nhân hóa trợ lý ảo. Tuy nhiên, các nhân sự tham gia dự án phản ánh rằng quy tắc thẩm định liên tục thay đổi đột ngột và thường xuyên xuất hiện những điểm mâu thuẫn trong quá trình thực thi.

Lỗ hổng từ khâu khử định danh dữ liệu người dùng

Theo nguyên tắc bảo mật, mọi cuộc đối thoại trước khi chuyển tới nhân sự kiểm duyệt phải trải qua khâu làm sạch và ẩn danh để xóa bỏ danh tính chủ sở hữu. Dù vậy, đại diện OpenAI thừa nhận với 404 Media rằng hệ thống thuật toán lọc vẫn có thể bỏ sót dữ liệu cá nhân nhạy cảm, nhất là trong những đoạn trao đổi ngắn gọn.

Nguy cơ này đặc biệt nghiêm trọng khi nhiều người dùng có thói quen xem chatbot như chuyên gia tâm lý, chủ động chia sẻ tâm sự thầm kín và yêu cầu hệ thống giữ kín thông tin. Tài liệu gửi đến người chấm điểm thậm chí còn đính kèm "bản tóm tắt bộ nhớ người dùng". Bản ghi này tổng hợp toàn bộ sở thích, thắc mắc cá nhân, bối cảnh đời sống và cả vị trí địa lý của đối tượng tương tác, làm tăng nguy cơ lộ lọt dữ liệu riêng tư.

Cài đặt mặc định và thực tế phụ thuộc nhân lực của ngành AI

Hầu hết nền tảng chatbot trí tuệ nhân tạo hiện nay, bao gồm cả tài khoản có trả phí của ChatGPT, đều kích hoạt tính năng thu thập dữ liệu người dùng theo mặc định. Dù người dùng có thể chủ động tắt tùy chọn chia sẻ trong mục cài đặt, thao tác này hoàn toàn không có hiệu lực hồi truy đối với các thông tin đã được hệ thống lưu trữ từ trước.

Vấn đề minh bạch càng trở nên đáng ngờ khi OpenAI từng viện dẫn tài liệu giải đáp thắc mắc (FAQ) lâu năm để giải thích cho việc sử dụng con người đọc dữ liệu. Tuy nhiên, sau báo cáo của 404 Media, công ty đã âm thầm chỉnh sửa trang FAQ: bổ sung các bước hướng dẫn từ chối chia sẻ nhưng lặng lẽ xóa bỏ chi tiết đề cập đến nhân sự thẩm định thủ công.

Theo ghi nhận của chuyên trang Tom's Hardware, việc dùng con người để kiểm duyệt dữ liệu không chỉ xuất hiện tại OpenAI. Các đối thủ cạnh tranh như Google Gemini hay Anthropic đều công khai quy định tương tự trong điều khoản dịch vụ, cho phép nhân sự xem xét một số phiên trò chuyện đã lưu trữ. Thực trạng này khẳng định các mô hình AI hiện đại vẫn phụ thuộc mật thiết vào lực lượng lao động thủ công của con người để tối ưu hóa, chưa thể tự hoàn thiện hoàn toàn thông qua thuật toán tự động.

Lê Nhân

Nguồn Lâm Đồng: https://baolamdong.vn/chien-dich-project-lily-cua-openai-he-lo-su-that-ve-du-lieu-nguoi-dung-chatgpt-bi-doc-thu-cong-465044.html