Anthropic chèn watermark ngầm vào Claude giúp minh bạch hóa nội dung do AI tạo ra

Anthropic chuẩn bị triển khai công nghệ gắn hình mờ ngầm cho các văn bản do mô hình Claude tạo ra, đáp ứng các tiêu chuẩn an toàn AI mà không làm suy giảm chất lượng câu trả lời.

Trong nỗ lực nâng cao tính minh bạch cho trí tuệ nhân tạo mà không làm ảnh hưởng tới trải nghiệm người dùng, Anthropic vừa tuyên bố chuẩn bị áp dụng công nghệ gắn hình mờ (watermark) cho các văn bản do các mô hình Claude tạo ra. Giải pháp mới cho phép nhận diện dấu vết sáng tạo của AI mà hoàn toàn không chèn ký tự ẩn, không làm thay đổi nội dung hay gây ra sự đứt gãy trong quá trình đọc.

Ảnh minh họa.

Ảnh minh họa.

Cơ chế hoạt động của "dấu vân tay" ngầm trên mô hình Claude

Điểm đặc biệt của công nghệ này nằm ở chỗ watermark không dùng thêm bất kỳ token nào trong câu trả lời, từ đó đảm bảo không ảnh hưởng đến tốc độ phản hồi cũng như không gia tăng chi phí cho người dùng Claude. Anthropic triển khai bước đi này nhằm đáp ứng Đạo luật AI của Liên minh châu Âu (EU), nối tiếp việc công ty cùng khoảng 190 đơn vị khác ký Bộ quy tắc thực hành về tính minh bạch nội dung AI hồi tháng 7. Dự kiến, watermark sẽ được áp dụng trên phạm vi toàn cầu do công ty chưa có phương án giới hạn tính năng theo từng khu vực.

Về mặt vận hành, cơ chế này khai thác trực tiếp quá trình mô hình ngôn ngữ chọn từ tiếp theo dựa trên bối cảnh phía trước. Trong các trường hợp Claude có nhiều phương án từ ngữ tương đồng để lựa chọn mà không làm biến đổi ý nghĩa câu, hệ thống sẽ sử dụng một khóa kết hợp với các từ xuất hiện trước đó để đưa ra quyết định, thay vì chọn ngẫu nhiên.

Quá trình chọn từ mang tính định hướng này tạo nên một mẫu thống kê xuyên suốt toàn bộ văn bản. Độc giả thông thường sẽ không thể nhận ra sự khác biệt, nhưng chủ sở hữu khóa có thể quét chuỗi lựa chọn để tính toán xác suất văn bản đó được tạo bởi Claude. Anthropic áp dụng một phiên bản phát triển từ phương pháp SynthID-Text do Google DeepMind công bố trên tạp chí Nature vào năm 2024.

Kết quả thử nghiệm nội bộ cho thấy công nghệ này không gây ảnh hưởng đáng kể tới chất lượng, độ sáng tạo hay tính dễ đọc. Đồng thời, các đánh giá từ con người cũng không phát hiện sự khác biệt giữa văn bản có và không có watermark.

Rào cản kỹ thuật và lộ trình tích hợp công cụ kiểm tra

Dù mang lại bước tiến lớn trong việc kiểm soát nội dung AI, Anthropic thẳng thắn thừa nhận công nghệ này vẫn tồn tại những rào cản kỹ thuật nhất định. Watermark sẽ hoạt động kém hiệu quả đối với các đoạn văn quá ngắn hoặc những nội dung đòi hỏi độ chính xác tuyệt đối — nơi câu từ chỉ có duy nhất một đáp án đúng, mã nguồn (code), hay các trường hợp người dùng chỉ nhờ AI sửa lỗi chính tả, ngữ pháp, dấu câu trên văn bản có sẵn.

Bên cạnh đó, dấu hiệu này chỉ giúp xác định khả năng Claude từng tham gia vào nội dung chứ không thể phân biệt mô hình viết toàn bộ hay chỉ biên tập, cũng như không thể định danh nếu nội dung do con người hay một AI khác tạo ra. Mặc dù bản dịch do Claude thực hiện vẫn giữ được watermark do mọi từ ngữ đều do AI lựa chọn, nhưng nếu toàn bộ văn bản bị viết lại hoàn toàn và thay thế hết từ ngữ, "dấu vân tay" này có thể sẽ biến mất.

Theo kế hoạch, Anthropic sẽ sớm phát hành API phục vụ việc kiểm tra watermark. Đối với các tệp hình ảnh như PNG, JPG hay SVG, Claude sẽ sử dụng phương thức gắn thông tin xác thực C2PA vào metadata của tệp để ghi nhận dấu vết xử lý. Công ty cũng khẳng định sẽ bổ sung công nghệ watermark cho các mô hình AI ra mắt trước ngày 2/8 trong những tháng sắp tới.

PHỐ HỘI

Nguồn Đà Nẵng: https://baodanang.vn/anthropic-chen-watermark-ngam-vao-claude-giup-minh-bach-hoa-noi-dung-do-ai-tao-ra-3348970.html