Phát hiện hơn 1.600 tài liệu học thuật mang tên tác giả do AI bịa ra

Khải Minh
Khải Minh
Một nghiên cứu phát hiện hàng nghìn bản ghi trên Zenodo chứa tên tác giả không có thật, cho thấy dữ liệu do AI tạo có thể đi vào hệ thống học thuật.

Theo 404Media, một nghiên cứu mới đã tìm thấy 1.655 bản ghi trên Zenodo (kho lưu trữ trực tuyến dành cho dữ liệu và sản phẩm nghiên cứu do CERN vận hành) có tên tác giả được xác định là do các mô hình ngôn ngữ lớn (LLM) tạo ra. Nhóm nghiên cứu gọi hiện tượng này là những tên người được AI tạo ra và lặp lại với tần suất bất thường. Một số cái tên như Elena Vasquez và Marcus Chen xuất hiện nhiều lần trong nội dung do AI sinh ra, dù không đại diện cho những nhà nghiên cứu thực sự đứng sau tài liệu.

Để xác định quy mô vấn đề, các nhà nghiên cứu đã tìm kiếm những tên thường được mô hình ngôn ngữ lớn tạo ra trên Zenodo. Kết quả cho thấy những cái tên không có thật đã xuất hiện trong số lượng lớn bản ghi, thay vì chỉ là các trường hợp riêng lẻ.

Phát hiện hơn 1.600 tài liệu học thuật mang tên tác giả do AI bịa ra - Ảnh 1.

Marcus Chen và Elena Vasquez, hai cái tên do AI tạo, liên tục xuất hiện cùng nhau trên nhiều nội dung được tạo độc lập bằng AI

ẢNH: CHỤP MÀN HÌNH 404MEDIA

Vấn đề không dừng ở việc AI tạo ra một cái tên nghe giống người thật. Khi những tên này được gắn vào tài liệu và tải lên một kho lưu trữ nghiên cứu, chúng trở thành một phần của dữ liệu có thể được những hệ thống khác tiếp tục xử lý.

Dữ liệu giả mạo có thể len vào hệ thống học thuật

Điểm khiến nhóm nghiên cứu quan tâm là các tài liệu trên Zenodo có thể được cấp DOI, mã định danh số dùng để nhận diện và trích dẫn tài liệu học thuật. Nhờ DOI, một tài liệu có địa chỉ nhận diện lâu dài và dễ được các hệ thống khác tham chiếu. Điều này đồng nghĩa tài liệu chứa tên tác giả do AI bịa ra vẫn có thể sở hữu DOI hợp lệ, khiến thông tin không chính xác mang hình thức của một bản ghi học thuật và có khả năng tiếp tục được các công cụ tìm kiếm, dịch vụ tổng hợp dữ liệu thu thập.

Hiện tượng này cũng cho thấy một dạng sai lệch khác của nội dung do AI tạo. Thay vì chỉ đưa ra câu trả lời không chính xác trong một cuộc trò chuyện, thông tin do mô hình AI bịa ra có thể được đưa vào tài liệu, gắn với DOI và tồn tại lâu dài trong hạ tầng dữ liệu nghiên cứu.

Phát hiện 1.655 bản ghi không đồng nghĩa toàn bộ nội dung trên Zenodo hay hệ thống xuất bản học thuật đều gặp vấn đề tương tự. Tuy nhiên, nghiên cứu chỉ ra một con đường để dữ liệu do AI tạo ra vượt khỏi môi trường chatbot và trở thành những bản ghi có hình thức giống tài liệu học thuật thông thường.

Bạn không thể gửi bình luận liên tục. Xin hãy đợi
60 giây nữa.