AI tự bịa thuật ngữ, len lỏi vào hàng loạt bài báo khoa học

Một thuật ngữ vô nghĩa do lỗi số hóa đã được AI coi là kiến thức thật, rồi xuất hiện trong hàng chục bài báo khoa học, làm dấy lên lo ngại về "ô nhiễm tri thức"

Trong vài năm qua, trí tuệ nhân tạo đã trở thành công cụ hỗ trợ đắc lực cho hoạt động nghiên cứu, từ tổng hợp tài liệu đến gợi ý cách diễn đạt và xây dựng bản thảo khoa học. Tuy nhiên, sự phổ biến của AI cũng kéo theo một nguy cơ mới: những thông tin sai lệch có thể được khuếch đại và lặp lại với quy mô chưa từng có. Mới đây, giới khoa học quốc tế đã phát hiện một trường hợp điển hình khi thuật ngữ hoàn toàn vô nghĩa "kính hiển vi điện tử thực vật" (vegetative electron microscopy) xuất hiện trong hàng loạt bài báo khoa học. Hiện tượng này được các nhà nghiên cứu gọi là một "hóa thạch kỹ thuật số" - dấu vết của lỗi dữ liệu từ nhiều thập kỷ trước nhưng vẫn tiếp tục "sống" trong kỷ nguyên AI.

Nguồn gốc của sai sót này bắt đầu từ quá trình số hóa tài liệu khoa học vào những năm 1950. Khi đó, công nghệ nhận dạng ký tự quang học (OCR) còn nhiều hạn chế, khiến từ "vegetative" ở một cột văn bản bị ghép nhầm với cụm "electron microscopy" ở cột bên cạnh. Sai sót tưởng chừng vô hại tiếp tục bị khuếch đại nhiều thập kỷ sau khi hai công trình nghiên cứu bằng tiếng Ba Tư công bố vào các năm 2017 và 2019 mắc lỗi dịch thuật. Chỉ vì sự khác biệt rất nhỏ giữa hai ký tự, cụm từ đúng là "kính hiển vi điện tử quét" lại bị chuyển thành "kính hiển vi điện tử thực vật". Từ một lỗi đánh máy và dịch thuật, một khái niệm không hề tồn tại trong sinh học đã vô tình xuất hiện trên Internet và trở thành một phần của dữ liệu công khai.

Thuật ngữ "kính hiển vi điện tử thực vật" được hình thành từ lỗi OCR và sai sót dịch thuật trước khi lan truyền vào dữ liệu huấn luyện AI.

Vấn đề chỉ thực sự trở nên nghiêm trọng khi các mô hình AI thế hệ mới bắt đầu thu thập dữ liệu ở quy mô khổng lồ để huấn luyện. Với AI, mọi nội dung xuất hiện đủ nhiều trên Internet đều có thể được xem là kiến thức hợp lệ nếu không có cơ chế kiểm chứng. Kết quả là thuật ngữ vô nghĩa này được các mô hình ngôn ngữ lớn tiếp thu như một khái niệm khoa học có thật. Khi các nhà nghiên cứu sử dụng AI để hỗ trợ viết bài, hệ thống lại tiếp tục đề xuất hoặc tự động chèn cụm từ sai vào bản thảo. Theo nhóm nghiên cứu công bố phân tích trên The Conversation, hiện tượng này vẫn xuất hiện ở nhiều mô hình AI hiện đại, cho thấy lỗi dữ liệu đã ăn sâu vào kho tri thức của các hệ thống AI và không dễ loại bỏ.

Hậu quả không chỉ dừng lại ở các bản nháp. Các nhà nghiên cứu ghi nhận ít nhất 22 bài báo khoa học quốc tế đã sử dụng thuật ngữ này và vượt qua quy trình phản biện để được xuất bản. Thậm chí, cụm từ còn xuất hiện trên một số cơ quan báo chí lớn khi phóng viên trích dẫn từ các tài liệu khoa học. Điều đáng lo ngại là khác với lỗi trong cơ sở dữ liệu truyền thống, những sai sót đã được AI hấp thụ sẽ rất khó sửa triệt để. Ngay cả khi nguồn gốc ban đầu được chỉnh sửa hoặc gỡ bỏ, hàng tỷ tham số trong mô hình AI vẫn có thể tiếp tục tạo ra nội dung sai lệch nếu không được huấn luyện lại bằng dữ liệu sạch.

Các chuyên gia cảnh báo dữ liệu sai lệch khi đi vào mô hình AI có thể tiếp tục lan truyền qua nhiều thế hệ công cụ trí tuệ nhân tạo.

Sự việc này cũng phản ánh một thách thức lớn hơn đối với cộng đồng khoa học trong thời đại AI. Một phân tích trên khoảng 7,3 triệu bài báo khoa học cho thấy đến năm 2025, hơn một nửa số công trình xuất bản đã có dấu vết sử dụng mô hình ngôn ngữ lớn (LLM), từ chỉnh sửa câu chữ đến hỗ trợ xây dựng lập luận. Điều đó không đồng nghĩa các nghiên cứu đều thiếu tin cậy, nhưng làm gia tăng nguy cơ những lỗi nhỏ trong dữ liệu sẽ được nhân rộng với tốc độ rất nhanh. Trong khi các công cụ như Problematic Paper Screener đang nỗ lực phát hiện dấu hiệu AI trong các công trình khoa học, việc kiểm soát vẫn gặp nhiều khó khăn khi dữ liệu huấn luyện của các mô hình AI chưa được công khai đầy đủ và nhiều nhà xuất bản cũng thận trọng trong việc thu hồi bài báo đã phát hành.

Câu chuyện về "hóa thạch kỹ thuật số" là lời nhắc nhở rằng AI không tự tạo ra tri thức mới từ hư không, mà học từ những dữ liệu con người cung cấp. Nếu dữ liệu đầu vào chứa lỗi và không được kiểm chứng kỹ lưỡng, AI có thể biến những sai sót nhỏ thành "kiến thức" được lặp lại trên phạm vi toàn cầu. Trong bối cảnh AI ngày càng trở thành trợ lý quen thuộc của giới nghiên cứu, việc tăng cường kiểm chứng nguồn tài liệu, minh bạch dữ liệu huấn luyện và duy trì vai trò phản biện của con người sẽ là yếu tố then chốt để bảo vệ chất lượng của tri thức khoa học trong tương lai.

[GALLERY] Kymco People R 125 ra mắt Việt Nam, xe ga Đài Loan đắt hơn Honda SH

Vừa được chính thức ra mắt tại Việt Nam, Kymco People R 125 có giá đắt hơn đối thủ Honda SH 125i dù kém xe về nhận diện thương hiệu lẫn mạng lưới đại lý.

5-8834.jpg
Sau khi được hé lộ hồi đầu tháng, hãng xe máy Đài Loan Kymco đã chính thức ra mắt chiếc People R 125 2026 tại Việt Nam. Được định vị là mẫu xe tay ga bánh lớn cao cấp cho đô thị, People R 125 sẽ cạnh tranh với những cái tên quen thuộc Honda SH 125i và Piaggio Medley 125.
10-2077.jpg
Theo hãng xe Đài Loan, mẫu xe tay ga People Hybrid 2026 mới sở hữu những trang bị công nghệ tối tân. vừa tạo ra trải nghiệm vận hành tiện nghi đồng thời còn góp phần hoàn thiện vẻ đẹp tổng thể giúp người dùng thoải mái hơn khi sử dụng.

[GALLERY] Wuling Bingo Pro giá rẻ về Việt Nam sẽ được bán dưới mác Chevrolet

Nếu được thông qua, Wuling Bingo Pro sẽ là mẫu hatchback thuần điện giá rẻ của Chevrolet cho các thị trường toàn cầu, mở rộng danh mục xe điện của thương hiệu.

2-826.jpg
Theo GM Authority dẫn lời các nguồn tin am hiểu vấn đề, General Motors (GM) đang có kế hoạch cấp phép cho mẫu Wuling Bingo Pro thông qua liên doanh SAIC-GM-Wuling, sau đó đổi tên và phân phối dưới thương hiệu Chevrolet tại nhiều thị trường quốc tế.
3-2607.jpg
Nếu được thông qua, mẫu ôtô này sẽ trở thành xe hatchback thuần điện giá rẻ mới của Chevrolet dành cho các thị trường toàn cầu, đồng thời mở rộng danh mục xe điện của thương hiệu. Theo báo cáo, mẫu xe dự kiến sẽ được phân phối tại Brazil, Mexico và nhiều thị trường mới nổi khác ở khu vực Mỹ Latinh, châu Phi cũng như châu Á.

BYD Qin Plus DM-i bị điều tra vì cháy rụi tại Tứ Xuyên, Trung Quốc

Một vụ tai nạn liên hoàn tại Thành Đô, Trung Quốc đã khiến chiếc xe điện BYD Qin Plus DM-i cháy rụi, rất may tài xế và hành khách trên xe đã kịp thoát ra ngoài.

Một vụ tai nạn liên hoàn liên quan đến 3 phương tiện đã xảy ra trên tuyến đường Vành đai 3, thuộc quận Kim Nới, thành phố Thành Đô, tỉnh Tứ Xuyên (Trung Quốc). Sự việc khiến chiếc sedan hybrid cắm điện (PHEV) BYD Qin Plus DM-i bốc cháy hoàn toàn sau va chạm.

1-636.jpg
BYD Qin Plus DM-i bị điều tra vì cháy rụi tại Tứ Xuyên, Trung Quốc.

Đọc nhiều nhất

Tin mới

Trường Đại học Mỏ - Địa chất đào tạo kỹ sư AI tiên phong phát triển Bản sao số Trái đất

Trường Đại học Mỏ - Địa chất đào tạo kỹ sư AI tiên phong phát triển Bản sao số Trái đất

Đón đầu xu hướng AI và dữ liệu số đang trở thành nền tảng của chuyển đổi số toàn cầu, Trường Đại học Mỏ - Địa chất (HUMG) triển khai Chương trình Kỹ sư tài năng "Trí tuệ nhân tạo ứng dụng và Bản sao số Trái đất" nhằm đào tạo đội ngũ kỹ sư AI chất lượng cao, sẵn sàng tham gia giải quyết những bài toán lớn về tài nguyên, môi trường, đô thị thông minh và phát triển bền vững.