Ngày càng có nhiều nhà nghiên cứu sử dụng AI cho công việc phản biện. Thiết kế: Ngô Hà
Trong 5 năm gần đây, số lượng công bố khoa học đã tăng gấp đôi, lên hơn 8 triệu bài vào năm 2025 [1]. Nguyên nhân một phần do thời gian viết bản thảo giờ đây được rút ngắn đáng kể nhờ sự hỗ trợ của các mô hình ngôn ngữ lớn (LLM). Thực tế này khiến tình trạng thiếu người phản biện bản thảo học thuật càng trầm trọng.
Một số người tin rằng có thể dùng AI để giảm bớt gánh nặng của công việc phản biện. Chẳng hạn, dùng AI để soạn các nhận xét, và trong một số trường hợp, để đánh giá phương pháp nghiên cứu và thống kê [2].
Tuy nhiên, nhiều tạp chí học thuật vẫn cấm sử dụng AI để bình duyệt bởi nghi ngờ khả năng của AI trong việc đánh giá tính mới hay ý nghĩa của nghiên cứu. Đó là chưa tính đến những rủi ro như thiên kiến của AI hay tác giả của bản thảo dùng mẹo để "qua mặt" AI.
Mặt khác, ngày càng có nhiều dự án và chương trình được triển khai để kiểm tra khả năng phản biện khoa học của AI.
Nơi AI bổ khuyết cho hạn chế của con người
Xét về điểm mạnh, một trong những lĩnh vực then chốt mà các mô hình LLM có thể phát huy tối đa sức mạnh là thực hiện những công việc kiểm tra mang tính kỹ thuật hơn là đòi hỏi khả năng phán đoán khoa học, như kiểm tra đạo văn.
Gần đây, các nhà nghiên cứu đã sử dụng GPT-5 của OpenAI để đánh giá 2.500 bài báo được chọn ngẫu nhiên tại hai hội nghị lớn về AI - là ICLR và NeurIPS - và trên tạp chí TMLR trong giai đoạn 2018-2025 [3]. Kết quả, họ nhận thấy, AI có thể làm tốt việc đánh giá dựa trên những tiêu chí rất cụ thể và hẹp, chẳng hạn phép tính có chính xác không, phần chữ/văn bản có khớp với các dữ liệu được trình bày trong bảng biểu không. James Zou, đồng tác giả nghiên cứu tại Đại học Stanford, nói: "Người bình duyệt không đủ thời gian để lần từng dòng trong bài báo. AI có thể bổ trợ cho họ".
Khi AI tạo sinh đẩy nhanh số lượng công bố khoa học, các biên tập viên và chuyên gia phản biện phải chạy đua để theo kịp khối lượng bình duyệt. Dữ liệu: Dimensions | Thiết kế: Ngô Hà
Một nghiên cứu khác do Seungone Kim, nghiên cứu sinh tiến sĩ tại Đại học Carnegie Mellon, cùng các cộng sự thực hiện đã so sánh chi tiết nhận xét của con người và AI đối với 82 bản thảo về sau được đăng trên các tạp chí thuộc hệ thống của Nature [4].
Cụ thể, các nhà nghiên cứu yêu cầu ba mô hình LLM phổ biến hiện nay là GPT, Claude và Gemini thực hiện phản biện theo các yêu cầu định sẵn đối với các bản thảo. Sau đó, họ đề nghị 45 nhà khoa học chấm điểm 3.000 nhận xét trong các phản biện của AI theo ba tiêu chí: tính chính xác, mức độ dựa trên bằng chứng và ý nghĩa đối với việc cải thiện bài báo. Các nhà khoa học cũng được đề nghị chấm điểm các phản biện do con người viết cho từng bài báo.
Nhìn chung, nghiên cứu chỉ ra, AI phản biện kỹ lưỡng hơn con người ở những nhiệm vụ mang tính thường quy nhưng tốn thời gian, như tự chạy mã nguồn do tác giả cung cấp kèm theo bản thảo để kiểm tra xem kết quả mà mã tạo ra có phù hợp với các kết luận của bài báo hay không.
Xét trên toàn bộ các bài báo, GPT đạt điểm cao hơn người phản biện được đánh giá cao nhất. Đồng thời, cả ba mô hình LLM đều vượt qua người phản biện có điểm thấp nhất. Nhóm nghiên cứu nhận thấy có khoảng 1/4 số nhận xét, góp ý của AI không được bất kỳ người phản biện nào phát hiện, và những nhận xét này đều có giá trị.
Đáng chú ý, năm nay, ba hội nghị khoa học máy tính - STOC, ICML và NeurIPS - mời các tác giả sử dụng Công cụ Hỗ trợ Bài báo (Paper Assistant Tool) dựa trên Gemini để kiểm tra phương pháp nghiên cứu, các phép tính và các chứng minh. Theo các nhà nghiên cứu của Google, trong số 1.068 tác giả sử dụng công cụ này để chuẩn bị bài cho hội nghị NeurIPS, 86% cho biết họ thấy công cụ rất hữu ích hoặc khá hữu ích.
Vì sao AI chưa thể thay thế người phản biện
Dù cho thấy AI có những ưu điểm không thể phủ nhận trong phản biện, nghiên cứu của Seungone Kim đồng thời chỉ ra không ít hạn chế [4]. Chẳng hạn, các LLM đạt điểm thấp hơn người phản biện về độ chính xác trong đánh giá. Kết quả này liên quan đến một hạn chế đã biết của LLM: khả năng ghi nhớ trong quá trình xử lý có giới hạn, khiến chúng có thể bỏ sót những chi tiết quan trọng, đặc biệt khi thông tin nằm rải rác ở nhiều phần của bài báo và tài liệu bổ sung.
Các mô hình LLM cũng có chưa nắm bắt tốt những quy ước riêng của từng chuyên ngành. Chẳng hạn, một AI nhận xét một bài nghiên cứu vật lý hạt không cung cấp đủ chi tiết về cách phân tích dữ liệu để có thể tái lập kết quả. Tuy nhiên, trong vật lý hạt, những thông tin này thường được lưu trữ tập trung tại CERN và không nhất thiết phải đưa hết vào bài báo - một quy ước mà AI không hiểu.
Tóm lại, Seungone Kim và các cộng sự cho rằng: "AI có thể bổ trợ nhưng không nên dùng AI thay thế người phản biện. [...] AI và con người có xu hướng cùng xác định những phần nào của bài báo cần được xem xét, nhưng lại khác nhau trong cách diễn giải các phát hiện. Điều đó có nghĩa là một hội đồng phản biện AI không thể được xem là sự thay thế tương đương cho hội đồng phản biện con người."
AI cũng có thể yêu cầu những bổ sung không cần thiết. Ruth Ley, nhà vi sinh học tại Viện Sinh học Max Planck, kể, khi đưa bản thảo của mình qua q.e.d. Science, công cụ này đề xuất nhóm của cô thực hiện thêm các nghiên cứu tốn thời gian, dù những kết quả đó không cần thiết để chứng minh luận điểm chính của bài báo.
Một số nhà khoa học lại cho rằng các bản phản biện do AI tạo ra thường dài dòng, quá chú trọng những lỗi vặt vãnh, trong khi lại bỏ qua các vấn đề quan trọng nhất. Yoshitomo Matsubara, nhà nghiên cứu tại Yahoo, mô tả một phản biện của AI trong chương trình thử nghiệm dùng AI đánh giá bản thảo gửi đến hội nghị thường niên năm nay của Hiệp hội AAAI: phản biện của AI gồm 34 gạch đầu dòng với tổng cộng 14.000 ký tự. Trong khi đó, phản biện của ông về cùng bài báo chỉ dài khoảng 4.000 ký tự. Matsubara nhận xét: "Phản biện của AI quá dài dòng, các ý không ăn nhập với nhau."
Các mô hình AI cũng có thể phản ánh những thiên kiến đã ăn sâu trong kho dữ liệu khổng lồ mà chúng được huấn luyện, chẳng hạn xu hướng ưu ái nghiên cứu của các tác giả đến từ những cơ sở danh tiếng. Trong nghiên cứu của Đại học bang Arizona[5], mô hình LLM được yêu cầu đánh giá nhiều phiên bản của các bài báo đã đăng trên PNAS. Các phiên bản này giống hệt nhau về nội dung, chỉ thay đổi tên và cơ quan công tác của tác giả đứng đầu. Kết quả, mô hình có xu hướng đề xuất từ chối những bài báo của tác giả thuộc các cơ sở ít danh tiếng hơn.
Ngoài ra, AI gặp khó khăn khi đánh giá các kết quả thuộc những lĩnh vực mới hoặc chuyên ngành quá hẹp, nơi có ít nghiên cứu trước đó để dựa vào khi đưa ra nhận xét. Để phù hợp với xu hướng "chiều lòng" người dùng, AI thường chấm điểm bản thảo cao hơn mức trung bình mà người phản biện chấm. Nghiên cứu của Joachim Baumann, ĐH Stanford, còn cho thấy có thể "đánh lừa" AI để bài báo nhận điểm cao hơn: nếu tác giả chủ động yêu cầu một LLM viết lại bài báo theo hướng tối ưu cho đánh giá của AI, bài báo có thể được chấm điểm cao hơn. Ông gọi thủ thuật này là "paper laundering", tức là "rửa bài báo".
Cuối cùng, sử dụng AI chưa chắc giúp người phản biện tiết kiệm thời gian. Một nhóm nghiên cứu của University College London (UCL) yêu cầu 24 nhà khoa học phản biện hai bài báo đã được xuất bản có nội dung tương tự nhau; họ chỉ được phép sử dụng AI hỗ trợ phản biện một trong hai bài. Kết quả, khi dùng AI, các nhà khoa học mất ít thời gian hơn cho những việc như tìm đọc và đối chiếu với các nghiên cứu liên quan đến bài báo đang được phản biện. Bù lại, họ mất không ít thời gian để kiểm tra xem các gợi ý của AI có chính xác không. Thời gian tiết kiệm được tính ra chỉ vài phút cho mỗi giờ phản biện và mức chênh lệch này không có ý nghĩa thống kê. [6]
Chuẩn mực đang dần thay đổi
Bất chấp những bất cập cũng như việc thiếu các tiêu chuẩn rõ ràng, việc thử nghiệm dùng AI để hỗ trợ phản biện vẫn diễn ra trên thực tế.
bioRxiv, một nền tảng lưu trữ bản thảo lớn trong lĩnh vực khoa học sự sống, đã bắt đầu cho phép các tác giả đưa bản thảo qua các công cụ AI để tự động kiểm tra những vấn đề kỹ thuật của nghiên cứu. Các bản nhận xét được giữ bí mật và chỉ tác giả có thể xem, từ đó họ có thể quyết định chỉnh sửa bản thảo trước khi công bố hay không.
Hiệp hội AAAI thì sử dụng phối hợp nhiều mô hình LLM để hỗ trợ xử lý 30.000 bản thảo, cao gấp đôi năm trước, gửi tới hội nghị năm nay của mình. Dĩ nhiên, bản thảo có được chấp nhận hay không vẫn do con người quyết định.
NEJM AI, một ấn phẩm của The New England Journal of Medicine tập trung vào việc ứng dụng AI trong y học, cũng bắt đầu thử nghiệm một quy trình "nhanh": ra quyết định chấp nhận hoặc từ chối bài báo trong vòng 7 ngày, dựa trên sự kết hợp giữa phân tích của AI và đánh giá của các biên tập viên. Quy trình này chỉ được áp dụng với những bài mà biên tập viên cho rằng có khả năng cao được chấp nhận nếu đi theo quy trình thông thường. Thay vì gửi bài cho các phản biện bên ngoài, một biên tập viên sẽ tự mình đọc và đánh giá toàn bộ bài mà không sử dụng AI. Sau đó, các biên tập viên khác sẽ thảo luận, cân nhắc cả đánh giá của con người và AI, trước khi quyết định có xuất bản bài hay không.
Arjun Manrai, Phó tổng biên tập NEJM AI, nhận xét: "AI gần như chắc chắn sẽ đóng vai trò lớn hơn [trong quy trình phản biện của NEJM AI] trong tương lai. Cách đây không lâu, thật khó tưởng tượng một trong những tạp chí hàng đầu về AI trong y học lại sử dụng AI ngay trong quy trình phản biện. Tôi nghĩ các chuẩn mực đang dần thay đổi."
Phong Du tổng hợp
Tài liệu tham khảo:
[1] Jeffrey Brainard, Can AI help solve the peer-review crisis? Here are its promises and pitfalls. (2026). Science. https://doi.org/10.1126/science.z6vx92p
[2] Most peer reviewers now use AI, and publishing policy must keep pace. (2025). Frontiers, https://www.frontiersin.org/news/2025/12/15/most-peer-reviewers-now-use-ai-and-publishing-policy-must-keep-pace
[3] Bianchi, F., Kwon, Y., Izzo, Z., Zhang, L., & Zou, J. (2025). To err is human: Systematic quantification of errors in published AI papers via LLM analysis. arXiv. https://arxiv.org/abs/2512.05925
[4] Kim, S., Yoon, et al (2026). On the limits and opportunities of AI reviewers: Reviewing the reviews of Nature-family papers with 45 expert scientists. arXiv. https://arxiv.org/abs/2605.20668v1
[5] Howell, A., Wang, J., Du, L., Melkers, J., & Shah, V. (2025). Prestige over merit: An adapted audit of LLM bias in peer review. arXiv. https://arxiv.org/abs/2509.15122
[6] Chen, S., Brumby, D., Cox, A, (2025). Envisioning the Future of Peer Review: Investigating LLM-Assisted Reviewing Using ChatGPT as a Case Study. In Proceedings of the 4th Annual Symposium on Human-Computer Interaction for Work (CHIWORK '25). Association for Computing Machinery, New York, NY, USA, Article 8, 1–18. https://doi.org/10.1145/3729176.3729196