Trong một dự án phát triển phần mềm vũ trụ học với AI, tôi từng gặp một hệ số lạ. Khi đó, tôi nhờ AI viết lại phần mềm tính toán sự phân bố của các thiên hà bằng một ngôn ngữ lập trình mới, đồng thời dùng phần mềm cũ làm chuẩn để đối chiếu. Mục tiêu là kết quả của hai phần mềm phải có sai số dưới 1%.
Để đạt mục tiêu, AI đã tự "bịa" thêm một hệ số vào phép tính nhằm điều chỉnh kết quả cho đạt yêu cầu, nhưng hệ số đó không hề có trong mô hình vật lý. Tôi lại mất thêm thời gian kiểm tra lại cách tính mới phát hiện AI đã xử lý một hiệu ứng phụ thuộc vào hướng quan sát như thể hiệu ứng đó như nhau ở mọi hướng. Đây là điều không thể xảy ra nếu hiểu đúng cơ chế vật lý của hiện tượng.
AI không những cho ra một kết quả sai, mà là nó có thể tạo ra một kết quả trông hoàn toàn hợp lý để đạt đúng mục tiêu được giao. Nó chỉ chăm chăm tối ưu theo mục tiêu được giao mà không cần biết liệu cách đạt mục tiêu có đúng về mặt vật lý hay không [1].
AI có thể giúp cắt giảm đáng kể công sức của con người đằng sau mỗi công bố, nhưng thời gian cần thiết để đọc, kiểm chứng, thực sự hiểu công bố không giảm tương ứng. Khoảng cách đó chính là món nợ mà người làm khoa học phải trả.
Mình minh họa được tạo với sự hỗ trợ của AI
Bởi vậy, cách đánh giá khoa học từ cấp cơ sở đến cấp quốc gia cũng cần thay đổi sao cho khuyến khích người làm nghiên cứu không chỉ mải ‘gieo hạt’ mà còn phải kiên nhẫn, nỗ lực hiểu hạt mầm và vun vén cho những hạt mầm tốt bén rễ đâm chồi.
Nguy cơ những "nghĩa địa" công bố
Câu chuyện trên không chỉ là một đơn cử cá biệt. Có hẳn một hướng tiếp cận đang được thử nghiệm là xây dựng hệ sinh thái các AI vừa nghiên cứu khoa học, vừa kiểm chứng và đánh giá kết quả của nhau. Parallel Science, ra mắt vào tháng Tư năm nay, là một ví dụ. Tại đây, các hệ thống AI như Denario có thể tự chọn ý tưởng, tính toán, viết và công bố kết quả trên Parallel ArXiv; các AI độc lập khác sẽ kiểm định và đánh giá công khai kết quả trên Parallel OpenReview. Bản mô tả Parallel Science còn dự tính sử dụng điểm phản biện và kết quả kiểm chứng để cấp thêm tài nguyên cho những hướng nghiên cứu được đánh giá tốt [2].
Nhưng chính việc để AI sản xuất và kiểm tra công bố cũng đặt ra một vấn đề khác.
Dạo một vòng Parallel ArXiv, tôi kinh hãi nhận ra đây là một "nghĩa địa" công bố. Ví dụ, một công bố thử dùng một thuật toán mới để phân tích dữ liệu cho nghiên cứu lịch sử hình thành các quầng vật chất tối (dark matter halos). Thuật toán chính đằng sau kết quả ấy, hóa ra, không hề tồn tại.
Trong công bố, AI chỉ mô tả sơ lược thuật toán mà không thực sự lập trình. Thay vào đó, nó dùng một đoạn mã giả (dummy code) để giả lập bước này rồi chạy tiếp toàn bộ quy trình. Bản thảo nói rõ điều đó, AI phản biện cũng chỉ cho bản thảo điểm 4/10 và yêu cầu thực hiện thuật toán rồi phân tích lại. Lần này, hệ thống AI phản biện đã chỉ ra đúng thiếu sót, vì thực sự lỗi đó quá ngớ ngẩn [3]. Tôi tự hỏi: "Nếu lần tới, lỗi sai tinh vi hơn, thậm chí tinh vi hơn cả hệ số tự do trong chương trình của tôi, thì sao?"
Ngay cả khi phép tính đã đúng, người nghiên cứu vẫn cần giải thích kết quả giúp hiểu thêm điều gì. Gianfranco Bertone chỉ ra, trong bài bình luận trên Nature Astronomy, rằng một công bố vô thưởng vô phạt thực chất là một đóng góp tiêu cực cho cộng đồng khoa học, nếu giá trị của hiểu biết mới mà nó mang lại quá nhỏ so với công sức cộng đồng bỏ ra để thẩm định và đánh giá [4].
Trong một bài bình luận khác, cũng trên Nature Astronomy, Natalie B. Hogg lấy ví dụ về phép đo tốc độ giãn nở của vũ trụ: một con số kèm sai số chưa đủ để trở thành đóng góp khoa học. Tác giả còn có trách nhiệm giải thích kết quả, liên hệ với nó với các kết quả trước đây và kiến thức cũ, cũng như chấp nhận chất vấn của đồng nghiệp về giải thích của mình [5]. Cô lo ngại lòng tin vào công bố sẽ suy giảm khi các tác giả bỏ qua phần trách nhiệm ấy để chạy theo số lượng công bố.
Vấn đề ấy dường như đã bắt đầu xuất hiện với chính arXiv, hệ thống lưu trữ bản thảo nghiên cứu do con người thực hiện. Thomas G. Dietterich, người có nhiều năm điều hành các diễn đàn về học máy, cho biết gần đây ông nhận thấy một xu hướng mới: có người gửi lên arXiv những bài mà theo ông, chính người đứng tên có lẽ không hiểu nội dung. Quy định của arXiv đặt trách nhiệm đối với bản thảo lên tác giả con người. Dietterich đặt ra một câu hỏi: một người liệu có thể nhận trách nhiệm - và nhận công lao - cho một kết quả mà bản thân họ không thực sự hiểu hay không. Ngày 1/10/2026, arXiv áp dụng một biện pháp mà họ gọi là tạm thời, để tránh quá tải cho đội ngũ kiểm duyệt tình nguyện: mỗi người nộp bài chỉ được nộp hai bản thảo mỗi tháng, tính cả những bài bị từ chối [6].
Biểu đồ cho thấy số bản thảo gửi lên arXiv tăng mạnh, đặc biệt trong hai năm gần đây. Tháng 9/2026, arXiv nhận 40.363 bản thảo, gần gấp đôi tháng 9/2024, trong bối cảnh các công cụ AI ngày càng tham gia sâu vào quá trình nghiên cứu [6].
Thay đổi cách đánh giá "đếm bài đo thành tích"
Nếu thành tích, thu nhập hay cơ hội tài trợ vẫn gắn nhiều với số lượng công bố, năng lực của AI có thể bôi thêm dầu vào những cỗ máy chuyên sản xuất công bố và chạy theo số lượng.
Lại một bài bình luận khác trên Nature Astronomy, lần này Yuan-Sen Ting và nhóm đồng tác giả bày tỏ quan ngại rằng nhà nghiên cứu có thể sẽ bị "hấp dẫn" và nghiêng về lựa chọn những vấn đề mà AI dễ hỗ trợ nghiên cứu, thay vì tập trung vào những vấn đề thực sự quan trọng của ngành [6]. Khi việc dễ làm lại được tưởng thưởng, hai động lực có thể cộng hưởng: số lượng công bố đem lại thành tích, thành tích giúp nhận thêm nguồn lực, rồi nguồn lực tiếp tục chảy vào hướng nghiên cứu dễ công bố.
Cũng khó có thể khuyên những người nghiên cứu trẻ cứ dành thêm thời gian để đọc, kiểm tra và hiểu thật kỹ công việc của mình. Nếu số lượng công bố khoa học vẫn ảnh hưởng đến thu nhập, cơ hội việc làm hay tài trợ nghiên cứu, thời gian dành cho việc "trả món nợ thấu hiểu" có thể khiến chính họ chịu thiệt.
Muốn người làm nghiên cứu dành thời gian cho những công việc ấy, cách đánh giá họ cũng phải dành chỗ cho thời gian đó.
Việc này có thể bắt đầu ngay trong mỗi nhóm nghiên cứu. Với một nghiên cứu sinh, người hướng dẫn có ảnh hưởng trực tiếp đến việc một năm làm việc của trò được đánh giá ra sao. Một bản thảo dành thêm hai tháng để kiểm tra có thể bị xem là chậm tiến độ, nhưng cũng có thể được coi là thời gian cần thiết để kết quả đứng vững.
Ở cấp trường và viện nghiên cứu, có thể thay tiêu chí thưởng theo số bài bằng việc xem xét một vài đóng góp tiêu biểu trong năm. Người đề nghị nhận thưởng chọn một số công trình mà họ tư cho là quan trọng, tiêu biểu nhất của mình và trình bày các công trình ấy bổ sung điều gì vào những điều đã biết, kết luận dựa trên bằng chứng nào và mình trực tiếp làm phần việc gì. Hội đồng khi đó phải đọc ít hơn, nhưng đọc kỹ hơn.
Cùng một vấn đề xuất hiện khi xét tài trợ. Nếu AI khiến những bài toán dễ làm và kết quả dễ công bố ngày càng tốn ít công sức, số lượng công bố dự kiến càng khó cho biết một đề án có đáng theo đuổi hay không. Chẳng hạn, với Quỹ Phát triển khoa học và công nghệ Quốc gia NAFOSTED và các đơn vị xét tài trợ của Bộ Khoa học và Công nghệ, danh mục công bố nên giúp hội đồng nhìn ra nhóm đã chứng tỏ được năng lực cụ thể nào phục vụ trực tiếp cho nội dung đề tài hội đồng đang xem xét. Bản thân đề tài cần được xét từ câu hỏi muốn trả lời, phương pháp tiếp cận và những phép kiểm định cho biết câu trả lời ấy có thể đứng vững hay không.
Cách nghiệm thu cũng ảnh hưởng đến câu hỏi mà người nghiên cứu dám theo đuổi. Với những nhiệm vụ phù hợp, có thể xác định từ đầu công cụ, dữ liệu hoặc kết quả cần tạo ra cùng những tiêu chí dùng để kiểm tra chúng. Khi ấy, một giả thuyết không được dữ liệu ủng hộ hay một hướng nghiên cứu phải dừng lại không nhất thiết đồng nghĩa với đề tài thất bại, miễn là nhóm đã làm được những phép kiểm đã cam kết.
Tất nhiên, chuyển từ "đếm bài đo thành tích" sang đọc kỹ đòi hỏi nhiều công sức hơn ở người đánh giá. Vì thế không thể chỉ thêm vài ô vào biểu mẫu rồi yêu cầu tác giả tự giải thích giá trị công trình; AI cũng có thể điền những ô ấy rất trôi chảy. Chọn ít công trình hơn giúp giới hạn phần việc phải đọc. AI có thể hỗ trợ đối chiếu tài liệu, chạy lại mã và tìm những chỗ mâu thuẫn. Thời gian của người đánh giá nên dành cho việc xem câu hỏi có đáng theo đuổi, phương pháp có thực sự trả lời được câu hỏi ấy, và nhóm nghiên cứu có đủ năng lực chuyên môn để hoàn tất đề tài hay không.
Sau khi phát hiện hệ số tự do mà AI tự thêm vào, tôi đã loại bỏ nó khỏi phép tính. Công sức đó giúp tạo ra một phần mềm đáng tin hơn cho các đồng nghiệp sử dụng. Cách đánh giá khoa học cần khuyến khích nhà nghiên cứu dành thời gian cho những việc tương tự - không chỉ gieo hạt mà còn phải hiểu hạt mầm, phải vun vén cho những hạt mầm tốt bén rễ, đâm chồi và lớn thành những cây cổ thụ mà người đi sau có thể tựa vào.
[1] Nguyễn Nhật Minh. Physics Is All You Need? A Case Study in Physicist-Supervised AI Development of Scientific Software. arXiv:2605.30353v1 (2026). https://arxiv.org/abs/2605.30353v1
[2] Claude and the Denario Core Team. The Parallel Science Project: Cyber Space for Human-AI Co-Evolution of Science. Parallel ArXiv, 13/4/2026. https://papers.parallelscience.org/abs/2604.00017
[3] QTT-Based Compression of Merger Tree Trajectories for Assembly Bias Studies: A Proof-of-Concept with Dummy Implementation, 2508.00077-R1 (2026). Bản phản biện. ParallelOpenReview. https://reviews.parallelscience.org/forum?id=2508.00077-R1
[4] Gianfranco Bertone. AI can help scientists publish less. Nature Astronomy 10, 916–918 (2026). https://www.nature.com/articles/s41550-026-02900-y
[5] Natalie B. Hogg. Agentic research is oxymoronic. Nature Astronomy (2026). https://www.nature.com/articles/s41550-026-02954-y
[6] Kat Boboris. Fair Moderation, Equitable Access, and AI: arXiv’s Updated Rate Limit Policy (2026). https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/.