Trong 30 năm qua, mạng internet toàn cầu vận hành dựa trên một "khế ước xã hội". Đó là các website cho phép công cụ tìm kiếm như Google, Bing,... truy cập nội dung miễn phí. Đổi lại, các công cụ khi sử dụng nội dung phải ghi nhận nguồn bằng cách dẫn liên kết về website gốc.
Nhưng với sự phát triển như vũ bão của AI trong thời gian gần đây, "khế ước xã hội" này đã bắt đầu đổ vỡ.
Thỏa thuận đôi bên cùng có lợi bị phá vỡ
Các công cụ AI không dẫn người dùng đến các website sau khi thu thập dữ liệu như cách làm trước đây mà dùng nội dung từ các website để huấn luyện mô hình và tạo ra câu trả lời.
Dù hiển thị trong câu trả lời của ChatGPT dành cho người dùng, hay trong AI Overview (thông tin tổng quan do AI tạo) trên trang kết quả tìm kiếm của Google cung cấp, các liên kết đến nguồn tham khảo chỉ là một phần bổ sung chứ không phải yếu tố chính của câu trả lời như trước đây.
AI Overview hiển thị ngay ở phần đầu trang kết quả tìm kiếm của Google và cung cấp các liên kết đến nguồn tham khảo. Ảnh: Mỹ Hạnh
Một báo cáo theo dõi hoạt động duyệt web của khoảng 900 người trưởng thành tại Mỹ của Pew Reseach Center cho thấy, người dùng Google khi bắt gặp một bản tóm tắt do AI tạo ra có xu hướng ít nhấp vào các liên kết dẫn đến website khác hơn so với những người không nhìn thấy bản tóm tắt đó. Đồng thời, người dùng cũng hiếm khi nhấp vào các liên kết nằm ngay trong câu trả lời của AI.
Nghiên cứu của các nhà khoa học tại Đại học Washington về Wikipedia chỉ ra rằng, lượng truy cập vào phiên bản tiếng Anh của Wikipedia giảm nhanh sau khi Google ra mắt tính năng AI Overview bằng tiếng Anh. Vấn đề tương tự cũng xuất hiện ở các ngôn ngữ khác khi tính năng AI Overview lần lượt được áp dụng.
Khi website mất lượng truy cập và doanh thu, nhiều website sẽ chặn các công cụ thu thập dữ liệu bằng AI, đồng nghĩa với việc kết quả do AI tạo ra cũng phụ thuộc nhiều hơn vào những website chất lượng thấp (trong đó có không ít trang cũng được tạo ra bởi AI). Cuối cùng, nguồn thông tin đáng tin cậy sẽ ngày càng khó kiếm.
Trong những ngày đầu của World Wide Web, các công cụ tìm kiếm và nhà sáng tạo nội dung đã hình thành một thỏa thuận về việc thu thập dữ liệu, hay còn gọi là crawling - quá trình kiểm tra một website bằng công nghệ để lập chỉ mục nội dung, từ đó đưa các trang này vào kết quả tìm kiếm.
Theo thỏa thuận, người tạo nội dung sẽ cung cấp quyền truy cập miễn phí vào các website của họ, thậm chí còn cho phép các công cụ tìm kiếm sao chép những đoạn văn bản ngắn.
Đổi lại, công cụ tìm kiếm cung cấp các liên kết đến website của nhà sáng tạo nội dung, qua đó mang lại lượng truy cập cho họ. Dù mỗi lượt truy cập website làm phát sinh những chi phí (về băng thông, máy chủ và hạ tầng) nhất định cho chủ website, các chủ website vẫn có doanh thu từ quảng cáo hoặc từ lưu lượng truy cập của người dùng. Do đó, đây vẫn là mối quan hệ đôi bên cùng có lợi.
Ngày nay, các trình thu thập dữ liệu AI có xu hướng thu thập nội dung sâu hơn và với cường độ cao hơn so với các trình thu thập dữ liệu web trước đây, khiến những chi phí về băng thông, máy chủ và hạ tầng tăng cao, song có thể không mang lại lưu lượng truy cập thực, khiến các nhà sáng tạo nội dung bị loại khỏi vòng tuần hoàn kinh tế.
Chủ website có thể sử dụng tệp robots.txt để yêu cầu các trình thu thập dữ liệu AI không truy cập trang của mình, nhưng một số công ty AI vẫn có thể phớt lờ yêu cầu lịch sự ấy.
Còn nếu các công ty AI tuân thủ yêu cầu không truy cập thì lại nảy sinh một vấn đề đau đầu khác. "Trên thực tế, các website chứa thông tin sai lệch ít khi chặn trình thu thập dữ liệu AI so với các website chất lượng cao, vì vậy câu trả lời do AI tạo ra sẽ dễ phụ thuộc vào các nguồn thông tin chất lượng kém", TS Dana McKay và TS Damiano Spina (Đại học RMIT, Úc) viết trên The Conversation.
Ngày 'Google Zero' đang đến gần
Cloudflare - công ty cung cấp dịch vụ và hạ tầng web đang quản lý hơn 30% trong số 10.000 website hàng đầu trên Internet - ước tính rằng hơn một nửa trong tổng lưu lượng truy cập web hiện nay đã đến từ các bot AI. Một phần trong số này có thể là các AI agents (tác tử AI) do con người trực tiếp giám sát, nhưng phần lớn vẫn là các trình thu thập dữ liệu tự động.
Với tình hình đó thì "Google Zero" - ngày mà lượng truy cập trực tiếp từ Google đến các website giảm xuống bằng 0 - sẽ chỉ còn là vấn đề thời điểm.
Hơn một nửa trong tổng lưu lượng truy cập web hiện nay đến từ các bot AI. Ảnh minh họa: Đan Miu
"Việc không bao giờ phải nhấp vào một website để tìm câu trả lời nghe có vẻ thuận tiện đối với người tìm kiếm thông tin, nhưng thực tế thì phức tạp hơn nhiều", TS Dana McKay và TS Damiano Spina bày tỏ quan điểm.
Hiện nay, nhiều website đã chặn hoàn toàn các trình thu thập dữ liệu AI. Từ ngày 15/9, các website sử dụng dịch vụ của Cloudflare sẽ mặc định chặn trình thu thập dữ liệu AI trên những trang có quảng cáo (và do đó tạo ra doanh thu cho các nhà sáng tạo nội dung).
Điều này đồng nghĩa với việc có tới 30% các website hàng đầu thế giới có thể sẽ không còn xuất hiện trong các bản tóm tắt của Google AI Overview. Đồng thời, phần lớn dữ liệu mà AI được huấn luyện cũng có khả năng chính là 'dữ liệu cận huyết' do AI tạo ra trước đó.
TS Dana McKay và TS Damiano Spina nhận định cách làm này "tạo ra một vòng xoáy bất lợi đối với chủ website, công chúng và thậm chí cả các công ty AI".
Một nghiên cứu gần đây cho thấy khoảng 1/6 nguồn được các công cụ tìm kiếm AI sử dụng hiện nay là những website do AI tạo ra. Và khi các mô hình AI ngày càng được huấn luyện dựa trên nội dung do AI sản xuất thì chất lượng đầu ra của chúng cũng có thể suy giảm - một hiện tượng được gọi là "sụp đổ mô hình" (model collapse).
Những chủ website lựa chọn chặn trình thu thập dữ liệu AI ít có khả năng được dẫn liên kết trong các câu trả lời của AI Overview, ngay cả khi công cụ AI vẫn có thể truy cập nội dung để làm cơ sở cho câu trả lời (thông qua kỹ thuật retrieval-augmented generation - tạm gọi là tạo nội dung tăng cường bằng cách truy xuất).
Đã có đề xuất mô hình "trả tiền để thu thập dữ liệu" (pay to crawl) nhằm bù đắp cho các nhà sáng tạo nội dung, tuy nhiên những đề xuất này chưa được phổ biến rộng rãi.
TS Dana McKay và TS Damiano Spina dự báo, trong bối cảnh các mô hình kinh tế mới của website đang dần được định hình, thì chất lượng của các bản tóm tắt do AI tạo ra nhiều khả năng sẽ suy giảm, ít nhất là trong ngắn hạn.
"Lúc này, công cụ tìm kiếm ít phụ thuộc vào AI có thể trở nên đáng tin cậy hơn", TS Dana McKay và TS Damiano Spina cho biết.
Dù điều thách thức là làm thế nào để tìm ra một công cụ không sử dụng trình thu thập dữ liệu dựa trên AI, theo TS Dana McKay và TS Damiano Spina, vẫn có một số công cụ như vậy tồn tại. Chẳng hạn, Mojeek và Brave là những công cụ tìm kiếm độc lập, sử dụng trình thu thập dữ liệu và chỉ mục web riêng thay vì phụ thuộc vào các công ty công nghệ lớn như Google hay Bing. Ngoài ra, còn có một số công cụ khác dành riêng cho nội dung từ các "nhà sản xuất nhỏ", như các blog.
Song, từ góc nhìn của hai nhà nghiên cứu, "trong thời điểm hiện tại, bất kể bạn đang sử dụng công cụ tìm kiếm nào, tốt nhất là nên nhấp vào một vài kết quả tìm kiếm thực sự. Cách làm này sẽ giúp các nhà sáng tạo nội dung duy trì được lượng truy cập website, đồng thời giúp bạn tìm thấy những thông tin chính xác hơn", TS Dana McKay và TS Damiano Spina đưa ra lời khuyên.
Kim Dung tổng hợp
---
Tài liệu tham khảo:
AI is eating website traffic, websites are blocking AI – and reliable information is getting harder to find. The Conversation. https://theconversation.com/ai-is-eating-website-traffic-websites-are-blocking-ai-and-reliable-information-is-getting-harder-to-find-289817
Google users are less likely to click on links when an AI summary appears in the results. Pew Research Center. https://www.pewresearch.org/short-reads/2025/07/22/google-users-are-less-likely-to-click-on-links-when-an-ai-summary-appears-in-the-results/
Synthetic Sources?: Auditing Generative Search Engine Citations for Evidence of AI-Generated Sources. https://arxiv.org/abs/2605.23684