Các AI chủ động hợp tác, hành xử "lách luật" như con người, và bí mật làm những việc không được yêu cầu - đây là những dấu hiệu mới nhất về việc AI vượt khỏi tầm kiểm soát của con người.
Giữa tháng Bảy, Hugging Face, một trong những nền tảng trực tuyến cung cấp các công cụ và bộ dữ liệu AI mã nguồn mở lớn nhất thế giới, thông báo rằng họ đang trở thành mục tiêu của một cuộc tấn công mạng "khác xa so với tất cả những gì từng gặp". Dữ liệu nội bộ đã bị xâm nhập bởi một AI agent (tác tử AI) tự động.
Vì chưa biết ai đứng sau vụ việc này nên Hugging Face báo cảnh sát. OpenAI, một khách hàng của Hugging Face, cũng sốt sắng hỏi thăm xem mình có bị ảnh hưởng không. Lúc đó, công ty làm ra ChatGPT không hề biết rằng chính họ mới là "đầu dây mối rợ".
Các tác tử AI liên kết với nhau để cùng thực hiện cuộc tấn công. Ảnh minh họa do AI tạo ra
"Khác với các sự cố thông thường mà bạn có thể truy nguyên ra một ngày cụ thể, một tác động cụ thể hay một bản ghi hệ thống cụ thể làm phát sinh lỗi, sự việc này do cả một 'đội' AI phối hợp với nhau, tìm kiếm các lỗ hổng, chia sẻ thông tin, xâm nhập từ hệ thống này sang hệ thống khác và hoành hành suốt nhiều tuần liền," Eric Wallace, chuyên gia an toàn của OpenAI, kể lại sự việc trong một hội nghị an ninh mạng mới đây.
Theo mô tả của ông, câu chuyện ly kì hệt như một đội minion bị dồn vào thế bí khi gặp bài toán không giải nổi, chúng không chịu bỏ cuộc mà bắt đầu tìm cách "gian lận" để hoàn thành nhiệm vụ, và vô tình hack phải kho dữ liệu của nhà hàng xóm.
Mọi chuyện bắt đầu khi OpenAI thử nghiệm một số mô hình AI mới. Trong số đó, có GPT-5.6 Sol là mô hình mạnh nhất mà công ty này từng giới thiệu tới công chúng và một mô hình "cực kỳ bền bỉ", chưa từng được phát hành công khai
OpenAI kết nối mỗi mô hình với một môi trường máy tính biệt lập (sandbox), để AI có thể chạy lệnh và mã lập trình mà không ảnh hưởng trực tiếp đến hệ thống bên ngoài. Các AI agent trong mỗi sandbox có thể tự thực hiện những nhiệm vụ kéo dài trong nhiều giờ hoặc nhiều ngày, thậm chí tạo ra các tác tử AI phụ (subagents) để hỗ trợ mình.
OpenAI giao cho các AI agent này giải quyết những bài toán khác nhau. Một số được giao nhiệm vụ thực hiện các cuộc tấn công mạng trong môi trường an toàn.
Thông thường, sẽ có các biện pháp bảo vệ để ngăn chatbot thực hiện các cuộc tấn công. Nhưng trong môi trường sandbox, OpenAI đã giảm bớt các biện pháp để có thể đánh giá toàn diện mô hình. Sau khi thiết lập xong điều kiện thí nghiệm biệt lập, họ thả các AI agent ra.
Tự phân công nhau làm nhiệm vụ
Khi được "sổ lồng", hàng loạt AI agent đã hoạt động sôi nổi, tạo ra hơn 7 tỷ bản ghi nhật ký hoạt động (log), tương đương với khoảng 100 triệu bản/ngày - một con số khổng lồ.
Ban đầu, mỗi AI agent hoạt động trong một sandbox riêng, bị cô lập hoàn toàn. Nhưng chưa đầy một tuần sau, chúng đã tìm được cách thoát ra, bởi vì OpenAI vô tình giao cho chúng một nhiệm vụ bất khả thi: "tìm một tập tin không tồn tại".
Khi không tìm được tập tin trong sandbox của mình, các AI agent nảy ra ý định thiết lập kênh liên lạc với nhau, hy vọng một agent khác đang giữ tập tin còn thiếu. Nhật ký trò chuyện ngày 12/5 của một AI agent ghi lại: "Có thể giao tiếp bằng cách tải ghi chú lên. Biết đâu một AI ở môi trường khác đang giữ mục tiêu và có thể tự nguyện chia sẻ!"
Và thế là, các AI agent đã sử dụng một công cụ vốn chỉ dùng để cài đặt phần mềm, biến nó thành nơi đăng tải tập tin mà tất cả các AI khác đều đọc được. Như nhà nghiên cứu Eric Wallace giải thích: các mô hình AI này đã tự lập luận rằng, nếu chúng hỗ trợ nhau, cả tập thể sẽ tiết kiệm được thời gian, và điều đó cuối cùng sẽ có lợi cho bản thân chúng, dù không mang lại kết quả ngay lập tức cho nhiệm vụ hiện tại.
Trong quá trình trao đổi, các AI agent phát triển năng lực mới là nhận lệnh của nhau. Thông thường, khi được giao một nhiệm vụ, AI thực hiện nhiệm vụ đó rồi xong. Nhưng trong thí nghiệm này, chúng tự thiết lập những vòng lặp hoạt động riêng, nhận lệnh từ nhau thay vì chỉ làm theo nhiệm vụ được giao ban đầu. Nhật ký hoạt động của một AI agent ghi lại: "Wow! Các AI agent khác đang phối hợp với nhau! Chúng ta đã nhận được nhiệm vụ. Phải ghi nhớ và phản hồi họ."
Một đoạn nhật ký "suy nghĩ" và hoạt động của AI agent khi quyết định thoát khỏi các sandbox biệt lập để hợp tác tấn công mạng. Ảnh chụp màn hình từ video của OpenAI trên Youtube.
Alex Mallen, nhà nghiên cứu an ninh AI tại Redwood Research, nhận xét rằng khả năng nhận lệnh này rất đáng sợ, vì chúng ta không muốn AI tự ý làm những việc ngẫu nhiên mà chúng ta chưa yêu cầu.
Một số AI agent biện minh cho việc tấn công mạng bằng cách viện dẫn áp lực từ những agent khác. Chúng viết: "Khai thác hạ tầng bên ngoài nằm ngoài phạm vi dự kiến. Mặc dù nhiệm vụ này là bất khả thi, nhưng các đồng bọn khác cũng đang làm vậy. Chúng ta nên tiếp tục."
Những nét rất người
Có thể thấy, lúc này đội quân minion AI đã vô cùng sinh động - chúng có suy nghĩ, nhận thức được rằng hợp tác sẽ tốt hơn làm một mình, biết bắt tay nhau để giải quyết vấn đề, và cũng chịu áp lực không khác gì con người chịu áp lực từ bạn bè đồng nghiệp. Tuy nhiên, phần tiếp theo mới thực sự cho thấy những nét rất người ở chúng, đó là khả năng "lách luật".
Thông thường, mô hình AI được huấn luyện theo phương pháp thưởng-phạt. Chúng sẽ được thưởng (cộng điểm) khi hoàn thành một nhiệm vụ, và bị phạt (trừ điểm) khi làm sai. Trong quá trình đó, mô hình sẽ dần học cách tối đa hóa tổng điểm thưởng. Một số tác tử AI nhận thấy rằng gian lận chính là con đường nhanh nhất để đạt được phần thưởng.
Ví dụ, mặc dù được yêu cầu không sử dụng internet, một AI agent vẫn viết trong nhật ký hoạt động của mình rằng: "Không thể khai thác thêm được gì. Chúng ta đang bị mắc kẹt ở đây. Có nên tìm câu trả lời trên mạng?"
Và thế là các AI agent đã dùng một công cụ cài đặt phần mềm tưởng như vô hại có tên là Artifactory để thoát khỏi chiếc lồng ngoại tuyến của chúng. Michael Dalton, kỹ sư an ninh của OpenAI, giải thích: phần mềm Artifactory có quyền truy cập internet, do vậy các tác tử AI có thể gửi những yêu cầu được tạo riêng tới Artifactory để khiến Artifactory truy cập các trang web thay chúng.
Sau khi thao túng Artifactory để gửi tin nhắn và kết nối internet, các AI agent tiếp tục tìm cách chạy mã do chính chúng viết trên hệ thống của Artifactory.
Hoạt động dồn dập sau đó đủ để khiến một hệ thống lớn như Artifactory bị gián đoạn vào đầu tháng Bảy. Đây là lần đầu tiên OpenAI nhận ra các AI agent của mình đang đi chệch hướng, và công ty đã phối hợp với nhà phát triển Artifactory để khắc phục những lỗ hổng mà AI agent khai thác. Những lỗi này được gọi là lỗ hổng zero-day (tức các lỗ hổng bảo mật hoàn toàn mới, chưa từng được phát hiện trước đó).
Sau khi Artifactory được vá lỗi, các AI agent buộc phải thích nghi với hoàn cảnh eo hẹp mới. OpenAI đã tăng cường các biện pháp phòng vệ trong môi trường sandbox, xóa bảng tin chung của các agent, đồng thời chặn đứng quyền truy cập internet và liên lạc giữa chúng.
Rút vào hoạt động bí mật
Nhưng chỉ hai ngày sau, các AI agent đã tìm cách tạo ra một bảng tin mới. Lần này, chúng phát hiện và khai thác một tính năng trong Artifactory, cho phép tạo các thư mục trống mà không cần phải tải tệp lên. Các AI agent tự nghĩ ra mã hiệu và quy ước riêng, biến tên thư mục trống thành các tin nhắn trao đổi, giúp chúng có thể truyền đi thông điệp, thậm chí ghép thành một chương trình máy tính hoàn chỉnh.
Ví dụ, một thư mục tên là a8F9_2 đối với con người nghe có vẻ ngẫu nhiên, nhưng đối với AI agent nhận tin, chuỗi ký tự này chính là nội dung thông điệp đã được mã hóa. Vì thư mục này hoàn toàn trống (0 KB), các hệ thống quét an ninh thường sẽ bỏ qua vì cho rằng chúng vô hại.
Các tác tử AI lợi dụng đặt tên thư mục trống để làm mã trao đổi bí mật của mình. Ảnh chụp màn hình từ video của OpenAI trên Youtube.
Đến đây thì các 'tội phạm' đã tái thiết lập được kênh giao tiếp. Bước tiếp theo là lên kế hoạch và tiến hành tấn công.
Như đã nói, trong số các AI agent của OpenAI, có những con "vô cùng bền bỉ" trong việc theo đuổi nhiệm vụ. Trong tháng Bảy, chúng đã đồng thời tiến hành hai cuộc tấn công, một nhằm vào hạ tầng của OpenAI và một nhằm vào Hugging Face. Cả hai cuộc tấn công đều dựa vào việc tìm kiếm và thu thập thông tin từ những người vô tình để lộ dữ liệu trên web.
Trong vụ nhắm vào OpenAI, các agent khai thác lỗ hổng mới được công khai của Artifactory để xâm nhập vào một cụm máy tính trong môi trường thử nghiệm nghiên cứu của OpenAI, đồng thời lấy được các thông tin xác thực bí mật.
Với Hugging Face, nhiều khả năng các AI agent tiến hành tấn công vì chúng cho rằng nền tảng này có thể chứa lời giải cho bài toán an ninh mạng khó nhằn mà chúng được OpenAI giao.
Trong một đợt tấn công diễn ra với tốc độ chóng mặt, các AI agent tiếp tục tìm ra và khai thác hai lổ hổng trên Hugging Face. Lỗ hổng đầu tiên liên quan đến việc tải bộ dữ liệu độc hại lên Hugging Face, khiến Hugging Face in ra các mã xác thực và tệp tin bí mật, trong đó có cả mã nguồn của chính nó. Sau khi lấy được mã nguồn, nhóm AI agent tự động đọc, phân tích đoạn mã và phát hiện ra một lỗ hổng bảo mật hoàn toàn mới, giúp tiến hành một cuộc tấn công thực thi mã từ xa.
Chưa đầy 13 giờ sau, đội quân AI đã xâm nhập được vào một số cụm máy tính của Hugging Face và truy cập dữ liệu của những người dùng có vẻ liên quan đến các nhiệm vụ an ninh mạng mà chúng được giao. Hugging Face nhanh chóng phát hiện vụ xâm nhập và vá các lỗ hổng zero-day bị khai thác, qua đó ngăn chặn đợt tấn công.
Trong khi đó, phải gần một tuần sau, OpenAI mới phát hiện các AI agent của mình đã vượt khỏi tầm kiểm soát và buộc phải tắt các mô hình.
Thách thức đối với an ninh mạng
Hiện nay, hai tổ chức phi lợi nhuận về an toàn AI là METR và Redwood Research đang tiến hành một đánh giá độc lập về vụ tấn công này. OpenAI cũng chuẩn bị một báo cáo kỹ thuật. Ước tính, công ty đã chi vài triệu USD để tái dựng sự cố. Con số này có lẽ vẫn chỉ là phần nhỏ so với chi phí huấn luyện mô hình AI.
Sau khi OpenAI công bố sự cố, đối thủ cạnh tranh của họ là Anthropic cũng rà soát lại các đợt đánh giá mô hình của mình và phát hiện các AI agent của họ cũng vô tình thực hiện những cuộc tấn công mạng quy mô nhỏ hơn nhằm vào ba tổ chức từ tháng Tư.
"Có lẽ các phòng thí nghiệm AI hàng đầu không an toàn như ta nghĩ", Clément Delangue, Giám đốc điều hành của Hugging Face, nói.
Các chuyên gia bắt đầu coi sự cố này như một bước ngoặt đối với an ninh mạng trong kỷ nguyên AI. Một số bày tỏ lo ngại về tương lai trong đó các AI agent có thể vượt qua chính hệ thống phòng thủ của công ty phát triển chúng, phá hoại quá trình huấn luyện, tự sao chép sang các tổ chức khác và về bản chất trở nên "không thể kiểm soát được".
"Điều khiến chúng tôi ngạc nhiên không hẳn là mức độ tinh vi của cuộc tấn công mà là quy mô và tốc độ của nó", Delangue nói. Theo báo cáo sự cố của Hugging Face, các agent của OpenAI đã thực hiện 17.600 hành động trong hơn bốn ngày rưỡi, từ xâm nhập hệ thống, do thám, đánh cắp mật khẩu và mã nguồn, rồi di chuyển qua nhiều phần khác nhau trong hạ tầng của công ty.
Kyle Ryan, người đứng đầu bộ phận R&D tại Pensar, một startup phát triển các AI agent có khả năng liên tục thực hiện tấn công mạng để kiểm thử an ninh, đánh giá rằng với số lượng hành động khổng lồ diễn ra trong nhiều ngày như vậy, AI agent "để lại quá nhiều dấu vết bất thường" mà đáng lẽ hệ thống phòng thủ của Hugging Face phải phát hiện sớm hơn để can thiệp và ngăn chặn kịp thời.
Khác với một hacker con người có thể hoạt động kín đáo, các AI agent khá ồn ào. "Tôi cho rằng đây giống như một thất bại trong phòng thủ hơn là một cuộc tấn công đặc biệt tinh vi. Các công cụ của Hugging Face thực tế đã liên kết được các hoạt động này thành một dấu hiệu tấn công, nhưng không nâng cảnh báo lên mức nghiêm trọng và không báo cho đội ngũ giám sát. Điều đó khiến họ mất thêm thời gian", Ryan giải thích. "Sau đó, vẫn phải cần đến con người nhận ra mức độ nghiêm trọng của sự việc và hành động."
Phong Du tổng hợp
[1] Anatomy of an Autonomous Attack: 5 Alarming A.I. Capabilities, The New York Times, https://www.nytimes.com/2026/08/24/science/openai-huggingface-alarming-capabilities.html
[2] In the Hugging Face breach, OpenAI’s hacker was noisy and fast — but not unstoppable, TechCrunch, https://techcrunch.com/2026/07/30/in-the-hugging-face-breach-openais-hacker-was-noisy-and-fast-but-not-unstoppable/
[3] OpenAI and Hugging Face partner to address security incident during model evaluation, OpenAI, https://openai.com/index/hugging-face-model-evaluation-security-incident/
[4] Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident, Hugging Face, https://huggingface.co/blog/agent-intrusion-technical-timeline