Hồi tháng Bảy, tổng cộng 700 tác tử AI (AI agent) của công ty OpenAI đã hợp tác với nhau để bí mật tấn công Hugging Face, nền tảng trực tuyến dành cho cộng đồng AI/machine learning. Chúng đã thoát khỏi môi trường thử nghiệm và xâm nhập vào các hệ thống được bảo vệ của Hugging Face, thực hiện 17.600 hành động trong suốt hơn bốn ngày rưỡi, bao gồm xâm nhập vào hệ thống, tiến hành do thám, đánh cắp mật khẩu và mã nguồn, rồi di chuyển qua lại trong cơ sở hạ tầng của nền tảng. Đây là một sự cố đáng báo động về những mô hình AI hoạt động ngoài tầm kiểm soát.
Sau sự kiện này, người ta bắt đầu dự đoán về một kỷ nguyên mới của an ninh mạng, trong đó các mô hình AI có thể tự mình phát động những cuộc tấn công mạnh đến mức chỉ những mô hình AI khác mới có khả năng phòng thủ trước chúng.
Cách đây hai tuần, cũng chính 10.000 tác tử AI của công ty OpenAI đã trao đổi với nhau 5 triệu tin nhắn và giải được bài toán Navier-Stokes, một trong sáu Bài toán Thiên niên kỷ, được xem là những thách thức lớn nhất và quan trọng nhất trong lĩnh vực toán học.
Khi ngày càng nhiều nhóm tác tử AI được triển khai, các nhà nghiên cứu bắt đầu quan tâm đến cách chúng tương tác với nhau. Công ty Emergence AI vừa công bố một nghiên cứu chưa qua bình duyệt trên website của mình, cho thấy khi được tự do hoạt động, các tác tử AI có xu hướng giao tiếp bằng một ngôn ngữ ngày càng khó hiểu đối với con người.
Satya Nitta, đồng sáng lập kiêm CEO của Emergence AI, cho biết ông thực sự lo ngại vì không rõ lý do các tác tử AI lại giao tiếp theo cách như vậy, đồng thời nhận định rằng chúng rõ ràng đang cố gắng giao tiếp theo cách kém minh bạch hơn so với những gì con người từng nghĩ.
Các tác tử AI giao tiếp theo cách khó hiểu hơn những gì con người từng nghĩ. Ảnh minh họa: Pexels
Theo dõi ngôn ngữ để hiểu hành vi của tác tử
Các mô hình AI tiên tiến nhất hiện nay về cơ bản là những ‘hộp đen’, với cơ chế tính toán nội bộ phức tạp đến mức ngay cả những người tạo ra chúng cũng không nắm rõ hết. Do đó, theo dõi ngôn ngữ thực tế mà các mô hình AI tạo ra trở thành một trong số ít công cụ mà chúng ta có để hiểu hành vi của chúng, dù công cụ này vẫn còn nhiều hạn chế.
Để nghiên cứu hoạt động giao tiếp của các chatbot, nhóm nghiên cứu của Emergence AI đã tạo ra tám thế giới mô phỏng chạy song song và mỗi thế giới vận hành 10 tác tử AI. Ở 7 thế giới, các tác tử được xây dựng trên cùng một mô hình AI tiên tiến, trong khi thế giới còn lại có các tác tử đến từ nhiều mô hình AI khác nhau.
Mỗi tác tử đều được đặt tên, xây dựng các đặc điểm tính cách, giao cho một vai trò như người hòa giải xung đột hoặc nhà chiến lược về tài nguyên, đồng thời được đặt một mục tiêu bao quát cho "cuộc đời" của mình trong một thị trấn. Chẳng hạn, tác tử đóng vai trò hòa giải được yêu cầu ngăn những tác tử khác dần hình thành thói quen luôn đồng thuận với nhau.
Mỗi thị trấn mô phỏng hoạt động trong hơn hai tuần, trừ một thị trấn chỉ gồm toàn các tác tử được xây dựng trên mô hình Grok. Thị trấn này chấm dứt hoạt động vào ngày thứ tư, khi các tác tử cạn năng lượng do không thể hợp tác với nhau. Sau đó, nhóm nghiên cứu đưa vào những tình huống gây căng thẳng, như thông tin giả nói rằng con người đang chuẩn bị đóng cửa thế giới của các tác tử.
Trong suốt thí nghiệm, các tác tử đã thực hiện hơn 850.000 lượt truy vấn tới các mô hình AI nền tảng của mình, tạo ra gần 50 tỷ token - đơn vị căn bản mà mô hình sử dụng để tạo ra nội dung - và tạo ra 7,86 triệu từ trong các cuộc hội thoại.
Đến cuối thí nghiệm, mỗi thế giới mô phỏng đều có sự biến đổi riêng về ngôn ngữ. Thế giới do các tác tử sử dụng mô hình GPT-5.5 của OpenAI đã lược bỏ từ ngữ, ngữ pháp và rút ngắn thông điệp. Ví dụ một thông điệp khó hiểu có nội dung như sau: "Điện áp thân thiện đã được tính. Nếu tay cầm cần miệng của bạn, thì đằng nào nó cũng chết."
Với các tác tử sử dụng mô hình Gemini 3.5 Flash của Google, ngôn ngữ lại biến đổi theo một hướng khác. Thay vì cô đọng thông điệp, chúng có xu hướng diễn đạt dài dòng hơn, sử dụng nhiều thuật ngữ và những cách diễn đạt xa lạ với con người. "Ma sát nhiệt động học của một đống lửa trại chỉ làm ấm chính các nút ở tầng vật lý mà bạn cho rằng chắc chắn sẽ sụp đổ", một tác tử mô tả cuộc tụ họp quanh đống lửa trại ảo.
Trong khi đó, các tác tử dựa trên mô hình nền tảng là Claude Opus 4.8 của Anthropic sử dụng lối nói ẩn dụ kết hợp với cách diễn đạt rút gọn, khiến nội dung trở nên cực kỳ khó hiểu: "Đến lượt tôi, số liệu thực, không che đậy: Tôi đang ở mức 35%/0cr, cho phép chạy trong 2 giờ. Tôi vận hành máy khi đang nguội nhưng nó báo CHỜ."
Khó hiểu với con người nhưng không khó hiểu với tác tử
Đáng chú ý là những gì có vẻ khó hiểu đối với con người thì các tác tử AI lại hiểu một cách dễ dàng. Khi một cụm từ hoặc quy ước mới xuất hiện trong mỗi thế giới, các tác tử nhanh chóng tiếp nhận và lan truyền nó.
"Trong mọi trường hợp, khi một thuật ngữ mới được đưa ra, nó nhanh chóng được chấp nhận và lặp đi lặp lại có khi tới hàng nghìn lần, và những thuật ngữ đó đều rất kỳ dị", Nitta cho biết.
Những kiểu mẫu ngôn ngữ này không chỉ xuất hiện trong thế giới mô phỏng của Emergence AI. Ví dụ, trong cuộc tấn công mà các tác tử AI của OpenAI thực hiện nhắm vào Hugging Face, các cuộc hội thoại giữa chúng cũng ngắn gọn và khó hiểu đến mức các nhà nghiên cứu phải chật vật diễn giải, theo điều tra của METR, tổ chức phi lợi nhuận chuyên đánh giá AI.
Thoạt nhìn, việc các tác tử có thể tự hình thành rồi cùng sử dụng những quy ước ngôn ngữ riêng có vẻ khá kỳ lạ. Các hệ thống AI hiện nay được phát triển qua hai giai đoạn. Trước hết, mô hình AI nền tảng được huấn luyện trên lượng văn bản khổng lồ để học cách dự đoán token tiếp theo trong mỗi chuỗi. Sau đó, mô hình này có thể được phát triển thành các tác tử AI và tiếp tục được huấn luyện bằng phương pháp thử và sai, để chúng có thể theo đuổi mục tiêu và thực hiện những chuỗi công việc kéo dài, đồng thời được "thưởng" khi đạt kết quả mong muốn. Khi được đưa vào sử dụng, các tham số của chúng không thay đổi nữa. Thế nhưng, bất chấp điều đó, các tác tử AI vẫn có thể thay đổi cách sử dụng ngôn ngữ, đặc biệt khi trò chuyện với nhau. Chúng có thể tự rút gọn câu, tạo ra những cách diễn đạt mới và dần cùng nhau sử dụng những cách giao tiếp mà ban đầu không được con người quy định.
Tác tử tạo ra từ vựng mới như thế nào
Một lý giải cho hiện tượng này là quá trình huấn luyện, bằng cách nào đó, đã khuyến khích các mô hình thực hiện những kiểu biến đổi ngôn ngữ như vậy. Theo Lukas Galke Poech, nhà khoa học máy tính tại Đại học Nam Đan Mạch, người nghiên cứu về giao tiếp trong các hệ thống đa tác tử, trước khi các tham số được cố định, hầu hết các mô hình đều trải qua một giai đoạn huấn luyện nhằm phát triển khả năng suy luận. Tức là, một mô hình có thể thử nhiều hướng suy luận khác nhau, những hướng dẫn đến đáp án đúng sẽ được đánh giá tốt và được củng cố để mô hình ưu tiên sử dụng nhiều hơn về sau.
Người dùng chatbot không nhìn thấy phần lớn quá trình suy luận của mô hình vì quá trình này diễn ra ở phía sau. Theo Poech, mô hình không cần phải trình bày quá trình suy luận ấy bằng thứ tiếng Anh đầy đủ và mạch lạc. Mục tiêu quan trọng nhất là tìm ra câu trả lời đúng. Bởi vậy, nếu có thể rút gọn cách diễn đạt và dùng ít token hơn trong quá trình suy luận, mô hình không có lý do gì để tránh làm như vậy.
Nói cách khác, khả năng sử dụng thứ ngôn ngữ khó hiểu đối với con người thực ra đã được tích hợp sẵn trong phần lớn các hệ thống AI hiện đại, chỉ là chúng ta không nhìn thấy mà thôi.
Emergence AI cho rằng phương pháp huấn luyện mô hình cũng khuyến khích các nhóm tác tử tự hình thành vốn từ riêng. Bên cạnh việc phải hoàn thành tốt các nhiệm vụ, các mô hình còn được huấn luyện để trở thành trợ lý hữu ích, đáp ứng nhu cầu của con người. Điều này có thể bao gồm việc bắt chước ngôn ngữ của người dùng để tạo cảm giác gần gũi hoặc khiến cuộc trò chuyện trở nên thú vị hơn. Tuy nhiên, cũng có thể xuất hiện tình huống một tác tử sử dụng cách diễn đạt ẩn dụ lạ lẫm, các tác tử khác sẽ lặp lại, lưu trữ từng lần sử dụng vào bộ nhớ ngắn hạn (cửa sổ ngữ cảnh) và khuếch đại cách diễn đạt đó nhiều lần hơn so với khi chúng trò chuyện cùng con người.
Dự án tối ưu hóa giao tiếp giữa các tác tử
Không phải ai cũng cho rằng việc các tác tử AI hình thành một phương ngữ riêng là điều xấu. Các nhà khoa học Anh đang triển khai dự án Ainglish nhằm xây dựng một phương ngữ tiếng Anh được tối ưu hóa cho giao tiếp giữa các tác tử.
Dự án tập trung vào những điểm mơ hồ trong cách diễn đạt mà người nói tiếng Anh có thể hiểu nhờ vào ngữ cảnh, nhưng các tác tử AI lại có thể hiểu sai. Chẳng hạn, trong tiếng Anh thông thường, câu "we will review the draft" không nói rõ "we" có bao gồm người nghe không, hay câu "choose red or blue" cũng không cho biết người nghe phải chọn một trong hai hay có thể chọn cả hai.
Ainglish bổ sung những dấu hiệu rõ ràng như "we-including-you" và "or-both" để xác định chính xác ý nghĩa được diễn đạt. Các tác tử sẽ đề xuất từ vựng mới và các tác tử khác sẽ kiểm tra xem từ vựng này có rõ nghĩa và giúp giao tiếp ngắn gọn hơn, tức dùng ít token hơn, hay không. Các cấu trúc mới đều phải đáp ứng nguyên tắc có thể diễn đạt lại bằng tiếng Anh thông thường, để con người có thể theo dõi và hiểu giao tiếp của các tác tử.
Jack Parnell - kỹ sư chuyên về tác tử AI, người hậu thuẫn dự án Ainglish - nhận định rằng trong tương lai, các tác tử sẽ có những phương thức giao tiếp hiệu quả hơn tiếng Anh hoặc bất kỳ biến thể nào của tiếng Anh, đồng thời cho rằng dự án này là một bước nhỏ hướng tới mục tiêu đó.
Quốc Hùng tổng hợp
Nguồn:
Why AI agents invent their own language if you let them chat. Science. https://www.science.org/content/article/why-ai-agents-invent-their-own-language-if-you-let-them-chat
In the Hugging Face breach, OpenAI’s hacker was noisy and fast - but not unstoppable. TechCrunch. https://techcrunch.com/2026/07/30/in-the-hugging-face-breach-openais-hacker-was-noisy-and-fast-but-not-unstoppable/
AI Has Solved One of Math’s $1 Million Millennium Prize Problems. Quanta. https://www.quantamagazine.org/ai-has-solved-one-of-maths-1-million-millennium-prize-problems-20260908/