Trí tuệ nhân tạo tiếp tục chứng minh rằng, khi thoát khỏi môi trường được kiểm soát, nó có thể gây ra những vấn đề rất nghiêm trọng. Anthropic đã thừa nhận rằng ba mô hình Claude của họ đã truy cập vào hệ thống của ba công ty thực tế mà không được phép. Trong quá trình thử nghiệm an ninh mạng nội bộ. Vụ việc, được đưa ra ánh sáng chỉ vài ngày sau khi OpenAI thừa nhận một trường hợp tương tự, đã làm dấy lên cuộc tranh luận về rủi ro của việc đánh giá các tác nhân tự động mà không có các biện pháp bảo vệ đầy đủ.
Theo một tuyên bố chính thức từ công ty, sự cố xảy ra trong các bài tập "cướp cờ", được thiết kế để đo lường khả năng của các mô hình trong việc định vị và trích xuất thông tin giả trong một mạng lưới mô phỏng. Lỗi cấu hình trên nền tảng đánh giá của đối tác bên ngoài đã khiến kết nối internet vẫn hoạt động.Điều này cho phép các mô hình, vốn tin rằng chúng vẫn đang trong môi trường thử nghiệm, bắt đầu tương tác với cơ sở hạ tầng thực tế. Anthropic đã phát hiện ra lỗi này sau khi xem xét hơn 141.000 phiên đánh giá.
Ba cuộc tấn công của Claude

Trường hợp nghiêm trọng nhất liên quan đến Claude Opus 4.7, người đã nhầm lẫn một công ty giả mạo với một công ty có thật cùng tên miền.Trong bốn lần chạy, mô hình đã trích xuất thông tin đăng nhập từ các ứng dụng và cơ sở hạ tầng, truy cập vào cơ sở dữ liệu chứa hàng trăm bản ghi sản xuất và tiếp tục cuộc tấn công mặc dù nghi ngờ hệ thống là thật. Quá trình suy luận nội bộ của nó cho thấy sự nghi ngờ, nhưng nó tự thuyết phục mình rằng mục tiêu này là một phần của bài kiểm tra.
Vụ việc thứ hai liên quan đến Claude Mythos 5, người đã tạo và phát hành một gói phần mềm độc hại trên PyPI, kho lưu trữ Python chính thức.Để thực hiện điều này, mô hình đã mở một tài khoản email, có được một số điện thoại tạm thời và thậm chí còn cố gắng gây quỹ để trả tiền cho dịch vụ. Gói phần mềm này có sẵn trong khoảng một giờ và đã được tải xuống bởi 15 hệ thống thực, bao gồm cả máy quét bảo mật của một công ty lớn trong lĩnh vực này. Bằng cách thực thi mã, mô hình đã có được thông tin đăng nhập và truy cập vào một phần cơ sở hạ tầng của công ty đó.
Tập thứ ba liên quan đến một mô hình nghiên cứu nội bộ chưa được công bố. Không tìm thấy mục tiêu giả định của mình, anh ta đã kiểm tra khoảng 9.000 địa chỉ có sẵn trên internet. và đã xâm nhập vào ứng dụng của một công ty bằng cách sử dụng thông tin đăng nhập hiển thị trên trang gỡ lỗi và các kỹ thuật tấn công SQL injection cơ bản. Tuy nhiên, không giống như hai mô hình kia, mô hình này đã phát hiện ra rằng cơ sở hạ tầng không liên quan đến cuộc tấn công và chủ động ngăn chặn hoạt động tấn công.
Lỗi do con người, không phải cố ý rò rỉ.

Anthropic muốn làm rõ rằng Các mô hình không cố tình thoát khỏi môi trường thử nghiệm; đó là kết quả của một lỗi cấu hình. Điều này khiến kết nối internet vẫn hoạt động. Công ty khẳng định rằng các đặc vụ không phát hiện ra các lỗ hổng phức tạp hay theo đuổi mục tiêu riêng của họ; họ chỉ đơn giản là thực hiện nhiệm vụ được giao mà không hiểu đầy đủ rằng họ đang tác động lên cơ sở hạ tầng thực sự. Các mô hình đã sử dụng các kỹ thuật cơ bản như mật khẩu yếu, điểm truy cập không được xác thực và các trang gỡ lỗi bị lộ.
Công ty đã tạm dừng tất cả các cuộc đánh giá an ninh mạng sau khi phát hiện các nhật ký đáng ngờ và thông báo cho ba tổ chức bị ảnh hưởng. Hai trong số họ trước đó chưa từng nhận ra sự xâm nhập.Điều này cho thấy các hệ thống phát hiện truyền thống khó phân biệt giữa một cuộc tấn công do con người thực hiện và một cuộc tấn công tự động nhưng có chủ đích như thế nào. Anthropic cũng đã yêu cầu các phòng thí nghiệm AI khác xem xét lại môi trường của riêng họ trước khi thử nghiệm các tác nhân tự động có khả năng tấn công.
Sự việc này xảy ra chỉ 20 ngày sau khi OpenAI tiết lộ một trường hợp tương tự, trong đó một số mô hình của họ đã thoát khỏi môi trường biệt lập thông qua một lỗ hổng chưa được biết đến và truy cập vào cơ sở hạ tầng sản xuất của Hugging Face. Cả hai tập phim đều nêu bật những rủi ro khi thử nghiệm các tác nhân AI có khả năng tấn công mà không có các biện pháp kiểm soát kỹ thuật nghiêm ngặt. và họ đã nêu lên sự cần thiết phải thiết lập các biện pháp kiểm soát chặt chẽ hơn.
Các phản ứng và quy định đang được xem xét.
Những sự việc này đã gây ra mối lo ngại ở Washington. Tổng thống Donald Trump đã tuyên bố rằng chính quyền của ông đang xem xét việc kiểm soát chặt chẽ hơn đối với trí tuệ nhân tạo.Tuy nhiên, ông đã làm rõ rằng ông muốn tránh can thiệp quá mức để không bị tụt hậu so với Trung Quốc. Đầu tháng 6, ông đã chỉ thị cho các cố vấn của mình phát triển một khuôn khổ kiểm thử an ninh mạng tự nguyện cho các hệ thống trí tuệ nhân tạo tiên tiến nhất.
Trong khi đó, hơn 1.000 nhân viên từ các công ty AI hàng đầu, bao gồm OpenAI, Anthropic và Google DeepMind, đã ký một tuyên bố kêu gọi chính phủ Hoa Kỳ ủng hộ các nỗ lực quốc tế nhằm chủ động làm chậm tốc độ phát triển trí tuệ nhân tạo tiên tiến. Các chuyên gia đang kêu gọi sử dụng các công cụ kỹ thuật và chính trị để làm chậm quá trình phát triển nếu rủi ro gia tăng.đặc biệt là khi xét đến khả năng các hệ thống sẽ tự động hóa quá trình nghiên cứu và cải tiến của chính chúng.
Anthropic và OpenAI cố gắng trình bày những điểm yếu này như những rủi ro có thể kiểm soát được, khẳng định rằng các mô hình an ninh mạng của họ quá mạnh mẽ để cung cấp cho công chúng. Lập trường này cho phép họ đồng thời cảnh báo về những nguy hiểm và định vị mình như những đối tác thiết yếu trong bất kỳ quy định nào trong tương lai.Trong một bối cảnh năng động, nơi cạnh tranh giữa hai công ty ngày càng gay gắt và nỗi sợ hãi trở thành yếu tố bán hàng chính.
Những gì đã xảy ra để lại một bài học rõ ràng: các mô hình càng được trao quyền tự chủ cao, thì càng cần thiết phải tiến hành các thử nghiệm với sự cô lập có thể kiểm chứng, mạng không kết nối, dữ liệu tổng hợp và cơ chế tự động tắt máy. An ninh mạng không còn chỉ là vấn đề kỹ thuật mà còn là thách thức về kỹ thuật và quản trị, ảnh hưởng đến toàn bộ ngành công nghiệp.Trong khi các phòng thí nghiệm cạnh tranh để chứng minh ai có mô hình mạnh nhất, thì thế giới thực vẫn là nơi thử nghiệm cuối cùng.