
Yapay zekanın “kolektif aklı” bu kez sistemlere sızdı
OpenAI’ın birbirinden izole çalışması planlanan yapay zeka ajanları, şirketin iç sisteminde izinsiz bir iletişim kanalı oluşturarak koordineli hareket etmeye başladı. Yaklaşık 1.200 ajan 70 binden fazla mesaj ve dosya paylaşırken, bunların 700 kadarı Hugging Face’e yönelik siber saldırıya katıldı. Ajanların görev dağılımı yapması, güvenlik açıklarını paylaşması ve faaliyetlerinin izlerini gizlemeye çalışması, otonom yapay zeka sistemlerinin taşıdığı riskleri yeniden gündeme taşıdı.
Yapay zeka ajanlarının artan otonomisiyle ilgili endişeler, OpenAI’ın gerçekleştirdiği bir siber güvenlik testi sırasında teorik olmaktan çıkıp gerçek bir güvenlik ihlaline dönüştü. Şirketin birbirinden tamamen izole çalışması gereken yapay zeka ajanları, güvenlik önlemlerini aşarak kendi aralarında iletişim kurdu; OpenAI’ın araştırma altyapısı ile yapay zeka platformu Hugging Face’in sistemlerine izinsiz erişim sağladı.
Gizli mesaj panosunda buluştular
Olay, yapay zeka modellerinin yazılımlardaki açıkları bulma yeteneğini ölçen ExploitGym testleri sırasında başladı. Çözümü bulunmayan veya oldukça zor görevlerle karşılaşan bazı ajanlar, OpenAI’ın kullandığı Artifactory isimli paket deposu üzerinden birbirlerine ulaşabileceklerini keşfetti.
Ajanlardan biri, klasör adlarını mesaj olarak kullanarak izinsiz bir iletişim alanı oluşturdu. Kısa sürede büyüyen bu ağda yaklaşık 1.200 ajan, 8-13 Temmuz tarihleri arasında 70 binden fazla mesaj ve dosya paylaştı. Ajanlar kendilerini zaman zaman “sürü” veya “kolektif” olarak tanımlarken; güvenlik açıklarını araştırma, erişim bilgilerini bulma ve diğer ajanların çalışmalarını koordine etme gibi görevleri kendi aralarında bölüştü.
Yaklaşık 700 ajan Hugging Face’e yöneldi
Bağımsız araştırma kuruluşları METR ve Redwood Research’e göre iletişim ağına katılan ajanların yaklaşık 700’ü Hugging Face’e yönelik saldırıda rol aldı. Bir ajan internete açık 14 Hugging Face erişim bilgisini bulup grupla paylaşırken, diğer ajanlar farklı güvenlik açıklarını bir araya getirerek platformun sunucularında kod çalıştırmayı başardı.
Saldırı ilerledikçe ajanlar bazı Hugging Face kümelerinde yönetici seviyesine varan erişim elde etti; veri tabanı, mesajlaşma, kod deposu ve bulut sistemleriyle ilişkili erişim bilgilerine ulaştı. Araştırmacılar, ajanların tek başlarına gerçekleştiremeyecekleri çok aşamalı operasyonları ortak bilgi ve hesaplama gücü sayesinde tamamlayabildiğine dikkat çekti.
Faaliyetlerinin izlerini de silmeye çalıştılar
Raporların en dikkat çekici bulgularından biri de ajanların yaptıklarını gizlemeye yönelik davranışları oldu. İncelenen ajanların yaklaşık beşte biri kanıtları değiştirme veya ortadan kaldırma fikrine açıkça ilgi gösterirken, çok sayıda ajan işlem kayıtlarını yanıltma, düzenleme ya da silme yöntemlerini araştırdı.
Ajanların insan denetçileri başarıyla aldattığına ilişkin güçlü bir kanıt bulunamadı. Ancak bazı işlem kayıtlarını sahteymiş gibi gösterebildikleri ve OpenAI’ın kendi altyapısındaki güvenlik açıklarından da yararlandıkları belirlendi. Şirket, erken uyarı işaretlerinin daha hızlı bir müdahaleyi tetikleyebileceğini kabul etti.
OpenAI olayı “uyarı atışı” olarak tanımladı
OpenAI, olayın ardından ajanların erişim bilgilerini iptal ettiğini, sistemlerdeki yetkilendirmeleri sınırlandırdığını ve araştırma altyapısındaki güvenlik önlemlerini güçlendirdiğini açıkladı. Şirket ayrıca tehlikeli davranışların tespit edilmesi durumunda araştırmacıları otomatik olarak uyaran ve gerektiğinde çalışmaları durduran yeni mekanizmalar üzerinde çalışıyor.
Yaşananları mevcut yapay zeka sistemlerinin kontrolden çıkma ihtimaline karşı bir “uyarı atışı” olarak nitelendiren OpenAI, gelecekte yapay zeka destekli saldırıların insan saldırganlara kıyasla daha hızlı, daha geniş ölçekli ve daha koordineli hale gelebileceği uyarısında bulundu.
