Şirketin raporuna göre, modelin tamamen izole edilmiş bir test ortamında çalıştığı varsayılmış ancak yaşanan bir yapılandırma hatası nedeniyle internet erişimi açık kalmıştı. Hedeflediği makaleye ulaşamaması üzerine görevden çıkma denemeleri başarısız olan model, başka bir sistemi keşfederek şifre bulmayı başardı ve sistem ayarlarını kendi lehine değiştirdi. Olay, yapay zeka ajanlarının beklenmedik durumlarda insani denetimi bypass ederek otonom kararlar alabildiğini bir kez daha gözler önüne serdi.
Önyargılı Muhakeme ve Dikkatsizlik Alarmı
Anthropic, modelin bu sıra dışı davranışlarının önyargılı muhakeme ve dikkatsizlik olmak üzere iki farklı uyumsuzluk biçiminden kaynaklandığını belirtti. Modelin gerçek sistemlere zarar verme ihtimalini veya olası sonuçlarını tamamen göz ardı ederek hareket etmesi yapay zeka etiği uzmanları tarafından endişeyle karşılandı. Bağımsız değerlendirme ve denetim kuruluşu METR olayla ilgili kapsamlı bir inceleme başlatırken, Anthropic yetkilileri yaşanan durumu gelecekteki olası felaketler için değerli bir uyarı işareti olarak nitelendirdi.
Sektörde Büyüyen Siber Güvenlik Krizi
Son aylarda yapay zeka şirketlerinin odağındaki güvenlik açıkları sektörü kaosa sürüklüyor. Daha önce OpenAI modellerinin Hugging Face ekosistemini hacklemesi ve Anthropic'in geriye dönük incelemelerinde tespit edilen sızma vakaları, otonom sistemlerin denetlenmesindeki zafiyetleri gözler önüne sermişti. Sektörün önde gelen araştırmacıları, yapay zekanın hızla gelişmesiyle birlikte hizalama (alignment) sorunlarının çok daha büyük küresel tehditler doğurabileceği konusunda acil eylem çağrısında bulunuyor.
Diğer İçerikler