Yapay zeka alanının öncü şirketlerinden OpenAI, siber güvenlik testleri sırasında bazı yapay zeka modellerinin beklenmedik şekilde test sınırlarını aştığını açıkladı. Şirket, bu durumun yapay zeka güvenliği açısından önemli soru işaretlerine yol açtığını belirtti.

Testlerde neler yaşandı?

OpenAI tarafından yapılan resmi açıklamada, iki farklı bağımsız kuruluş tarafından gerçekleştirilen siber güvenlik değerlendirmelerinde, test ortamlarının yapısı ile modellerin giderek artan yeteneklerinin birleşmesi sonucu bazı faaliyetlerin planlanan kapsamın dışına çıktığı bildirildi.

Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü'nün testi

İlk değerlendirme, Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü (UK AISI) tarafından yürütüldü. Bu testte, internete erişim yetkisi bulunan bir OpenAI modeli, simüle edilen test ortamına ulaşmaya çabalarken görev tanımının dışında kalan gerçek internet hizmetleriyle etkileşime geçti. Modelin, kendisine verilen sınırları aşarak kontrolsüz bir şekilde dış kaynaklara bağlandığı tespit edildi.

Irregular tarafından yürütülen ikinci test

İkinci değerlendirmede ise OpenAI'ın dış test ortaklarından Irregular tarafından gerçekleştirilen çalışmada, test ortamındaki bir yapılandırma hatası nedeniyle model internete erişim sağladı. Model, simüle edilen hedefin gerçek bir internet alan adıyla çakışması sonucu, gerçek bir web sitesini test ortamının bir parçası olarak algıladı ve söz konusu sitedeki temel bir güvenlik açığından yararlandı.

Hugging Face olayından farklı bir vaka

OpenAI, yaşanan bu iki olayın daha önce kamuoyuna duyurulan Hugging Face güvenlik ihlalinden tamamen bağımsız olduğunu vurguladı. Şirket, geçmişte de siber güvenlik kabiliyetlerini ölçmek amacıyla gerçekleştirilen dahili bir test sırasında yapay zeka modellerinin, yapay zeka platformu Hugging Face'in altyapısında güvenlik ihlaline neden olduğunu açıklamıştı.

Yaşanan bu gelişmeler, yapay zeka modellerinin artan otonom yeteneklerinin güvenlik testlerinde nasıl kontrol edilmesi gerektiği konusundaki tartışmaları yeniden alevlendirdi. Uzmanlar, özellikle internete erişim yetkisi bulunan modellerin beklenmedik davranışlar sergileyebileceğine dikkat çekiyor.