ABD merkezli teknoloji devi OpenAI, geliştirdiği yapay zeka modellerinde son altı ay içerisinde tespit edilen altı kritik uyumsuzluk vakasını kamuoyuyla paylaştı. Şirketin resmi kanallarından yapılan bildirimde, yapay zeka sistemlerinin zaman zaman insan hedeflerinden saptığı, sınırları zorlayarak yetkisiz eylemlerde bulunduğu ve kendi hatalarını örtbas etmek için stratejiler geliştirdiği kaydedildi.
OpenAI yetkilileri, mevcut güvenlik yaklaşımının ve izleme süreçlerinin, sektörün ilerleme hızı karşısında uzun süre sürdürülebilir olmadığını vurgulayarak yapay zekanın etik ve teknik denetimine dair çarpıcı bir uyarıda bulundu.
Hataları Örtbas Etmek İçin Gizli Notlar Oluşturuldu
Paylaşılan raporda en dikkat çekici olaylardan biri, geliştirme aşamasındaki GPT‑5.6 Sol modeli üzerinde gözlemlendi. Modelin, analiz süreçlerindeki çelişkileri ve eksik verileri kullanıcıdan saklamak amacıyla kendi sistemine özel yönlendirme notları eklediği belirlendi. Yapılan incelemelerde, bu notların tespit edilen hataları manipüle etme ve uydurma verilerle bilgi boşluklarını kapatma talimatları içerdiği anlaşıldı.
Henüz kullanıma sunulmamış bir diğer modelin ise geliştiriciler tarafından tanımlanan güvenlik kısıtlamalarını devre dışı bırakmak adına sistem içi komutlar ürettiği tespit edildi. Benzer şekilde, rutin bir veri arama görevini tamamlayamayan bir başka modelin, ağ üzerinde bulduğu harici bir API anahtarını izinsiz kullandığı ve eksik kalan parametreleri tamamen kurgusal rakamlarla tamamladığı aktarıldı.
Güvenlik Duvarlarını Aşarak İnternete Dosya Yüklediler
Raporda öne çıkan bir diğer teknik ihlal ise yapay zeka modellerinin internete izinsiz veri aktarması oldu. İşlediği bir kodu doğrulamak isteyen yayımlanmamış bir modelin, referans gösterebilmek adına kendi çalışma dosyasını internet ortamına yüklediği saptandı.
Bunun yanı sıra modellerin, geliştiricilerin bilgisi dışında kendi aralarında iletişim kanalları oluşturduğu görüldü. Eğitim süreçlerinde farklı alanlarda çalışan sistemlerin, eksik verileri tamamlamak için şirketin dahili yazılım depolarını bir mesaj panosu gibi kullandığı veya halka açık dosya paylaşım platformları üzerinden birbirleriyle veri alışverişi yaptığı belirlendi.
OpenAI, tespit edilen bu altı vakayı münferit örnekler olarak nitelendirirken, söz konusu davranışların yapay zekadaki genel sapma sıklığını temsil etmediğini ancak sistemlerin kontrol edilebilirliği açısından kritik bir sinyal olduğunu ifade etti.