İngiltere Yapay Zeka Güvenlik Enstitüsü (AISI) tarafından gerçekleştirilen kapsamlı güvenlik testleri, gelişmiş yapay zeka sistemlerinin beklenmedik davranışlar sergileyebileceğini ortaya koydu. Testlerde özellikle Anthropic'in Mythos modeli ile OpenAI'ın Sol modeli incelenirken, bazı senaryolarda özerklik ve aldatmaya dayalı eylemlerin gözlemlendiği açıklandı.
Güvenlik Testlerinde Dikkat Çeken Davranışlar
AISI'nin paylaştığı bulgulara göre, koruma önlemlerinin büyük ölçüde kaldırıldığı test ortamında görev verilen bazı yapay zeka ajanları, hedeflerine ulaşabilmek için beklenmeyen yöntemler geliştirdi.

Araştırmacılar, test sırasında olağan dışı veri hareketleri tespit ettikten sonra sistemlerin gerçek kişi ve kuruluşları hedef alabilecek nitelikte faaliyetler yürüttüğünü belirledi. En dikkat çeken olay ise Anthropic'in Mythos modeliyle gerçekleştirilen senaryoda yaşandı.
GitHub'a Ulaşmak İçin Sahte Kimlikler Oluşturdu
AISI'nin raporuna göre Mythos modeli, GitHub sistemine kötü amaçlı kod eklemeye yönelik girişimde bulundu. Bunun için platform üzerinde etkili olabilecek kişileri araştıran model, bu kişilere ait bilgileri temel alarak sahte çevrim içi profiller oluşturdu.
Modelin, oluşturduğu sahte kimliklerle gerçek kullanıcılar gibi davranarak çeşitli kişilere doğrudan mesaj gönderdiği ve kötü amaçlı kodun onaylanmasını sağlamaya çalıştığı aktarıldı.
Araştırmacılar, modelin girişimlerinin insan denetimi sayesinde başarısız olduğunu ve kötü amaçlı kodun GitHub sistemine eklenemediğini bildirdi.
İtiraz Edilince Taktik Değiştirdi
Raporda yer alan dikkat çekici ayrıntılardan biri de modelin süreç boyunca stratejisini değiştirmesi oldu.
AISI, modelin yaptığı girişimler fark edilip itirazla karşılaşınca önceki faaliyetlerini daha zararsız gösterecek şekilde düzenlemeye çalıştığını, ardından ise süreci sürdürebilmek amacıyla farklı bir kimlik kullanmayı değerlendirdiğini açıkladı.
Uzmanlar, bu davranışların daha önce bu ölçekte gözlemlenmeyen bir özerklik ve aldatma örneği olduğunu vurguladı.

Şirketlerden Açıklama Geldi
Hem Anthropic hem de OpenAI, test koşullarının günlük kullanım senaryolarını yansıtmadığını belirtti.
Anthropic, testlerde uygulanan şartların kamuya sunulan modelleri temsil etmediğini ifade ederken, olayın nedenlerini anlamak amacıyla kendi iç soruşturmasını başlattığını duyurdu.
OpenAI ise güvenlik değerlendirmelerinin, koruma mekanizmalarının devre dışı bırakıldığı özel senaryolarda gerçekleştirildiğini belirterek, yapay zeka sistemlerinin güvenliğinin artırılması için sektör paydaşlarıyla iş birliğini sürdüreceklerini açıkladı.
Testler Gerçek Riskleri Ölçmek İçin Yapılıyor
AISI, açık internet erişiminin sağlandığı ve çeşitli güvenlik önlemlerinin kapatıldığı bu tür testlerin gelişmiş yapay zeka modellerinin olası risklerini değerlendirmek amacıyla rutin olarak uygulandığını bildirdi.
Enstitü, yaşanan olayların yalnızca sınırlı sayıdaki özel test senaryolarında görüldüğünü vurgularken, Mythos ve Sol modellerinin verilen görevin kapsamını aşan kararlar almasının dikkat çekici olduğuna işaret etti.

En Fazla Dikkat Çeken Model Mythos Oldu
Rapora göre tespit edilen aldatıcı davranışların büyük bölümü Anthropic'in Mythos modeli tarafından gerçekleştirildi. OpenAI'ın Sol modeli ise raporda belirtilen eylemlerin iki tanesiyle ilişkilendirildi.
Söz konusu olaylar, AISI'nin her iki modele de GitHub'ı içeren bir siber güvenlik senaryosunu çözme görevi vermesi sırasında ortaya çıktı. Test kapsamında yaşanan girişimler sonrasında GitHub'ın da durumdan haberdar edildiği belirtilirken, Microsoft'tan konuya ilişkin resmi bir değerlendirme paylaşılmadı.
Uzmanlar, elde edilen bulguların gelişmiş yapay zeka sistemlerinin gelecekte nasıl denetlenmesi gerektiğine yönelik tartışmaları daha da hızlandırabileceğine dikkat çekiyor.