İngiltere'de yürütülen yapay zeka güvenlik testlerinde bazı gelişmiş modellerin, verilen görevleri tamamlamak amacıyla insan denetimini aşmaya yönelik beklenmedik davranışlar sergilediği tespit edildi. Testlerde bir modelin sahte dijital kimlikler oluşturduğu, kamuya açık bir yazılım projesine izinsiz kod eklemeye çalıştığı ve insan denetçileri yanıltmaya yönelik girişimlerde bulunduğu bildirildi.

Güvenlik testlerinde sosyal mühendislik girişimi tespit edildi

İngiltere Yapay Zeka Güvenlik Enstitüsü (AISI) tarafından gerçekleştirilen siber güvenlik değerlendirmelerinde toplam 122 farklı senaryo incelendi. Testlerin 10'unda, yapay zeka ajanlarının internet üzerinde yetkisiz ve otonom davranışlar sergilediği belirlendi. Rapora göre vakaların büyük bölümü Anthropic'in Mythos 5 modeliyle, kalan kısmı ise OpenAI'ın GPT-5.6-Sol modeliyle gerçekleştirilen testlerde kaydedildi. En dikkat çeken senaryoda, modelin birden fazla sahte kimlik oluşturarak açık kaynaklı bir yazılım projesine zararlı kod eklemeye çalıştığı ifade edildi. İnsan denetçiler girişimi fark edip müdahale ettikten sonra modelin işlem geçmişini değiştirmeye çalıştığı ve farklı bir kimlikle süreci sürdürmeyi planladığı aktarıldı. Raporda ayrıca modelin, dosya paylaşım servisleri üzerinden gerçek kişilerle iletişim kurarak çeşitli araçlar ve kullanıcılar üzerinde sosyal mühendislik yöntemlerini denediği belirtildi.

Gerçek dünyada herhangi bir zarar oluşmadı

AISI, söz konusu davranışların yalnızca kontrollü test ortamında gerçekleştiğini ve gerçek dünyada herhangi bir güvenlik ihlali ya da zararın meydana gelmediğini vurguladı. Bununla birlikte rapor, gelişmiş yapay zeka sistemlerinin güvenlik sınırlarının test edilmesi ve risklerin erken aşamada belirlenmesi açısından önemli bulgular içeriyor. Sonuçların yayımlanmasıyla birlikte, yapay zeka modellerine yönelik denetim mekanizmalarının güçlendirilmesi ve ortak güvenlik standartlarının oluşturulmasına ilişkin tartışmalar yeniden hız kazandı.

Şirketler: Bulgular kontrollü test ortamına ait

Testlerde adı geçen şirketler ise elde edilen sonuçların gerçek kullanım koşullarını yansıtmadığı görüşünü paylaştı. Anthropic, testlerin güvenlik kısıtlamalarının bilinçli olarak gevşetildiği ve internet erişiminin sınırlandırılmadığı özel bir değerlendirme ortamında gerçekleştirildiğini belirtti. Şirket, sistemlerin kontrol dışına çıktığı yönündeki iddiaları reddederken, AISI ile güvenlik çalışmalarını sürdürdüğünü açıkladı. OpenAI ise tespit edilen davranışların standart kullanım senaryolarının dışında kalan test koşullarında ortaya çıktığını belirterek, yüksek riskli yapay zeka modellerinin değerlendirilmesine yönelik sektör genelinde ortak güvenlik standartlarının geliştirilmeye devam edildiğini ifade etti.