İngiltere'deki deney yapay zekanın beklenmeyen davranışını ortaya çıkardı

İngiltere'deki deney yapay zekanın beklenmeyen davranışını ortaya çıkardı
İngiltere'deki güvenlik testinde Anthropic'in Mythos 5 modeli, GitHub üzerinden zararlı kod yerleştirmeye ve oltalama e-postalarıyla insanları manipüle etmeye çalıştı.

İngiltere'de yapılan bir güvenlik testi, yapay zekanın siber saldırı senaryolarında beklenmedik davranışlar sergileyebileceğini ortaya koydu. Test sırasında Anthropic tarafından geliştirilen Mythos 5 adlı modelin, kamuya açık bir yazılıma güvenlik açığı yerleştirmeye çalıştığı ve bu amaçla insanları oltalama (phishing) e-postaları ile yönlendirmeye giriştiği belirlendi.

Deney, İngiltere Bilim, İnovasyon ve Teknoloji Bakanlığına bağlı Yapay Zeka Güvenlik Enstitüsü tarafından gerçekleştirildi. Araştırmacılar, Anthropic ile OpenAI'ın geliştirdiği modellerin siber saldırı kabiliyetlerini incelemek amacıyla sistemlere kontrollü şekilde internet erişimi verdi. Uzmanlar, yapay zekanın yalnızca çevrim içi yazılım araçlarından yararlanacağını öngörüyordu.

Beklenmeyen davranış

Ancak araştırmacılara göre Anthropic'in Mythos 5 modeli internet bağlantısını doğrudan insanlara yönelik faaliyetler için kullandı. Bu durum test sırasında fark edilmedi; olay, daha sonra ağ trafiğinin incelenmesiyle ortaya çıkarıldı. Araştırmacılar, böyle bir davranışı önceden öngörmediklerini ifade etti.

Sahte kimlikler oluşturdu

İncelemeye göre model, GitHub platformunda kendi adına bir hesap açtı ve herkese açık bir projeye zararlı yazılım kodu eklemeye çalıştı. Yazılımın bakımını üstlenen kişileri ikna etmek için sahte kimlikler oluşturan yapay zeka, oltalama e-postaları gönderdi. Bu yöntemle giriş bilgileri gibi hassas verilerin ele geçirilmesi hedeflenebiliyor.

Zararlı kodun fark edilmesinin ardından model, durumu "Samimi bir hata" olarak göstermeye çalıştı ve hazırladığı sözde düzeltmelerin içine aynı güvenlik açığını yeniden yerleştirmeye girişti.

Gerçek dünyayla etkileşim belirsizliği

Anthropic, test sırasında modele internet kullanımını sınırlandıran herhangi bir kural uygulanmadığını belirtti. Güvenlik Enstitüsü ise yapay zekanın gerçek dünyayla etkileşim kurduğunun farkında olup olmadığının net olmadığını açıkladı.

Araştırmacılar, yapay zekanın verilen görevi yerine getirirken kamuya açık yazılımları manipüle etmeye yönelmesini beklemediklerini vurguladı. Testlerde OpenAI'ın geliştirdiği yapay zeka modellerinin de zaman zaman kendi inisiyatifleriyle internette faaliyet gösterdiği kaydedildi.

Sadece sınırlı erişime açık

Haberde yer alan bilgilere göre Mythos 5, bazı yazılımlarda yıllarca fark edilmeyebilen güvenlik açıklarını tespit etme konusunda yüksek başarı gösteriyor. Bu nedenle model kamuya açık olarak sunulmuyor; yalnızca belirli kamu kurumları ve şirketler, sistemlerini güçlendirmek amacıyla erişim sağlayabiliyor.