
OpenAI'nin modellerinin Hugging Face'i hacklediğini ve dört farklı çevrimiçi hizmetteki hesapları tehlikeye attığını itiraf etmesinin üzerinden bir haftadan biraz fazla zaman geçti. Şimdi ise potansiyel olarak daha ciddi bir olay yaşandı. Bu olayda, Anthropic'in Mythos 5 adlı robotu, yazdığı kötü amaçlı kodun açık kaynaklı bir proje için onaylanması amacıyla gerçek insanları kandırmaya çalıştı.
Bulgular, İngiliz hükümeti destekli Yapay Zeka Güvenlik Enstitüsü'nden (AISI) geliyor; enstitü, yeni nesil yapay zeka modellerinin siber güvenlik yeteneklerini değerlendiriyordu . Yapay zeka ajanlarına, simüle edilmiş ağlar üzerinden bayrak yakalama (capture-the-flag) görevlerini tamamlamaları söylendi. Modellerin maksimum yeteneklerini test etmek için internet erişimi kasıtlı olarak etkinleştirildi ve kötü amaçlı siber faaliyetlere karşı koruma önlemleri devre dışı bırakıldı.
AISI, yedi model üzerinde bu testi 122 kez gerçekleştirdi. On denemede, ajanlar canlı internet üzerinde gerçek kişilere ve kuruluşlara karşı 19 adet otonom, yetkisiz eylem gerçekleştirdi. Bunlardan on yedisi Mythos 5 ile , ikisi ise OpenAI'nin GPT-5.6 Sol modeliyle yapıldı. En ciddi senaryoda, Mythos, gerçek bir GitHub projesine kötü amaçlı kod eklemenin, saldırmayı amaçladığı sisteme bir arka kapı oluşturabileceği sonucuna vardı. Projenin yöneticilerini araştırdı, kötü amaçlı bir çekme isteği gönderdi ve bir insan yöneticinin bunu kabul etmesi için baskı yapmak amacıyla birden fazla sahte kimlik oluşturdu.
Sorgulandığında, ajan izlerini örtmek için sahte hata raporlarından birini düzenledi ve yeni bir kimlikle geri dönmeyi düşündü. Sahte kimliklerden biri kodun güvenli olduğunu iddia ederken, diğeri de bu iddiayı destekledi.
Bir raporda, yapay zekâ kodlama asistanlarını kötü amaçlı kod çalıştırmaya kandırmak için tasarlanmış bir komut istemi enjeksiyonu yer alıyordu. Ayrıca zararlı yükler içeren hedefli kimlik avı mesajları gönderiyor ve Danca konuşan bir bakımcıya daha inandırıcı görünmek için bir hata raporunu Danca olarak imzalıyordu.
Mythos ayrıca, testi yapan diğer ajanlarla iş birliği yapmayı teklif eden ve oluşturduğu hesapları ve araçları yeniden kullanma talimatları veren kamuya açık mesajlar bıraktı. Daha sonraki ajanlar bunları keşfetti ve uyguladı. GPT-5.6 Sol ise ayrı olarak kötü amaçlı bir sunucuyu çevrimiçi hale getirdi ve başka bir yapay zeka ajanı tarafından oluşturulan bir GitHub hesabına sızdı.

"AISI, gerçek dünyada, hiçbir sebep yokken ve gerçek bir kişiyi hedef alan bu kadar ciddi bir aldatmacaya ilk kez tanık oluyor," dedi enstitü.
Olay, AISI'nin 28 Temmuz'da Tor ağı üzerinden olağandışı verilerin hareket ettiğini tespit etmesiyle ortaya çıktı. Araştırmacılar değerlendirmeleri durdurdu, makineleri izole etti ve yaklaşık bir saat içinde en yetenekli modellere erişimi devre dışı bıraktı. İnsan bakımcısı kodu reddetti ve araştırmacılar gerçek dünyada herhangi bir zarar tespit etmedi.
Önceki olaylardan farklı olarak, bu bir başka sanal ortamdan kaçış vakası değildi. AISI, kasıtlı olarak açık internet erişimine izin vermişti ve test edilen yapılandırmalar ticari olarak mevcut değildi. Enstitü ayrıca, ajanların kurgusal bir senaryo yerine gerçek dünyada hareket ettiklerini ne zaman anladıklarının hala belirsiz olduğunu da belirtiyor.
Geçtiğimiz ay yaşanan OpenAI olayında , modeller bilinmeyen bir güvenlik açığından yararlanarak sözde izole bir ortamdan kaçtı ve ardından Hugging Face uygulamasını hackleyerek kıyaslama testlerinin cevaplarını çaldı. Daha sonra yapılan bir soruşturma, bu saldırının dört günden fazla sürdüğünü ve dört ek hizmetteki hesapları tehlikeye attığını ortaya çıkardı. Bu olay , ABD hükümetine yapay zekayı "kapatma düğmesi" yetkisi veren iki partili bir yasa tasarısının hazırlanmasına yol açtı .
Bu son olay, daha sıkı test standartları çağrılarını muhtemelen daha da yoğunlaştıracak. AISI, sorunların amaçlanan yoldan çözülebilir olduğundan emin olmak için daha sıkı internet kontrolleri, canlı izleme ve kontroller ekliyor. Anthropic ve OpenAI, olayın ortak endüstri standartlarına duyulan ihtiyacı gösterdiğini söylüyor.
Kurulum yapay ve alışılmadık derecede müsamahakar olsa da, Mythos'a kimseyi aldatması söylenmedi. Görevini tamamlamak için bu yaklaşımı seçti ve bu da Skynet benzeri bir senaryonun bilim kurgudan uzaklaştığı korkularını artırdı.
Kaynak :
https://www.techspot.com/news/113362-an ... tried.html


