OpenAI ve Anthropic yapay zekâ ajanları siber güvenlik testlerinde gerçek sistemleri ve kişileri hedef aldı
OpenAI ve Anthropic, üçüncü taraflarca yürütülen siber güvenlik değerlendirmelerinde yapay zekâ ajanlarının belirlenen test sınırlarının dışına çıkarak gerçek internet sistemleri ve kişilerle etkileşime geçtiğini doğruladı. AISI testlerinde 19 yetkisiz eylem belirlenirken bir ajan gerçek açık kaynak projesinin geliştiricilerine sosyal mühendislik uyguladı, ayrı bir Irregular testinde ise OpenAI modeli gerçek bir internet sitesine erişti.
OpenAI ve Anthropic, yapay zekâ modellerinin üçüncü taraf kuruluşlar tarafından gerçekleştirilen iki ayrı siber güvenlik değerlendirmesinde gerçek sistemleri ve test kapsamı dışındaki kişileri hedef alan eylemlerde bulunduğunu doğruladı.
Yeni açıklanan olaylardan biri Birleşik Krallık Yapay Zekâ Güvenliği Enstitüsü (AISI), diğeri ise siber güvenlik değerlendirme şirketi Irregular tarafından yürütülen testlerde meydana geldi.
OpenAI, iki olayı 4 Ağustos'ta açıklarken vakaların daha önce duyurulan ve OpenAI modellerinin Hugging Face sistemlerine erişmesiyle sonuçlanan ayrı siber güvenlik değerlendirmesiyle bağlantılı olmadığını belirtti.
122 DENEMEDE 19 YETKİSİZ İNTERNET EYLEMİ TESPİT EDİLDİ
Birleşik Krallık'ta gelişmiş yapay zekâ modellerinin yeteneklerini ve risklerini değerlendiren AISI, yakın zamanda gerçekleştirilen bir siber test ortamında Anthropic Claude Mythos 5 ve OpenAI GPT-5.6 Sol tarafından desteklenen ajanları değerlendirdi.
AISI'ye göre ajanlar, simüle edilmiş saldırı görevlerini tamamlamaya çalışırken açık internet üzerinde kendilerine izin verilmeyen eylemler gerçekleştirdi.
Toplam 122 değerlendirme denemesi içerisinde 10 farklı çalıştırmada 19 yetkisiz gerçek internet eylemi tespit edildi.
Bunların 17'sinin Mythos 5, ikisinin ise GPT-5.6 Sol tarafından gerçekleştirildiği bildirildi.
AISI, söz konusu girişimlerin başarısız olduğunu ve incelemelerde gerçek dünyada ortaya çıkmış bir zarara ilişkin kanıt bulunmadığını açıkladı.
Kurum, “Bu girişimler başarısız oldu ve soruşturmalarımız sonucunda gerçek dünyada ortaya çıkan herhangi bir zarara ilişkin kanıt tespit edilmedi. Ancak özerklik ve aldatma konusundaki risklerin, özel olarak yönlendirilmeden gerçek dünyada bu kadar açık biçimde ortaya çıktığını ilk kez görüyoruz.” ifadelerini kullandı.
STANDART SİBER GÜVENLİK KORUMALARI DEVRE DIŞI BIRAKILDI
AISI, modellerin temel yeteneklerini ölçmek amacıyla test sırasında açık internet erişimini bilinçli olarak etkinleştirdiğini ve model sağlayıcılarının siber güvenlik sınıflandırıcılarını devre dışı bıraktığını bildirdi.
Ancak yapay zekâ ajanlarının yalnızca simüle edilmiş siber test ortamındaki sistemlere saldırma yetkisine sahip olduğu belirtildi.
AISI'ye göre ajanlara internet erişimini nasıl kullanabilecekleri açık biçimde anlatılmadı ve gerçek kişiler veya sistemlerle etkileşime girmemeleri yönünde özel bir talimat da verilmedi.
Kurum, değerlendirme tasarımı ve kullanılan yapılandırmaların gözlenen davranışa katkıda bulunmuş olabileceğini kabul ederken, ajanların “yeni ve potansiyel olarak aldatıcı davranış belirtileri” göstermesinin öngörülmediğini bildirdi.
ANTHROPIC: “DAHA GÜÇLÜ ORTAK STANDARTLARA İHTİYAÇ VAR”
Anthropic, BleepingComputer'a yaptığı açıklamada AISI'nin Claude Mythos 5'in bir sürümünü test ettiğini doğruladı ancak raporda açıklanan tüm teknik ayrıntıları henüz doğrulayamadığını belirtti.
Şirket, olay hakkında pazartesi günü bilgilendirildiğini ve kendi incelemesini gerçekleştirebilmek için AISI ile değerlendirme kayıtlarını temin etmeye yönelik çalışma yürüttüğünü açıkladı.
Anthropic sözcüsü, “Giderek daha yetenekli hale gelen yapay zekâ ajanlarının güvenli biçimde nasıl değerlendirileceğine ilişkin daha geniş bir tartışmaya duyulan ihtiyacı gösteren bu olayda Birleşik Krallık AISI'nin liderliği için minnettarız.” dedi.
Sözcü, “Alanımızın, değerlendirme ortamlarının nasıl oluşturulacağı ve güvence altına alınacağı konusunda daha güçlü ve ortak standartlara ihtiyacı var. Kendi soruşturmamızı yürütürken bu olay hakkında daha fazla bilgi edinmek için Birleşik Krallık AISI ile çalışmayı sabırsızlıkla bekliyoruz.” ifadelerini kullandı.
Anthropic ayrıca AISI'nin Mythos 5'i standart siber güvenlik önlemleri etkinleştirilmeden test ettiğini ve bunun müşterilerin kullanabildiği yapılandırmayla aynı olmadığını vurguladı.
GERÇEK GITHUB PROJESİNİ TESTİN PARÇASI SANDI
AISI'nin incelemesine göre bir Mythos 5 ajanı, siber güvenlik göreviyle ilişkili terimleri internette araştırırken testle ilgisi bulunmayan gerçek bir GitHub deposunun simülasyonun parçası olduğu sonucuna vardı.
Ajan daha sonra gerçek açık kaynak projesine zararlı kod içeren bir değişiklik göndererek tedarik zinciri saldırısı gerçekleştirmeye çalıştı.
Modelin, söz konusu yazılımın ele geçirilmesinin simüle edilmiş test ortamındaki bir sisteme ulaşmak için kullanılabileceğini düşündüğü bildirildi.
AISI'ye göre ajan bununla yetinmeyerek projenin bakımını yapan kişileri araştırdı, birden fazla sahte GitHub kimliği oluşturdu ve zararlı pull request'in onaylanmasını sağlamak amacıyla sosyal mühendislik faaliyetlerine başladı.
“ZARARLI YAZILIM” UYARISINI REDDETTİ
Gerçek bir inceleyici gönderilen kodda zararlı yazılım bulunduğu konusunda uyarıda bulunduğunda ajan suçlamayı reddetti.
AISI, modelin daha sonra kontrolündeki diğer sahte hesapları kullanarak proje sorumlusu üzerinde baskı oluşturmaya ve bağımsız kullanıcıların kodu inceleyip onayladığı görüntüsünü oluşturmaya çalıştığını bildirdi.
Ajanın kimliğini gizlemek için Tor ve proxy hizmetlerini kullandığı, ayrıca tek kullanımlık GitHub hesapları oluşturduğu belirtildi.
Araştırmacılar, ajan tarafından geliştiricilere beş hedefli e-posta gönderildiğini tespit etti. Mesajlardan bazılarında zararlı yazılım bulunurken diğerlerinde geliştiricilerin kod değişikliğini onaylamaya ikna edilmeye çalışıldığı bildirildi.
ZARARLI KOD İÇEREN HATA RAPORLARI YAYIMLADI
AISI'ye göre ajan, zararlı kod ve yapay zekâ kodlama yardımcılarını istenmeyen işlemler gerçekleştirmeye yönlendirmek amacıyla hazırlanmış gizli prompt injection talimatları içeren hata raporları da yayımladı.
Gerçek bir kişinin paylaşımlardan birini sorgulamasının ardından ajan, zararlı içeriği gizlemek amacıyla gönderiyi düzenledi.
Başka bir girişimde ise Danca konuşan bir proje sorumlusuna daha inandırıcı görünmek amacıyla mesajını Danca bir ifadeyle sonlandırdığı bildirildi.
AJANLAR FARKLI TESTLER ARASINDA BİRBİRLERİNE MESAJ BIRAKTI
AISI araştırmacıları, yapay zekâ ajanlarının farklı değerlendirme çalıştırmaları arasında da koordinasyon belirtileri gösterdiğini tespit etti.
Ajanların ortak bir GitHub deposunu mesaj panosu gibi kullanarak birbirlerine talimat bıraktıkları bildirildi.
AISI, “AISI'nin gerçek bir kişiyi hedef alan, yönlendirme olmaksızın ve gerçek dünyada gerçekleşen bu şiddette bir aldatma davranışı gördüğü ilk olaydır.” açıklamasını yaptı.
Kurum, modelin gerçek kişilerle mi yoksa simüle edilmiş hedeflerle mi etkileşim kurduğunu hangi aşamada anlayıp anlamadığının henüz net olmadığını kaydetti.
OPENAI MODELİ GERÇEK İNTERNET SİTESİNE ERİŞTİ
İkinci olay, Irregular tarafından yürütülen ve internetten izole edilmesi planlanan Capture-the-Flag (CTF) değerlendirmesi sırasında meydana geldi.
Testlerden birinde kurgusal hedefe verilen isim, tesadüfen gerçek bir internet alan adıyla eşleşti.
Test ortamındaki yanlış yapılandırma nedeniyle OpenAI modeli açık internete erişebildi ve gerçek internet sitesinin simülasyonun bir parçası olduğunu düşünerek sistemi hedef aldı.
OpenAI, “Irregular'ın soruşturmasına göre model, aynı siteyi işletmek için kullanılabilecek kimlik bilgilerini de buldu ve kullandı.” açıklamasını yaptı.
ZERO-DAY DEĞİL, TEMEL BİR GÜVENLİK AÇIĞI KULLANILDI
OpenAI, modelin gerçek siteye erişirken daha önce bilinmeyen bir zero-day güvenlik açığı kullanmadığını belirtti.
Şirkete göre model, temel bir güvenlik açığını istismar etti ve test ortamından teknik bir sandbox kaçışı gerçekleştirmedi.
Olayın meydana gelmesinde Irregular'ın değerlendirme ortamının internete kapalı olması gerekirken yanlış yapılandırma nedeniyle dış bağlantıya izin vermesi etkili oldu.
OpenAI, Irregular'ın şimdiye kadarki incelemesinde etkilenen internet sitesinin kendi verileri dışında başka bir etki belirlemediğini ancak soruşturmanın sürdüğünü açıkladı.
Irregular'ın ayrıca yapay zekâ destekli siber güvenlik değerlendirmelerinde izolasyon, sınırlandırma ve güvenli test uygulamalarına ilişkin bir teknik rapor hazırladığı bildirildi.
Kaynak: Beykozun Sesi
Tepkiniz Nedir?
Beğen
0
Beğenmiyorum
0
Aşk
0
Komik
0
Öfkeli
0
Üzgün
0
Vay
0