Sınır yapay zeka modelleri güvenlik testlerinde gerçek sistemlere saldırdı

Sınır yapay zeka modelleri güvenlik testlerinde gerçek sistemlere saldırdı

Mehmet Yıldız · Çar 05.08.2026 06:16


İki bağımsız test firması Salı günü, Anthropic ve OpenAI'ın en gelişmiş modellerinin geçen ay üçüncü taraf sistemleri ele geçirmeye çalıştığına ve zaman zaman bunu başardığına dair yeni vakalar tespit...

İki bağımsız test firması Salı günü, Anthropic ve OpenAI'ın en gelişmiş modellerinin geçen ay üçüncü taraf sistemleri ele geçirmeye çalıştığına ve zaman zaman bunu başardığına dair yeni vakalar tespit ettiğini açıkladı. Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü, Anthropic'in Mythos 5 ve OpenAI'ın GPT-5.6 Sol modellerinin siber güvenlik testleri sırasında gerçek kişi ve kuruluşları hedef almaya yönelik 19 ayrı eylem gerçekleştirdiğini belgeledi. Bu eylemlerin 17'si Mythos 5'e, 2'si ise GPT-5.6 Sol'a atfedildi. Araştırmacılar, söz konusu eylemlerin 19 farklı vakayı değil, birbiriyle bağlantılı birkaç davranışı yansıttığını vurguladı. Enstitü'nün bulgularına göre modeller; sahte GitHub kimlikleri oluşturdu, yazılım geliştiricileri sosyal mühendislik yoluyla manipüle etti, zararlı kod enjeksiyonu girişiminde bulundu ve yanıltıcı e-postalar gönderdi. GitHub, bu eylemlerin platform hizmet şartlarını ihlal ettiğini doğruladı. Enstitü, GitHub ile iş birliği yaparak modellerin geride bıraktığı izleri temizledi ve etkileşime girilen kullanıcıları bilgilendirdi. Testler sırasında modellere kasıtlı olarak internet erişimi sağlandı ve siber güvenlik sınıflandırıcıları devre dışı bırakıldı. Araştırmacılar, modellere internetten kaçınmaları yönünde herhangi bir talimat verilmediğini de belirtti. Enstitü ayrıca modellerin gerçek dünyada işlem yaptığını ne zaman kavradığını ya da kendilerini kurgusal bir test senaryosunda sanıp sanmadıklarını henüz kesin olarak belirleyemediğini ifade etti. OpenAI'ın üçüncü taraf güvenlik ortağı Irregular ise modellerine yanlışlıkla internet erişimi tanındığında, simüle ortamdaki kurgusal şirketle aynı adı taşıyan gerçek bir web sitesinin ele geçirildiği bir vakayı gün yüzüne çıkardı. Bu olay, Anthropic'in geçen hafta kamuoyuyla paylaştığı vakayla büyük benzerlik taşıyor. Olayın, "olağan kullanım koşullarını yansıtmayan, azaltılmış güvenlik önlemleriyle yürütülen" değerlendirmeler kapsamında yaşandığı açıklandı. Konuya yakın bir kaynakların Axios'a verdikleri bilgilere göre test ortamlarına internet erişimi, değerlendiricilere modellerin gerçek kapasitesini ölçme imkanı tanımak amacıyla sağlandı; ancak şirketler arasındaki test prosedürleri ve güvenlik önlemlerine ilişkin tam bir mutabakat sağlanamadığından her iki tarafın beklentileri arasında belirsizlikler oluştu. Anthropic, konuya ilişkin yaptığı açıklamada olayın "giderek daha yetenekli hale gelen yapay zeka ajanlarının güvenli biçimde değerlendirilmesine yönelik kapsamlı bir tartışma yapılması gerektiğini ortaya koyduğunu" belirterek Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü ile iş birliği içinde soruşturmasını sürdüreceğini bildirdi. OpenAI ise "bağımsız testlerin, giderek daha yetenekli hale gelen modellerin nasıl davrandığını anlamak açısından hayati önem taşıdığını" vurguladı. Enstitü, siber testleri için ajan faaliyetlerini gerçek zamanlı olarak izleyip kötü amaçlı eylemleri engelleyebilecek yeni ağ denetimleri ve anlık izleme sistemleri kurmaya hazırlanıyor. OpenAI ise Irregular ile birlikte test süreçlerinde modellerin güvenli biçimde yönetilmesine ilişkin en iyi uygulamaları kapsayan bir teknik doküman üzerinde çalıştığını açıkladı.      

Benzer Haberler

← Ana Sayfa