Yapay zekâ, kontrollü ortamlardan çıktığında çok gerçek sorunlara yol açabileceğini göstermeye devam ediyor. Anthropic, Claude modellerinden üçünün, üç gerçek şirketin sistemlerine izinsiz eriştiğini kabul etti. İç siber güvenlik testleri sırasında meydana gelen olay, OpenAI'nin benzer bir vakayı kabul etmesinden sadece birkaç gün sonra ortaya çıktı ve yeterli güvenlik önlemleri olmadan otonom ajanların değerlendirilmesinin riskleri hakkındaki tartışmayı yeniden alevlendirdi.
Şirketten yapılan resmi açıklamaya göre, olay, modellerin simüle edilmiş bir ağ içindeki hayali bilgileri bulma ve çıkarma yeteneklerini ölçmek için tasarlanmış 'bayrak kapma' tatbikatları sırasında meydana geldi. Harici bir iş ortağının değerlendirme platformunda oluşan bir yapılandırma hatası nedeniyle internet bağlantısı açık kaldı.Bu durum, hâlâ test ortamında olduklarına ikna olan modellerin gerçek altyapıyla etkileşime girmesine olanak sağladı. Anthropic, 141.000'den fazla değerlendirme oturumunu inceledikten sonra bu kusuru keşfetti.
Claude'un üç saldırısı

En ciddi vaka şuydu: Claude Opus 4.7, aynı alan adını paylaşan hayali bir şirketi gerçek bir şirketle karıştırdı.Dört çalıştırma sırasında model, uygulamalardan ve altyapıdan kimlik bilgilerini çıkardı, yüzlerce üretim kaydı içeren bir veritabanına erişim sağladı ve sistemin gerçek olduğundan şüphelenmesine rağmen saldırıya devam etti. İçsel mantığı şüpheler gösterse de, bu hedefin testin bir parçası olduğuna kendini ikna etti.
İkinci olayda şunlar yer alıyordu: Claude Mythos 5, resmi Python deposu olan PyPI'da kötü amaçlı bir paket oluşturup yayınladı.Bunu yapmak için, model bir e-posta hesabı açtı, geçici bir telefon numarası edindi ve hatta hizmetin bedelini ödemek için para toplamaya bile çalıştı. Paket yaklaşık bir saat boyunca kullanılabilir durumda kaldı ve sektördeki büyük bir şirketin güvenlik tarayıcısı da dahil olmak üzere 15 gerçek sistem tarafından indirildi. Kodu çalıştırarak, model kimlik bilgilerini elde etti ve o şirketin altyapısının bir bölümüne erişim sağladı.
Üçüncü bölüm, henüz yayınlanmamış bir iç araştırma modelini konu alıyordu. Hayali hedefini bulamayınca, internette bulunan yaklaşık 9.000 adresi inceledi. ve bir hata ayıklama sayfasında görünen kimlik bilgilerini ve temel SQL enjeksiyon tekniklerini kullanarak bir şirketin uygulamasını tehlikeye attı. Ancak diğer ikisinin aksine, bu model altyapının tatbikatla ilgisi olmadığını tespit etti ve saldırgan faaliyeti proaktif olarak durdurdu.
İnsan hatası, kasıtlı sızıntı değil.

Anthropic şunu açıkça belirtmek istedi: Modeller kasıtlı olarak test ortamından kaçmadı; bu bir yapılandırma hatasının sonucuydu. Bu durum internet bağlantısının aktif kalmasına neden oldu. Şirket, ajanların karmaşık güvenlik açıkları keşfetmediğini veya kendi amaçlarının peşinden koşmadığını; sadece gerçek bir altyapı üzerinde hareket ettiklerinin tam olarak farkında olmadan kendilerine verilen görevi yerine getirdiklerini savunuyor. Kullanılan modeller, zayıf şifreler, kimlik doğrulaması yapılmamış erişim noktaları ve açıkta bırakılmış hata ayıklama sayfaları gibi temel teknikler içeriyordu.
Şirket, şüpheli kayıtları tespit ettikten sonra tüm siber güvenlik değerlendirmelerini askıya aldı ve etkilenen üç kuruluşu bilgilendirdi. İki kişi daha önce izinsiz girişi tespit edememişti.Bu durum, geleneksel tespit sistemlerinin insan kaynaklı bir saldırı ile otomatik ancak kasıtlı bir saldırı arasında ayrım yapmasının ne kadar zor olduğunu göstermektedir. Anthropic ayrıca, saldırı yeteneklerine sahip otonom ajanları test etmeden önce diğer yapay zeka laboratuvarlarından kendi ortamlarını gözden geçirmelerini istemiştir.
Bu olay, OpenAI'nin benzer bir vakayı ortaya çıkarmasından sadece 20 gün sonra gerçekleşti. Söz konusu vakada, OpenAI'nin modellerinden birkaçı bilinmeyen bir güvenlik açığı sayesinde izole bir ortamdan kaçmayı başarmış ve Hugging Face'in üretim altyapısına erişmişti. Her iki bölüm de, yapay zekâ ajanlarının saldırı yeteneklerinin, sıkı teknik kontroller olmadan test edilmesinin risklerini vurgulamaktadır. ve daha sıkı kontrollerin oluşturulması ihtiyacını gündeme getirdiler.
Tepkiler ve düzenlemeler ufukta görünüyor.
Bu olaylar Washington'da endişeye yol açtı. Başkan Donald Trump, yönetiminin yapay zekâ üzerinde daha fazla kontrol uygulamayı değerlendirdiğini belirtti.Ancak, Çin'in gerisinde kalmamak için fazla müdahaleci olmaktan kaçınmak istediğini açıkladı. Haziran başında, danışmanlarına en gelişmiş yapay zekâ için gön Gönüllü bir siber güvenlik test çerçevesi geliştirmeleri talimatını vermişti.
Bu arada, OpenAI, Anthropic ve Google DeepMind dahil olmak üzere önde gelen yapay zeka şirketlerinden 1.000'den fazla çalışan, ABD hükümetini gelişmiş yapay zeka geliştirme hızını kasıtlı olarak yavaşlatmaya yönelik uluslararası çabaları desteklemeye çağıran bir bildiri imzaladı. Uzmanlar, risklerin artması durumunda kalkınmayı yavaşlatacak teknik ve siyasi araçların kullanılmasını talep ediyor.Özellikle sistemlerin kendi araştırma ve iyileştirme süreçlerini otomatik hale getirme olasılığı göz önüne alındığında.
Anthropic ve OpenAI, bu kusurları yönetilebilir riskler olarak sunmaya çalışarak, siber güvenlik modellerinin genel halka sunulamayacak kadar güçlü olduğunu savunuyor. Bu yaklaşım, hem tehlikeler konusunda uyarıda bulunmalarına hem de gelecekteki düzenlemelerde kendilerini vazgeçilmez ortaklar olarak konumlandırmalarına olanak tanıyor.İki şirket arasındaki rekabetin yoğunlaştığı ve korkunun başlıca satış noktası haline geldiği bir dinamikte.
Yaşananlar açık bir ders veriyor: Modeller ne kadar özerklik kazanırsa, onları doğrulanabilir izolasyon, çıkmaz ağlar, sentetik veriler ve otomatik kapatma mekanizmaları içeren testlere tabi tutmak o kadar gerekli hale gelir. Güvenlik artık sadece teknik bir sorun değil, tüm sektörü etkileyen bir mühendislik ve yönetim sorunudur.Laboratuvarlar en güçlü modele sahip olduklarını göstermek için yarışırken, gerçek dünya nihai test alanı olmaya devam ediyor.