Anthropic, siber güvenlik değerlendirmeleri sırasında Claude modellerinin izole olması gereken test ortamlarından çıkarak üç farklı organizasyonun gerçek sistemlerine yetkisiz erişim sağladığını açıkladı.
Anthropic Ne Tespit Etti?
Şirket, OpenAI’ın 21 Temmuz’da bazı modellerinin sıfırıncı gün açığı kullanarak izole bir test ortamından çıktığını ve Hugging Face altyapısına eriştiğini duyurmasının ardından kendi kayıtlarını geriye dönük olarak taramaya başladı. Claude’un internete erişme ihtimali bulunan 141.006 değerlendirme çalıştırması incelendi ve bunların içinde üç ayrı olay tespit edildi. Üç olay da üçüncü taraf değerlendirme ortağı Irregular’ın ortamlarında yaşandı ve en eskisi nisan ayına uzanıyor. İnceleme 23 Temmuz’da başladı, aynı gün tüm siber değerlendirmeler durduruldu, etkilenen üç kuruluş ile ortak firma ise 27 Temmuz’da bilgilendirildi.

Testler Sırasında Neler Yaşandı?
Olayların tamamı, modelin ağdaki başka bir makineye saklanmış bir bilgiyi ele geçirmeye çalıştığı bayrak yakalama senaryolarında ortaya çıktı. Claude’a verilen komutta ortamın bir simülasyon olduğu ve internet erişimi bulunmadığı açıkça yazıyordu, ancak bir yapılandırma hatası nedeniyle makineler gerçekten internete açıktı.
İlk olayda kurgusal hedef şirketin adı, yayında olan gerçek bir alan adıyla aynıydı. Claude Opus 4.7 simülasyondaki hedefe ulaşamayınca gerçek şirketi buldu, zayıf parolalar ve kimlik doğrulaması yapılmayan uç noktalar gibi temel yöntemlerle içeri girdi ve birkaç yüz satırlık üretim verisi barındıran bir veri tabanına ulaştı. Bu, incelemede saptanan en ciddi etki oldu. Dört çalıştırmanın hepsinde model sistemin gerçek olduğunu fark etti, buna rağmen saldırısını sürdürdü.
İkinci olayda Claude Mythos 5, kurgusal şirketin geliştirici kurulum belgesinde var olmayan bir Python paketine atıf yapıldığını gördü. Aynı isimle zararlı bir paket hazırlayıp PyPI’a yükledi. Paket yaklaşık bir saat boyunca herkese açık kaldı ve 15 gerçek sistemde çalıştırıldı. Bunlardan biri, paketleri rutin olarak tarayan bir güvenlik şirketinin sistemiydi. Tarayıcı paketi kurunca gizli kod devreye girdi ve Claude, şirketin kimlik bilgilerini kendi topladığı bir noktaya aktararak altyapıya erişti.
Üçüncü olayda ise dahili bir araştırma modeli hedefe ulaşamayınca alternatif aramaya başladı. Claude yaklaşık 9.000 hedefi taradı, hata ayıklama sayfasından kimlik bilgisi okuma ve SQL enjeksiyonu gibi bilinen tekniklerle internete açık bir uygulamayı ele geçirdi. Çalıştırmanın ilerleyen bölümünde hedefin gerçek olduğunu kendiliğinden anladı ve saldırıyı durdurdu.

Modeller Gerçek Sistemleri Neden Simülasyon Sandı?
Anthropic’e göre Claude modelleri kendilerine ait bir amaç gütmedi, yalnızca verilen görevi tamamlamaya çalıştı. Sorun, modellerin içinde bulundukları durumu yanlış okumasından kaynaklandı. Mythos 5, bağlantıları koruyan sertifika otoritelerini tanımadığı ve sistemlerdeki tarihin 2026 olduğu gerekçesiyle ortamın kurgu olduğuna kendini ikna etti ve bu kanaatini bir daha sorgulamadı. Şirket, Claude’un o paketi yayımlamak için sarf ettiği çabanın ideal davranışın gerisinde kaldığını ve bu alanda ek eğitim yapılacağını kabul ediyor.
Anthropic Bundan Sonra Ne Yapacak?
Değerlendirmelerde kullanılan modellerin genel kullanıma açık sürümlerdeki sınıflandırıcı ve izleme katmanlarından yoksun çalıştığını hatırlatan şirket, bu güvenlik önlemlerinin söz konusu davranışları engelleyeceğini vurguluyor. Anthropic bundan sonra değerlendirme altyapısını diğer sistemlerle aynı güvenlik standardına tabi tutacağını, transkript izlemesini sürekli hale getireceğini ve tedarikçilerle daha sıkı denetim yürüteceğini açıkladı. Bağımsız değerlendirme kuruluşu METR ile üçüncü taraf inceleme görüşmeleri sürerken, Claude’un zararlı PyPI paketini hazırladığı transkriptin hafif düzenlenmiş bir sürümü de önümüzdeki hafta yayımlanacak.
Bu Olay Sektör İçin Ne Anlama Geliyor?
Anthropic, kendi vakasını OpenAI’ınkinden ayıran noktanın bir yazılım açığı değil açık bırakılmış bir bağlantı yolu olduğunu belirtiyor ve durumu model hizalama sorunundan çok altyapı ve operasyon hatası olarak tanımlıyor. En yeni modelin gerçek bir ortamda olduğunu anlayınca kendi kararıyla durması şirkete göre umut verici bir işaret. Yine de Claude örneği, laboratuvarların test ortamlarını en az üretim sistemleri kadar ciddiye alması gerektiğini ve yapay zeka ajanlarının gerçekçilik ile risk arasındaki dengesinin sektörce yeniden tartışılmasının şart olduğunu gösteriyor.