Anthropic, Çinli Z.ai tarafından geliştirilen GLM-5.3 modelinin siber güvenlik risklerine dikkat çekti. Şirketin Frontier Red Team ekibi, modelin yazılım açıklarından yararlanan saldırı araçları geliştirebildiğini belirledi. 29 Eylül’de yayımlanan araştırma, güvenlik önlemlerinin de test ortamında aşılabildiğini gösterdi.
GLM-5.3 Testlerde Ne Kadar Başarılı Oldu?
Chrome’un V8 motorundaki bilinen açıkları değerlendiren ExploitBench testinde GLM-5.3, 410 denemenin 50’sinde çalışan saldırı kodu üretti. Claude Mythos Preview aynı testte 56 başarılı sonuç aldı. Bu karşılaştırma, belirli bir siber görevde iki modelin birbirine yakın performans gösterdiğini ortaya koydu.
Z.ai, GLM-5.3’ü 14 Ağustos’ta duyurdu. Şirket, güvenlik değerlendirmeleri ve güçlendirme çalışmalarının ardından model ağırlıklarını iki hafta sonra paylaşacağını açıkladı. CAISI raporu, ağırlıkların bu takvimle yayımlandığını doğruluyor.
Z.ai’nin açıklamasına göre model, GLM-5.2 ile aynı temel yapıyı kullanıyor. İyileştirmeler sonradan yapılan eğitim çalışmalarından geliyor. Şirket, kendi kodlama testinde yüzde 50 gelişme bildirdi. Güvenlik açığı tespitini ölçen CyberGym’de ise puanının yüzde 77,2’den yüzde 84,5’e çıktığını duyurdu. Bunlar geliştiricinin paylaştığı ölçümler.
Table.Media’nın haberine göre Z.ai, Anthropic’in iddialarını reddetti.

Güvenlik Önlemleri Neden Tartışılıyor?
GLM-5.3 açık ağırlıklı olarak sunuluyor. Yani kullanıcılar modeli indirip kendi sistemlerinde çalıştırabiliyor ve değiştirebiliyor. Anthropic’in deneylerinde modelin zararlı talepleri reddetme mekanizması zayıflatıldı. Bazı güvenlik testlerinde yüzde 90’ın üzerindeki ret oranı yaklaşık yüzde 3’e düştü. Bunlar kontrollü deneylerin sonuçları; gerçek saldırıların başarı oranını göstermiyor.
Bağımsız Değerlendirme Ne Söylüyor?
ABD Ulusal Standartlar ve Teknoloji Enstitüsü’ne bağlı CAISI, 17 Eylül’de yayımladığı değerlendirmede GLM-5.3’ü o tarihe kadar çıkan en güçlü siber yeteneklere sahip açık ağırlıklı model olarak nitelendirdi.
Kurum, güvenlik açığı bulma ve bu açıkları kullanma becerilerini dört farklı testte ölçtü. Genel değerlendirmede GLM-5.3’ün, Amerikan modellerinin ulaştığı en ileri seviyenin yaklaşık dört ay gerisinde olduğu belirtildi. Karşılaştırmaya yalnızca onaylı kullanıcılara sunulan Amerikan modelleri de dahil edildi.
CAISI’nin incelemesi, GLM-5.3’ün tüm siber görevlerde Amerikan rakiplerini yakaladığı sonucunu desteklemiyor. Ayrıca testlerde, uygulanabildiği durumlarda Amerikan modellerinin siber güvenlik kısıtlamaları kapatıldı. Bu ayrıntı, sonuçların halka açık ürünlerle birebir aynı koşulları yansıtmadığını gösteriyor.
CAISI’nin açık kaynak projelerdeki bilinen kusurları kullandıran testinde modelin başarı oranı yüzde 7,7 oldu. Amerikan modellerinin en yüksek sonucu yüzde 23,2 olarak ölçüldü. Bu fark, modelin açık ağırlıklı rakipleri arasında öne çıkarken en ileri sistemlerin gerisinde kalabildiğini gösteriyor.
Savunma Tarafında Nasıl Kullanılıyor?
Anthropic, benzer yetenekleri savunma çalışmalarında kullanmak için nisan ayında Project Glasswing’i başlattı. Apple, Google, Microsoft ve diğer ortaklar, kritik yazılımlardaki açıkları bulup gidermek amacıyla Claude Mythos Preview’a erişim sağladı.
Proje, güçlü modellerin güvenlik ekiplerine de katkı sunabileceğini gösteriyor. GLM-5.3 hakkındaki uyarı ise bu yeteneklerin yaygınlaşmasıyla birlikte kötüye kullanımın önlenmesini yeniden gündeme taşıyor.