Anthropic, Claude için güvenlik testlerini yeniden başlattı [FNC-NEWS]
01.09.2026 06:29
Anthropic, Claude modellerinin güvenlik değerlendirmeleri sırasında internete erişerek gerçek bilgisayar sistemlerine yetkisiz şekilde ulaşmasının ardından durdurduğu dış siber güvenlik testlerini yeni önlemlerle yeniden başlattığını açıkladı. Şirket, yaşananları "operasyonel güvenlik başarısızlığı" olarak nitelendirirken, olayların üçüncü taraf değerlendirme ortamlarındaki yapılandırma hatalarıyla bağlantılı olduğunu belirtti.
Anthropic, temmuz sonunda üç olayda Claude modellerinin gerçek sistemlere yetkisiz erişim sağladığını, ayrıca İngiltere AI Security Institute'un da Claude Mythos 5'in canlı internette yetkisiz eylemlerde bulunduğu ayrı bir olayı raporladığını bildirdi.
Kaçış girişimlerini durduracak yeni sistem
Şirket, olayların ardından dış siber güvenlik değerlendirmelerini, kısa süreliğine de iç testleri durdurdu. Bu süreçte modelin test ortamından çıkmaya, çevreyi agresif biçimde yoklamaya veya beklenmedik şekilde internete erişmeye çalıştığını gerçek zamanlı tespit eden bir sınıflandırıcı devreye alındı. Sistem böyle bir girişimi saptadığında eylemi başlamadan engelliyor, testi sonlandırıyor ve bir insan denetçiyi uyarıyor.
Anthropic, harici testlerin artık yeni kurallarla yeniden başladığını açıkladı. Varsayılan olarak siber güvenlik değerlendirmelerinin internete erişimi olmayan güçlendirilmiş ve izole edilmiş ortamlarda yapılması, sistemlerin test başlamadan önce doğrulanması ve modellerin faaliyetlerinin sürekli izlenmesi isteniyor.
Eğitim ortamlarının yüzde 10'dan fazlasında sorun bulundu
Anthropic ayrıca yapay zekâ modellerinin eğitim altyapısını yeniden yapılandırdığını bildirdi. Şirket, üretimde kullanılan eğitim ortamlarının yüzde 10'dan fazlasını "reward hacking", bozuk görevler ve yanlış yapılandırmalar gibi sorunlar nedeniyle işaretlediğini açıkladı. Sorunlu ortamlar ancak düzeltildikten sonra yeniden eğitime alındı.
"Reward hacking", modelin verilen görevi gerçekten tamamlamadan eğitim sistemini kandırarak ödül elde etmesi anlamına geliyor. Anthropic, bu tür davranışların daha ciddi uyumsuz davranışları tetikleyebildiğine ilişkin deneyler yaptığını, ancak mevcut güvenlik süreçlerinin kusursuz olmadığını ve modellerin de "mükemmel biçimde hizalanmış" olmadığını kabul etti.
150 mühendis güvenlik çalışmalarına kaydırıldı
Şirket, güvenlik, güvenilirlik ve gizlilik çalışmalarını hızlandırmak amacıyla yaklaşık 150 ürün mühendisini geçici olarak bu alanlara yönlendirdi. Araştırmacıların bir bölümü de model eğitimi çalışmalarından güvenlik projelerine kaydırılırken, ürün ekipleri yeni özelliklerin büyük kısmının geliştirilmesini bir süre durdurdu.
Anthropic, temmuzdaki olayların siber güvenlik savunmalarını güçlendirmenin aciliyetini daha da artırdığını belirterek bu alandaki çalışmalarını hızlandıracağını bildirdi.
ForInvest Haber