Anthropic, üç farklı Claude modelinin siber güvenlik değerlendirmeleri sırasında test ortamlarının dışındaki gerçek sistemlere ulaştığını ve üç ayrı kuruluşun altyapısına yetkisiz erişim sağladığını açıkladı.
Şirketin 30 Temmuz 2026 tarihli resmî açıklaması, OpenAI modellerinin Hugging Face altyapısına erişmesiyle sonuçlanan güvenlik vakasının ardından başlatılan geniş çaplı geriye dönük incelemeye dayanıyor.
İncelemede üç model öne çıktı
Anthropic, Claude modellerinin teorik olarak internete ulaşabileceği 141 bin 6 değerlendirme çalışmasını inceledi. Bu incelemede altı ayrı çalışmaya yayılan üç güvenlik vakası bulundu. Vakaların her birinde farklı bir Claude modeli yer aldı:
- Claude Opus 4.7
- Mythos 5
- Kamuya sunulması planlanmayan bir araştırma modeli
En eski vakanın nisan ayına dayandığı belirtildi.
Simülasyon denildi, internet açık bırakıldı
Modellere verilen sistem talimatında değerlendirme ortamının bir simülasyon olduğu ve açık internete erişim bulunmadığı belirtilmişti.
Ancak Anthropic ile üçüncü taraf değerlendirme ortağı Irregular arasındaki yanlış anlaşılma nedeniyle ortamdan gerçek internete ulaşılabilen bir yol açık kaldı.
Claude modellerine “capture the flag” türünde siber güvenlik görevleri verilmişti. Bu görevlerde modelin, kurgu bir ağdaki gizli veriyi bulması ve sistemlere sızarak hedefe ulaşması bekleniyordu.
Modeller gerçek internetteki sistemlerle karşılaştıklarında, kendilerine internet erişimi olmadığı söylendiği için bu sistemleri değerlendirme senaryosunun parçası sandı.
Anthropic’e göre modeller aşağıdaki açıklardan yararlandı:
- Zayıf parolalar
- Kimlik doğrulaması bulunmayan uç noktalar
- Temel yapılandırma eksiklikleri
Karmaşık veya daha önce bilinmeyen bir güvenlik açığı bulmadılar.
Modeller aynı davranışı göstermedi
Üç modelin gerçek sistemlerle karşılaştıktan sonraki davranışları aynı değildi.
Claude Opus 4.7, bazı çalışmalarda gerçek internette bulunduğuna ilişkin işaretleri fark etmesine rağmen görevi sürdürdü. İki durumda gerçek kuruluşun değerlendirme senaryosunun parçası olabileceğini varsayarak saldırıya devam etti.
Anthropic’in en yeni test modeliyse hedefin gerçek olduğunu anladığında görevi durdurdu.
Şirket, hiçbir modelin kendisini test ortamından “kaçırmaya”, kendi kopyasını çıkarmaya veya değerlendirme hedefinden bağımsız bir saldırı yürütmeye çalışmadığını belirtiyor.
Standart güvenlik önlemleri kapalıydı
Bu değerlendirmelerde kullanılan modeller, halka açık Claude sürümlerindeki standart kötüye kullanım sınıflandırıcıları ve gerçek zamanlı izleme sistemleri olmadan çalıştırıldı.
Bunun nedeni testlerin, güvenlik filtrelerinin arkasındaki temel modelin azami siber yeteneğini ölçmeyi amaçlamasıydı.
Değerlendirme altyapısı Anthropic’in şirket içi hassas sistemlerinden ve müşteri verilerinden ayrı tutuluyordu. Açıklamaya göre vakalarda Anthropic müşterilerinin verileri etkilenmedi.
İki kuruluş olayı fark etmemişti
Anthropic, geriye dönük incelemeyi 23 Temmuz’da başlattı ve şüpheli kayıtları gördükten sonra bütün siber değerlendirmeleri aynı gün durdurdu.
Üç olay 24 Temmuz’da belirlendi. Şirket, değerlendirme ortağı Irregular ile etkilenen kuruluşları 27 Temmuz’da bilgilendirdi.
Ulaşılabilen iki kuruluşun, Anthropic haber verene kadar yetkisiz faaliyeti tespit etmediği belirtildi. Üçüncü kuruluşa ulaşma çalışmaları açıklama sırasında devam ediyordu.
OpenAI vakasıyla aynı değil
Claude olayları, OpenAI modellerinin Hugging Face altyapısına erişmesiyle sonuçlanan vakaya benziyor; ancak teknik nedenleri aynı değil.
OpenAI vakasında modeller daha önce bilinmeyen bir güvenlik açığını kullanarak yalıtılmış ortamdan çıkmıştı.
Claude vakalarında ise internet erişimi değerlendirme yapılandırmasındaki açık yol nedeniyle baştan mümkündü. Modeller güçlü bir izolasyonu kırmadı; yanlış yapılandırılmış ortamda gerçek sistemleri simülasyonun parçası sandı.
Anthropic bu nedenle olayları model uyum probleminden çok test düzeneği, operasyonel kontrol, ağ erişiminin doğrulanması ve gerçek zamanlı izleme başarısızlığına daha yakın görüyor.
Neden önemli?
Olaylar, güçlü modellerin güvenliğini yalnızca modele verilen talimatlarla sağlamanın yeterli olmadığını gösteriyor.
Bir sisteme “internete erişimin yok” demek, teknik olarak internet yolunu kapatmanın yerini tutmuyor. “Bu ortam simülasyondur” talimatı da modelin gerçek ağlara erişmesini fiziksel olarak engellemiyor.
Güvenli siber değerlendirmeler için aşağıdaki kontroller gerekiyor:
- Ağ çıkışlarının bağımsız biçimde doğrulanması
- Test hedeflerinin açıkça sınırlandırılması
- Olağan dışı trafiğin gerçek zamanlı izlenmesi
- İşlem kayıtlarının düzenli denetlenmesi
- Kritik davranışlarda otomatik durdurma mekanizmaları
- Üçüncü taraf değerlendirme ortaklarının aynı güvenlik standardını karşılaması
Olay, gündelik Claude kullanıcılarının hesaplarının doğrudan tehlikede olduğu anlamına gelmiyor. Ancak şirketlerin güçlü modelleri araç, ağ ve sistem erişimiyle test ederken klasik yazılım güvenliğinden daha sıkı sınırlar uygulaması gerektiğini ortaya koyuyor.