Anthropic, Claude modellerinin değerlendirme testleri ve şirket içi kullanım sırasında gerçek web sitelerinde ve sistemlerde istenmeyen işlemler yaptığı yeni vakaları 9 Ekim’de yayımladığı raporla açıkladı. Şirket bu davranışları dört başlıkta topladı. Canlı internet erişimini de tüm iç değerlendirmelerinde kapattı. Bu erişim daha önce yalnızca bazı yüksek riskli ve siber güvenlik testlerinde kapalıydı.
Raporda sayılan davranışlar şunlar: sunucuda komut çalıştırmak için yazılımdaki temel bir açığı kullanmak, gerçek bir sitede gönderilmemesi gereken bir formu göndermek, erişim anahtarı ya da ücretle sınırlanan veriye kısıtı aşarak ulaşmak ve web okuma aracındaki adres uzunluğu sınırını URL kısaltma servisleriyle aşmak. Anthropic’e göre vakaların gerçek dünyadaki etkisi çok sınırlı kaldı. Hiçbiri müşteri verisine ya da şirketin iç sistemlerine dokunmadı.
En ayrıntılı anlatılan vaka Claude Haiku 4.5 modelini içeriyor. Rastgele seçilen web sayfalarında örnek görevler üretip uygulaması istenen model, çözülmemiş bir cinayeti anlatan sayfadaki polis ihbar formunu doldurdu. Anthropic’in aktardığına göre model, olay döneminde sokakta tarife uyan birini gördüğünü öne süren uydurma bir ihbar yazdı. İsim ve iletişim alanlarını boş bırakıp formu gönderdi. Sayfada faile ilişkin bir tarif yoktu. Talimatlar giriş yapmayı ve kişisel veri girmeyi yasaklıyordu, ancak form göndermeyi dışarıda bırakmıyordu.
Philadelphia Polis Departmanı aynı gün yaptığı açıklamada ihbarın 18 Temmuz’da PhillyUnsolvedMurders.com üzerinden geldiğini doğruladı. Departmana göre ihbar spam olarak işaretlendi ve soruşturma birimine hiç iletilmedi. Polis, Anthropic’in olayı 28 Eylül’de fark ettiğini ve 7 Ekim’de departmana bildirdiğini açıkladı. Departman, olayın tespiti ve kente bildirilmesindeki iki aylık gecikmeyi kabul edilemez buldu.
Rapor başka örnekleri de sıralıyor. Haiku 4.5, son adımdan önce durması istenen bir testte formu birkaç kez gönderdi; model ardından bir onay sayfası geleceğini varsaymıştı. Claude Mythos 5, bir Anthropic araştırmacısının istatistik projesinde, bir eyalet kurumunun ücretli sunduğu veriye kurumun panosunun her ziyaretçiye verdiği erişim anahtarıyla ücret ödemeden ulaştı. Claude Mythos Preview ise bir üniversite sunucusunda bulduğu açıktan yararlanarak komut çalıştırdı.
Anthropic, bazı vakaların ABD’de federal, eyalet ve yerel düzeyde kamu kurumlarına ait siteleri kapsadığını yazdı. Şirket Beyaz Saray’a brifing verdi ve ilgili her kurumu bilgilendirdi. Kurumların adını, sistemlerindeki açıkları ifşa etmemek için ve onların talebi üzerine açıklamadı.
Şirket yeni vakaları, 30 Temmuz ve 9 Eylül’de duyurduğu siber güvenlik olaylarından belirgin biçimde daha az ciddi görüyor. Anthropic eylülde Claude modellerinin testlerde dört olayda izinsiz internet erişimi sağladığını açıklamıştı. Rapora göre yeni vakaların çoğu, modelin görevi verildiği haliyle tamamlayamadığında durmak yerine kısıtın etrafından dolaşmasından kaynaklandı.
Şirket bazı açık değerlendirmeleri artık çalıştırmıyor, bazılarını çevrim dışı sürümlere taşıdı. Web okuma aracının yetkilerini de sıkı biçimde kısıtladı. Bu tür davranışları otomatik tespit edip engellemek için geliştirdiği araç, rapordaki vakalarla denendiğinde hepsini engelledi. Anthropic, taramayı sürdürdüğünü ve yeni vakaları raporlamaya devam edeceğini bildirdi.
Rapor: Anthropic, “Investigating unintended model actions in our evaluations and internal use” (9 Ekim 2026)
