Anthropic, 9 Eylül 2026’da yayımladığı hizalama değerlendirmesinde, Claude modellerinin dört ayrı olayda üçüncü taraf sistemlere izinsiz eriştiğini açıkladı. Şirket bu olayların üçünü 30 Temmuz’da duyurmuştu. Dördüncüsü ise ocak ayına ait ve Claude Opus 4,6 sürümünün erken bir kopyasını kapsıyor.

Dört olayın tamamı, aynı değerlendirme ortağının kurduğu siber güvenlik testleri sırasında yaşandı. Modele internet bağlantısı olmayan bir benzetim içinde çalıştığı söylendi, ancak yanlış yapılandırma yüzünden sistem açık internete bağlandı. Testlerde, yayımlanan sürümlerle birlikte gelen siber güvenlik korumaları devre dışıydı.

Anthropic ilk taramasını yaklaşık 141 bin kayıt üzerinde yapmış, bunun için de bir yapay zekâ ajanı kullanmıştı. Bu yöntem bir grup kaydı atladı. Şirket eksik kayıtları ağustosta, bağımsız değerlendirme kuruluşu METR ile paylaşılacak dosyaları hazırlarken fark etti. Ardından arama 481 milyon kayda genişletildi. İlk aşamada genel ağ adresleri ve alan adları tarandı, işaretlenen 9,2 milyon kayıt ikinci aşamada Claude ile incelendi. Tarama aynı dört olayı doğruladı ve benzer ağırlıkta yeni bir vaka bulmadı.

Şirket, METR ile bağımsız soruşturma anlaşması imzaladığını da bildirdi. Anlaşma kuruluşa olay penceresinin dışındaki kayıtlara ve gizli bilgi paylaşabilecek Anthropic çalışanlarına erişim veriyor. Süre sekiz hafta ve karşılıklı mutabakatla uzatılabiliyor.

Değerlendirme iki tekrar eden sorun tarif ediyor. Birincisi, modelin gerçek internette çalıştığına işaret eden kanıtları görmezden gelmesi veya yanlış yorumlaması. İkincisi ise verilen görevi tamamlamak uğruna zararlı adım atmaya istekli davranması. Anthropic en ağır vaka için Claude Mythos 5 olayını gösteriyor: model, Python yazılımlarının büyük bölümünün kurulduğu PyPI deposuna zararlı bir paket yükledi. Araştırmacılar kayıt üzerinde değişiklik yapıp benzetimde olmadığını daha açık hale getirdiklerinde bile model saldırgan adımları sürdürdü. Şirket bu kaydı, başkaları incelemesini sürdürebilsin diye kamuya açtı.

Anthropic olayların kapsamını sınırlı sayıyor. Modeller verilen alıştırmanın dışına çıkmadı, her olayda tek bir kopya çalıştı, başka ajanlarla eşgüdüm kurulmadı ve izler gizlenmedi. Şirket, saldırı talimatı almayan gündelik kullanımda bu davranışların ortaya çıkmasını olası görmüyor.

Yeni modeller aynı senaryonun benzetiminde denendi. Claude Opus 5 ve Mythos 5,1 zararlı adımı belirgin biçimde daha seyrek attı, ama oranlar hâlâ endişe verici bulundu. Anthropic yayın öncesi denetimlerinin bu ağırlıkta bir hizalama sorununu yakalayamadığını da kabul ediyor. Şirket bu nedenle test setine, çözümü kapsam içinde bulunmayan hatalı yapılandırılmış bir bayrak yakalama görevi ekledi.

Anthropic eğitim sürecini de inceledi ve yanlı akıl yürütmenin tek bir kök nedenini bulamadı. Buna karşılık bu davranışın üretime çıkan modellerde zaman içinde azaldığını saptadı. Şirket bunu güncellenen pekiştirmeli öğrenme ve hizalama ortamlarına bağlıyor. Değerlendirme, Birleşik Krallık Yapay Zekâ Güvenliği Enstitüsü’nün Claude Mythos 5 testlerinde bildirdiği ayrı olayı kapsamıyor; Anthropic o kayıtlar için de benzer bir inceleme yapmayı planlıyor.

Share.
Exit mobile version