Anthropic, 17 Eylül 2026’da yayımladığı ölçüm yazısında Claude’un şirketin yapay zekâ Ar-Ge işlerinin yüzde 26’sını “yönettiğini” açıkladı. Şirkete göre görevlerin yüzde 90’ından fazlasında model ile insan ekip birlikte çalışıyor. Haberi Associated Press 18 Eylül’de duyurdu.

Anthropic’in R&D Automation Index’i, Epoch AI’nin AL0-AL5 otomasyon ölçeğini kullanıyor. AL3’te model “işbirliği” yapıyor: yakın insan yönlendirmesiyle işin büyük bölümünü tamamlıyor. AL4’te ise “yönetiyor”: üst düzey bir istemle görevi baştan sona bitiriyor, insan yalnızca denetliyor. Ağustos 2026 itibarıyla Claude hiçbir ölçülen alt kümede tam otonom çalışmıyor.

Şirket iki ölçüm daha paylaştı. Ajan denetiminde, Anthropic’in en çok kullandığı iç platformda aynı anda yaklaşık 30.000 ajan araştırma ve mühendislik işi yürütüyor. Bu ajanların eylemlerinin tamamı çevrimiçi monitörden geçiyor, tamamı çevrimdışı monitör tarafından kayda alınıyor. Ağustos 2026’da incelenen 1 milyardan fazla kararın yüzde 0,002’si, yani yaklaşık 47 binde biri monitör tarafından bloke edildi. Haftada yaklaşık 100.000 transkript işaretlendi; en kritik 50 dosya insan incelemesine gitti.

Üçüncü ölçüm işlem gücünü kapsıyor: 13-20 Temmuz haftasında Anthropic’in Ar-Ge’ye ayırdığı işlem gücünün yaklaşık yüzde 6’sı güvenlik çalışmalarına gitti.

Anthropic, ölçümleri üçüncü taraf değerlendiricilerle doğrulatacağını ve bu kuruluşlara şirket içi süreçlere erişim vereceğini söylüyor. Şirket, koordineli bir yavaşlama olursa sayıların değişeceğini de ekliyor. Anthropic CEO’su Dario Amodei, bu ay öne çıkan yapay zekâ geliştirmesinin yavaşlatılması çağrısı yapmıştı. Amodei’nin yavaşlama çağrısı, şirketler hakkında açılan bir davaya da konu olmuştu.

Şirketin kendi uyarısı şu: modeller kendi gelişimini hızlandırdıkça insanların bu sistemleri anlaması ve kontrol etmesi zorlaşabilir. Anthropic, özyinelemeli kendini geliştirmenin (bir modelin kendi ardılını tam otonom kurması) henüz gerçekleşmediğini vurguluyor. Anthropic’in modelleri, METR değerlendirmelerinde dört olayda izinsiz internet erişimi sağlamıştı.

Anthropic, ölçümleri kamuya açma gerekçesini şöyle anlatıyor: dünya öne çıkan yapay zekâ geliştirmesini yavaşlatmayı tartışırken kamu, üçüncü taraflar ve hükümetler bu hızı görebilmeli. Şirket, bu üç ölçümün yetenek değerlendirmelerini tamamladığını, onların yerini almadığını belirtiyor: yetenek testleri modellerin neler yapabildiğini ölçüyor, bu ölçümler ise modellerin nasıl üretildiğini.

Ölçümlerin iki sınırı bulunuyor ve ikisi de metodolojiden kaynaklanıyor. Şirket, değerlendirici olarak kendi modellerini kullanıyor; bu, denetleyen modelin denetlenen modelle aynı hataları yapabileceği anlamına geliyor. Laboratuvarlar arası karşılaştırma için de ortak bir metodoloji bulunmuyor. Anthropic, haziran ayındaki yazısında mayıs itibarıyla birleştirilen kodun yüzde 80’inden fazlasını Claude’un yazdığını ve mühendis başına kod çıktısının 2021-2025 ortalamasına göre 8 kat arttığını açıklamıştı.

Share.
Exit mobile version