Anthropic 22 Eylül salı günü yeni amiral gemisi modeli Claude Opus 5.5’i yayına aldı. Şirketin Claude 5.5 ailesinin ilk modeli, çoğu işte önceki amiral gemisi Claude Fable 5.1 seviyesinde çalışıyor; Anthropic’in ölçümüne göre tipik iş yüklerinde Opus 5’ten yüzde 40 daha ucuza geliyor.

Fiyat indirimi doğrudan API tarifesine yansıdı. Milyon girdi tokenı 5 dolardan 4 dolara, milyon çıktı tokenı 25 dolardan 20 dolara indi. Ajan ve kodlama işlerinde maliyetin büyük bölümünü oluşturan önbellek okumaları 0,50 dolardan 0,20 dolara geriledi. Anthropic modelin çıktıyı Opus 5’ten yüzde 30’dan fazla hızlı ürettiğini söylüyor. Claude Code ve Claude Platform’daki hızlı mod 2,5 kata kadar hızlanıyor; bu modda fiyat milyon başına 8 dolar girdi, 40 dolar çıktı.

Şirketin uzun görevlerdeki iddiası kod tabanı ölçeğinde. Bir erken test kullanıcısı 200 bin satırlık kod tabanının denetimini üç saatten kısa sürede bitirdi; aynı iş Opus 5’te 20 saati aşmıştı. HAProxy’nin C’den Rust’a çevrilmesinde Opus 5.5 dokuz buçuk saatte tamamladı, Fable 5.1 on iki saatte bitirdi ve şirketin hesabına göre iş yüzde 51 daha pahalıya geldi.

Kıyaslamalarda Anthropic kendi tablosunu paylaşıyor. Terminal-Bench 4.0’da Opus 5.5 yüzde 66,4 ile Fable 5.1’in yüzde 55,8’ini ve OpenAI’ın bildirdiği GPT-6 Astra’nın yüzde 57,9’unu geçiyor. GDPval-AA v2.1’de 1846 Elo ile Fable 5.1 ve Opus 5’in önünde; OSWorld 2.0’da yüzde 81,8’e ulaşıyor. Anthropic, GPT-6 Astra seviyesine onun görev başına maliyetinin yaklaşık yüzde 40’ıyla eriştiğini hesaplıyor.

Abonelik tarafında beş saatlik kullanım limitleri Pro, Max, Team ve koltuk bazlı Enterprise planlarında yükseldi; kullanıcılara istedikleri zaman harcayabilecekleri bir limit sıfırlama hakkı tanımlandı. Model Amazon Web Services, Google Cloud ve Microsoft Azure üzerinde kullanıma açık; API’de claude-opus-5-5 adıyla çağrılıyor ve önceki Opus modelleri gibi sıfır veri saklama seçeneğiyle sunuluyor.

Güvenlik tarafında siber görevler Opus 4.8’e, biyoloji ve ön sınır model geliştirme görevleri Opus 5’e yönlendiriliyor; Anthropic bunun kıyaslama skorlarını bir miktar düşürdüğünü kabul ediyor. Model, yayından önce Frontier Design ve METR tarafından dış değerlendirmeye tabi tutuldu; şirket otomatik davranış denetiminde bugüne kadarki en iyi skoru aldığını, modelin geri döndürülmesi zor eylemlerden kaçındığını bildiriyor. Gray Swan’ın prompt injection testinde Opus 5.5, Fable 5.1 ile birlikte en düşük başarı oranını paylaşıyor. Anthropic, Fable 5.1 ile getirdiği korunmuş düşünme önlemini Opus 5.5’te de sürdürüyor.

Şirket, Claude Sonnet 5.5 ve Claude Haiku 5.5’i önümüzdeki haftalarda yayınlayacağını, iki modelin performans, verimlilik ve güvenlik iyileştirmelerinin çoğunu taşıyacağını bildirdi.

Share.
Exit mobile version