Çinli yapay zekâ şirketi DeepSeek, yeni bir mimari ailesinin ilk modeli olan V4.1-Flash’ı 10 Eylül’de yayımladı. Şirket modeli “daha akıllı, daha hızlı, daha verimli” diye tanıtıyor ve ailenin en küçük üyesi olarak konumlandırıyor. Duyurunun asıl mesajı tek bir modelin performansı değil: DeepSeek bununla birlikte amiral gemisi V4-Pro’yu emekliye ayırdığını açıkladı.

Modelin merkezinde Causal Encoder-Decoder adını verdiği yeni bir mimari var. Model kartına göre V4.1-Flash, 552 milyar parametrelik bir uzmanlar karışımı omurgasına sahip ve bir milyon tokenlık bağlamı destekliyor. Mimari 40 katmanlı bir Transformer’ı 20 katmanlık nedensel kodlayıcı ve 20 katmanlık kod çözücü olarak ikiye bölüyor. Asimetri buradan geliyor. Girdi işleme aşamasında token başına 8 milyar parametre etkinleşiyor, çıktı üretiminde bu sayı 16 milyara yükseliyor.

İkinci teknik iddia bellekte. Kod çözücünün genel KV önbelleği, ayrı bir hesap yerine kodlayıcının son gizli durumlarından türetiliyor. FP4 formatında önbellekleme ve katmanlar arası paylaşımla birleştiğinde, şirket token başına genel KV önbellek ayak izini yaklaşık 890 bayta indirdiğini söylüyor. Bu ayrıntı teknik bir dipnot gibi görünse de doğrudan faturaya bakıyor: önbellek isabet ücretleri ajan maliyetlerinin büyük bölümünü oluşturuyor ve önbelleği sıkıştırmak bu kalemi düşürüyor.

Ticari sonuç net biçimde açıklandı. DeepSeek yeni API fiyatlandırmasını 10 Eylül 04:00 UTC’de yürürlüğe koydu ve yoğun olmayan saatlerde ücretin yoğun saat tarifesinin yarısı olduğunu belirtti. V4-Flash ile V4-Flash-Vision-Exp emekliye ayrıldı, eski model adları geçici olarak yeni modele yönlendiriliyor. 14 Eylül 04:00 UTC’den itibaren doğrudan V4-Pro’ya gelen tüm istekler V4.1-Flash’a ve onun tarifesine yönlenecek; bu, V4.1-Pro çıkana kadar sürecek.

Burada dikkat çeken şey sürüm numarası ile yapılan işin uyuşmaması. Nokta güncellemesi gibi adlandırılan model, aslında yeni bir mimari ailesinin temel modeli ve şirketin kendi ifadesiyle daha büyük modellere ölçeklenmek üzere tasarlandı. DeepSeek ayrıca çok taraflı testlerin V4.1-Flash’ı performans, maliyet, hız ve toplam çalışma süresinde V4-Pro’nun önüne koyduğunu öne sürüyor.

Bu iddiaların bağımsız doğrulaması henüz yok. Rakamlar DeepSeek’in model kartına ve API belgelerine dayanıyor; üçüncü taraf değerlendirmesi yayımlanmadı. Şirket teknik raporu ve model ağırlıklarını Hugging Face üzerinden paylaştı, açık kaynak topluluğuyla çıkarım desteği üzerinde çalışacağını duyurdu.

Modelin eğitimi de rapora yansıyor. Seyrek dikkat mekanizması 64 bin tokenlık dizi uzunluğunda eğitildi, bağlam penceresi 34 trilyon token aşamasında bir milyona çıkarıldı. Model kartı ayrıca token tabanlı arama ile seyrek biçimde erişilen 196 milyar parametrelik Engram koşullu bellek bileşeninden ve DSpark adlı spekülatif kod çözme yönteminden söz ediyor. Model, görselleri ve metni doğrudan işliyor ve çıktıyı metin biçiminde üretiyor.

DeepSeek fiyat cephesinde yine agresif davranıyor. Üçüncü taraf sağlayıcılardaki listelemelere göre model milyon girdi tokenı başına 0,15 dolar, milyon çıktı tokenı başına 0,60 dolar seviyesinde konumlanıyor. Şirket resmî ortakları arasında WorkBuddy ve OpenCode’un modeli desteklediğini duyurdu. DeepSeek bir yandan da büyük ölçekli kurulum arayanlara doğrudan çağrı yapıyor: iki bin GPU ve depolama kümesi ölçeğinde dağıtım planlayanları görüşmeye davet ediyor.

Share.
Exit mobile version