Zhipu, yeni bayrak modeli GLM-5.3’ün gerçek yazılım açıklarını bulmada Amerikan öncü sistemlerini geride bıraktığını açıkladı. Pekin merkezli şirket, modeli GLM-5.2 ile aynı temel üzerine oturttuğunu; farkın neredeyse tümünün son eğitim ölçeklemesinden geldiğini söylüyor.

Skor dar, iddia büyük

Şirketin paylaştığı CyberGym sonuçlarına göre GLM-5.3, kaynak koddan güvenlik açığını tespit edip doğrulama başarısında yüzde 84,5 skor aldı. Aynı tabloda Anthropic’in Mythos 5 modeli yüzde 83,8, OpenAI’nin GPT-5.6 Sol modeli yüzde 83,6. Fark dar. Ama rakam, Çin’in siber yeteneğinde “Mythos seviyesine” yaklaştığı anlatısını beslemek için kullanılıyor.

Zhipu’nun kendi cümlesi daha iddialı: son eğitim büyüdükçe siber yetenek beklenenden hızlı gelişti; model yalnızca tekil hataları değil, sömürü zincirinin birden fazla basamağını birlikte düşünmeye başladı. Resmî dokümantasyon da CyberGym’de açık keşfinde SOTA iddiasını tekrarlıyor ve sömürü kıyaslarında GLM-5.2’ye göre performansın iki kattan fazla arttığını yazıyor.

Sömürü merdiveni ayrı hikâye

Aynı pakette ters yönde bir rakam var. ExploitBench’te, yani modelin sömürü merdiveninde ne kadar yükselebildiğini ölçen testte GLM-5.3 yüzde 54,4’te kaldı. Mythos 5 yüzde 78, GPT-5.6 Sol yüzde 76,5. Açık bulmak ile açığı zincirleyerek kullanmak aynı şey değil. Şirket iddiası keşif tarafında; sömürü tarafında Amerikan modelleri hâlâ önde görünüyor.

Zhipu, Çin’deki güvenlik ekipleriyle gerçek kod tabanlarında çalıştığını ve uzman incelemesinden sonra 269 projede 2.436 güvenlik bulgusu kaydettiğini söylüyor. Bunların 1.097’si orta-yüksek şiddette. Liste çekirdekler, işletim sistemleri, tarayıcı motorları, açık kaynak altyapı, web uygulamaları ve ağ protokollerini kapsıyor. En eskisinin yaklaşık 40 yıllık olduğu belirtiliyor. Bu rakamlar bağımsız bir denetim raporu değil; şirketin kendi açıklaması.

Yalnız siber bir model değil

GLM-5.3 yalnızca siber bir model olarak konumlanmıyor. Z.ai, yazılım mühendisliği ve ajan işlerinde de sıçrama iddia ediyor: Z.ai Code Bench’te GLM-5.2’ye göre yüzde 50 iyileşme; Terminal-Bench 3.0 ve Agents’ Last Exam (CLI) gibi kıyaslarda açık kaynak SOTA. Bağlam penceresi 1 milyon token, azami çıktı 128 bin token olarak veriliyor. API henüz “yakında” notuyla duruyor; Coding Plan kullanıcılarına açıldığı belirtiliyor.

ABD tarafında Anthropic’in Mythos hattı, siber yeteneği bir milli güvenlik avantajı gibi anlatılmıştı. GLM-5.3’ün keşif skoru o anlatıyı daraltıyor. Ama sömürü kıyasındaki açık fark, “daha iyi hata avcısı” iddiasının henüz “daha iyi siber silah” anlamına gelmediğini gösteriyor. Kurumsal tarafta asıl soru başka: açık ağırlıklı bir Çin modelinin, kendi kod tabanınızda bu kadar uzağa gitmesine izin verip vermeyeceğiniz.

Share.
Exit mobile version