World Labs, 1 Eylül 2026’da uzamsal zekâ (spatial intelligence) için Atlas adlı çok kipli dünya modelini (omni world model) duyurdu. Fei-Fei Li, Justin Johnson, Ben Mildenhall ve Christoph Lassner’in kurduğu şirket, modeli sıfırdan eğittiğini ve metin, görüntü, video ile üç boyutlu veriyi aynı uzamsal bağlamda işlediğini yazdı. Atlas seçilmiş ortaklarla erken erişime giriyor.

Şirket Atlas’ı çok kipli otoregresif yayılım dönüştürücüsü (multimodal autoregressive diffusion transformer) olarak tanımladı. Her görüntü ve derinlik haritası açık bir kamera pozuna bağlanıyor. Bu düzen uzamsal bağlamı oluşturuyor. Model bu bağlamdan sonraki kareyi, yeni bakış açısını veya üç boyutlu çıktıyı üretiyor. Videolar görüntü dizisi olarak işleniyor.

Kamera kontrollü üretimde Atlas bir ile altı referans görüntüden yeni görünümler üretiyor. Çıktı en fazla yaklaşık bir dakikalık video ve 1440p çözünürlüğe çıkabiliyor. Kamera geometrisi kaba metin talimatı olarak girilmiyor; yerel bir girdi türü. Şirket, tek bir görüntüden sahnenin görünmeyen yüzünü ve komşu zemin gibi ayrıntıları da doldurabildiğini örnekledi. İki ilgisiz görüntü üç boyutlu uzaya yerleştirildiğinde model aradaki geçişi de kuruyor.

Seyrek görüntüden uzamsal rekonstrüksiyon ikinci ana iş. Atlas bir ile onlarca girdi görüntüsünden gerçek sahneleri yeniden kuruyor. Daha fazla görüntü verildiğinde hayal payı azalıyor. Şirket iki veya üç görüntüyle sadık rekonstrüksiyon aldığını, yüzden fazla görüntüyü de bağlama alabildiğini yazdı. Stanford ana avlusu örneğinde yer seviyesindeki az sayıda kareden hava çekimi üretildiğini anlattı. Çıktı videoyla sınırlı kalmıyor. Derinlik haritaları, nokta bulutu ve üç boyutlu Gauss serpintisi (3D Gaussian splat) da üretilebiliyor. Bu temsil Marble ürünündeki dünya gösterimiyle aynı.

Zaman-uzay simülasyonunda Atlas sıradan kameralarla çekilmiş videoyu yeniden kadrajlıyor. Üç ila beş cep telefonu veya aksiyon kamerasıyla çekilen sahneden yeni açılar üretilebiliyor. Robotik için gerçekten simülasyona (Real-to-Sim) iş akışında birkaç gerçek kayıttan robotun gövde kamerasının göreceği renk ve derinlik kareleri üretiliyor. Şirket büyük iç mekân örneklerini 24 kareyle kurduğunu yazdı. Nesnelerin konumunu, robot hareketini, ışığı ve arka planı değiştirerek eğitim verisi çeşitlendirilebiliyor.

Görüntü üretimi birincil hedef olarak tanımlanmadı. Atlas yine de metinden görüntü ve 360 derece panorama üretebiliyor. World Labs kendi karşılaştırmasında kamera kontrollü üretimde insan değerlendiricilerin Atlas’ı MiniMax H3 karşısında yüzde 75, Gemini Omni Flash karşısında yüzde 81 tercih ettiğini bildirdi. Üç boyutlu rekonstrüksiyonda da uzman modellere göre daha düşük hata verdiğini savundu. Bu kıyaslar şirketin kendi protokolü.

Atlas gelecek Marble sürümlerini ve diğer World Labs ürünlerini besleyecek. Genel kullanıma açık bir fiyat veya takvim yayımlanmadı. Dünya modeli iddiasının laboratuvar karşılaştırmasının ötesinde sahada ne kadar dayanacağı henüz bağımsız bir üçüncü testle ölçülmedi.

Share.
Exit mobile version