Teknoloji dünyasında yapay zekânın sınırları her geçen gün daha da genişliyor. Son olarak Tencent, geliştirdiği HunyuanWorld-Voyager modeli ile büyük ses getirdi. Bu sistem, tek bir fotoğrafı üç boyutlu derinlik verileriyle zenginleştirilmiş kısa videolara dönüştürebiliyor. Yani elinizdeki sıradan bir fotoğraf, birkaç saniye içinde hareketli ve üç boyutlu bir sahneye dönüşebiliyor.
Peki bu yeni teknoloji nasıl çalışıyor, hangi avantajları ve sınırlamaları var? Gelin birlikte inceleyelim.
Bu derinlik bilgisi sayesinde sahnedeki nesneler sabit kalıyor, kamera hareket ettikçe perspektif gerçekçi bir şekilde korunuyor. Voyager, her kareyi önceki karelerle karşılaştırarak mekânsal bütünlüğü korumaya çalışıyor. Ancak çok karmaşık veya 360° döndürmeli sahnelerde ufak bozulmaların yaşanması mümkün.
Voyager, 100 binden fazla gerçek ve yapay video ile eğitilmiş. Bu veri setine Unreal Engine ortamlarından elde edilen sahneler de dahil edilmiş. Eğitim sırasında otomatik derinlik hesaplama yöntemleri kullanıldığı için manuel etiketleme ihtiyacı da ortadan kalkmış.
Bununla birlikte sistem, çoklu GPU desteği sunuyor. Örneğin 8 GPU’lu bir yapı, tek GPU’ya göre yaklaşık 6,7 kat daha hızlı çalışabiliyor. Araştırmacılar için modelin ağırlıkları Hugging Face üzerinden erişime açılmış durumda.
Rakiplerinden WonderWorld (72,69) ve CogVideoX-I2V (62,15) gibi sistemleri geride bıraksa da, Voyager’ın kamera kontrolü konusunda hâlâ eksikleri olduğu belirtiliyor.
Tencent Voyager, fotoğrafları üç boyutlu kısa videolara dönüştürme konusundaki en gelişmiş yapay zekâ modellerinden biri. Henüz günlük kullanım için pratik olmasa da, özellikle oyun, sanal gerçeklik ve animasyon gibi alanlarda büyük potansiyel barındırıyor. Yüksek donanım ihtiyacı ve lisans sınırlamaları ise bu teknolojinin önündeki en büyük engeller olarak öne çıkıyor.
Peki bu yeni teknoloji nasıl çalışıyor, hangi avantajları ve sınırlamaları var? Gelin birlikte inceleyelim.
Voyager Nasıl Çalışıyor?
Voyager’ın çalışma mantığı oldukça dikkat çekici. Kullanıcı yalnızca bir fotoğraf yüklüyor ve ardından kaydırma, eğim, yakınlaşma ya da sahneye doğru ilerleme gibi kamera hareketlerini tanımlıyor. Model bu hareketleri işleyerek hem renkli bir video hem de aynı anda derinlik haritaları üretiyor.Bu derinlik bilgisi sayesinde sahnedeki nesneler sabit kalıyor, kamera hareket ettikçe perspektif gerçekçi bir şekilde korunuyor. Voyager, her kareyi önceki karelerle karşılaştırarak mekânsal bütünlüğü korumaya çalışıyor. Ancak çok karmaşık veya 360° döndürmeli sahnelerde ufak bozulmaların yaşanması mümkün.
World Cache Teknolojisi
Tencent’in raporunda öne çıkan bir diğer yenilik ise “world cache” sistemi. Bu yapı, üretilen her yeni karedeki bilgiyi saklıyor ve sonraki karelerde tekrar kullanıyor. Böylece özellikle birkaç dakikalık videolarda geometrik tutarlılık büyük oranda korunuyor.Voyager, 100 binden fazla gerçek ve yapay video ile eğitilmiş. Bu veri setine Unreal Engine ortamlarından elde edilen sahneler de dahil edilmiş. Eğitim sırasında otomatik derinlik hesaplama yöntemleri kullanıldığı için manuel etiketleme ihtiyacı da ortadan kalkmış.
Yüksek Donanım İhtiyacı
Voyager’ın en büyük handikapı donanım gereksinimleri. Modeli yalnızca 540p çözünürlükte çalıştırmak için 60 GB GPU belleği gerekiyor. Daha yüksek kalitede sonuç almak isteyenlerin ise 80 GB’a ihtiyacı var.Bununla birlikte sistem, çoklu GPU desteği sunuyor. Örneğin 8 GPU’lu bir yapı, tek GPU’ya göre yaklaşık 6,7 kat daha hızlı çalışabiliyor. Araştırmacılar için modelin ağırlıkları Hugging Face üzerinden erişime açılmış durumda.
Voyager ve Rakipleri
Voyager, video üretiminde farklı bir noktada duruyor. Örneğin OpenAI’nin Sora modeli görsel gerçekçiliğe odaklanırken, Voyager kareler arasında geometrik tutarlılığı ön planda tutuyor. Bu yaklaşımı sayesinde Stanford’un WorldScore benchmark testinde 77,62 puan alarak zirveye oturmayı başardı.Rakiplerinden WonderWorld (72,69) ve CogVideoX-I2V (62,15) gibi sistemleri geride bıraksa da, Voyager’ın kamera kontrolü konusunda hâlâ eksikleri olduğu belirtiliyor.
Lisans ve Kullanım Kısıtlamaları
Her ne kadar etkileyici olsa da Voyager’ın kullanımı bazı bölgelerde kısıtlı. Model, Avrupa Birliği, Birleşik Krallık ve Güney Kore’de yasaklanmış durumda. Ayrıca 100 milyonun üzerinde aktif kullanıcıya hizmet veren ticari platformlarda kullanılabilmesi için ek lisans anlaşmaları gerekiyor.Tencent Voyager, fotoğrafları üç boyutlu kısa videolara dönüştürme konusundaki en gelişmiş yapay zekâ modellerinden biri. Henüz günlük kullanım için pratik olmasa da, özellikle oyun, sanal gerçeklik ve animasyon gibi alanlarda büyük potansiyel barındırıyor. Yüksek donanım ihtiyacı ve lisans sınırlamaları ise bu teknolojinin önündeki en büyük engeller olarak öne çıkıyor.