Linum metinden görüntü üreten modellerin eğitimini hızlandıran JiT-DDT mimarisini sundu
Öne çıkanlar
- JiT-DDT mimarisi, Linum v2 modeline göre 4 kat piksel üretirken GPU eğitim süresini 3,6 kat azalttı.
- Model, harici VAE yerine doğrudan DiT içinde 32x32 belirteç sıkıştırması gerçekleştirdi.
- Araştırma kodları ve model ağırlıkları Apache 2.0 lisansıyla kamuya açıldı.
Görüntü ve video üretim modelleri geliştiren Linum, metinden görüntü üreten yapay zeka modellerinin eğitim sürecini hızlandıran JiT-DDT adlı yeni mimarisini duyurdu. Şirket, geleneksel modellerde kullanılan VAE bileşenini devreden çıkararak piksel uzayında çalışan JiT yaklaşımını temel aldı. Yapılan testlerde JiT-DDT, Linum v2 temel modeline kıyasla dört kat daha fazla piksel üretmesine rağmen 3,6 kat daha az GPU saati harcayarak eğitildi.
Sistem, metin ve görüntü belirteçlerini tek bir akışta birleştiren bir transformer omurgası ve ayrıştırılmış kodlayıcı-kod çözücü yapısı kullanıyor. Kodlayıcı düşük çözünürlüklü yapısal bilgiyi tahmin ederken, kod çözücü metin girdisi ve gürültülü veriyi işleyerek yüksek frekanslı ince ayrıntıları oluşturuyor. Akış eşleme eğitiminde hız tahmini yerine x-tahmini yaklaşımına geçilmesi, yüksek boyutlu verilerdeki kararsızlık sorununu çözdü ve 32x32 oranında belirteç sıkıştırması sağladı.
Model mimarisinde SwiGLU aktivasyon fonksiyonları, Muon optimizasyon aracı, PixelREPA yardımcı kaybı ve Qwen3.5-4B üzerinden alınan metin gömmeleri kullanıldı. Linum, JiT-DDT kodlarını ve model ağırlıklarını Apache 2.0 lisansı altında açık kaynak olarak paylaştı. Şirket, bu çalışmanın Linum v3 yolunda bir araştırma çıktısı niteliğinde olduğunu ve topluluk araştırmacılarına daha verimli eğitim metotları için zemin sağladığını belirtti.
Bu özet yapay zekâ ile hazırlanmıştır; ayrıntılar ve doğrulama için orijinal kaynağa başvurun.