CANLI · 524 haber akışta Son güncelleme 22:23
22 Temmuz 2026
AI · Hugging Face Blog

NVIDIA NeMo + Hugging Face Diffusers: Görsel ve Video Yapay Zekası Artık Toplu İnce Ayarlanıyor

NVIDIA NeMo Automodel ve Hugging Face Diffusers birleşti: görüntü ve video modelleri artık 1'den yüzlerce GPU'ya ölçeklenecek şekilde ince ayarlanabiliyor.

17 Temmuz 2026

Ne oldu?


NVIDIA ile Hugging Face, görüntü ve video üretimi için kullanılan diffusion modellerinin büyük ölçekte ince ayarını kolaylaştıran bir iş birliğini duyurdu. Ortaya çıkan çözüm, NVIDIA'nın açık kaynaklı NeMo Automodel kütüphanesinin Hugging Face Diffusers ile bütünleşmesini sağlıyor. Bu entegrasyon sayesinde FLUX.1-dev, Wan 2.1 T2V 1.3B ve HunyuanVideo gibi popüler modeller, Hugging Face Hub üzerinden doğrudan yüklenip tek bir GPU'dan yüzlerce GPU'ya kadar ölçeklenebilir şekilde eğitilebiliyor. NeMo Automodel, PyTorch DTensor tabanlı olup FSDP2 dağıtık eğitim, çok çözünürlüklü bucketing ve önceden kodlanmış latent önbellekleme gibi teknikleri destekliyor. Kullanıcılar, eğitim akışını bir YAML dosyası üzerinden yapılandırabiliyor ve model ağırlıklarını dönüştürmeden kullanabiliyor. Ayrıca kütüphane flow matching kaybı ile çalışıyor ve Apache 2.0 lisansıyla açık kaynak olarak sunuluyor.

Neden önemli?


Görüntü ve video üreten yapay zeka modelleri, genel amaçlı sonuçlar verse de kurumsal veya özel projelerde kendi veri setine uyması için ince ayar gerektiriyor. Ancak bu modellerin eğitimi çok yüksek bellek, verimli paralelleştirme ve karmaşık altyapı gerektirdiğinden genellikle büyük ekiplerin erişebileceği bir alan oluyordu. NeMo Automodel ile Diffusers entegrasyonu, aynı YAML reçetesi ve eğitim betiğinin tek GPU'dan yüzlerce GPU düğümüne kadar çalışmasına olanak tanıyarak bu engeli kaldırıyor. Böylece araştırmacılar ve geliştiriciler, checkpoint dönüşümü veya model yeniden yazımı yapmadan üretim düzeyinde dağıtık eğitim gerçekleştirebiliyor. Bu durum, görsel üretken yapay zeka araştırmalarını ve ürün prototiplemesini hızlandırabilir.

Kim veya ne etkileniyor?


Öncelikle yapay zeka araştırmacıları, makine öğrenimi mühendisleri, görsel içerik üretimi yapan girişimler ve özel stil ya da ürün görselleriyle çalışan kurumlar bu gelişmeden etkilenecek. Hugging Face Hub'da Diffusers formatında yayınlanan modellerle çalışan herkes, NeMo Automodel'i kullanarak kendi veri setleri üzerinde ince ayar yapabilir. NVIDIA altyapısına sahip veri merkezleri ve bulut kullanıcıları, FSDP2 desteği sayesinde verimli şekilde ölçeklenebilecek. Ayrıca açık kaynak topluluğu, entegrasyonun Apache 2.0 lisansı altında olması nedeniyle katkıda bulunup kendi iyileştirmelerini ekleyebilir.

Ne yapılmalı?


Kendi görüntü veya video modelini ince ayarlamak isteyen ekiplerin önce NVIDIA NeMo Automodel belgelerini ve Hugging Face Diffusers eğitim rehberini incelemesi önerilir. Veriler `.meta` latent dosyaları şeklinde hazırlandıktan sonra YAML tabanlı reçete ile model, veri yolu ve paralellik stratejisi yapılandırılmalı. Eğitim `torchrun` ile başlatılabilir ve sonuçta çıkan checkpoint DiffusionPipeline ile çıkarım için kullanılabilir. Küçük ölçekte başlayıp, hafıza ve hız karakteristiğini ölçtükten sonra GPU sayısını artırmak, maliyetli denemelerin önüne geçer. Henüz tüm Diffusers modeli destekliyor mu konusu dokümantasyonda model listesiyle sınırlı olduğundan, hedef modelin desteklenip desteklenmediği çalışmadan önce mutlaka doğrulanmalı.

Kaynaklar

Güne dön