NVIDIA och Hugging Face: finjustera videomodeller i produktionsskala utan kodrewrite
NVIDIA och Hugging Face har integrerat NeMo Automodel med Diffusers, vilket gör det möjligt att distribuerat finjustera modeller som Wan 2.1 och FLUX.1-dev i stor skala — utan checkpoint-konvertering och utan att skriva om ett enda rader parallelismkod.
Parallelism är ett konfigurationsval, inte en kodrewrite — växla mellan FSDP2, tensor parallel, expert parallel, context parallel och pipeline parallel genom att deklarera konfigurationer, inte skriva om modeller.
Hugging Face Blog
NVIDIA och Hugging Face har gemensamt lanserat en integration mellan NeMo Automodel och Diffusers-biblioteket. Integrationen möjliggör distribuerad finjustering av video- och bildmodeller i produktionsskala. Stödda modeller inkluderar Wan 2.1 T2V i storlekarna 1.3B och 14B, Wan 2.2 T2V A14B, FLUX.1-dev, FLUX.2-dev, HunyuanVideo 1.5 och Qwen-Image. NeMo Automodel är ett open source PyTorch DTensor-native träningsbibliotek inom NVIDIA NeMo-ramverket.
Det som skiljer integrationen från tidigare lösningar är att finjusterade checkpoints laddas direkt i DiffusionPipeline utan konverteringssteg — ett flaskhalsproblem som tidigare krävde manuell hantering. Parallelism konfigureras deklarativt: FSDP2, tensor parallel, expert parallel, context parallel och pipeline parallel väljs via konfigurationsfiler snarare än kodändringar. Det sänker tröskeln markant för team som vill skala träning utan att ha djup infrastrukturkompetens. Wan 2.1 T2V 1.3B-modellen får plats på en enda 40 GB A100, vilket gör att experimentfasen inte kräver ett kluster.
Hela integrationen är öppen källkod. För den som bygger produkter med generativ video eller bild är det här ett konkret alternativ till att rulla egna träningspipelines — med direkt kompatibilitet mot Hugging Face Hub.
