Todas las noticias breves
Actualización de producto

NeMo AutoModel escala el ajuste de Diffusers desde una GPU hasta un clúster

La noticia en cinco frases

  1. Nvidia y Hugging Face integran NeMo AutoModel más estrechamente con modelos en formato Diffusers.
  2. Los modelos deberían poder entrenarse sin convertir checkpoints ni reescribirlos a medida.
  3. La escala se controla mediante métodos configurables de paralelismo en lugar de programas de entrenamiento separados.
  4. Las recetas preparadas cubren varias familias abiertas de modelos de imagen y vídeo, además del ajuste completo y LoRA.
  5. Se ha anunciado una API Python tipada, pero todavía no está disponible en la versión descrita.

Explicación completa

NeMo AutoModel es una biblioteca de entrenamiento de código abierto basada en PyTorch DTensor que ahora trabaja directamente con modelos en formato Hugging Face Diffusers. Los checkpoints pueden cargarse y guardarse de nuevo sin un proceso independiente de conversión. La compatibilidad con un modelo debería requerir un adaptador limitado, no un programa completamente reescrito. La integración se publica bajo Apache 2.0.

La escala se controla mediante configuración. Los métodos incluyen FSDP2 y paralelismo de tensor, expertos, contexto y canalización. La implementación actual solo admite modelos basados en flow matching. Las recetas cubren Wan 2.1, Wan 2.2, FLUX.1, FLUX.2, HunyuanVideo 1.5 y Qwen-Image. Según el modelo, se puede realizar un ajuste completo o aplicar LoRA.

El ejemplo ajusta FLUX con 78 imágenes de dominio público de Rider-Waite durante 200 pasos. Muestra el flujo de trabajo, pero no demuestra una calidad general. Las mediciones utilizan ocho GPU H100 con 80 gigabytes y proceden de los proveedores participantes. Nvidia y Hugging Face anuncian una API tipada como trabajo futuro; esa interfaz todavía no está disponible.