Alle Kurznews
Produkt-Update

NeMo AutoModel skaliert Diffusers-Finetuning von einer GPU bis zum Cluster

Kurz in fünf Sätzen

  1. Nvidia und Hugging Face verbinden NeMo AutoModel enger mit Modellen im Diffusers-Format.
  2. Modelle sollen ohne Konvertierung der Checkpoints oder individuelle Neuschreibung trainiert werden können.
  3. Die Skalierung wird über konfigurierbare Parallelismusverfahren statt separater Trainingsprogramme gesteuert.
  4. Fertige Rezepte decken mehrere offene Bild- und Videomodellfamilien sowie vollständiges Finetuning und LoRA ab.
  5. Eine typisierte Python-API ist angekündigt, aber in der beschriebenen Version noch nicht verfügbar.

Ausführliche Einordnung

NeMo AutoModel ist eine quelloffene, auf PyTorch DTensor basierende Trainingsbibliothek, die nun direkt mit Modellen im Hugging-Face-Diffusers-Format arbeitet. Checkpoints lassen sich aus diesem Ökosystem laden und ohne gesonderte Konvertierung wieder dorthin schreiben. Für ein neues Modell soll ein begrenzter Adapter genügen, statt das Trainingsprogramm vollständig neu zu bauen. Die Integration steht unter Apache 2.0.

Die Skalierung wird per Konfiguration gesteuert. Unterstützt werden FSDP2 sowie Tensor-, Expert-, Context- und Pipeline-Parallelismus. Der aktuelle Diffusionspfad gilt nur für Flow-Matching-Modelle. Rezepte gibt es für Wan 2.1, Wan 2.2, FLUX.1, FLUX.2, HunyuanVideo 1.5 und Qwen-Image. Je nach Modell sind vollständiges Finetuning oder LoRA möglich.

Das Beispiel passt FLUX mit 78 gemeinfreien Rider-Waite-Bildern über 200 Schritte an. Es demonstriert den Ablauf, belegt aber keine allgemeine Ausgabequalität. Die Leistungsmessungen liefen auf acht H100-GPUs mit 80 Gigabyte und stammen von den beteiligten Anbietern. Eine typisierte Python-Rezept-API ist als zukünftige Arbeit angekündigt und gehört noch nicht zur beschriebenen Version.

Datenschutz-Einstellung

Mit deiner Zustimmung misst PostHog EU, welche Seiten aufgerufen werden, und zeichnet zusätzlich deine Sitzung auf: Mausbewegungen, Klicks, Scrollen und die dargestellten Seiteninhalte werden als abspielbares Abbild gespeichert. Getippte Eingaben werden vor dem Senden maskiert. Die Inhalte von Anmeldung, Registrierung, Passwort-Wiederherstellung, Founder-Chat, Newsletter-Feld, deiner E-Mail-Anzeige, deinen Quizantworten und den Checklisten werden gar nicht erst aufgezeichnet; auf den Anmelde- und Registrierungsseiten pausiert die Aufzeichnung. Adressen werden immer ohne Suchparameter gespeichert. Verarbeitet werden außerdem eine zufällige Gerätekennung und technische Verbindungsdaten wie die IP-Adresse. Zusätzlich werden fest definierte Nutzungsereignisse gemessen: wie weit ein Beitrag gelesen wurde, welcher Artikelbaustein benutzt wurde, welcher Handlungsaufruf geklickt wurde, wie eine Newsletter-Anmeldung ausging, wie weit du in einem Kurs oder im Feed kommst (dabei nur richtig oder falsch einer Aufgabe, nie deine Antwort selbst), welches Video du startest, ob du die Sprache wechselst und wie ein Anmelde- oder Registrierungsversuch ausging — ohne E-Mail-Adresse, ohne Passwort und ohne Fehlermeldung. Dabei werden ausschließlich Werte aus einer festen Liste und ganze Zahlen aus festen Wertebereichen übertragen — keine Eingaben und kein Freitext. Wir kennzeichnen außerdem Produktions-, interne und automatisierte Testaufrufe getrennt und leiten aus einer bekannten Herkunfts-Domain oder einem streng erlaubten Kampagnenwert ab, ob ein Besuch etwa aus ChatGPT, Claude oder Perplexity kam. Die vollständige Herkunftsadresse und Suchparameter werden nicht gesendet; ein konkretes KI-Modell lässt sich daraus nicht erkennen. Sofern PostHog die IP-basierte Geo-Anreicherung im Projekt aktiviert hat, kann der Dienst grob Land, Kontinent und Region ableiten; einen Browser- oder GPS-Standort fragen wir nicht ab. Jeder Aufruf wird außerdem einem Seitenbereich aus einer festen Liste zugeordnet (etwa Startseite, Blog, Werkzeuge, Konto) — gesendet wird der Bereich, nicht die Adresse. Gemessen werden zusätzlich Ladezeit- und Stabilitätskennzahlen der Seite (Core Web Vitals: LCP, CLS, INP, FCP), ohne Netzwerkinhalte. Ein Klick auf einen Link nach außen wird nur als Zieldomain aus einer festen Liste erfasst, ohne Pfad, Suchparameter und Linktext. Bei den Werkzeugen Ideenrad, KI-Kennzeichnung und Limit-Reset wird nur die Art der Handlung gemessen, etwa Drehen, Auswahl geändert, Kopieren oder Export — keine Eingaben und keine Ergebnisse. Mehr zum Datenschutz

Ohne deine Zustimmung wird weder Analyse-Code geladen noch aufgezeichnet. Du kannst die Einwilligung jederzeit widerrufen: Der Widerruf beendet die Erfassung sofort; bereits erhobene Daten können zu diesem Zeitpunkt schon übertragen sein und werden nach der Speicherfrist gelöscht.