← Все новости
Зачем NVIDIA скрестила NeMo Automodel с диффузионными моделями

Зачем NVIDIA скрестила NeMo Automodel с диффузионными моделями

Еще в июле NVIDIA и Hugging Face выпустили совместный пост про то, как их опенсорсная библиотека для обучения нейросетей NeMo Automodel умеет теперь работать с диффузионными моделями. В анонсе фигурировали FSDP2, тензорный параллелизм, контекстный параллелизм, мультинодовая оркестрация. Обещали, что дообучение FLUX, Wan и HunyuanVideo можно будет масштабировать с одной видеокарты до сотен, без конвертации чек-пойнтов. Список, конечно, впечатляет, но все эти технологии придумала не NVIDIA, они давно есть в PyTorch и Megatron-Core. Я решила проверить все заявления, ушло немало времени, и в какой-то момент я подумала, а почему бы не поделиться с вами тем, что получилось. Так что вот, делюсь:) Читать далее