Nunchaku Lite : inférence 4-bit pour Diffusers
Nunchaku Lite permet désormais une inférence 4-bit pour les modèles de diffusion via Diffusers, réduisant la mémoire VRAM nécessaire de 24GB à 12GB sur RTX 5090. Cette solution élimine aussi la nécessité de compilation CUDA locale.
« SVDQuant, the quantization method behind the popular Nunchaku inference engine, takes a different approach. » — Hugging Face Blog
Que faut-il retenir ?
- Nunchaku Lite réduit l'utilisation de VRAM de 24GB à 12GB pour une image 1024x1024 sur RTX 5090.
- La solution permet une inférence en 1.7 secondes pour une image 1024x1024.
- NVFP4 checkpoints nécessitent une GPU NVIDIA Blackwell (RTX 50 series).
- SVDQuant gère les outliers en les déplaçant dans les poids avec une branche low-rank 16-bit.
Pourquoi cette nouvelle compte-t-elle ?
Cette avancée rend accessible l'inférence de modèles de diffusion haute performance sur des GPUs grand public, éliminant des barrières techniques majeures. Les professionnels peuvent désormais déployer ces modèles avec des ressources matérielles réduites, tout en maintenant des performances élevées.
12 GB de VRAM pour une image 1024x1024 sur RTX 5090
Public concerné : développeurs
Quels sont les avantages de Nunchaku Lite pour l'inférence des modèles de diffusion ?
Nunchaku Lite permet une réduction de 50% de l'utilisation de VRAM (de 24GB à 12GB) tout en accélérant l'inférence, rendant ces modèles accessibles sur des GPUs grand public sans compilation CUDA locale.
🔧 Outils mentionnés