Apple Silicon booste l'inférence LLM avec llama.cpp
Une nouvelle couche de compatibilité Metal pour macOS VMs sur Apple Silicon permet des gains de performance significatifs pour l'inférence LLM. Sur un M1 Ultra, llama.cpp traite les prompts 11.08× plus vite et génère des tokens 16.36× plus vite, atteignant près de 99% des performances natives.
« On an M1 Ultra, TinyLlama 1.1B running through llama.cpp processed prompts 11.08× faster and generated tokens 16.36× faster than the same workload in the same stock VM. » - Hacker News (frontpage)
Que faut-il retenir ?
- Sur un M1 Ultra, llama.cpp traite les prompts 11.08× plus vite dans un VM macOS.
- La génération de tokens est 16.36× plus rapide avec la nouvelle couche Metal.
- Google Gemma 4 12B QAT Q4_0 voit une amélioration de 7.20× en traitement de prompts.
- La couche Metal permet d'atteindre 99.59% des performances natives en traitement de prompts.
Pourquoi cette nouvelle compte-t-elle ?
Cette avancée technologique permet des gains de performance significatifs pour l'inférence LLM sur macOS VMs, ce qui est crucial pour les développeurs et les entreprises utilisant des modèles de langage. Les performances proches du natif ouvrent de nouvelles possibilités pour les applications d'IA générative.
16.36× plus rapide en génération de tokens
💬 Francesco Bonacci, Co-auteur de l'article
Public concerné : développeurs, entreprises