Optimisation du batching continu pour l'inférence LLM
L'article détaille comment l'asynchronisme dans le batching continu peut améliorer l'utilisation du GPU lors de l'inférence des LLM. En séparant les tâches CPU et GPU, on peut réduire de 24% le temps de génération, passant de 300 à 228 secondes pour 8K tokens.