IA
vLLM
Aussi : vllm
En clair
vLLM n’est pas un modèle, mais le moteur qui le fait tourner en production. Il regroupe les demandes arrivées en même temps et gère finement la mémoire de la carte graphique, ce qui permet de servir beaucoup plus d’utilisateurs avec le même matériel. Le choix du moteur pèse autant sur le coût final que le choix du modèle.
Concrètement
Passer d’un script simple à un moteur dédié multiplie le nombre de requêtes traitées par seconde sur la même carte.
Pourquoi ça compte
Servir un modèle avec un script maison laisse la carte graphique inoccupée la moitié du temps et fait s’effondrer les délais dès que plusieurs personnes s’en servent.
Définition technique
Moteur d’inférence haute performance pour servir des LLM (paged attention, batching).