404 Mates

Accueil/Lexique/IA

IA

vLLM

Aussi : vllm

En clair

vLLM n’est pas un modèle, mais le moteur qui le fait tourner en production. Il regroupe les demandes arrivées en même temps et gère finement la mémoire de la carte graphique, ce qui permet de servir beaucoup plus d’utilisateurs avec le même matériel. Le choix du moteur pèse autant sur le coût final que le choix du modèle.

Concrètement

Passer d’un script simple à un moteur dédié multiplie le nombre de requêtes traitées par seconde sur la même carte.

Pourquoi ça compte

Servir un modèle avec un script maison laisse la carte graphique inoccupée la moitié du temps et fait s’effondrer les délais dès que plusieurs personnes s’en servent.

Définition technique

Moteur d’inférence haute performance pour servir des LLM (paged attention, batching).

Termes liés

Vu dans ces articles

← Tout le lexique