IA
MoE
Aussi : Mixture of Experts · mixture-of-experts
En clair
Un modèle à mélange d’experts contient plusieurs sous-réseaux spécialisés et n’en active que quelques-uns pour chaque fragment de texte traité. On obtient une grande capacité totale sans payer le calcul de la totalité à chaque fois. Le nombre de paramètres affiché devient alors trompeur : seule une partie travaille réellement.
Concrètement
Un modèle annoncé à cent milliards de paramètres n’en mobilise parfois que dix à vingt pour traiter chaque fragment.
Pourquoi ça compte
Comparer deux modèles sur leur nombre total de paramètres n’a plus de sens dès que l’un est un mélange d’experts. Le coût réel dépend de ce qui s’active.
Définition technique
Mixture of Experts : architecture où seules certaines « experts » (sous-réseaux) s’activent par token, pour scaler la capacité.