IA
Multimodal
Aussi : multimodalité · vision-language
En clair
Un modèle multimodal accepte plusieurs types d’entrée dans une même demande — texte, image, son, parfois vidéo. Il ne voit pas comme un humain : il convertit chaque type en une représentation interne, puis raisonne dessus. La qualité varie fortement d’une modalité à l’autre, et selon la netteté du document fourni.
Concrètement
Photographier un tableau électrique et demander quelles protections sont présentes, sans rien retranscrire au préalable.
Pourquoi ça compte
Choisir multimodal par défaut ajoute du coût et des sources d’erreur. Mais l’écarter quand le métier est visuel oblige à décrire les documents à la main.
Définition technique
Modèle capable de traiter plusieurs modalités (texte, image, audio, vidéo) dans un même pipeline.
Termes liés
Vu dans ces articles
- Qwen, Kimi, DeepSeek : la bataille du coût de l’IA21 août 2026
- OpenRouter unifie la génération d’images via une API18 août 2026
- Muse Glimmer : Meta ouvre un modèle de 30 Md de paramètres pour agents locaux11 août 2026
- Generative AI dans les équipes créatives : les chiffres qui comptent pour builders et agences en 20264 août 2026