L'IA multimodale est une intelligence artificielle capable de comprendre et de traiter plusieurs types de contenus en même temps : texte, image, son et vidéo. Par exemple, elle peut analyser une photo, lire la légende qui l'accompagne et écouter un extrait audio lié à cette image, pour proposer une réponse plus complète et précise. Cette technologie fonctionne grâce à des réseaux de neurones avancés qui apprennent à relier et interpréter des informations venant de sources différentes. Ainsi, l'IA multimodale permet d'améliorer les recherches sur internet, l'accessibilité numérique ou encore les services clients en combinant efficacement texte, image, audio et vidéo (source : Nature, "Multimodal foundation models", 2024).