La génération d'images, de sons et de vidéos par intelligence artificielle (IA) désigne l'utilisation de modèles informatiques capables de créer du contenu visuel, sonore ou audiovisuel à partir de descriptions textuelles ou d'exemples. Les technologies les plus utilisées en 2025 sont les réseaux de neurones génératifs, comme les GAN (Generative Adversarial Networks) et les modèles de diffusion pour les images (ex : DALL-E, Midjourney, Stable Diffusion), les modèles de synthèse vocale (ex : VALL-E, ElevenLabs) pour le son, et les IA spécialisées comme Runway, Sora ou Pika Labs pour la vidéo. Ces outils reposent sur l'apprentissage profond, traitent de grandes quantités de données et sont capables de créer des contenus réalistes qui imitent l'apparence, le style ou la voix d'origines humaines ou imaginées.