Intelligence Artificielle > IA multimodale > Qu'est-ce que l'IA multimodale Vidéo
Qu'est-ce que l'IA multimodale Vidéo Transcription :
« Bienvenue dans la série Salesforce AI Research Lab Explained, où nous vous présentons les techniques d'IA émergentes sur lesquelles travaille notre équipe. Nous simplifions des concepts complexes et partageons des enseignements concrets issus de la recherche de pointe. Je m'appelle Juan Carlos Niebles et je dirige l'équipe de recherche en IA chez Salesforce.
La multimodalité, c'est-à-dire la capacité des modèles IA à comprendre non seulement le texte, mais aussi les sons et les images, représente l'une des frontières les plus passionnantes de l'intelligence artificielle. C'est précisément ce thème que nous allons explorer dans cet épisode. Pourquoi concentrer nos recherches sur la multimodalité ? Réfléchissez à la façon dont vous interagissez avec le monde : vous envoyez des SMS, partagez des photos, enregistrez des vidéos, laissez des notes vocales… Chaque jour, vous passez naturellement d'un type de données à un autre, d'une « modalité » à l'autre. Et si l'IA pouvait en faire autant ? Après tout, l’intelligence dans le monde réel est toujours multidimensionnelle.
C'est là qu'intervient l'IA multimodale. Contrairement aux modèles traditionnels, qui ne traitent qu'un seul type d'entrée, comme les chatbots textuels ou les classificateurs d'images, les modèles multimodaux combinent plusieurs sources de données pour obtenir une compréhension plus riche et contextuelle du monde. Par exemple, imaginez que vous soumettiez une vidéo à un système d'IA multimodale et que vous lui demandiez : « Que se passe-t-il ici ? » Au lieu d'analyser uniquement le son ou une seule image, il examine à la fois la vidéo et ses séquences d'images. Il identifie les objets, reconnaît la parole et saisit l'ensemble de la scène pour fournir une réponse pertinente et complète.
Comment développer une IA multimodale ? L'IA multimodale repose sur l'intégration de plusieurs modèles visuels, vocaux et textuels, qui sont entraînés ensemble pour fonctionner de manière interconnectée et cohérente. Concrètement, tout commence avec une IA basée sur le langage, comme un LLM, capable d'interpréter les jetons de texte. Pour lui conférer des capacités multimodales, on y ajoute des modules de réseaux neuronaux qui jouent le rôle de traducteurs. Le rôle de chaque traducteur est de convertir les entrées d'une modalité, comme les données de pixels d'une image par exemple, dans un format que le LLM peut comprendre. Nous disposons à présent d'un système d'IA qui combine le LLM avec ce module supplémentaire, lui permettant de comprendre à la fois le texte et les images. Nous pouvons ensuite ajouter un module pour chaque modalité supplémentaire, comme l'audio, la vidéo ou les données de capteurs, ce qui permet de créer un système d'IA multimodal capable de comprendre plusieurs types de données.
Pour que ce concept fonctionne, notre système d'IA doit être entraîné, c’est-à-dire soumis à un processus d'apprentissage machine basé sur des exemples de données afin de l'optimiser. Chaque module de traduction, comme le module image-jeton, peut être entraîné indépendamment ou en parallèle avec les autres. Grâce à cet entraînement, le module peut traduire le contenu d'une image en un format vectoriel compréhensible par le LLM. Une fois entraîné, le LLM dispose d'une nouvelle voie d'entrée, lui permettant de traiter les images et de générer des réponses en fonction de leur contenu. Ce processus peut ensuite être répété pour ajouter d’autres modalités, comme le son ou les données des capteurs.
Après l'entraînement, nos recherches révèlent que ce système d'IA multimodale ne se limite pas à comprendre chaque modalité individuellement. Il peut également répondre à des questions intermodales. Par exemple, si l'on fournit une image d'un terrain de football et un extrait sonore de guitare, nous pouvons demander au système d'IA : « Quelle entrée est pertinente pour un musicien ? » La faculté de raisonner sur plusieurs modalités à la fois est une caractéristique clé de l'IA multimodale.
Comment intégrer la multimodalité aux systèmes d'IA agentiques ? En intégrant des capacités d'IA multimodale au framework des agents IA, nous permettons à ces agents d'interagir avec un plus grand nombre de types de données. Par exemple, un agent multimodal pourrait analyser une image et raisonner sur son contenu, en comptant des objets ou en identifiant des motifs sur plusieurs images. Il pourrait également interagir visuellement avec une page web, en lisant du texte, en cliquant sur des boutons et en remplissant des formulaires en temps réel. Ces agents d'IA multimodale pourront également servir de cerveaux robotiques, permettant à des robots de percevoir leur environnement grâce à des capteurs visuels et de communiquer avec des utilisateurs humains par le langage.
C’est là toute la puissance de l’IA multimodale : combiner différents types de données pour offrir des informations plus approfondies et des résultats plus précis. L'IA multimodale va bien au-delà du texte, des images et des sons. Elle permet à l'IA d’interpréter le monde comme nous le faisons. Pour en savoir plus sur les aspects techniques de la recherche sur l'IA multimodale chez Salesforce, consultez les liens dans la description. Un projet phare de notre équipe est xGen-MM, également appelé BLIP. Il s'agit d'un modèle qui intègre le traitement du texte, de l'image et de la vidéo pour une compréhension avancée du langage visuel. Vous trouverez plus d'informations ci-dessous. Si vous avez trouvé cette vidéo utile, n'hésitez pas à mettre un « like » et à vous abonner pour en découvrir davantage sur notre laboratoire de recherche en IA. Merci d’avoir regardé et à bientôt ! »
En savoir plus sur les agents IA et sur la manière dont ils peuvent aider votre entreprise.
Prêt à passer au niveau supérieur avec Agentforce ?
Créer des agents en un clin d'œil.
Découvrez comment se déroule la création d'un agent dans notre bibliothèque.
Bénéficiez de conseils d'experts.
Lancez Agentforce rapidement et en toute confiance, avec un ROI que vous pouvez mesurer.
Parler à un représentant.
Faites-nous part des besoins de votre entreprise et nous vous aiderons à trouver les solutions adéquates.