Kunstmatige intelligentie > Multimodale AI > Wat is multimodale AI Video
Wat is multimodale AI Video Transcript:
"Welkom bij AI Research Lab Explained, de Salesforce-serie, waar we je een kijkje geven in de nieuwe, opkomende AI-technieken waarmee ons team experimenteert. We maken complexe concepten begrijpelijk en delen inzichten uit de praktijk, allemaal vers van de pers. Mijn naam is Juan Carlos Niebles en ik leid een AI-onderzoeksteam hier bij Salesforce.
Een van de meest opwindende grenzen in AI is multimodaliteit, het vermogen van AI-modellen om niet alleen tekst, maar ook geluiden en afbeeldingen te begrijpen. Dat wordt onze focus voor dit segment. Waarom richt ons onderzoek zich nu op multimodaliteit? Denk eens na over hoe je met de wereld omgaat: sms'en, foto's delen, video's opnemen, spraakmemo's verzenden. Elke dag schakel je naadloos tussen verschillende soorten data of modaliteiten. Zou AI niet hetzelfde moeten doen? In de echte wereld is informatie meer dan eendimensionaal.
Dat is waar multimodale AI om de hoek komt kijken. In tegenstelling tot traditionele AI-modellen die slechts één type invoer verwerken, zoals chatbots met alleen tekst of beeldclassificaties, combineren multimodale modellen meerdere databronnen om een rijker, meer contextueel begrip van de wereld te creëren. Stel dat je een multimodaal AI-systeem een video geeft en vraagt: "Wat gebeurt hier?" In plaats van alleen de audio of een enkel frame te analyseren, verwerkt het zowel video als reeksen frames tegelijk, identificeert het objecten, herkent het spraak en begrijpt het de volledige scène om een zinvolle reactie te genereren.
Hoe kunnen we eigenlijk multimodale AI bouwen? Multimodale AI werkt door meerdere modellen te integreren, zoals visuele modellen, spraakmodellen en tekstmodellen, en deze samen te trainen om effectief met elkaar te verbinden. Conceptueel werkt deze architectuur als volgt: we beginnen met een op taal gebaseerde AI zoals een LLM, die al teksttokens begrijpt. Om multimodale mogelijkheden mogelijk te maken, introduceren we neurale netwerkmodules die als vertalers fungeren. De rol van elke vertaler is om input van één modaliteit, zoals pixeldata van bijvoorbeeld afbeeldingen, om te zetten in een formaat dat de LLM kan begrijpen. Dit creëert een AI-systeem dat de LLM en deze extra module integreert om inzicht te krijgen in zowel tekst als afbeeldingen. Daarna kunnen we voor elke extra modaliteit, zoals audio, video of sensordata, een nieuwe module introduceren, wat resulteert in een multimodaal AI-systeem dat meerdere soorten data kan begrijpen.
Om dit concept te laten werken, moeten we ons AI-systeem door middel van training leiden, een machine learning-proces dat voorbeelddata gebruikt om een systeem te optimaliseren. Elke vertaalmodule kan, net als de image-to-token-module, onafhankelijk of naast de andere worden getraind. Deze training zorgt ervoor dat de module de inhoud van afbeeldingen nauwkeurig kan toewijzen aan een vectorruimte die de LLM begrijpt. Eenmaal getraind, verkrijgt de LLM een nieuw invoerpad, waardoor het afbeeldingen kan verwerken en reacties kan genereren op basis van hun inhoud. Zoals gezegd, kan dit proces worden herhaald om meer modaliteiten toe te voegen, zoals geluid of sensordata.
Interessant is dat uit ons onderzoek na training blijkt dat dit multimodale AI-systeem niet alleen elke modaliteit afzonderlijk begrijpt. Het kan ook vragen beantwoorden die meerdere modaliteiten omvatten. Als we bijvoorbeeld een afbeelding van een voetbalveld en een geluidsfragment van een gitaar krijgen, kunnen we het AI-systeem vragen: "Welke invoer is relevant voor een muzikant?" Deze modaliteitoverstijgende redenering is een belangrijke functionaliteit van multimodale AI.
Dus hoe past multimodaliteit in AI-agentische systemen? Door multimodale AI-mogelijkheden te integreren in het framework van AI-agents, kunnen we agents effectief in staat stellen om met meer soorten data te communiceren. Een multimodale agent kan bijvoorbeeld een afbeelding analyseren en redeneren over de inhoud ervan, zoals het tellen van objecten of het identificeren van patronen in meerdere afbeeldingen. Een multimodale agent kan ook visueel met een webpagina communiceren, tekst lezen, op knoppen klikken en formulieren in realtime invullen. Bovendien zal zo'n multimodale AI-agent van cruciaal belang zijn om als robotbrein te dienen, waardoor in de toekomst nuttige robots kunnen worden ontwikkeld die de omgeving kunnen waarnemen met beeldsensoren, maar ook via taal met menselijke gebruikers kunnen praten.
Dat is de kracht van multimodale AI, waarbij verschillende soorten data worden gecombineerd om te leiden tot diepere inzichten en betere resultaten. Multimodale AI omvat meer dan tekst, afbeeldingen en geluiden. Het gaat erom AI te helpen de wereld te interpreteren zoals wij dat doen. Klik op de links in de beschrijving voor een nog gedetailleerdere blik op de technische componenten van het onderzoek naar multimodale AI bij Salesforce. Een bijzondere ontwikkeling van ons team die we graag voor het voetlicht willen brengen, is xGen-MM, ook wel bekend als BLIP. Het is een model dat tekst-, beeld- en videoverwerking integreert voor een geavanceerd begrip van visuele taal. Hieronder kun je er alles over lezen. Als je dit nuttig vond, geef deze video dan een like en abonneer je op ons kanaal voor meer van het AI Research Lab. Bedankt voor het kijken en tot de volgende keer!"
Ontdek wat AI-agents voor je bedrijf kunnen betekenen.
Klaar voor de volgende stap met Agentforce?
Bouw snel agenten.
Bekijk in onze bibliotheek hoe je agenten kunt bouwen.
Krijg deskundige begeleiding.
Lanceer Agentforce met snelheid, vertrouwen en ROI die je kunt meten.
Praat met een salesmedewerker.
Laat ons weten wat je zakelijke behoeften zijn, dan helpen wij je antwoorden te vinden.