Artificiell intelligens > Multimodal AI > Vad är multimodal AI Video
Vad är multimodal AI Video Transkription:
"Välkommen till AI Research Lab Explained, Salesforce-serien, där vi ger dig en inblick i de nya, framväxande AI-tekniker som vårt team experimenterar med." Vi bryter ner komplexa koncept och delar insikter från verkligheten, allt från forskningens framkant. Mitt namn är Juan Carlos Niebles och jag leder ett AI-forskningsteam här på Salesforce.
En av de mest spännande frontlinjerna inom AI är multimodalitet, förmågan för AI-modeller att förstå inte bara text utan även ljud och bilder. Det kommer att vara vårt fokus för det här segmentet. Varför fokuserar vår forskning på multimodalitet? Tänk på hur du interagerar med världen: sms:ar, delar foton, spelar in videor, skickar röstmeddelanden. Varje dag växlar du sömlöst mellan olika typer av data eller modaliteter. Borde inte AI göra detsamma? Verklig intelligens är helt enkelt inte endimensionell.
Det är där multimodal AI kommer in i bilden. Till skillnad från traditionella AI-modeller som bara bearbetar en typ av inmatning, som textbaserade chattrobotar eller bildklassificerare, sammanfogar multimodala modeller flera datakällor för att skapa en rikare och mer kontextuell förståelse av världen. Låt oss till exempel säga att du visar ett multimodalt AI-system en video och frågar: "Vad händer här?" Istället för att bara analysera ljudet eller en enskild bildruta bearbetar den både video och sekvenser av bildrutor samtidigt, identifierar objekt, känner igen tal och förstår hela scenen för att generera ett meningsfullt svar.
Så hur bygger vi egentligen multimodal AI? Multimodal AI fungerar genom att integrera flera modeller, såsom visuella modeller, talmodeller och textmodeller, och träna dem tillsammans så att de sammankopplas effektivt. Konceptuellt fungerar denna arkitektur så här: vi börjar med en språkbaserad AI som en LLM, som redan förstår texttokens. För att möjliggöra multimodala funktioner introducerar vi neurala nätverksmoduler som fungerar som översättare. Varje översättares roll är att konvertera indata från en modalitet, som till exempel pixeldata från bilder, till ett format som LLM kan förstå. Nu har vi ett AI-system som integrerar LLM och denna tilläggsmodul för att uppnå förståelse av både text och bilder. Efter det kan vi introducera en ny modul för varje ytterligare modalitet, såsom ljud, video eller sensordata, vilket resulterar i ett multimodalt AI-system som kan förstå flera typer av data.
För att få det här konceptet att fungera måste vi nu träna vårt AI-system, en maskininlärningsprocess som använder exempeldata för att optimera ett system. Varje översättningsmodul, liksom bild-till-token-modulen, kan tränas oberoende av varandra eller tillsammans med de andra. Denna utbildning säkerställer att modulen korrekt kan mappa bildinnehåll till ett vektorrum som LLM:en förstår. När den väl är tränad får LLM:en en ny inmatningsväg, vilket gör att den kan bearbeta bilder och generera svar baserat på deras innehåll. Återigen kan denna process upprepas för att lägga till fler modaliteter som ljud eller sensordata.
Intressant nog visar vår forskning efter träning att detta multimodala AI-system inte bara förstår varje modalitet separat. Den kan också besvara frågor som sträcker sig över flera modaliteter. Till exempel, givet en bild av en fotbollsplan och ett ljudklipp av en gitarr, kan vi fråga AI-systemet: "Vilken input är relevant för en musiker?" Detta tvärmodala resonemang är en nyckelfunktion hos multimodal AI.
Så hur passar multimodalitet in i AI-agentsystem? Genom att integrera multimodala AI-funktioner i AI-agentramverket kan vi effektivt göra det möjligt för agenter att interagera med fler typer av data. Till exempel kan en multimodal agent analysera en bild och resonera kring dess innehåll, som att räkna objekt eller identifiera mönster i flera bilder. En multimodal agent kan också interagera visuellt med en webbsida, läsa text, klicka på knappar och fylla i formulär i realtid. Dessutom kommer en sådan multimodal AI-agent att vara nyckeln till att fungera som en robothjärna, vilket möjliggör användbara robotar i framtiden som kan känna av omgivningen med bildsensorer men också kan prata med mänskliga användare via språk.
Det är kraften i multimodal AI, att kombinera olika typer av data för att leda till djupare insikter och bättre resultat. Multimodal AI är mer än text, bilder och ljud. Det handlar om att hjälpa AI att tolka världen på samma sätt som vi gör. För en djupare fördjupning i de tekniska komponenterna i den multimodala AI-forskningen på Salesforce kan du se länkarna i beskrivningen. Ett särskilt arbete att lyfta fram från vårt team är xGen-MM, även känt som BLIP. Det är en modell som integrerar text-, bild- och videobehandling för avancerad visuell språkförståelse, och du kan läsa allt om det nedan. Om du tyckte att detta var användbart, gilla videon och prenumerera för mer från AI Research Lab. Tack för att du tittade och vi ses nästa gång!"
Läs mer om AI-agenter och hur de kan hjälpa din verksamhet.
Redo att ta nästa steg med Agentforce?
Skapa agenter snabbt.
Titta närmare på hur det går till att bygga agenter i vårt bibliotek.
Få expertvägledning.
Lansera Agentforce med hastighet, förtroende och ROI som du kan mäta.
Prata med en representant.
Berätta vad du behöver så hjälper vi dig vidare.