Inteligência artificial > IA multimodal > O que é IA multimodal Vídeo
O que é IA multimodal Vídeo Transcrição:
"Boas-vindas ao AI Research Lab Explained, a série Salesforce em que mostramos as novas técnicas de IA que nossa equipe está testando. Analisamos conceitos complexos e compartilhamos insights do mundo real, tudo o que está na vanguarda da pesquisa. Meu nome é Juan Carlos Niebles e lidero uma equipe de pesquisa de IA aqui, na Salesforce.
Uma das fronteiras mais empolgantes da IA é a multimodalidade, a capacidade dos modelos de IA de entender não apenas texto, mas também sons e imagens. Esse será o nosso foco neste segmento. Mas por que nossa pesquisa está focada na multimodalidade? Pense em como você interage com o mundo: enviando mensagens de texto, compartilhando fotos, gravando vídeos, enviando notas de voz. Todos os dias, você alterna facilmente entre diferentes tipos de dados ou modalidades. A IA não deveria fazer o mesmo? A inteligência do mundo real simplesmente não é unidimensional.
É aí que entra a IA multimodal. Ao contrário dos modelos tradicionais de IA, que processam apenas um tipo de entrada, como chatbots somente de texto ou classificadores de imagens, os modelos multimodais fundem várias fontes de dados para criar uma compreensão mais rica e contextual do mundo. Por exemplo, digamos que você apresente um vídeo a um sistema de IA multimodal e pergunte: "O que está acontecendo aqui?". Em vez de analisar apenas o áudio ou um único quadro, ele processa o vídeo e as sequências de quadros ao mesmo tempo, identificando objetos, reconhecendo a fala e entendendo a cena completa para gerar uma resposta significativa.
Então, como realmente construir uma IA multimodal? Bem, a IA multimodal funciona integrando vários modelos, como modelos visuais, modelos de fala e modelos de texto, e treinando-os juntos para os interconectar de forma eficaz. Conceitualmente, essa arquitetura funciona da seguinte maneira: começamos com uma IA baseada em linguagem, como um LLM, que já entende tokens de texto. Para habilitar recursos multimodais, introduzimos os Módulos de rede neural, que atuam como tradutores. O papel de cada tradutor é converter entradas de uma modalidade, como dados de pixels de imagens, por exemplo, em um formato que o LLM possa entender. Agora, temos um sistema de IA que integra o LLM e esse módulo adicional para compreender o texto e as imagens. Depois disso, podemos introduzir ainda mais um módulo para cada modalidade adicional, como áudio, vídeo ou dados de sensores, que resultam em um sistema de IA multimodal capaz de entender vários tipos de dados.
Agora, para fazer esse conceito funcionar, precisamos treinar nosso sistema de IA, um processo de machine learning que usa dados de exemplo para otimizar um sistema. Cada Módulo de tradução, como o módulo image-to-token, pode ser treinado de forma independente ou junto com os outros. Esse treinamento garante que o módulo possa mapear com precisão o conteúdo da imagem em um espaço vetorial que o LLM compreenda. Uma vez treinado, o LLM ganha um novo caminho de entrada, com o qual pode processar imagens e gerar respostas com base no conteúdo dessas imagens. Novamente, esse processo pode ser repetido para adicionar mais modalidades, como dados de som ou sensores.
Curiosamente, após o treinamento, nossa pesquisa mostra que esse sistema de IA multimodal não entende apenas cada modalidade separadamente. Ele também pode responder a perguntas intermodais. Por exemplo, dada a imagem de um campo de futebol e o clipe de som de uma guitarra, podemos perguntar ao sistema de IA: "Qual entrada é relevante para um músico?". Esse raciocínio intermodal é uma capacidade fundamental da IA multimodal.
Então, como a multimodalidade se encaixa nos sistemas agentes de IA? Bem, ao integrar recursos da IA multimodal à estrutura de agentes de IA, possibilitamos efetivamente que os agentes interajam com mais tipos de dados. Por exemplo, um agente multimodal pode analisar uma imagem e raciocinar sobre seu conteúdo, como contar objetos ou identificar padrões em várias imagens. Um agente multimodal também pode interagir visualmente com uma página da web, lendo texto, clicando em botões e preenchendo formulários em tempo real. Além disso, esse agente de IA multimodal terá uma utilidade fundamental como um cérebro robótico, permitindo que robôs úteis no futuro possam sentir o ambiente com sensores de imagem e também possam conversar com usuários humanos por meio da linguagem.
Esse é o poder da IA multimodal: combinar diferentes tipos de dados para gerar insights mais avançados e melhores resultados. A IA multimodal é mais do que texto, imagens e sons. Ela ajuda a IA a interpretar o mundo da maneira como nós, humanos, fazemos. Para se aprofundar nos componentes técnicos da pesquisa sobre IA multimodal na Salesforce, acesse os links na descrição. Um trabalho específico da nossa equipe que eu gostaria de destacar é o XGen-MM, também conhecido como BLIP. É um modelo que integra processamento de texto, imagem e vídeo para gerar uma compreensão avançada da linguagem visual. Saiba mais sobre ele a seguir. Se você achou esse conteúdo útil, curta o vídeo e inscreva-se para receber mais informações do AI Research Lab. Agradecemos por assistir, e até a próxima!"
Saiba mais sobre agentes de IA e como eles podem ajudar sua empresa.
Tudo pronto para dar o próximo passo com Agentforce?
Crie agentes rapidamente
Veja mais detalhadamente como a criação de agentes funciona em nossa biblioteca.
Obtenha orientação especializada
Lance Agentforce com velocidade, confiança e ROI que você pode medir.
Fale com um representante
Conte-nos sobre as necessidades dos seus negócios, e ajudaremos você a encontrar respostas.