Inteligencia artificial > IA multimodal > ¿Qué es la IA multimodal?Video
Transcripción del Video "¿Qué es la IA multimodal?":
"Bienvenido a AI Research Lab - Explained, la serie de Salesforce en la que te mostramos las técnicas emergentes de IA con las que experimenta nuestro equipo. Analizamos conceptos complejos y compartimos información del mundo real, todo desde la vanguardia de la investigación. Mi nombre es Juan Carlos Niebles y dirijo un equipo de investigación de IA aquí en Salesforce.
Una de las fronteras más emocionantes de la IA es la multimodalidad, la capacidad de los modelos de IA de comprender no solo el texto, sino también los sonidos y las imágenes. Ese será nuestro enfoque para este segmento. Ahora, ¿por qué nuestra investigación se centra en la multimodalidad? Bueno, piensa en cómo interactúas con el mundo: enviando mensajes de texto, compartiendo fotos, grabando videos, intercambiando notas de voz. Todos los días alternas fácilmente entre diferentes tipos de datos o modalidades. ¿No debería la IA hacer lo mismo? La inteligencia del mundo real simplemente no es unidimensional.
Ahí es donde entra en juego la IA multimodal. A diferencia de los modelos tradicionales de IA que solo procesan un tipo de entrada, como chatbots de solo texto o clasificadores de imágenes, los modelos multimodales fusionan múltiples fuentes de datos para crear una comprensión más rica y contextual del mundo. Por ejemplo, supongamos que le das un video a un sistema de IA multimodal y le preguntas: "¿Qué está pasando aquí?". En lugar de analizar solo el audio o un solo cuadro, procesa tanto el video como las secuencias de cuadros a la vez, identificando objetos, reconociendo el habla y comprendiendo la escena completa para generar una respuesta significativa.
Entonces, ¿cómo desarrollamos realmente la IA multimodal? Bueno, la IA multimodal funciona integrando múltiples modelos, como modelos visuales, de voz y de texto, y capacitándolos juntos para interconectarse de manera efectiva. Conceptualmente, esta arquitectura funciona de la siguiente manera: comenzamos con una IA basada en lenguaje, como un LLM, que ya entiende tokens de texto. Para habilitar capacidades multimodales, introducimos módulos de redes neuronales que actúan como traductores. La función de cada traductor es convertir las entradas de una modalidad, como los datos de píxeles de las imágenes, por ejemplo, a un formato que el LLM pueda entender. Ahora, tenemos un sistema de IA que integra el LLM y este módulo adicional para lograr la comprensión tanto del texto como de las imágenes. Luego de eso, podemos introducir un nuevo módulo para cada modalidad adicional, como datos de audio, video o sensores, que dan como resultado un sistema de IA multimodal que puede comprender múltiples tipos de datos.
Ahora, para que este concepto funcione, el sistema de IA debe pasar por una etapa de entrenamiento, un proceso de aprendizaje automático que emplea datos de ejemplo para optimizar el sistema. Cada módulo de traducción, al igual que el módulo de imagen a token, se puede capacitar de forma independiente o junto con los demás. Esta capacitación garantiza que el módulo pueda asignar con precisión el contenido de la imagen a un espacio vectorial que el LLM comprenda. Una vez capacitado, el LLM obtiene una nueva vía de entrada, lo que le permite procesar imágenes y generar respuestas basadas en su contenido. Como ya mencioné, este proceso se puede repetir para agregar más modalidades, como sonido o datos de sensores.
Curiosamente, luego del entrenamiento, nuestra investigación muestra que este sistema de IA multimodal no solo entiende cada modalidad por separado, sino que también puede responder preguntas multimodales. Por ejemplo, dada una imagen de un campo de fútbol y un clip de sonido de una guitarra, podemos preguntarle al sistema de IA: "¿Cuál de estas entradas es relevante para un músico?". Este razonamiento intermodal es una capacidad clave de la IA multimodal.
Entonces, ¿cómo encaja la multimodalidad en los sistemas de IA agéntica? Al integrar capacidades de IA multimodal en el marco del agente de IA, podemos permitir que los agentes interactúen de manera efectiva con más tipos de datos. Por ejemplo, un agente multimodal podría analizar una imagen y razonar sobre su contenido, como contar objetos o identificar patrones en varias imágenes. Un agente multimodal también podría interactuar con un sitio web visualmente, leyendo texto, haciendo clic en botones y completando formularios en tiempo real. Además, los agentes de IA multimodal de este tipo tendrán la tarea clave de funcionar como cerebro robótico, lo que permitirá tener robots útiles en el futuro que no solo puedan detectar el entorno con sensores de imagen, sino también comunicarse con usuarios humanos a través del lenguaje.
Ese es el poder de la IA multimodal, que combina diferentes tipos de datos para obtener información más profunda y mejores resultados. La IA multimodal es más que texto, imágenes y sonidos. Se trata de ayudar a la IA a interpretar el mundo de la manera en que lo hacemos. Para profundizar en los componentes técnicos de la investigación de IA multimodal que llevamos a cabo en Salesforce, puedes ver los enlaces en la descripción. Un trabajo específico de nuestro equipo que es digno de destacar es xGen-MM, también conocido como BLIP. Es un modelo que integra procesamiento de texto, imagen y video para una comprensión avanzada del lenguaje visual, y puedes leer todo sobre él a continuación. Si te resultó útil, dale me gusta al video y suscríbete para obtener más información sobre AI Research Lab. ¡Gracias por mirar y hasta la próxima!".
Obtén más información sobre los agentes de IA y cómo pueden ayudar a tu empresa.
¿Todo listo para dar el siguiente paso con Agentforce?
Desarrolla agentes rápidamente.
Echa un vistazo más de cerca a cómo funciona el desarrollo de agentes en nuestra biblioteca.
Obtén orientación de expertos.
Lanza Agentforce con velocidad, confianza y ROI que puedes medir.
Habla con un representante
Cuéntanos cuáles son las necesidades de tu empresa y te ayudaremos a encontrar respuestas.