Inteligencia artificial > IA multimodal > Vídeo "Qué es la IA multimodal"
Vídeo "Qué es la IA multimodal": transcripción
"Les damos la bienvenida al Laboratorio de Investigación en IA, la serie de Salesforce en la que analizamos las técnicas emergentes de IA que nuestro equipo está probando. Desglosamos conceptos complejos y compartimos información práctica, todo ello desde la vanguardia de la investigación. Soy Juan Carlos Niebles y lidero un equipo de investigación de IA en Salesforce.
Una de las fronteras más emocionantes de la IA es la multimodalidad: la capacidad de los modelos de IA para comprender no solo el texto, sino también los sonidos y las imágenes. En esta tecnología es en la que nos centraremos. ¿Y por qué centramos el análisis en la multimodalidad? Pensemos en cómo interactuamos con el mundo: enviamos mensajes de texto, compartimos fotos, grabamos vídeos y enviamos notas de voz. Todos los días, pasamos naturalmente de diferentes tipos de datos o modalidades a otros. ¿No debería la IA hacer lo mismo? La inteligencia del mundo real no es unidimensional.
Ahí es donde entra en juego la IA multimodal. A diferencia de los modelos tradicionales de IA, que solo procesan un tipo de entrada, como los chatbots de solo texto o los clasificadores de imágenes, los modelos multimodales fusionan varias fuentes de datos para formarse una comprensión más rica y contextual del mundo. Por ejemplo, supongamos que envía un video a un sistema de IA multimodal y le pregunta: "¿Qué está pasando aquí?" En lugar de analizar solo el audio o un fotograma, la IA multimodal procesa simultáneamente tanto el video como los fotogramas, para identificar objetos, reconocer el habla y comprender la escena en su totalidad con el objetivo de generar una respuesta significativa.
¿Y cómo se desarrolla la IA multimodal? La IA multimodal integra varios modelos, como los visuales, los de voz y los de texto, que se entrenan juntos para interconectarse de manera efectiva. Conceptualmente, la arquitectura funciona de la siguiente manera: empezamos con una IA basada en el lenguaje, como un LLM, que entiende tókenes de texto. Para habilitar las capacidades multimodales, incorporamos módulos de redes neuronales que actúan como traductores. La función de cada uno de estos traductores es convertir las entradas de una modalidad, como los datos de píxeles de las imágenes, a un formato que el LLM pueda entender. Ahora tenemos un sistema de IA que integra el LLM y este módulo adicional para poder entender tanto el texto como las imágenes. A continuación, podemos introducir un módulo nuevo para cada modalidad adicional, como datos de audio, vídeo o sensores, lo que dará como resultado un sistema de IA multimodal capaz de comprender múltiples tipos de datos.
Para que este concepto funcione, tenemos que entrenar al sistema de IA a través de un proceso de aprendizaje automático con datos de ejemplo para su optimización. Cada módulo de traducción, al igual que el módulo de imagen a token, se puede entrenar de forma independiente o junto con los demás. El entrenamiento asegura que el módulo pueda asignar con precisión el contenido de la imagen a un espacio vectorial que el LLM comprenda. Una vez entrenado, el LLM obtiene una nueva vía de entrada que le permite procesar imágenes y generar respuestas basadas en su contenido. De nuevo, este proceso se puede repetir para agregar más modalidades como sonido o datos de sensores.
Curiosamente, después del entrenamiento, nuestra investigación demuestra que este sistema de IA multimodal no solo entiende cada modalidad por separado. También es capaz de responder a preguntas multimodales. Por ejemplo, si le damos una imagen de un campo de fútbol y un clip de sonido de una guitarra, le podemos preguntar: "¿Cuál es la entrada relevante para un músico?" Este razonamiento en el que se cotejan varias modalidades de datos es una capacidad clave en la IA multimodal.
Dicho esto, ¿cómo encaja la multimodalidad en los sistemas agénticos de IA? Si integramos las capacidades de la IA multimodal en el marco de los agentes de IA, conseguimos que los agentes interactúen de manera efectiva con más tipos de datos. Por ejemplo, un agente multimodal podría analizar una imagen y razonar sobre su contenido, como contar objetos o identificar patrones en varias imágenes. El agente multimodal también podría interactuar visualmente con una página web, leyendo texto, haciendo clic en botones y completando formularios en tiempo real. Además, los agentes de IA multimodal de este tipo serán claves para funcionar como cerebro robótico, lo que permitirá crear robots útiles en el futuro que puedan percibir el entorno con sensores de imagen, pero que también puedan comunicarse con los usuarios humanos a través del lenguaje.
Ese es el poder de la IA multimodal: combinar diferentes tipos de datos para obtener información más profunda y mejores resultados. La IA multimodal es más que analizar texto, imágenes y sonidos. Se trata de ayudar a la IA a interpretar el mundo de la manera en que lo hacemos los humanos. Si quieren profundizar en los componentes técnicos de la investigación de la IA multimodal en Salesforce, revisen los enlaces incluidos en la descripción. Un trabajo que merece la pena destacar de nuestro equipo es xGen-MM, también conocido como BLIP. Se trata de un modelo que integra el procesamiento de texto, imágenes y vídeos para lograr una comprensión avanzada del lenguaje visual. Podrán conocer los detalles más abajo. Si les ha resultado útil, hagan clic en 'Me gusta' y suscríbanse para ver más contenido del Laboratorio de Investigación en IA. ¡Gracias y hasta la próxima!"
Obtenga más información sobre los agentes de IA y cómo pueden ayudar a su empresa.
¿Todo listo para dar el siguiente paso con Agentforce?
Cree agentes IA rápidamente.
Conozca en detalle cómo funciona la creación de agentes en nuestra biblioteca de recursos.
Obtenga orientación experta.
Lance Agentforce rápidamente, con confianza y consiga un ROI que pueda medir.
Hable con un representante.
Cuéntenos las necesidades de su negocio y le ayudaremos a encontrar respuestas.