멀티모달 AI란? 영상 스크립트:
"Salesforce 시리즈 AI 연구소 해설(AI Research Lab Explained)에 오신 것을 환영합니다. 저희 팀이 실험하고 있는 새롭고 떠오르는 AI 기술을 소개해 드립니다. 저희는 복잡한 개념을 쉽게 설명하고, 연구 최전선에서 얻은 실제 세계의 인사이트를 공유합니다. 제 이름은 후안 카를로스 니에블레스(Juan Carlos Niebles)이며, 이곳 Salesforce에서 AI 연구팀을 이끌고 있습니다.
AI 분야에서 가장 흥미로운 개척 분야 중 하나는 AI 모델이 텍스트뿐만 아니라 소리와 이미지도 이해하는 능력인 멀티모달리티입니다. 이번 세그먼트에서는 바로 이 주제에 초점을 맞추겠습니다. 그렇다면 저희 연구는 왜 멀티모달리티에 집중하고 있을까요? 여러분이 세상과 어떻게 소통하는지 생각해 보세요. 문자를 보내고, 사진을 공유하며, 동영상을 녹화하고, 음성 메모를 보냅니다. 여러분은 매일 다양한 유형의 데이터, 즉 양식(modality) 사이를 자연스럽게 오갑니다. AI도 그렇게 해야 하지 않을까요? 현실 세계의 지능은 결코 1차원적이지 않습니다.
바로 이 지점에서 멀티모달 AI가 필요합니다. 텍스트 전용 챗봇이나 이미지 분류기처럼 한 가지 유형의 입력만 처리하는 기존 AI 모델과 달리, 멀티모달 모델은 여러 데이터 소스를 융합하여 세상에 대해 더 풍부하고 맥락에 맞는 이해를 형성합니다. 예를 들어, 멀티모달 AI 시스템에 동영상을 보여주며 "여기서 무슨 일이 일어나고 있나요?"라고 질문한다고 가정해 보겠습니다. 단순히 오디오나 단일 프레임만 분석하는 대신, 비디오와 연속된 프레임을 동시에 처리하여 객체를 식별하고, 음성을 인식하며, 전체 장면을 파악하여 의미 있는 답변을 생성합니다.
그렇다면 실제로 멀티모달 AI를 구축하려면 어떻게 해야 할까요? 멀티모달 AI는 시각 모델, 음성 모델, 텍스트 모델과 같은 여러 모델을 통합하고, 이들을 함께 훈련시켜 효과적으로 상호 연결되도록 함으로써 작동합니다. 개념적으로 이 아키텍처는 다음과 같이 작동합니다. 먼저, 이미 텍스트 토큰을 이해하는 LLM과 같은 언어 기반 AI에서 시작합니다. 멀티모달 기능을 활성화하기 위해, 우리는 번역기 역할을 하는 신경망 모듈을 도입합니다. 각 번역기의 역할은 예를 들어 이미지의 픽셀 데이터와 같은 한 양식의 입력을 LLM이 이해할 수 있는 형식으로 변환하는 것입니다. 이제 우리는 LLM과 이 추가 모듈을 통합하여 텍스트와 이미지 모두를 이해하는 AI 시스템을 갖게 됩니다. 그 후, 오디오, 비디오 또는 센서 데이터와 같은 추가적인 양식마다 새로운 모듈을 도입하여 여러 유형의 데이터를 이해할 수 있는 멀티모달 AI 시스템을 만들 수 있습니다.
이제 이 개념을 실현하려면 AI 시스템을 훈련시켜야 하는데, 이는 예시 데이터를 사용하여 시스템을 최적화하는 기계 학습 과정입니다. 이미지-토큰 모듈과 같은 각 번역 모듈은 독립적으로 또는 다른 모듈과 함께 훈련될 수 있습니다. 이 훈련을 통해 모듈은 이미지 콘텐츠를 LLM이 이해하는 벡터 공간에 정확하게 매핑할 수 있게 됩니다. 훈련이 완료되면 LLM은 새로운 입력 경로를 얻게 되어 이미지를 처리하고 그 내용에 기반한 응답을 생성할 수 있습니다. 이 과정은 소리나 센서 데이터와 같은 더 많은 양식을 추가하기 위해 반복될 수 있습니다.
흥미롭게도 훈련 후 저희 연구에 따르면 이 멀티모달 AI 시스템은 각 양식을 개별적으로 이해하는 데 그치지 않습니다. 또한 교차 모달(cross-modal) 질문에도 답할 수 있습니다. 예를 들어, 축구장 이미지와 기타 소리 클립을 주고 AI 시스템에 "어떤 입력이 음악가와 관련이 있나요?"라고 물을 수 있습니다. 이러한 교차 모달 추론은 멀티모달 AI의 핵심 기능입니다.
그렇다면 멀티모달리티는 AI 에이전트 시스템에 어떻게 적용될까요? 멀티모달 AI 기능을 AI 에이전트 프레임워크에 통합함으로써 에이전트가 더 많은 유형의 데이터와 효과적으로 상호 작용할 수 있도록 할 수 있습니다. 예를 들어, 멀티모달 에이전트는 이미지를 분석하고 그 내용에 대해 추론할 수 있습니다. 가령 객체의 수를 세거나 여러 이미지에 걸쳐 패턴을 식별하는 것과 같습니다. 또한 멀티모달 에이전트는 웹페이지와 시각적으로 상호 작용하며 실시간으로 텍스트를 읽고, 버튼을 클릭하고, 양식을 작성할 수 있습니다. 더 나아가, 이러한 멀티모달 AI 에이전트는 로봇의 두뇌 역할을 하는 핵심이 되어, 미래에 이미지 센서로 환경을 감지하면서도 언어를 통해 인간 사용자와 대화할 수 있는 유용한 로봇을 가능하게 할 것입니다.
이것이 바로 다양한 유형의 데이터를 결합하여 더 깊은 통찰력과 더 나은 결과를 이끌어내는 멀티모달 AI의 힘입니다. 멀티모달 AI는 텍스트, 이미지, 소리 그 이상입니다. 이는 AI가 우리가 세상을 해석하는 방식대로 세상을 해석하도록 돕는 것입니다. Salesforce의 멀티모달 AI 연구의 기술적 구성 요소에 대해 더 깊이 알고 싶으시다면, 설명란의 링크를 참조해 주세요. 저희 팀의 연구 중 특별히 강조하고 싶은 것은 BLIP으로도 알려진 xGen-MM입니다. 이 모델은 텍스트, 이미지, 비디오 처리를 통합하여 고급 시각적 언어 이해를 구현하며, 아래에서 자세한 내용을 읽어보실 수 있습니다. 이 영상이 도움이 되셨다면 좋아요를 누르고 구독하여 AI 연구소의 더 많은 소식을 받아보세요. 시청해 주셔서 감사합니다. 다음에 또 뵙겠습니다!"