什麼是多模態 AI 影片 文字轉出:
歡迎來到《AI 研究實驗室解說》,這是 Salesforce 的系列,我們會在這裡向您展示我們團隊正在嘗試的新興人工智慧技術。我們拆解複雜的概念,並分享真實世界的洞察,我們所有內容都來自研究最前線。我的名字是 Juan Carlos Niebles,我在 Salesforce 領導一個人工智慧研究團隊。
AI 中最令人興奮的一個尖端領域是「多模態」,也就是 AI 模型不僅能理解文字,還能理解聲音與影像的能力。這將是我們今天的重點。現今,為什麼我們的研究要聚焦在多模態呢?想一想您如何與世界互動:傳訊息、分享照片、錄製影片和發送語音訊息等。您每天都在無縫切換不同種類的資料或模態。AI 不也應該做到同樣的事嗎?真實世界的智慧並非單一維度。
這就是多模態 AI 發揮作用之處。與純文字聊天機器人或影像分類器等只處理單一輸入的傳統 AI 模型不同,多模態模型會融合多種資料來源,建立對世界更豐富且具情境的理解。例如,假設您丟一段影片給一個多模態 AI 系統,並發問:「這裡發生了什麼事?」它不會只分析音訊或單一影格,而是同時處理影片及影格序列,進而辨識對象、識別語音,並理解整個場景,藉以生成有意義的回應。
那麼,我們究竟要如何建構多模態 AI 呢?多模態 AI 的運作方式是整合多個模型,例如視覺模型、語音模型和文字模型,並將它們一起訓練,以達到有效的相互連結成果。在概念上,這種架構的運作方式如下:例如我們從一個大型語言模型 LLM,也就是語言型的 AI 開始,它已經能夠理解文字標記。為了啟用多模態功能,我們引入扮演翻譯器角色的「神經網路模組」。每個翻譯器的作用是將影像的像素資料等一種模態輸入,轉換成 LLM 可以理解的格式。這樣我們就得到一個整合了 LLM 與額外模組的 AI 系統,能同時理解文字與影像。接著,我們可以針對音訊、影片或感測器資料等每種新的模態,引入一個新模組,藉以形成能理解多種資料的多模態 AI 系統。
現在,為了讓這個概念起作用,我們必須讓 AI 系統經歷訓練,也就是利用範例資料來最佳化系統的機器學習過程。例如影像轉換成文字標記模組等每個翻譯模組,可以單獨訓練,也可以與其他模組一起訓練。這種訓練可確保模組能準確地將影像內容映射到 LLM 能理解的向量空間。經過培訓後,LLM 就獲得了一條新的輸入途徑,能夠處理影像並根據其內容生成回應。同樣地,可以重複這個過程,來新增更多模態,例如聲音或感測器資料。
有趣的是,在訓練之後,我們的研究顯示這個多模態 AI 系統不僅能分別理解各種模態,還能回答跨模態的問題。例如,將足球場影像和一段吉他的聲音片段輸入到 AI 系統中,我們可以發問:「哪個輸入資料與音樂家相關?」這種跨模態推理是多模態 AI 的一種關鍵能力。
那麼多模態如何融入 AI 代理系統呢?將多模態 AI 的能力整合到 AI 智慧代理的框架中,我們可以有效地讓智慧代理能與更多類型的資料互動。舉例來說,一個多模態代理可以分析一張影像並推理其內容,例如計算物件的數量,或在多張影像中找出規律。一個多模態代理也能以視覺方式與網頁互動,如即時閱讀文字、點擊按鈕並填寫表單。此外,這樣的多模態 AI 代理將成為機器人大腦的關鍵,使未來的實用機器人能透過影像感測器感知環境,同時還能透過語言與人類使用者交談。
這就是多模態 AI 的力量,結合不同類型的資料,帶來更深入的洞察和更好的結果。多模態 AI 不僅僅是文字、影像和聲音。它的核心概念在協助 AI 像我們一樣去理解這個世界。若想更深入了解 Salesforce 在多模態 AI 研究中的技術元件,您可以查看說明中的連結。我們團隊的一項重點工作是 xGen-MM,也被稱為 BLIP。這是一種整合文字、影像與影片處理的模型,用於進階視覺語言理解,您可以在下方詳細閱讀相關資訊。如果您覺得本影片有幫助,請按讚並訂閱,獲取更多來自 AI 研究實驗室的內容。感謝收看,我們下次再見!