ปัญญาประดิษฐ์ > AI แบบหลายโหมด > AI แบบหลายโหมดคืออะไร วิดีโอ
AI แบบหลายโหมดคืออะไร วิดีโอ บทบรรยาย:
"ยินดีต้อนรับสู่ AI Research Lab Explained ซีรีส์ Salesforce ซึ่งเราจะพาคุณไปดูเทคนิค AI ใหม่ๆ ที่กำลังเกิดขึ้นซึ่งทีมของเรากำลังทดลองใช้" เราวิเคราะห์แนวคิดที่ซับซ้อนและแบ่งปันข้อมูลเชิงลึกจากโลกแห่งความเป็นจริงทั้งหมดจากแนวหน้าของการวิจัย ฉันชื่อฮวน คาร์ลอส นีเบิลส์ เป็นผู้นำทีมวิจัย AI ที่ Salesforce
หนึ่งในขอบเขตที่น่าตื่นเต้นที่สุดของ AI คือมัลติโมดัลลิตี้ ซึ่งเป็นความสามารถของโมเดล AI ที่จะเข้าใจไม่เพียงแค่ข้อความเท่านั้น แต่ยังรวมถึงเสียงและรูปภาพด้วย นั่นจะเป็นจุดเน้นของเราสำหรับส่วนนี้ แล้วทำไมการวิจัยของเราจึงมุ่งเน้นไปที่หลายรูปแบบ ลองคิดดูว่าคุณจะโต้ตอบกับโลกอย่างไร เช่น การส่งข้อความ การแชร์รูปภาพ การบันทึกวิดีโอ การส่งข้อความเสียง คุณสามารถสลับระหว่างประเภทข้อมูลหรือโหมดต่างๆ ได้อย่างราบรื่นทุกวัน AI ไม่ควรทำเช่นเดียวกันหรือ สติปัญญาในโลกแห่งความเป็นจริงไม่ได้มีมิติเดียว
นั่นคือที่มาของ AI แบบหลายโหมด จะต่างจากโมเดล AI ดั้งเดิมที่ประมวลผลอินพุตเพียงประเภทเดียว เช่น แชทบอทแบบข้อความล้วนหรือตัวจำแนกภาพ เพราะโมเดลมัลติโหมดจะรวมแหล่งข้อมูลหลายแหล่งเข้าด้วยกันเพื่อสร้างความเข้าใจโลกที่สมบูรณ์และอิงบริบทมากขึ้น ตัวอย่างเช่น สมมติว่าคุณให้วิดีโอแก่ระบบ AI แบบหลายโหมดและถามว่า "เกิดอะไรขึ้นที่นี่" แทนที่จะวิเคราะห์เพียงเสียงหรือเฟรมเดียว ระบบจะประมวลผลทั้งวิดีโอและลำดับเฟรมในคราวเดียว โดยระบุวัตถุ รับรู้คำพูด และทำความเข้าใจฉากทั้งหมดเพื่อสร้างการตอบสนองที่มีความหมาย
แล้วเราจะสร้าง AI แบบหลายโหมดได้จริงอย่างไร AI แบบหลายโหมดทำงานโดยการผสานการทำงานโมเดลต่างๆ เช่น โมเดลภาพ โมเดลเสียง และโมเดลข้อความ จากนั้นฝึกอบรมพวกมันเข้าด้วยกันเพื่อเชื่อมต่อกันได้อย่างมีประสิทธิภาพ ในทางแนวคิด สถาปัตยกรรมนี้ทำงานดังต่อไปนี้: เราเริ่มต้นด้วย AI ที่ใช้ภาษา เช่น LLM ซึ่งเข้าใจโทเค็นข้อความอยู่แล้ว เพื่อเปิดใช้งานความสามารถแบบหลายโหมด เราขอแนะนำโมดูลเครือข่ายประสาทที่ทำหน้าที่เป็นตัวแปล บทบาทของนักแปลแต่ละคนคือการแปลงอินพุตจากโหมดหนึ่ง เช่น ข้อมูลพิกเซลจากรูปภาพ เป็นต้น ให้เป็นรูปแบบที่ LLM สามารถเข้าใจได้ ขณะนี้เรามีระบบ AI ที่ผสานการทำงาน LLM และโมดูลเพิ่มเติมนี้เพื่อให้สามารถเข้าใจทั้งข้อความและรูปภาพ หลังจากนั้น เราสามารถแนะนำโมดูลใหม่สำหรับแต่ละโหมดเพิ่มเติม เช่น เสียง วิดีโอ หรือข้อมูลเซ็นเซอร์ ซึ่งส่งผลให้เกิดระบบ AI แบบหลายโหมดที่สามารถเข้าใจข้อมูลหลายประเภทได้
ในการที่จะทำให้แนวคิดนี้ใช้งานได้ เราจะต้องนำระบบ AI ของเราเข้าสู่การฝึกอบรม ซึ่งเป็นกระบวนการเรียนรู้ของเครื่องจักรที่ใช้ข้อมูลตัวอย่างเพื่อเพิ่มประสิทธิภาพระบบ แต่ละโมดูลการแปล เช่น โมดูลการแปลงรูปภาพเป็นโทเค็น สามารถฝึกได้อย่างอิสระหรือควบคู่กันกับโมดูลอื่นๆ การฝึกอบรมนี้ช่วยให้แน่ใจว่าโมดูลสามารถแมปเนื้อหาของภาพไปยังเวกเตอร์สเปซที่ LLM เข้าใจได้อย่างแม่นยำ เมื่อผ่านการฝึกอบรมแล้ว LLM จะได้รับเส้นทางอินพุตใหม่ ซึ่งทำให้สามารถประมวลผลภาพและสร้างการตอบสนองตามเนื้อหาของภาพได้ สามารถทำซ้ำขั้นตอนนี้ได้อีกครั้งเพื่อเพิ่มคุณสมบัติอื่นๆ เช่น เสียงหรือข้อมูลเซ็นเซอร์
ที่น่าสนใจคือ หลังจากการฝึกอบรม การวิจัยของเราแสดงให้เห็นว่าระบบ AI แบบหลายโหมดไม่ได้เข้าใจแต่ละโหมดแยกจากกัน นอกจากนี้ยังสามารถตอบคำถามข้ามโหมดได้อีกด้วย ตัวอย่างเช่น หากมีรูปภาพสนามฟุตบอลและคลิปเสียงของกีตาร์ เราสามารถถามระบบ AI ได้ว่า "อินพุตใดมีความเกี่ยวข้องกับนักดนตรี" การใช้เหตุผลแบบข้ามโหมดนี้เป็นความสามารถหลักของ AI แบบหลายโหมด
แล้วมัลติโมดัลลิตี้จะเข้ากับระบบตัวแทน AI ได้อย่างไร ด้วยการผสานการทำงานความสามารถของ AI แบบหลายโหมดเข้ากับเฟรมเวิร์กตัวแทน AI เราสามารถเปิดใช้งานตัวแทนให้โต้ตอบกับข้อมูลประเภทต่างๆ ได้มากขึ้นอย่างมีประสิทธิภาพ ตัวอย่างเช่น ตัวแทนมัลติโหมดสามารถวิเคราะห์ภาพและหาเหตุผลเกี่ยวกับเนื้อหา เช่น การนับวัตถุหรือการระบุรูปแบบต่างๆ ทั่วทั้งภาพหลายภาพ ตัวแทนมัลติโหมดยังสามารถโต้ตอบกับเว็บเพจในรูปแบบภาพได้ เช่น อ่านข้อความ คลิกปุ่ม และกรอกแบบฟอร์มแบบเรียลไทม์ ยิ่งไปกว่านั้น ตัวแทน AI แบบหลายโหมดดังกล่าวจะเป็นกุญแจสำคัญในการทำหน้าที่เป็นสมองหุ่นยนต์ ช่วยให้หุ่นยนต์ที่มีประโยชน์ในอนาคตสามารถรับรู้สภาพแวดล้อมด้วยเซ็นเซอร์ภาพและยังสามารถพูดคุยกับผู้ใช้มนุษย์ผ่านภาษาได้อีกด้วย
นั่นคือพลังของ AI แบบหลายโหมดที่ผสมผสานข้อมูลประเภทต่างๆ เพื่อให้ได้ข้อมูลเชิงลึกที่ลึกซึ้งยิ่งขึ้นและผลลัพธ์ที่ดีกว่า AI แบบหลายโหมดมีมากกว่าข้อความ รูปภาพ และเสียง มันเป็นเรื่องของการช่วยให้ AI ตีความโลกตามแบบที่เราทำ หากต้องการเจาะลึกส่วนประกอบทางเทคนิคของการวิจัย AI แบบหลายโหมดที่ Salesforce คุณสามารถดูลิงก์ในคำอธิบายได้ ผลงานหนึ่งที่โดดเด่นจากทีมของเราคือ xGen-MM หรือที่เรียกอีกอย่างว่า BLIP เป็นโมเดลที่ผสานการทำงานการประมวลผลข้อความ รูปภาพ และวิดีโอ เพื่อความเข้าใจภาษาภาพขั้นสูง และคุณสามารถอ่านเพิ่มเติมเกี่ยวกับเรื่องนี้ได้ด้านล่าง หากคุณพบว่าสิ่งนี้มีประโยชน์ โปรดกดไลค์วิดีโอและสมัครรับข้อมูลเพื่อดูเพิ่มเติมจาก AI Research Lab ขอบคุณที่รับชมแล้วพบกันใหม่โอกาสหน้าครับ!
เรียนรู้เพิ่มเติมเกี่ยวกับตัวแทน AI และวิธีที่สามารถช่วยธุรกิจของคุณได้
พร้อมที่จะก้าวไปสู่ขั้นต่อไปกับ Agentforce แล้วหรือยัง
สร้างตัวแทนอย่างรวดเร็ว
ศึกษารายละเอียดเพิ่มเติมเกี่ยวกับวิธีการสร้างตัวแทนในไลบรารีของเรา
รับคำแนะนำจากผู้เชี่ยวชาญ
เปิด Agentforce ด้วยความเร็ว ความมั่นใจและ ROI ที่คุณสามารถวัดได้
พูดคุยกับตัวแทน
บอกเราเกี่ยวกับความต้องการทางธุรกิจของคุณ และเราจะช่วยคุณค้นหาคำตอบ