Multimodal LLM — 複数のモダリティを1つの文脈で理解する仕組み
Multimodal Large Language Modelは、テキストを中心に画像、音声、動画など異なるモダリティを同時に理解し、生成処理まで行う大規模なAIモデルである。それぞれのモダリティを専用のencoderによってvector表現へ変換した後、共通のrepresentation space上で意味を対応付け、cross-attentionなどの統合メカニズムによって必要な情報を結び付ける。
07/18/2026