マルチモーダル学習 | JDLA Deep Learning for GENERAL(G検定)
マルチモーダル学習とは
マルチモーダル学習は画像、文章、音声など複数種類の情報を対応付け、統合して扱います。
具体例
単に別々のモデルを置くだけでなく、表現の整合、融合方法、欠損モダリティへの対応が論点です。
もう少し詳しく
この用語は単独で暗記せず、目的、入力、処理、結果、適用できない境界の順に説明できるようにします。実務では前提条件と評価基準を明記し、期待した結果と実測結果を区別します。
似た用語を見分けるときは、誰が何を判断するのか、いつ実施するのか、成果物が何かを比較します。名称だけで結論を出さず、問題文に示された条件へ定義を当てはめることが重要です。
試験でのポイント