Multimodal Alignment — Le principe d’alignement des modalités dans un espace sémantique commun
Multimodal Alignment désigne une approche d’apprentissage qui consiste à projeter les représentations de différentes modalités, comme les images, le texte ou l’audio, dans un même espace sémantique (embedding space) afin de pouvoir comparer leurs significations. Même si chaque type de donnée possède une structure différente, le modèle apprend à rapprocher les représentations qui partagent un même sens et à éloigner celles qui ne présentent aucune relation. L’objectif n’est pas de fusionner artificiellement toutes les modalités, mais de placer leurs représentations dans un espace de coordonnées sémantique commun où les correspondances de sens peuvent être apprises.
07/18/2026
Text–Video Alignment — Comment associer le sens d’un texte aux instants clés d’une vidéo
Text–Video Alignment est une technique qui consiste à relier les objets, les actions et les événements décrits dans un texte aux passages précis d’une vidéo où ces éléments apparaissent. Le problème ne se limite pas à mesurer une similarité entre une phrase et une vidéo. Il s’agit surtout de comprendre à quel moment un élément du texte devient visible dans la séquence et d’identifier la portion temporelle qui lui correspond.
07/18/2026