Latent Video Representation — Une représentation compacte des informations spatio-temporelles vidéo
Latent Video Representation désigne une approche qui consiste à transformer une vidéo brute en une représentation latente capable de conserver à la fois la structure spatiale d’une scène et son évolution dans le temps. Au lieu de manipuler directement chaque pixel de chaque frame, les modèles apprennent un espace plus compact qui préserve les informations essentielles nécessaires à la Video Generation et au Video Understanding.
07/18/2026
Spatiotemporal Representation — Le principe qui permet de comprendre les mouvements et les événements (Partie 1)
Spatiotemporal Representation désigne une méthode qui consiste à encoder simultanément la structure spatiale des données et leurs évolutions temporelles dans une même représentation. L’objectif n’est pas seulement d’identifier la position ou la forme d’un objet, mais également de comprendre comment il se déplace, comment il interagit avec d’autres éléments et comment son état évolue au fil du temps. Ainsi, Spatiotemporal Representation permet de dépasser la simple reconnaissance d’une scène statique pour représenter ce qui est réellement en train de se produire dans celle-ci.
08/08/2026
Text–Video Alignment — Comment associer le sens d’un texte aux instants clés d’une vidéo
Text–Video Alignment est une technique qui consiste à relier les objets, les actions et les événements décrits dans un texte aux passages précis d’une vidéo où ces éléments apparaissent. Le problème ne se limite pas à mesurer une similarité entre une phrase et une vidéo. Il s’agit surtout de comprendre à quel moment un élément du texte devient visible dans la séquence et d’identifier la portion temporelle qui lui correspond.
07/18/2026