Crowding Problem — Cómo se comprime la estructura de distancias en embeddings de baja dimensión

Crowding Problem es el fenómeno en el que la estructura de distancias de datos de alta dimensión se comprime y se distorsiona al proyectarse en un espacio de baja dimensión, como 2D o 3D, haciendo que especialmente los puntos con distancias intermedias terminen demasiado juntos. Aunque los vecinos más cercanos suelen conservarse de forma razonable, resulta difícil representar en un espacio limitado toda la distribución global y las diferencias de distancia existentes en muchas dimensiones. Por esta razón, Crowding Problem es una de las principales limitaciones que deben tenerse en cuenta al interpretar visualizaciones de reducción dimensional como t-SNE y UMAP.

08/02/2026

Hipótesis de la variedad — La suposición de que datos de alta dimensión viven sobre una estructura de baja dimensión

La hipótesis de la variedad (manifold assumption) sostiene que datos que se representan en un espacio de alta dimensión suelen concentrarse cerca de una estructura suave y de mucha menor dimensión, llamada variedad (manifold). Esta idea es un supuesto de trabajo en muchos modelos de aprendizaje automático, porque sugiere que no hace falta modelar todo el espacio, sino la región “significativa” donde realmente aparecen los datos.

12/25/2025

Histograma — Una forma de representar la distribución de datos numéricos mediante frecuencias por intervalos

Histograma es un método de visualización que divide los datos numéricos en varios intervalos (bins) y representa con la altura de barras cuántos valores caen en cada intervalo. En lugar de revisar los datos uno por uno, es una de las herramientas más básicas para detectar rápidamente dónde se concentran los valores, qué tan dispersos están, si la distribución está sesgada y si existen valores poco frecuentes o atípicos.

12/28/2025

Mapa Autoorganizado (SOM) — Una red neuronal tipo “mapa” que hace visible la estructura de los datos

Un mapa autoorganizado (SOM) es una red neuronal no supervisada que proyecta datos de alta dimensión en un mapa 2D para que las relaciones de similitud se vean de forma intuitiva. No busca “acertar etiquetas”, sino comprender cómo se organiza el conjunto de datos.

12/29/2025

Mapa de calor — Una forma de visualización que muestra patrones de manera intuitiva mediante el color

El mapa de calor es una técnica de visualización que representa la magnitud o la importancia de un valor mediante la intensidad del color. Cuando valores que no se interpretan fácilmente a simple vista, como números o probabilidades, se transforman en colores, resulta mucho más sencillo detectar patrones, zonas de concentración y puntos atípicos. En visión por computadora y aprendizaje profundo, los mapas de calor se utilizan con mucha frecuencia para mostrar qué regiones considera importantes un modelo.

03/09/2026

t-SNE (t-Distributed Stochastic Neighbor Embedding) — Un método de visualización no lineal para desplegar en 2D las relaciones locales de datos de alta dimensión

t-SNE (t-Distributed Stochastic Neighbor Embedding) es una técnica de reducción de dimensionalidad no lineal cuyo objetivo es proyectar features o embeddings de alta dimensión en 2D o 3D preservando, en la medida de lo posible, las relaciones de vecindad local. Se usa con frecuencia para inspeccionar visualmente cómo se agrupan las muestras dentro de un espacio de representación aprendido, cómo se separan los clústeres y dónde aparecen posibles valores atípicos.

12/22/2025

UMAP (Uniform Manifold Approximation and Projection) — Reducción de dimensionalidad que aprende representaciones de baja dimensión preservando la estructura de conectividad de los datos

UMAP (Uniform Manifold Approximation and Projection) es un algoritmo de reducción de dimensionalidad que parte de la idea de que los datos de alta dimensión viven sobre una variedad (manifold) de menor dimensión. Su objetivo es aprender un embedding en baja dimensión preservando, en la medida de lo posible, las relaciones de vecindad y la estructura de conectividad (topología) de los datos. Más que “igualar distancias”, UMAP intenta conservar “quién está conectado con quién”.

02/22/2026