☆ Guardar Regularización en Regresión Lineal — Cómo Lasso y Ridge reducen el sobreajuste
12/28/2025
La regularización en regresión lineal es un método que impone restricciones sobre los coeficientes de regresión para reducir la tendencia del modelo a ajustarse en exceso a los datos de entrenamiento. En particular, la Regresión Lasso puede llevar algunos coeficientes exactamente a 0, lo que produce un efecto natural de selección de variables, mientras que la Regresión Ridge reduce todos los coeficientes de forma más suave y hace que el modelo sea más estable. La idea central es que ambas técnicas no solo buscan reducir el error de predicción, sino también controlar la complejidad del modelo.
Dicho de forma simple: si para un examen intentas memorizar hasta el último detalle, puede que te vaya bien en una prueba de práctica, pero no necesariamente en el examen real. La regularización le dice al modelo: “No te limites a memorizar los datos; evita explicaciones demasiado rebuscadas”. La Regresión Lasso se parece más a eliminar por completo las explicaciones menos importantes, mientras que la Regresión Ridge conserva todas, pero atenúa las que son excesivas.
La Regresión Lasso puede llevar algunos coeficientes a 0 y generar así un efecto de selección de variables, mientras que la Regresión Ridge reduce todos los coeficientes y suele dar estimaciones más estables en presencia de multicolinealidad.
Método (funcionamiento y características)
-
Por qué se necesita regularización
- La regresión lineal básica aprende los coeficientes intentando minimizar al máximo el error en los datos de entrenamiento. Pero cuando hay muchas variables, predictores muy parecidos entre sí o pocos datos, los coeficientes pueden volverse inestables y crecer demasiado.
- En esa situación, el modelo puede parecer bueno sobre el conjunto de entrenamiento, pero comportarse de forma poco fiable con datos nuevos. Esa es una manifestación típica del sobreajuste.
- La regularización añade una penalización que, en la práctica, dice: “Los coeficientes grandes tienen un costo”. Eso evita que el modelo construya explicaciones demasiado complejas y ayuda a equilibrar el ajuste con la capacidad de generalización.
-
Principio común
- Tanto la Regresión Lasso como la Regresión Ridge añaden un término de penalización al término de error original. En otras palabras, intentan cumplir dos objetivos a la vez: ajustar bien los datos y evitar que los coeficientes crezcan demasiado.
- Aquí, lambda representa la intensidad de la regularización. Si lambda está cerca de 0, el modelo se comporta de forma similar a la regresión lineal ordinaria. A medida que lambda aumenta, la restricción sobre los coeficientes se vuelve más fuerte.
- La idea de fondo es clara: “Aceptar un poco más de error a cambio de un modelo más simple y menos sensible”.
-
Características de la Regresión Lasso
- La Regresión Lasso utiliza regularización L1. Como la penalización es la suma de los valores absolutos de los coeficientes, tiende a llevar exactamente a 0 aquellos coeficientes menos importantes.
- Eso le da un efecto natural de selección de variables. En conjuntos de datos con muchos predictores, puede decidir automáticamente qué variables permanecen en el modelo.
- Sin embargo, cuando hay varios predictores muy similares entre sí, Lasso puede quedarse con uno y descartar los demás, lo que puede volver el resultado menos estable.
-
\[ J(w)=\sum_{i=1}^{m}(y_i-\hat{y}_i)^2+\lambda\sum_{j=1}^{n}|w_j| \]
\[ \lambda \uparrow \Rightarrow \text{more coefficients become } 0 \]
La primera línea es la función objetivo que minimiza simultáneamente el error de predicción y la penalización L1. La segunda línea indica que, a medida que lambda aumenta, más coeficientes pueden volverse exactamente 0. Aquí, y es el valor real, y-hat es la predicción, w representa los coeficientes de regresión y lambda es la intensidad de regularización. Por ejemplo, si los coeficientes son 5.2, 0.8 y 0.1, la Regresión Lasso tenderá a llevar primero a 0 un coeficiente pequeño como 0.1, simplificando así el modelo.
-
Características de la Regresión Ridge
- La Regresión Ridge utiliza regularización L2. Como la penalización es la suma de los cuadrados de los coeficientes, tiende a reducirlos de manera suave en lugar de forzarlos exactamente a 0.
- Eso permite mantener todas las variables en el modelo y, al mismo tiempo, controlar el tamaño de los coeficientes. Resulta especialmente útil cuando existe multicolinealidad, es decir, cuando los predictores están fuertemente correlacionados entre sí.
- Aunque el modelo resultante puede ser menos disperso y menos fácil de interpretar que con Lasso, muchas veces es una mejor opción cuando lo más importante es la estabilidad de la predicción.
-
\[ J(w)=\sum_{i=1}^{m}(y_i-\hat{y}_i)^2+\lambda\sum_{j=1}^{n}w_j^2 \]
\[ \lambda \uparrow \Rightarrow \text{coefficients shrink toward } 0 \]
La primera línea es la función objetivo que minimiza el error de predicción junto con la penalización L2. La segunda línea indica que, al aumentar lambda, los coeficientes se acercan a 0, aunque normalmente no llegan a ser exactamente 0. Por ejemplo, si los coeficientes son 5.2, 0.8 y 0.1, la Regresión Ridge tenderá a reducirlos a algo como 4.7, 0.6 y 0.08. La idea principal aquí no es eliminar variables, sino contraer los coeficientes.
-
Cómo elegir entre Lasso y Ridge
- Si se busca un modelo fácil de interpretar y que destaque qué variables son realmente importantes, la Regresión Lasso suele ser una mejor opción. Es especialmente útil cuando hay muchos predictores y se sospecha que solo algunos son realmente relevantes.
- Si se quiere conservar todas las variables y mejorar la estabilidad de la predicción, la Regresión Ridge suele encajar mejor. Esta ventaja se vuelve más clara cuando varios predictores contienen información solapada.
- En la práctica, a menudo se estandarizan primero los predictores, porque las diferencias de escala pueden cambiar cuánto afecta la penalización a cada variable.
- Normalmente, lambda no se fija de forma arbitraria, sino mediante validación cruzada. Si es demasiado pequeña, el sobreajuste puede mantenerse. Si es demasiado grande, puede suprimir en exceso información importante y provocar subajuste.
Importancia y limitaciones
La regularización en regresión lineal es importante porque convierte la regresión lineal en algo más que un modelo centrado únicamente en reducir error: la transforma en un modelo que también considera la generalización. La Regresión Lasso puede producir modelos más interpretables gracias a la selección de variables, mientras que la Regresión Ridge es especialmente útil para estabilizar los coeficientes en presencia de multicolinealidad. Aun así, ambas técnicas son sensibles a la elección de lambda, y una regularización demasiado fuerte puede debilitar incluso el efecto de variables realmente importantes. Además, la Regresión Lasso puede resultar inestable cuando varias variables están muy correlacionadas, ya que puede conservar una y descartar las demás. Por eso, en aplicaciones reales suelen ser esenciales la estandarización, los procedimientos de validación y el ajuste de lambda basado en validación cruzada.
Lecturas previas recomendadas (2/2)
- Regularizador por Penalización de Norma — Restringir la Magnitud de los Pesos para Reducir el Sobreajuste
- Regularización L1 (Regresión Lasso) — Un Método de Regularización que Logra Selección de Variables y Generalización Mediante Esparsidad en los Pesos
Lecturas recomendadas para continuar (5/20)
+5
- 3.3 Regularización en Machine Learning y Deep Learning — Control de la complejidad del modelo para generalizar
- Fuerza de regularización — El valor que fija cuánto pesa el término de penalización para frenar el sobreajuste
- Inyección de Ruido — Una Técnica de Regularización que Añade Ruido Durante el Entrenamiento para Reducir el Sobreajuste y Mejorar la Generalización
- Capacidad del modelo — El límite de complejidad de patrones que un modelo puede representar
- Sesgo inductivo — Supuestos que permiten generalizar con pocos datos
- Hypothesis Space Reduction — Por qué demasiada libertad en el modelo facilita el overfitting
- Compromiso entre Capacidad y Generalización — Equilibrio entre Complejidad del Modelo y Rendimiento de Generalización
- Minimización del Riesgo Estructural (SRM) — Principio de aprendizaje para elegir el nivel óptimo de generalización en una jerarquía de modelos cada vez más complejos
- Approximation Bias — por qué la capacidad de representación del modelo limita su rendimiento
- Mixup — Un Método para Aprender Fronteras de Decisión Más Suaves Mezclando Muestras y Etiquetas
- Minimización del Riesgo Empírico (ERM) — Por qué minimizar el error de entrenamiento no garantiza la generalización
- Pre-pruning vs Post-pruning — por qué evitan el overfitting en un Decision Tree de formas diferentes
- Generative Replay — Cómo reducir el Catastrophic Forgetting
- Sharpening — cómo reforzar la confianza de los pseudo-labels
- Concept Shift — Fenómeno en el que la regla que determina la respuesta correcta cambia bruscamente en un momento específico
- Transformación que preserva la etiqueta — Transformaciones de datos que mantienen intacto el significado de la etiqueta correcta después del cambio
- Aprendizaje Robusto — Cómo entrenar modelos que sigan siendo estables ante ruido y cambio de distribución
- Minimización del Riesgo Invariante (IRM) — Cómo aprender una regla de predicción que se mantenga igual entre distintos entornos
- Aprendizaje Invariante — Cómo aprender características que se mantienen estables entre entornos para lograr predicciones más fiables
- Spurious Feature — el fenómeno en que un modelo aprende patrones erróneos a partir de correlaciones en los datos
Artículos del mismo tema (1/1)
Conceptos relacionados (0/0)
Aún no hay artículos sobre conceptos relacionados.
📍 Dónde encaja este concepto en el mapa de aprendizaje de IA
Consulta dónde se ubica este concepto dentro de AI Universe.
📍 Posición actual en AI Universe
☰
Restablecer Mostrar completados · Inicia sesión Cargando…
🌌 AI Universe
‹
›
⭐ Concepto
Selecciona una estrella.
« Término Regularizador (T…|Weight Decay — Técnica d… »
🔖 Etiquetas: error cuadrático medio MSE · Overfitting · regresión Lasso · regresión Ridge · regularización L1 · regularización L2