Overfitting y Underfitting

- ¿Qué son Overfitting y Underfitting?
- 🎯 ¿Por qué ocurren?
- 📊 Ejemplo cotidiano
- 🧮 Ejemplo visual con modelos
- 🧠 ¿Cómo detectarlo?
- 📈 Curvas de aprendizaje
- 🧰 ¿Cómo evitar el overfitting?
- 🧰 ¿Cómo evitar el underfitting?
- 🔗 Relación con otros conceptos clave
- ❓ Preguntas frecuentes (FAQ)
- 📢 Conclusión y próximos pasos
¿Qué son Overfitting y Underfitting?
Overfitting y Underfitting son dos problemas fundamentales que aparecen al entrenar modelos de inteligencia artificial y aprendizaje automático.
Es decir, ambos afectan directamente a la capacidad del modelo para generalizar a nuevos datos.
- Overfitting (sobreajuste): el modelo aprende demasiado bien los datos de entrenamiento, incluyendo el ruido y las excepciones.
- Resultado: funciona excelente con los datos que ha visto, pero falla en datos nuevos.
- Underfitting (subajuste): el modelo no logra captar los patrones relevantes ni siquiera en los datos de entrenamiento.
- Resultado: ni aprende bien los datos de entrenamiento ni generaliza.
Ambos extremos son perjudiciales.
Ya que el objetivo ideal es encontrar un punto medio donde el modelo generalice bien.
🎯 ¿Por qué ocurren?
📈 Overfitting puede ocurrir por:
- Modelos demasiado complejos (por ejemplo, redes neuronales profundas sin regularización).
- Poca cantidad de datos.
- Datos con ruido o errores.
- Demasiadas épocas de entrenamiento.
📉 Underfitting puede ocurrir por:
- Modelos demasiado simples (p. ej. una regresión lineal en un problema no lineal).
- Pocas características (features) relevantes.
- Tiempo de entrenamiento insuficiente.
- Preprocesamiento deficiente o incorrecto.
📊 Ejemplo cotidiano
Imagina que estás estudiando para un examen.
- Si memoriza palabra por palabra sin entender, puedes recitar el temario perfecto (como un modelo con overfitting), pero si te cambian la forma de preguntar, no sabes qué responder.
- Si solo hojeas por encima el temario sin profundizar, no recuerdas casi nada (como un modelo con underfitting).
- Lo ideal es comprender el contenido, practicar y aplicar. Ese sería el modelo equilibrado que generaliza bien.
🧮 Ejemplo visual con modelos
Supongamos que tenemos un conjunto de puntos con una relación no lineal.
- Modelo underfit: una línea recta que no se ajusta a nada. Error alto en entrenamiento y validación.
- Modelo overfit: una curva extremadamente ajustada que pasa por todos los puntos. Error bajo en entrenamiento, pero alto en validación.
- Modelo óptimo: una curva suave que capta la tendencia general. Error bajo en ambos conjuntos.
🧠 ¿Cómo detectarlo?
🔍 Indicadores de underfitting:
- Alta tasa de error tanto en entrenamiento como en validación.
- El modelo no mejora aunque entrenes más.
- Las predicciones parecen aleatorias o muy aproximadas.
🔍 Indicadores de overfitting:
- Muy bajo error en entrenamiento, pero alto en validación/test.
- El modelo cambia mucho frente a pequeñas variaciones en los datos.
- La curva de validación empeora tras varias épocas de entrenamiento.
📈 Curvas de aprendizaje
Una forma visual muy potente de detectar estos problemas es mediante las curvas de aprendizaje.
- En underfitting, las curvas de entrenamiento y validación están ambas altas y muy juntas.
- En overfitting, la curva de entrenamiento baja mucho, pero la de validación se mantiene alta o incluso sube.
Visualmente ayuda a saber cuándo parar o ajustar el modelo.
🧰 ¿Cómo evitar el overfitting?
- Usar más datos de entrenamiento.
- Aplicar técnicas de regularización (L1, L2).
- Implementar early stopping.
- Reducir la complejidad del modelo.
- Utilizar cross-validation para evaluar el rendimiento.
- Aplicar data augmentation (especialmente en imágenes).
🧰 ¿Cómo evitar el underfitting?
- Aumentar la complejidad del modelo (por ejemplo, usar redes más profundas o árboles más profundos).
- Añadir más características relevantes.
- Ajustar mejor los hiperparámetros.
- Asegurar un entrenamiento suficiente (más épocas).
🔗 Relación con otros conceptos clave
- Bias-Variance Tradeoff: el balance entre underfitting (alto sesgo) y overfitting (alta varianza).
- Regularización: técnica para controlar el overfitting.
- Early stopping: detener el entrenamiento cuando la validación deja de mejorar.
- Curvas de aprendizaje: herramienta visual clave para identificar ambos casos.
- Cross-validation: ayuda a medir generalización y evitar sobreajuste.
- Hiperparámetros: su ajuste influye directamente en el nivel de ajuste del modelo.
❓ Preguntas frecuentes (FAQ)
🔹 ¿Es mejor un poco de overfitting que underfitting?
A veces sí.
Un modelo ligeramente sobreajustado puede generalizar mejor que uno que no aprende nada. Pero lo ideal es evitar ambos.
🔹 ¿Qué significa “generalizar” en IA?
Significa que el modelo puede predecir correctamente sobre datos nuevos que nunca ha visto.
🔹 ¿Se puede medir el overfitting con un número?
No directamente.
Pero puedes observar la diferencia entre el error de entrenamiento y el de validación.
🔹 ¿Cómo afecta la cantidad de datos?
Pocos datos suelen provocar overfitting.
Muchos datos pueden ayudar a reducirlo.
📢 Conclusión y próximos pasos
Entender el overfitting y underfitting es esencial para entrenar modelos que realmente funcionen en el mundo real. No basta con que el modelo aprenda: debe aprender bien y generalizar mejor.
👉 En el próximo post profundizaremos en el concepto de Bias-Variance Tradeoff, que explica por qué aparecen estos dos fenómenos y cómo equilibrarlos inteligentemente.
Si quieres conocer otros artículos parecidos a Overfitting y Underfitting puedes visitar la categoría Wiki.

Deja una respuesta