Modelos Estimados y Validación
Los modelos utilizados para representar la probabilidad de default pertenecen a la familia de modelos lineales generalizados, estos son ampliamente utilizados y conocidos en la literatura estadística/econométrica . De las distintas especificaciones posibles, el más ampliamente utilizado es el modelo logit y las pruebas de ajuste realizadas en los modelos de axesor no mostraban ventajas de otras distribuciones respecto a la logística.
La validación del modelo se realiza con un conjunto de medidas de calidad. Se estudia el comportamiento de dichas medidas ante distintos escenarios que deben representar supuestos realistas de aplicación del modelo. Cuánto más realistas sean los escenarios, más robustas han de ser las conclusiones alcanzadas sobre validación. Se han elegido dos estadísticos que miden aspectos diferentes, aunque complementarios: la curva ROC, resumida en el área bajo la curva (AUC), y la distancia (o estadístico) de Kolmogorov-Smirnov (KSD).
La curva ROC es una herramienta visual donde se representa la confianza (uno menos la probabilidad de error tipo I) en ordenadas con el complementario de la potencia en abscisas (probabilidad de error tipo II) por lo que tiene una clara interpretación en términos de la calidad de cualquier contraste de hipótesis estadísticas, donde se consideran todos los posibles valores críticos del contraste (en el caso de un modelo de probabilidades de incumplimiento, van de 0 a 1). En esta interpretación, los valores críticos son las puntuaciones que obtienen las observaciones con el procedimiento de clasificación considerado, en nuestro caso la probabilidad de default.
Visualmente, cuanta mayor convexidad presente la curva, significa que
el modelo propuesto tiene mayor capacidad de discriminación entre
buenos y malos, puesto que con menores probabilidades de error de tipo
II irían asociadas también pequeñas probabilidades de error de tipo I.

El estadístico de Kolmogorov-Smirnov es la otra medida utilizada en la validación de modelos axesor, donde tiene sentido comparar la función de distribución empírica de la probabilidad de las empresas en default y las sanas para contrastar que efectivamente las medidas de riesgo obtenidas del modelo (la probabilidad de default) para ambos grupos tienen una distribución significativamente distinta. El estadístico es la mayor diferencia en valor absoluto entre las funciones de distribución empíricas de sanas y fallidas, y existen tablas estadísticas (además de ser conocida la distribución asintótica) para establecer si la diferencia es significativamente distinta de cero. Por tanto, cuanto mayor sea la diferencia, mejor discrimina el modelo entre empresas sanas y con incumplimiento.
Como ejemplo, en el siguiente gráfico se muestran las distribuciones y densidades empíricas para las empresas sanas y con incumplimiento en 2006.

Validación cruzada:
Una vez seleccionadas las medidas que permiten establecer la capacidad discriminatoria, se hace necesario validar que el modelo será adecuado en circunstancias realistas. Esto se comprueba mediante validación cruzada y se establecen intervalos de confianza utilizando la técnica de bootstrapping.
La validación cruzada pretende analizar la adecuación del modelo a los datos cuando dichos datos no han entrado en la estimación. El método consiste en dividir la muestra disponible aleatoriamente en K grupos de aproximadamente el mismo tamaño. Cada uno de estos grupos se excluye del proceso de estimación y se calcula el estadístico de interés, en nuestro caso, la probabilidad de default, utilizando las estimaciones del modelo sin el grupo en cuestión. Este proceso se repite para cada uno de los grupos de manera que, al final, todas las observaciones habrán sido previstas una vez, pero sin haber sido incluidas en la estimación.
Bootstrapping:
Una vez se obtienen los estadísticos de interés (AUC y KSD) mediante validación cruzada, queda responder a la cuestión de cómo de sensible es el estadístico calculado a la muestra utilizada. Para poder dar respuesta a esta pregunta se utiliza un procedimiento de bootstrapping aplicado a las probabilidades de incumplimiento obtenidas de la validación cruzada para obtener intervalos de confianza de los estadísticos relevantes.
El procedimiento consiste en extraer R muestras con reemplazamiento del mismo tamaño que la muestra de estimación disponible y con cada una de ellas calcular el estadístico de interés. Así, se obtienen R valores del estadístico que permiten tratarlos como una muestra de valores del mismo y estimar las características buscadas.
En el caso de los modelos de axesor, la validación se centra en establecer la sensibilidad del AUC y de la KSD para detectar posibles debilidades debido a la muestra utilizada. Dicha medida de sensibilidad se obtiene mediante intervalos de confianza para dichos estadísticos, por lo que se puede contrastar si un modelo diferente presenta mejoras significativas o no respecto al estimado.
Validación out of time:
Para ilustrar la robustez de los modelos elaborados, se realizan pruebas de validación fuera de tiempo. Para ello, se estiman las probabilidades de incumplimiento asociadas a un ejercicio t utilizando el modelo estimado para el ejercicio t-1.
La valoración de la calidad clasificatoria de los modelos en esta prueba se cuantifica también mediante los estadísticos AUC y KSD. Los resultados son similares a los de validación cruzada en el mismo ejercicio, tanto en estimación como en validación, es decir, se obtiene un alto nivel predictivo y se confirma que las estimaciones son robustas en el tiempo.