Simulación: máximos locales en la verosimilitud de una mezcla de normales

Los rendimientos diarios (%) de un activo vienen de dos regímenes: el calmo, 70 % de los días, con media μ1 y desviación 0.5, y el turbulento, 30 % de los días, con media μ2 y desviación 2. La densidad es f(y) = π φ(y; μ1, σ1²) + (1 − π) φ(y; μ2, σ2²). Aquí se conocen π, σ1 y σ2 y se estiman las dos medias, para poder ver la superficie ℓ(μ1, μ2). Verás que la superficie tiene más de una cima: un algoritmo que sube por la pendiente puede detenerse en una cima que no es la más alta.

Verdad: μ1 = 0.5, μ2 = −1 Muestra: n = 100 Cimas (máximos locales) en esta muestra: – ℓ en el máximo global: –

Los datos y la mezcla en la iteración actual

mezcla con (μ1, μ2) actuales mezcla en el máximo global

Superficie ℓ(μ1, μ2) vista desde arriba

máximo global máximo local camino del algoritmo punto de partida

Haz clic en el mapa para fijar el punto de partida. Cuanto más oscuro el azul, mayor ℓ; las curvas blancas rodean cada cima. Horizontal: μ1 (media del régimen calmo). Vertical: μ2 (media del turbulento).

1. Subir desde un punto de partida

Iteración

0

ℓ actual

–

ℓ del máximo global

–

‖∇ℓ‖ (el score)

–

Elige un punto de partida y sube paso a paso.
¿Por qué se queda ahí? Lo que dice el cálculo

2. Muchas partidas al azar

Cada punto del mapa es una partida; su color indica a dónde terminó el algoritmo elegido arriba.

Verde: máximo global. Coral: máximo local. Gris: se detuvo donde el gradiente es casi cero pero no es un máximo (meseta o silla). Con BFGS el primer paso usa el gradiente sin escalar y puede lanzar el punto muy lejos, a regiones planas; por eso aparecen más partidas grises. En la práctica se corre el algoritmo desde varias partidas y se conserva la de mayor ℓ.

3. Otra muestra

Entre muestras cambia el número de cimas. Con más datos las cimas locales no desaparecen: la cima global se separa más de ellas, pero un algoritmo que arranca mal sigue terminando en la equivocada.

Interpretación de la cima local en este modelo

En la cima global, el régimen calmo (σ1 = 0.5) se coloca sobre el grueso de los días y el turbulento absorbe las colas. La cima local reparte los papeles al revés: un régimen calmo estrecho se coloca sobre un grupo de días extremos de un lado y el turbulento cubre el resto. Cada reparto es un punto fijo de las ecuaciones de score; solo uno maximiza la verosimilitud.

Aquí los parámetros π, σ1 y σ2 están fijos para poder dibujar la superficie. Con todos desconocidos hay más cimas, y además la verosimilitud deja de estar acotada: si σ1 → 0 con μ1 sobre una observación, ℓ → ∞. Lo que se estima en la práctica es la mejor cima interior.