Los rendimientos diarios (%) de un activo vienen de dos regímenes: el calmo, 70 % de los días, con media μ1 y desviación 0.5, y el turbulento, 30 % de los días, con media μ2 y desviación 2. La densidad es f(y) = π φ(y; μ1, σ1²) + (1 − π) φ(y; μ2, σ2²). Aquí se conocen π, σ1 y σ2 y se estiman las dos medias, para poder ver la superficie ℓ(μ1, μ2). Verás que la superficie tiene más de una cima: un algoritmo que sube por la pendiente puede detenerse en una cima que no es la más alta.
Haz clic en el mapa para fijar el punto de partida. Cuanto más oscuro el azul, mayor ℓ; las curvas blancas rodean cada cima. Horizontal: μ1 (media del régimen calmo). Vertical: μ2 (media del turbulento).
Iteración
0
ℓ actual
–
ℓ del máximo global
–
‖∇ℓ‖ (el score)
–
Verde: máximo global. Coral: máximo local. Gris: se detuvo donde el gradiente es casi cero pero no es un máximo (meseta o silla). Con BFGS el primer paso usa el gradiente sin escalar y puede lanzar el punto muy lejos, a regiones planas; por eso aparecen más partidas grises. En la práctica se corre el algoritmo desde varias partidas y se conserva la de mayor ℓ.
Entre muestras cambia el número de cimas. Con más datos las cimas locales no desaparecen: la cima global se separa más de ellas, pero un algoritmo que arranca mal sigue terminando en la equivocada.
En la cima global, el régimen calmo (σ1 = 0.5) se coloca sobre el grueso de los días y el turbulento absorbe las colas. La cima local reparte los papeles al revés: un régimen calmo estrecho se coloca sobre un grupo de días extremos de un lado y el turbulento cubre el resto. Cada reparto es un punto fijo de las ecuaciones de score; solo uno maximiza la verosimilitud.
Aquí los parámetros π, σ1 y σ2 están fijos para poder dibujar la superficie. Con todos desconocidos hay más cimas, y además la verosimilitud deja de estar acotada: si σ1 → 0 con μ1 sobre una observación, ℓ → ∞. Lo que se estima en la práctica es la mejor cima interior.