Regularización · Artículo 04·02

El régimen de muchas copias

Antes del teorema, la intuición. Con muchas copias independientes, la razón de verosimilitud se convierte en una suma que se concentra en torno a su media. Esa media es la entropía relativa, y esa concentración es la razón profunda de que regularizar funcione.

El teorema de equipartición no es magia: es la ley de los grandes números disfrazada. Para verlo, hay que mirar la cantidad que decide todo en el régimen de muchas copias — la razón de verosimilitud logarítmica— y observar cómo, al sumar copias independientes, deja de fluctuar y se planta en su valor medio.

La razón de verosimilitud logarítmica

Para distinguir un estado de otro, la cantidad natural es cuánto más «probable» hace cada resultado bajo pp que bajo qq. Por símbolo, eso es la razón de verosimilitud logarítmica razón de verosimilitud logarítmica log2p(x)q(x)\log_2 \frac{p(x)}{q(x)}. Para nn copias independientes, la razón total es simplemente la suma de las individuales:

LLRn=i=1nlog2p(xi)q(xi).\mathrm{LLR}_n = \sum_{i=1}^{n} \log_2 \frac{p(x_i)}{q(x_i)}.

Y aquí aparece la conexión clave. La media de la razón por símbolo, tomada según pp, es exactamente la entropía relativa:

Ep ⁣[log2p(x)q(x)]=xp(x)log2p(x)q(x)=D(pq).\mathbb{E}_{p}\!\left[\log_2 \frac{p(x)}{q(x)}\right] = \sum_x p(x)\log_2 \frac{p(x)}{q(x)} = D(p\|q).

La concentración

LLRn\mathrm{LLR}_n es una suma de nn términos independientes, así que la ley de los grandes números ley de los grandes números se aplica sin más: el promedio por copia converge a la media,

1nLLRn  n  D(pq),\frac{1}{n}\,\mathrm{LLR}_n \;\xrightarrow[n\to\infty]{}\; D(p\|q),

y las fluctuaciones alrededor de ese valor se encogen como 1/n1/\sqrt{n} (teorema central del límite). Sube el número de copias y observa cómo la distribución de LLRn/n\mathrm{LLR}_n/n se estrecha en torno a D(pq)D(p\|q), alejándose del extremo DmaxD_{\max}:

El promedio se concentra (ley de los grandes números)

Con n = 12 copias, LLRₙ/n se agolpa cerca de su media D(p‖q) = 0.000, lejos del extremo D_max = 0.000.

Sube n y observa cómo la distribución se estrecha en torno a la media. Esa es la razón de que regularizar funcione.

p(0) 0.50
q(0) 0.20
n (copias) 12

Típico frente a atípico

Esta imagen explica el mecanismo entero. El valor extremo Dmax=log2maxipi/qiD_{\max} = \log_2 \max_i p_i/q_i se alcanza solo en las secuencias atípicas, aquellas formadas casi por completo por el símbolo de peor cociente. Al crecer nn, esas secuencias se vuelven exponencialmente raras: casi toda la probabilidad se concentra en las secuencias típicas, cuya razón por copia ronda D(pq)D(p\|q).

Y ahí encaja el suavizado. Permitir un error ε\varepsilon es, precisamente, poder descartar la pequeña cola atípica —la que sostiene el peor caso— por un coste ε\varepsilon. Lo que queda es el bloque típico, gobernado por la media. Por eso la entropía suavizada, regularizada, aterriza en D(pq)D(p\|q) y no en DmaxD_{\max}.

Ejemplos resueltos

Ejemplo resuelto 1 · La media es la entropía relativa

Problema. Con p=(0.5, 0.5)p = (0.5,\ 0.5) y q=(0.25, 0.75)q = (0.25,\ 0.75), calcula la razón por símbolo en cada resultado y su media bajo pp.

Solución. El símbolo 00 aporta log20.50.25=1\log_2\tfrac{0.5}{0.25} = 1 y el símbolo 11, aporta log20.50.75=log2230.585\log_2\tfrac{0.5}{0.75} = \log_2\tfrac23 \approx -0.585. Su media según pp:

Ep[LLR]=0.51+0.5(0.585)0.207=D(pq).\mathbb{E}_p[\mathrm{LLR}] = 0.5\cdot 1 + 0.5\cdot(-0.585) \approx 0.207 = D(p\|q).

La media de la razón coincide con la entropía relativa, como debía. El extremo, en cambio, es max(1, 0.585)=1=Dmax\max(1,\ -0.585) = 1 = D_{\max}: solo lo ve quien saca puros ceros.

Ejemplo resuelto 2 · Cómo se desvanece lo atípico

Problema. Para esas mismas distribuciones, ¿qué probabilidad tiene la secuencia «todo ceros» (la que alcanza DmaxD_{\max}) cuando n=10n = 10 y cuando n=50n = 50?

Solución. Bajo pp, cada símbolo es 00 con probabilidad 0.50.5, así que «todo ceros» tiene probabilidad 0.5n0.5^{n}: unas 10310^{-3} para n=10n = 10 y 1015\sim 10^{-15} para n=50n = 50.

La secuencia que sostiene el peor caso se vuelve astronómicamente rara. Con un presupuesto ε\varepsilon fijo, tarde o temprano cabe entera dentro de la cola que podemos descartar — y con ella se va DmaxD_{\max}, dejando solo el promedio.

Ejercicios

Ejercicio 1

Comprueba que la razón por copia promedio nunca es negativa para dos distribuciones distintas, es decir, D(pq)0D(p\|q) \ge 0, aunque algunos términos individuales lo sean.

Solución

Aunque un símbolo con p(x)<q(x)p(x) < q(x) aporte un log-cociente negativo, la media D(pq)=xp(x)log2p(x)q(x)D(p\|q) = \sum_x p(x)\log_2\frac{p(x)}{q(x)} es siempre 0\ge 0 por la desigualdad de Gibbs (o Jensen aplicada a log-\log), con igualdad solo si p=qp = q. En el ejemplo, el término 0.585-0.585 del símbolo 11 queda compensado de sobra por el +1+1 del símbolo 00.

Ejercicio 2

¿Por qué las fluctuaciones de LLRn/n\mathrm{LLR}_n/n se encogen como 1/n1/\sqrt{n} y no, por ejemplo, como 1/n1/n?

Solución

LLRn\mathrm{LLR}_n es una suma de nn términos i.i.d. con varianza finita ς2\varsigma^2. La varianza de la suma es nς2n\varsigma^2, así que su desviación típica es ςn\varsigma\sqrt{n}. Al dividir por nn, la desviación típica de LLRn/n\mathrm{LLR}_n/n es ς/n\varsigma/\sqrt{n} — el ritmo 1/n1/\sqrt{n} del teorema central del límite.