Regularización · Artículo 04·01

Por qué regularizar

Ya tenemos una entropía suavizada robusta, pero sigue siendo una cantidad de una toma y aún depende de ε. Para reconectar con las tasas asintóticas limpias hay que promediar sobre muchas copias. Eso es regularizar.

El módulo anterior nos dejó una cantidad domesticada: la entropía max-relativa suavizada, robusta y calculable. Pero todavía arrastra dos rasgos del régimen de una toma —depende del presupuesto de error ε\varepsilon y sigue siendo, en esencia, una cantidad de peor caso—. Este módulo da el último paso del arco: promediar sobre nn copias y dejar nn \to \infty. El resultado, lo adelantamos, es de una elegancia notable — reaparece la entropía relativa de siempre.

Lo que todavía falta

Suavizar arregló la fragilidad, pero no nos devuelve la magnitud «de libro de texto». Un criptógrafo que usa una clave una vez trabaja, con razón, con DmaxεD_{\max}^{\varepsilon}. Pero cuando el recurso se repite muchas veces de forma independiente —el escenario límite i.i.d. i.i.d.—, esperamos que la respuesta correcta sea una tasa por copia, igual que la entropía de Shannon era bits por símbolo. La pregunta natural es: ¿cuánto vale DmaxεD_{\max}^{\varepsilon} por copia cuando hay muchísimas?

Regularizar: por copia, en el límite

Formalizar esa idea es directo. Evaluamos la entropía suavizada en nn copias del estado y de la referencia, ρn\rho^{\otimes n} y σn\sigma^{\otimes n}, la dividimos por nn para obtener el valor por copia, y tomamos el límite. Esa es la regularización regularización:

limn1nDmaxε(ρnσn).\lim_{n \to \infty} \frac{1}{n}\, D_{\max}^{\varepsilon}\big(\rho^{\otimes n} \,\big\|\, \sigma^{\otimes n}\big).

Es el mismo gesto que convierte «bits para este bloque» en «bits por símbolo». Y lo bonito es que, como veremos, el límite ni siquiera depende de ε\varepsilon (mientras sea un error estrictamente entre 00 y 11): la dependencia del presupuesto se desvanece al promediar.

El caso crudo no basta

Podría tentarnos regularizar la versión sin suavizar. No sirve de nada, y conviene ver por qué. La entropía max-relativa cruda es exactamente aditiva bajo copias: Dmax(ρnσn)=nDmax(ρσ)D_{\max}(\rho^{\otimes n}\|\sigma^{\otimes n}) = n\, D_{\max}(\rho\|\sigma). Al dividir por nn recuperamos Dmax(ρσ)D_{\max}(\rho\|\sigma) tal cual: seguimos clavados en el peor caso, sin haber ganado nada.

La magia está en la combinación. Es el suavizado el que, copia a copia, permite descartar las secuencias atípicas —las que disparan el peor cociente— a un coste ε\varepsilon minúsculo; y es la regularización la que deja que esa ganancia se acumule hasta hacer emerger el comportamiento medio. Juntas llevan DmaxεD_{\max}^{\varepsilon} desde el peor caso hasta el promedio: la divergencia KL entropía relativa D(ρσ)D(\rho\|\sigma).

Ejemplos resueltos

Ejemplo resuelto 1 · El crudo se queda clavado

Problema. Con p=(0.5, 0.5)p = (0.5,\ 0.5) y q=(0.25, 0.75)q = (0.25,\ 0.75), calcula 1nDmax(pnqn)\tfrac1n D_{\max}(p^{\otimes n}\|q^{\otimes n}) para n=1,2,3n = 1, 2, 3.

Solución. Para una copia, Dmax(pq)=log2max(2, 23)=1D_{\max}(p\|q) = \log_2 \max(2,\ \tfrac23) = 1 bit. Como el máximo cociente de un producto es el producto de los máximos, DmaxD_{\max} es aditiva:

1nDmax(pnqn)=1nn1=1 bit,n=1,2,3,\tfrac1n D_{\max}(p^{\otimes n}\|q^{\otimes n}) = \tfrac1n \cdot n \cdot 1 = 1 \text{ bit}, \quad n = 1,2,3,\dots

La tasa por copia es 11 para todo nn: regularizar el crudo no aporta nada nuevo.

Ejemplo resuelto 2 · Adónde queremos llegar

Problema. Para las mismas pp y qq, calcula la entropía relativa D(pq)D(p\|q): el valor al que apunta la versión suavizada.

Solución. D(pq)=0.5log20.50.25+0.5log20.50.75=0.5(1)+0.5(0.585)0.207D(p\|q) = 0.5\log_2\tfrac{0.5}{0.25} + 0.5\log_2\tfrac{0.5}{0.75} = 0.5(1) + 0.5(-0.585) \approx 0.207 bits.

Ahí está la meta: D(pq)0.207D(p\|q) \approx 0.207 es bastante menor que Dmax=1D_{\max} = 1. La regularización de la cantidad suavizada hará descender la tasa por copia desde 11 hasta 0.2070.207 — es lo que demostramos en el artículo 03.

Lo que viene

Antes del teorema conviene mirar de cerca el régimen de muchas copias: por qué el promedio se concentra y qué papel juega la razón de verosimilitud. Ese es el artículo siguiente. Después enunciamos y entendemos el teorema de equipartición, y cerramos con el panorama completo — cómo toda la escalera, del peor caso al promedio, encaja de una vez.