Con la intuición de la concentración en la mano, el teorema se lee casi solo. Al promediar la entropía max-relativa suavizada sobre muchas copias, el peor caso se disuelve y emerge el promedio: la entropía relativa. Es la culminación del arco que empezó, hace tres módulos, con una cantidad de una sola toma.
El teorema
La propiedad de equipartición propiedad de equipartición para la max-relativa suavizada afirma que, para cualquier error fijo ,
Tres cosas merecen subrayarse. La primera: el límite es la divergencia KL entropía relativa, la cantidad asintótica «de siempre». La segunda: no depende de — el presupuesto de error, tan importante en una toma, es irrelevante en el límite. La tercera: contrasta con el crudo, cuya regularización se quedaba clavada en . El suavizado es justo lo que abre el hueco entre ambos y deja caer la tasa desde hasta .
La curva de convergencia lo dice todo: arranca cerca del peor caso y desciende hacia el promedio a medida que crece. Muévela y comprueba que el destino no cambia con :
Con n = 50: ≈ 0.000 bits, ya cerca de D(p‖q) = 0.000 y lejos de D_max = 0.000.
La curva parte del peor caso (D_max) y desciende hacia el promedio (D) al crecer n: eso es la equipartición.
Por qué es cierto
La demostración formaliza la imagen del artículo anterior. La razón de verosimilitud se concentra en torno a , con una anchura de solo . La entropía max-relativa suavizada equivale, en esencia, a un cuantil de esa razón: el suavizado nos deja recortar la cola superior de peso —las secuencias atípicas de razón enorme— y quedarnos con el borde del bloque típico. Ese borde está a distancia de la media, de modo que, al dividir por , la corrección se desvanece y solo sobrevive .
El vínculo con el lema de Stein
Este teorema tiene una cara operacional célebre. Imagina que debes decidir si tienes copias de o de —un problema de contraste de hipótesis—. El lema de Stein cuántico lema de Stein cuántico dice que, si mantienes controlado el error de un tipo, el error del otro tipo decae exponencialmente con exponente óptimo exactamente :
No es casualidad que aparezca la misma cantidad: la entropía max-relativa suavizada es la herramienta natural para probar Stein, y su regularización es el exponente de Stein. La distinguibilidad de una toma, promediada sobre muchas copias, se convierte en la velocidad a la que puedes separar dos hipótesis.
Ejemplos resueltos
Problema. Con y , ¿hacia qué valor tiende , y desde dónde parte?
Solución. Parte del peor caso bit (el valor para pequeño) y desciende hasta el límite
La aproximación al límite es del orden de , por lo que para moderado la tasa aún queda algo por encima de — como muestra la curva de arriba. Cambiar mueve la curva un poco, pero no su destino.
Problema. Para las mismas distribuciones, estima el error de tipo II al distinguir de con copias.
Solución. Con exponente bits por copia, el error de tipo II decae como
Cien muestras bastan para separar las dos hipótesis con un error inferior a una en un millón. Y ese ritmo —el exponente— es precisamente lo que la regularización de la entropía suavizada calcula.
Ejercicios
Argumenta por qué el límite nunca puede superar a , coherente con que la curva de convergencia desciende y no asciende.
Solución
Para cada , suavizar solo baja el valor: ; y el crudo, regularizado, vale exacto. Por tanto para todo , y el límite hereda la cota: . La entropía relativa es siempre la más pequeña de la escalera.
Para y , calcula el valor límite de la tasa regularizada.
Solución
El límite es . Numéricamente, bits. (El peor caso de partida era , así que la regularización lo rebaja de a .)