Suavizado · Artículo 03·01

Por qué suavizar

La entropía max-relativa cruda es frágil: un detalle minúsculo de soporte la manda a infinito. Para una tarea real, que tolera un pequeño error, eso es demasiado pesimista. Suavizar es la cura.

Cerramos el módulo anterior con una advertencia: la entropía max-relativa tiene un punto débil. Basta que la referencia σ\sigma se anule en una dirección donde el estado ρ\rho no lo haga para que DmaxD_{\max} salte a ++\infty. En una teoría de una toma, donde casi siempre se admite un pequeño margen de error, esa rigidez es más un defecto que una virtud. Este módulo la corrige, y la idea es tan natural como potente: permitir que ρ\rho se mueva un poquito.

La fragilidad del peor caso

El problema no es solo que DmaxD_{\max} pueda valer infinito, sino que lo hace de forma discontinua. Imagina dos estados casi idénticos, tan parecidos que ningún experimento razonable los separaría. Si uno cae justo dentro del soporte de σ\sigma y el otro se asoma un pelo fuera, el primero puede tener una DmaxD_{\max} pequeña y el segundo, infinita. Una magnitud que da saltos así ante perturbaciones imperceptibles no puede ser la respuesta operacional correcta: los recursos físicos no distinguen entre «casi cero» y «cero exacto», pero DmaxD_{\max} sí, y de la manera más brusca posible.

Tolerar un pequeño error

La salida es reconocer algo que las tareas de la vida real ya asumen: casi nunca exigimos éxito perfecto, sino éxito con una error tolerado ε probabilidad de fallo ε\varepsilon tan pequeña como queramos, pero no nula. Comprimir con error ε\varepsilon, extraer aleatoriedad con una imperfección ε\varepsilon, transmitir con probabilidad de error ε\varepsilon: en todos los casos hay un presupuesto de error.

Si aceptamos ese presupuesto, no tiene sentido atarnos al estado ρ\rho exacto. Podemos trabajar con cualquier estado ρ~\tilde\rho que esté a distancia ε\varepsilon de ρ\rho —indistinguible de él dentro de nuestra tolerancia— y quedarnos con el que más nos convenga. Eso es suavizar: en vez de evaluar Dmax(ρσ)D_{\max}(\rho\|\sigma), optimizamos sobre toda una bola de suavizado bola de estados cercanos y nos quedamos con el mejor:

Dmaxε(ρσ)=minρ~ερDmax(ρ~σ).D_{\max}^{\varepsilon}(\rho\,\|\,\sigma) = \min_{\tilde\rho \,\approx_\varepsilon\, \rho} D_{\max}(\tilde\rho\,\|\,\sigma).

En los artículos siguientes precisaremos qué significa ρ~ερ\tilde\rho \approx_\varepsilon \rho (necesitaremos una buena forma de medir cercanía) y estudiaremos la cantidad que resulta. Por ahora, quédate con la idea: un margen de error compra robustez.

Qué ganamos

El cambio parece pequeño, pero arregla los tres problemas de golpe. Se recupera la continuidad: como se optimiza sobre una bola, perturbar ρ\rho ya no provoca saltos. Se recupera la finitud: si el estado estaba «un pelo» fuera del soporte, dentro de la bola habrá otro que sí encaje, y DmaxεD_{\max}^{\varepsilon} será finita aunque DmaxD_{\max} fuera infinita. Y, sobre todo, se obtiene la cantidad operacionalmente correcta: la que de verdad gobierna las tareas con error ε\varepsilon.

Ejemplos resueltos

Ejemplo resuelto 1 · De infinito a cero con un 1 %

Problema. Sea p=(0.99, 0.01)p = (0.99,\ 0.01) y q=(1, 0)q = (1,\ 0). Calcula Dmax(pq)D_{\max}(p\|q) y compáralo con lo que ocurre si permitimos un error de ε=0.01\varepsilon = 0.01 (medido como distancia de traza).

Sin suavizar. El segundo resultado tiene q1=0q_1 = 0 pero p1=0.01>0p_1 = 0.01 > 0: soporte incompatible, así que Dmax(pq)=+D_{\max}(p\|q) = +\infty.

Con ε=0.01\varepsilon = 0.01. La distancia de traza entre pp y qq es exactamente 0.010.01, así que qq mismo está dentro de la bola de pp. Eligiendo ρ~=q\tilde\rho = q se obtiene Dmax(qq)=0D_{\max}(q\|q) = 0, luego Dmax0.01(pq)=0D_{\max}^{0.01}(p\|q) = 0.

Un margen del 1%1\% hace pasar la cantidad de ++\infty a 00. La versión cruda era, sencillamente, demasiado pesimista.

Ejemplo resuelto 2 · Una rebaja parcial

Problema. Con p=(0.5, 0.5)p = (0.5,\ 0.5) y q=(0.1, 0.9)q = (0.1,\ 0.9), calcula DmaxD_{\max} y luego DmaxεD_{\max}^{\varepsilon} con ε=0.1\varepsilon = 0.1.

Sin suavizar. Dmax=log2max ⁣(0.50.1, 0.50.9)=log252.322D_{\max} = \log_2 \max\!\big(\tfrac{0.5}{0.1},\ \tfrac{0.5}{0.9}\big) = \log_2 5 \approx 2.322 bits.

Con ε=0.1\varepsilon = 0.1. Nos conviene mover pp hacia qq tanto como el presupuesto permita: bajamos p0p_0 de 0.50.5 a 0.40.4 (una distancia de traza de 0.10.1). Entonces

Dmax0.1=log2max ⁣(0.40.1, 0.60.9)=log24=2 bits.D_{\max}^{0.1} = \log_2 \max\!\big(\tfrac{0.4}{0.1},\ \tfrac{0.6}{0.9}\big) = \log_2 4 = 2 \text{ bits}.

No llega a cero —haría falta ε=0.50.1=0.4\varepsilon = |0.5 - 0.1| = 0.4 para eso— pero baja de 2.3222.322 a 22. El descenso es continuo en ε\varepsilon, sin saltos.

Lo que viene

Para hacer todo esto riguroso falta una pieza: una forma sensata de decir «a distancia ε\varepsilon». En el siguiente artículo introducimos las dos herramientas estándar —la distancia de traza y la fidelidad— y la métrica que usa el suavizado. Después definimos con cuidado DmaxεD_{\max}^{\varepsilon} y, por último, mostramos que suavizar no es sino resolver otra optimización convexa: otra SDP.