Entropía max-relativa · Artículo 02

La entropía max-relativa

En el artículo anterior quedó dicho que el régimen de una toma pide medir la distinguibilidad en el peor caso. La entropía max-relativa es la forma precisa de esa idea — y es notable cuánto se exprime de una sola desigualdad entre operadores.

La entropía relativa de siempre mide, en promedio, cuánto se distingue un estado ρ\rho de otro σ\sigma. La entropía max-relativa mide lo mismo, pero en el peor caso: cuánto sobresale ρ\rho por encima de σ\sigma en la dirección más desfavorable de todas. Esa diferencia —promedio frente a peor caso— es exactamente lo que la convierte en la herramienta correcta para una sola realización.

Una desigualdad basta

Partimos de dos objetos: un estado ρ\rho y un operador semidefinido positivo σ\sigma que hace de referencia. La pregunta es cuánto hay que «inflar» σ\sigma para que cubra por completo a ρ\rho. Y «cubrir» tiene aquí un sentido muy concreto, el del orden de operadores orden de operadores: escribir ρλσ\rho \preceq \lambda\sigma quiere decir que λσρ\lambda\sigma - \rho es semidefinido positivo, es decir, que en cualquier dirección v|v\rangle se cumple vρvλvσv\langle v|\rho|v\rangle \le \lambda\langle v|\sigma|v\rangle. El menor λ\lambda que lo consigue define la entropía max-relativa entropía max-relativa:

Dmax(ρσ)=log2min{λ0:ρλσ}.D_{\max}(\rho\,\|\,\sigma) = \log_2 \min\{\, \lambda \ge 0 : \rho \preceq \lambda\,\sigma \,\}.

El logaritmo es casi cosmético —traduce factores a bits—; el contenido está en ese mínimo λ\lambda. Y aquí se ve por qué hablamos de «peor caso»: un único λ\lambda tiene que servir para todas las direcciones a la vez, de modo que lo fija la más exigente de todas, aquella en la que ρ\rho más sobresale sobre σ\sigma.

Esa dirección crítica se puede leer sin rodeos. El menor λ\lambda admisible resulta ser el mayor autovalor de σ1/2ρσ1/2\sigma^{-1/2}\rho\,\sigma^{-1/2}, con lo que la definición admite una forma cerrada mediante la norma del operador norma del operador:

Dmax(ρσ)=log2σ1/2ρσ1/2.D_{\max}(\rho\,\|\,\sigma) = \log_2 \big\lVert \sigma^{-1/2}\rho\,\sigma^{-1/2} \big\rVert_\infty.

Cuando ρ\rho y σ\sigma conmutan —el caso clásico de dos distribuciones pp y qq— todo se diagonaliza a la vez y la fórmula se vuelve transparente:

Dmax(pq)=log2maxipiqi.D_{\max}(p\,\|\,q) = \log_2 \max_i \frac{p_i}{q_i}.

No se promedian los cocientes pi/qip_i/q_i, como haría la divergencia KL divergencia KL: uno se queda con el mayor. Ese salto —de promediar a quedarse con el máximo— es toda la distancia que separa la cantidad asintótica de la de una toma. Compruébalo moviendo las dos distribuciones y observando qué resultado acaba mandando:

La max-relativa la manda el peor cociente

Dmax(p‖q) = 0.000 bits  ·  D(p‖q) = 0.000 bits

Dmax solo mira el cociente máximo (resaltado); la divergencia KL promedia todos. Siempre Dmax ≥ D.

p(0) 0.50
q(0) 0.25

Cuándo se dispara a infinito

La definición tiene un punto frágil que conviene ver desde ya. Si σ\sigma se anula en alguna dirección donde ρ\rho no lo hace —en símbolos, supp(ρ)⊈supp(σ)\operatorname{supp}(\rho) \not\subseteq \operatorname{supp}(\sigma)—, ningún λ\lambda finito logra ρλσ\rho \preceq \lambda\sigma: por mucho que infles un cero, sigue siendo cero. En ese caso Dmax=+D_{\max} = +\infty. Clásicamente es el cociente pi/qip_i/q_i con qi=0q_i = 0 y pi>0p_i > 0, que se dispara. Esta fragilidad no es un detalle menor: es precisamente lo que el Módulo 03 tendrá que suavizar.

Dos propiedades que usaremos sin descanso

Antes de ponernos a calcular, conviene tener a mano dos hechos. El primero es que la max-relativa es la más pesimista de su familia: para estados, Dmax(ρσ)D(ρσ)0D_{\max}(\rho\|\sigma) \ge D(\rho\|\sigma) \ge 0, con igualdad a cero únicamente cuando ρ=σ\rho = \sigma. De hecho es el límite α\alpha \to \infty de las entropía max-relativa entropías relativas de Rényi, así que acota por arriba a todas las demás — de ahí, otra vez, su carácter de peor caso.

El segundo es el procesamiento de datos: ningún canal cuántico Φ\Phi puede aumentarla,

Dmax(Φ(ρ)Φ(σ))Dmax(ρσ).D_{\max}\big(\Phi(\rho)\,\|\,\Phi(\sigma)\big) \le D_{\max}(\rho\,\|\,\sigma).

La lectura es natural —manipular la información nunca ayuda a distinguir mejor dos estados— y es justo la propiedad que legitima interpretarla como una medida de distinguibilidad.

Ejemplos resueltos

Ejemplo resuelto 1 · Peor caso frente a promedio

Problema. Con p=(12,12)p = (\tfrac12, \tfrac12) y q=(14,34)q = (\tfrac14, \tfrac34), calcula Dmax(pq)D_{\max}(p\|q) y compáralo con la divergencia KL D(pq)D(p\|q).

Solución. Los dos cocientes son p0/q0=1/21/4=2p_0/q_0 = \tfrac{1/2}{1/4} = 2 y p1/q1=1/23/4=23p_1/q_1 = \tfrac{1/2}{3/4} = \tfrac23. La max-relativa se queda con el mayor, así que Dmax(pq)=log22=1D_{\max}(p\|q) = \log_2 2 = 1 bit.

La divergencia KL, en cambio, los promedia: D(pq)=12log22+12log2230.207D(p\|q) = \tfrac12\log_2 2 + \tfrac12\log_2 \tfrac23 \approx 0.207 bits. El segundo resultado, con cociente 23<1\tfrac23 < 1, tira del promedio hacia abajo; la max-relativa simplemente lo ignora y se queda con el peor.

Comprobación. 10.2071 \ge 0.207, como debía ser por DmaxDD_{\max} \ge D.

Ejemplo resuelto 2 · Cuando se dispara

Problema. Sea p=(12,12)p = (\tfrac12, \tfrac12) y q=(1,0)q = (1, 0). ¿Cuánto vale Dmax(pq)D_{\max}(p\|q)?

Solución. El segundo resultado tiene q1=0q_1 = 0 mientras que p1=12>0p_1 = \tfrac12 > 0: el soporte de pp no cabe dentro del de qq. Su cociente p1/q1p_1/q_1 es infinito, y por tanto Dmax(pq)=+D_{\max}(p\|q) = +\infty.

Dicho de otro modo: ningún λ\lambda finito arregla la desigualdad 12λ0\tfrac12 \le \lambda\cdot 0 en la segunda coordenada. En cuanto la referencia σ\sigma «no ve» algo que ρ\rho sí, distinguirlas en el peor caso deja de tener cota.

Ejercicios

Ejercicio 1

Sea ρ=diag(0.6,0.4)\rho = \operatorname{diag}(0.6, 0.4) y σ=diag(0.5,0.5)\sigma = \operatorname{diag}(0.5, 0.5) (el estado maximalmente mezclado de un cúbit). Calcula Dmax(ρσ)D_{\max}(\rho\|\sigma).

Solución

Conmutan, así que basta con el mayor cociente: Dmax=log2max(0.6/0.5, 0.4/0.5)=log21.20.263D_{\max} = \log_2 \max(0.6/0.5,\ 0.4/0.5) = \log_2 1.2 \approx 0.263 bits. Coincide con la forma de la norma, porque cuando σ=121\sigma = \tfrac12\mathbb{1} se tiene σ1/2ρσ1/2=2ρ\sigma^{-1/2}\rho\,\sigma^{-1/2} = 2\rho, cuyo mayor autovalor es 20.6=1.22\cdot 0.6 = 1.2.

Ejercicio 2

Demuestra, directamente desde la definición, que si ρ\rho y σ\sigma son estados (Trρ=Trσ=1\operatorname{Tr}\rho = \operatorname{Tr}\sigma = 1), entonces Dmax(ρσ)0D_{\max}(\rho\|\sigma) \ge 0.

Solución

Si ρλσ\rho \preceq \lambda\sigma, tomar traza conserva la desigualdad (ABA \preceq B implica TrATrB\operatorname{Tr}A \le \operatorname{Tr}B), de modo que 1=TrρλTrσ=λ1 = \operatorname{Tr}\rho \le \lambda\operatorname{Tr}\sigma = \lambda. Todo λ\lambda admisible cumple entonces λ1\lambda \ge 1, y el mínimo también; por tanto Dmax=log2λminlog21=0D_{\max} = \log_2 \lambda_{\min} \ge \log_2 1 = 0.