Entropía max-relativa · Artículo 03

La min-entropía

De todas las entropías, la min-entropía es la más conservadora: no le importa la forma de la distribución, solo cuánto pesa su pico. Esa aparente pobreza es su fuerza, y tiene una lectura preciosa: es la probabilidad de acertar a la primera.

La min-entropía mira una distribución y se fija en una sola cosa: cuánta probabilidad acumula su resultado más probable. Ignora por completo la cola, la forma, los detalles. Podría parecer una medida pobre, pero es justo esa terquedad la que la hace valiosa — captura exactamente cuánta certeza tiene el observador más astuto, y por eso es la moneda de la aleatoriedad de una toma y de buena parte de la criptografía.

La definición y su lectura operacional

Para un estado ρ\rho sobre X\mathcal{X}, la min-entropía min-entropía se define a partir de su mayor autovalor:

Hmin(A)ρ=log2ρ=log2λmax(ρ).H_{\min}(A)_\rho = -\log_2 \big\lVert \rho \big\rVert_\infty = -\log_2 \lambda_{\max}(\rho).

En el caso clásico, con ρ=diag(p)\rho = \operatorname{diag}(p), el mayor autovalor es sencillamente la probabilidad más alta, y la fórmula se lee de un vistazo:

Hmin(A)p=log2maxipi=log2pacierto.H_{\min}(A)_p = -\log_2 \max_i p_i = -\log_2 p_{\text{acierto}}.

Ahí aparece la lectura operacional, y es la mejor manera de tener la min-entropía en la cabeza: maxipi\max_i p_i no es otra cosa que la probabilidad de probabilidad de acierto adivinar AA a la primera con la mejor estrategia posible —apostar siempre por el resultado más probable—. La min-entropía es, literalmente, log2-\log_2 de esa probabilidad de acierto. Cuanto más fácil de adivinar es el sistema, menos min-entropía tiene. Cambia la concentración de la distribución y observa cómo responden las dos cantidades:

Min-entropía = adivinar a la primera

Hmin = 0.000 bits  ·  H (Shannon) = 0.000 bits  ·  pacierto = 0.00

Hmin solo depende de la barra más alta (tu mejor apuesta). Siempre Hmin ≤ H.

Concentración 1.60

Vale la pena fijarse en los dos extremos. Si la distribución es uniforme sobre dd valores, adivinar es tan difícil como puede serlo (pacierto=1/dp_{\text{acierto}} = 1/d) y la min-entropía alcanza su máximo, Hmin=log2dH_{\min} = \log_2 d. Si en cambio se concentra en un único valor, pacierto1p_{\text{acierto}} \to 1 y Hmin0H_{\min} \to 0. Y entre medias se cumple siempre Hmin(A)H(A)H_{\min}(A) \le H(A): la min-entropía nunca supera a la de Shannon (o de von Neumann), porque solo cobra por el pico mientras que aquella suma toda la cola.

La versión condicional

Lo verdaderamente interesante ocurre cuando hay información lateral. Supón que un sistema BB está correlacionado con AA: ¿cuánta incertidumbre le queda sobre AA a quien tiene acceso a BB? La respuesta es la min-entropía condicional min-entropía condicional, que se construye —y esto no es casual— optimizando la max-relativa del artículo anterior contra un estado de referencia en BB:

Hmin(AB)ρ=minσBDmax(ρAB1AσB).H_{\min}(A|B)_\rho = -\min_{\sigma_B} D_{\max}\big(\rho_{AB} \,\big\|\, \mathbb{1}_A \otimes \sigma_B\big).

Merece la pena leer la fórmula despacio. El 1A\mathbb{1}_A refleja que, a priori, no suponemos ninguna estructura sobre AA; la minimización sobre σB\sigma_B busca la referencia en BB que mejor «explica» las correlaciones. Y ese mínimo tiene una segunda vida que revelaremos en el artículo siguiente: es un programa semidefinido, con lo que todo el aparato del Módulo 01 se pone al servicio de calcular una entropía.

Ejemplos resueltos

Ejemplo resuelto 1 · Min-entropía frente a Shannon

Problema. Para p=(0.7, 0.2, 0.1)p = (0.7,\ 0.2,\ 0.1), calcula HminH_{\min} y HH (Shannon), e indica la probabilidad de acierto.

Solución. El pico está en 0.70.7, de manera que la mejor apuesta acierta el 70%70\% de las veces: pacierto=0.7p_{\text{acierto}} = 0.7 y Hmin=log20.70.515H_{\min} = -\log_2 0.7 \approx 0.515 bits.

La entropía de Shannon suma la contribución de toda la distribución: H=(0.7log20.7+0.2log20.2+0.1log20.1)1.157H = -(0.7\log_2 0.7 + 0.2\log_2 0.2 + 0.1\log_2 0.1) \approx 1.157 bits.

Comprobación. 0.5151.1570.515 \le 1.157, como exige HminHH_{\min} \le H. La min-entropía sale menor porque cobra solo por el pico; la cola, que a Shannon le añade casi 0.650.65 bits, a ella no le importa.

Ejemplo resuelto 2 · El caso uniforme

Problema. Sea ρ=1/4\rho = \mathbb{1}/4, el estado maximalmente mezclado en dimensión d=4d = 4. Calcula HminH_{\min} y compáralo con HH.

Solución. Todos los autovalores valen 1/41/4, así que λmax=1/4\lambda_{\max} = 1/4 y

Hmin=log214=2 bits=log24.H_{\min} = -\log_2 \tfrac14 = 2 \text{ bits} = \log_2 4.

Aquí HminH_{\min} y HH coinciden, ambas iguales a log2d\log_2 d. Tiene sentido: cuando no hay ningún pico que destaque, el peor caso y el promedio son la misma cosa. La brecha entre HminH_{\min} y HH mide, en el fondo, cuán irregular es la distribución.

Ejercicios

Ejercicio 1

Un cúbit en el estado ρ=diag(0.85,0.15)\rho = \operatorname{diag}(0.85, 0.15). Da paciertop_{\text{acierto}} y HminH_{\min}.

Solución

La mejor apuesta es el primer resultado, con pacierto=0.85p_{\text{acierto}} = 0.85, así que Hmin=log20.850.234H_{\min} = -\log_2 0.85 \approx 0.234 bits. Casi seguro de acertar equivale a muy poca min-entropía.

Ejercicio 2

Explica por qué 0Hmin(A)log2d0 \le H_{\min}(A) \le \log_2 d para todo estado en dimensión dd, e identifica qué estados alcanzan cada extremo.

Solución

Por ser ρ\rho un estado, su mayor autovalor está atrapado entre 1/d1/d y 11: no puede bajar de 1/d1/d (si todos fueran menores, no sumarían 11) ni pasar de 11 (traza unidad y positividad). Aplicando log2-\log_2 se obtiene 0Hminlog2d0 \le H_{\min} \le \log_2 d. El máximo lo da el estado maximalmente mezclado (λmax=1/d\lambda_{\max} = 1/d) y el mínimo, los estados puros (λmax=1\lambda_{\max} = 1).