Ficha PE.1 · Probabilidad y estadística

Media, varianza, momentos y función generatriz

Qué es exactamente una desviación típica, de dónde sale el √N de un contador, por qué el nitrógeno tiene tres velocidades distintas, y qué significa que una distribución no tenga varianza.

Cuantario dice que Δx\Delta x y Δp\Delta p «son desviaciones típicas, y como toda desviación típica no son propiedades de una medida sino de una distribución». Un contador que registra 1000 sucesos tiene una incertidumbre del 3,2 % sin haber repetido nada. El nitrógeno a 300 K tiene tres velocidades típicas —422, 476 y 517 m/s— y las tres son correctas. Y la distribución de momento que sale de una rendija de bordes duros no tiene desviación típica en absoluto. Los cuatro hechos salen de la misma operación: integrar una distribución contra una potencia.

Quién pide esta ficha
Necesitas: integrar, y saber que una densidad de probabilidad integra a 1. La función generatriz de la sección 3 usa derivadas y una serie de Taylor; el resto se lee sin ellas.
Momentos medidos, y varianzas que no existen

El panel integra la distribución elegida por Simpson sobre 4000 intervalos —o la suma término a término, si es discreta— y saca su media y su desviación típica de las integrales, no de una fórmula. Al lado va el valor cerrado cuando existe. Y la última fila compara σ medida con el corte entero y con la mitad del corte: si la varianza existe ese cociente vale 1; si no existe, vale √2. Prueba la lorentziana.

x (en unidades de σ)
MomentoMedidoCerradoResiduo
normalización ∫f1.0000000001 exacto2,2 × 10⁻¹⁶
⟨x⟩5,6509615 × 10⁻¹⁷05,7 × 10⁻¹⁷
⟨x²⟩1,00000001,00000008,5 × 10⁻¹⁴
σ = √(⟨x²⟩ − ⟨x⟩²)1,00000001,00000004,2 × 10⁻¹⁴
σ(L) / σ(L/2)1.0005361 si la varianza existe5,4 × 10⁻⁴

Doblar el corte no mueve la desviación típica: el cociente vale 1.000536, y por eso tiene sentido decir «la σ de esta distribución» sin más. Mueve el mando de corte de 2 a 20 y comprueba que las cuatro primeras filas no se enteran — salvo en los cortes más apretados, donde falta cola por integrar y el residuo lo denuncia.

Qué es exactamente una desviación típica

Dada una densidad de probabilidad f(x)f(x) normalizada, su momento de orden nn es

xn=xnf(x)dx.\langle x^n\rangle = \int x^n f(x)\,dx.

El de orden 1 es la media. La desviación típica es la raíz del promedio del cuadrado de las desviaciones respecto de ella, y desarrollando el cuadrado sale la forma que se usa siempre:

σ2=(xx)2=x2x2.\sigma^2 = \big\langle (x-\langle x\rangle)^2\big\rangle = \langle x^2\rangle - \langle x\rangle^2.

Hay dos cosas que decir de esa definición, y las dos importan más que la fórmula. La primera es que σ es una propiedad de la distribución, no de una medida. No mide «lo mal que se ha medido algo»: mide cuánto se reparte la magnitud. Cuando la cuántica escribe ΔxΔp/2\Delta x\,\Delta p \ge \hbar/2, esas dos deltas son estas sigmas, calculadas sobre el estado, y para medir una hacen falta muchas copias del mismo estado medidas una a una.

La segunda es que σ es sólo una de las maneras de decir «lo típico», y no siempre la mejor. Una distribución asimétrica tiene la moda en un sitio, la mediana en otro y la media en un tercero. Atomario lo dice con números para el orbital 1s del hidrógeno: el máximo de la densidad radial está en 52,9 pm, el radio medio en 79,4 pm y hay que llegar a 141 pm para encerrar el 90 % de la probabilidad. Tres respuestas correctas a «cuánto mide un átomo».

Las tres velocidades del nitrógeno

El ejemplo canónico de que «lo típico» no es un número está en la distribución de Maxwell-Boltzmann:

f(v)=4π(m2πkT)3/2v2emv2/2kT.f(v) = 4\pi\left(\frac{m}{2\pi kT}\right)^{3/2}v^2e^{-mv^2/2kT}.

Integrándola —y las tres integrales están hechas con sympy en el guion de verificación, no copiadas— salen tres cantidades distintas:

QuéCómo se defineFórmulaN₂ a 300 K
Más probable, v_pel máximo de f√(2kT/m)422,0 m/s
Media, v̄⟨v⟩√(8kT/πm)476,2 m/s
Cuadrática media, v_rms√⟨v²⟩√(3kT/m)516,8 m/s
Dispersión, σ_v√(⟨v²⟩ − ⟨v⟩²)√((3 − 8/π)kT/m)200,9 m/s

Sus cocientes son universales —1:1,1284:1,22471 : 1{,}1284 : 1{,}2247— y no dependen ni del gas ni de la temperatura. La cuarta fila es la que suele faltar y la que más dice: la dispersión es el 42 % de la media. Un gas no tiene «una velocidad»: tiene una campana ancha, y de su cola derecha dependen la evaporación, el escape atmosférico y toda la cinética de Arrhenius.

Por qué v_rms y no v̄ en la teoría cinética. La presión y la energía cinética media dependen de v2\langle v^2\rangle, no de v\langle v\rangle, porque la energía va con el cuadrado. El flujo de moléculas que atraviesa un agujero, en cambio, depende de v\langle v\rangle — ahí está el 14nvˉ\tfrac14 n\bar v que usa Termario. La regla general: el momento que hay que usar es el que aparece en la magnitud física, y hay que mirarlo cada vez. Confundir vˉ\bar v con vrmsv_{\text{rms}} cuesta un 8,5 %, que es poco para equivocarse y mucho para publicarlo.

La función generatriz: todos los momentos de un tirón

Calcular los momentos uno a uno es trabajo. La función generatriz de momentos los produce todos con una sola integral y luego derivadas:

M(t)=etx,xn=dnMdtnt=0.M(t) = \big\langle e^{tx}\big\rangle, \qquad \langle x^n\rangle = \left.\frac{d^nM}{dt^n}\right|_{t=0}.

Que funcione es inmediato: desarrollando etx=tnxn/n!e^{tx} = \sum t^nx^n/n!, el coeficiente de tnt^n en M(t)M(t) es xn/n!\langle x^n\rangle/n!, así que la función generatriz es la serie de Taylor cuyos coeficientes son los momentos. Para la gaussiana sale M(t)=emt+σ2t2/2M(t) = e^{mt+\sigma^2t^2/2}. Y para la distribución de Poisson, que es la que gobierna cualquier recuento:

M(t)=n=0etnμneμn!=eμ(et1).M(t) = \sum_{n=0}^{\infty}e^{tn}\frac{\mu^ne^{-\mu}}{n!} = e^{\mu(e^t-1)}.

Derivando dos veces en t=0t=0 salen n=μ\langle n\rangle = \mu y n2=μ2+μ\langle n^2\rangle = \mu^2+\mu, y por tanto

σ2=μσ=μ.\sigma^2 = \mu \quad\Longrightarrow\quad \sigma = \sqrt{\mu}.

En una Poisson la varianza es la media. Ésa es toda la estadística de conteo, y es de donde sale la regla que usa cualquier laboratorio del mundo: un detector que registra NN sucesos tiene una incertidumbre estadística de N\sqrt{N}, y no hace falta repetir la medida para saberlo. La medida trae su propia barra de error dentro.

Ejemplo resuelto 1 · Cuánto hay que contar

Problema. Un contador Geiger acumula sucesos. ¿Cuántos hacen falta para un 1 % de precisión? ¿Y qué cuesta pasar de ahí al 0,5 %?

Solución. El error relativo es σ/N=N/N=1/N\sigma/N = \sqrt{N}/N = 1/\sqrt{N}, así que N=1/ε2N = 1/\varepsilon^2:

Cuentasσ = √NError relativo
1001010 %
1 00031,63,16 %
10 0001001 %
1 000 0001 0000,1 %

Resultado. Diez mil cuentas para el 1 %, y cuarenta mil para el 0,5 %: dividir el error por dos cuesta multiplicar el tiempo por cuatro. Ésa es la ley que gobierna el presupuesto de cualquier experimento — y por eso Particulario dice que pasar de 3σ a 5σ exige (5/3)2=2,8(5/3)^2 = 2{,}8 veces más datos, ni uno menos.

La lección de método está en el rendimiento decreciente. Las primeras cien cuentas te llevan del infinito al 10 %; las siguientes 999 900, del 10 % al 0,1 %. Cuando en un experimento la barra estadística ya es más pequeña que la sistemática, seguir contando no sirve para nada, y eso ocurre antes de lo que parece.

Cinco sigmas, y por qué la gaussiana no siempre vale

Con lo anterior se lee sin más ayuda el número más famoso de la física experimental. Si un experimento espera BB sucesos de fondo, ese fondo fluctúa con σ=B\sigma = \sqrt{B}, así que un exceso SS tiene significancia S/BS/\sqrt{B}. Con B=400B = 400 esperados y 500 contados, S/B=100/20=5S/\sqrt B = 100/20 = 5: cinco sigmas. Y la probabilidad de que el fondo solo produzca semejante exceso es la cola de la gaussiana,

p=12erfc ⁣(52)=2,87×107,p = \tfrac12\,\mathrm{erfc}\!\left(\frac{5}{\sqrt2}\right) = 2{,}87\times10^{-7},

una entre 3,49 millones. Con el listón de 3σ que se usa en casi todas las demás ciencias, p=0,135 %p = 0{,}135\ \%: una entre 740. La diferencia entre los dos listones son 2,8 veces más datos.

Pero la gaussiana es una aproximación, y con pocos sucesos falla del lado peligroso. Particulario da el caso: con μ=5,3\mu = 5{,}3 esperados, la probabilidad de observar 13 o más vale 3,3×1033{,}3\times10^{-3} según la Poisson exacta y 4,1×1044{,}1\times10^{-4} según la gaussiana equivalente — un factor ocho de diferencia, y la gaussiana es la optimista. La razón es que la cola discreta de la Poisson es mucho más gruesa que la de la campana. Regla de oficio: con pocos sucesos, cuenta sucesos. La sigma gaussiana es un idioma de traducción, no la matemática.

Cuando la varianza no existe

Toda la ficha ha supuesto que las integrales convergen. No siempre lo hacen, y ése es el contenido menos conocido y más útil de aquí. La lorentziana está perfectamente normalizada:

f(x)=γ/πx2+γ2,fdx=1,f(x) = \frac{\gamma/\pi}{x^2+\gamma^2}, \qquad \int_{-\infty}^{\infty}f\,dx = 1,

y sin embargo x2fdx\int x^2f\,dx diverge: el integrando tiende a γ/π\gamma/\pi, una constante, y su integral crece sin parar. Sus colas caen como 1/x21/x^2, lo bastante deprisa para que la distribución se normalice y no lo bastante para que tenga varianza.

Lo que se mide entonces depende de dónde se corte. Cortando en ±L\pm L,

x2L=Lγarctan(L/γ)γ2  L  2γLπ,\langle x^2\rangle_L = \frac{L\gamma}{\arctan(L/\gamma)}-\gamma^2 \;\xrightarrow[L\to\infty]{}\; \frac{2\gamma L}{\pi},

así que σL\sigma \propto \sqrt{L}: al doblar el corte, la «desviación típica» se multiplica por 2=1,4142\sqrt2 = 1{,}4142, y no converge nunca. El interactivo de arriba mide precisamente ese cociente y lo pone en pantalla: vale 1,000000 para la gaussiana, la Maxwell-Boltzmann y la Poisson, y tiende a 1,414214 para la lorentziana. No es una afirmación de la ficha — es una columna que cambia al arrastrar un mando.

Ejemplo resuelto 2 · La rendija dura no tiene Δp

Problema. Cuantario I.3 dice que «el estado que sale de una rendija dura tiene una distribución de momento cuyas colas caen como 1/p², y con eso el promedio de p² no converge; calculada con un corte artificial, la Δp crece como la raíz del corte». Compruébalo.

Solución. Una rendija de bordes abruptos y anchura aa da una función de onda rectangular, cuya transformada es una sinc\mathrm{sinc} y cuya densidad de momento va como sinc2\mathrm{sinc}^2. Para pp grande, sinc21/p2\mathrm{sinc}^2\sim 1/p^2, así que p2sinc2p^2\,\mathrm{sinc}^2 \to constante y la integral crece linealmente con el corte. Numéricamente, con el corte en 400 y en 800 unidades salen σ = 11,28 y σ = 15,96, cuyo cociente es 1,4151 — el √2 predicho.

Resultado. La rendija de bordes duros, que es el experimento con el que se enseña el principio de incertidumbre en todos los libros, es justamente el estado para el que Δp\Delta p no existe. La desigualdad ΔxΔp/2\Delta x\,\Delta p\ge\hbar/2 se cumple trivialmente, porque el miembro izquierdo es infinito.

La lección práctica no es que el argumento de la rendija sea inútil — sirve para el orden de magnitud, que es para lo que se cuenta —, sino que una cola gruesa invalida el resumen. Antes de escribir «σ» de cualquier distribución hay que preguntarse cómo caen sus colas, y si caen como una potencia baja, la respuesta correcta no es un número: es «no tiene». La anchura a media altura sí existe siempre, y por eso las rayas espectrales lorentzianas se tabulan con FWHM y nunca con σ.

Ejercicios

Ejercicio 1

En el interactivo, elige la lorentziana y lleva el corte de 2 a 20 anotando σ y el cociente σ(L)/σ(L/2). Después haz lo mismo con la gaussiana. ¿Por qué el cociente de la lorentziana empieza en 1,7 y baja hacia 1,41 en vez de valer 1,41 desde el principio?

Solución

Porque σL\sigma \propto \sqrt L es el comportamiento asintótico, no el exacto. Con la fórmula de arriba, x2L=L/arctanL1\langle x^2\rangle_L = L/\arctan L - 1 para γ=1\gamma=1: en L=2L=2 vale 0,806 y en L=1L=1 vale 0,273, cuyo cociente de raíces es 1,72. Sólo cuando LγL\gg\gamma el arcotangente se queda en π/2\pi/2 y aparece el 2\sqrt2 limpio. La gaussiana, en cambio, da 1,000000 desde L=4L=4.

La segunda lección es de diagnóstico numérico. Si estimas una σ de unos datos y al ampliar el rango de integración la σ sigue creciendo, no tienes un problema de muestreo: tienes una distribución sin varianza. La prueba cuesta treinta segundos —recalcular con la mitad del rango— y ahorra publicar una barra de error inventada.

Ejercicio 2

Un experimento espera 2500 sucesos de fondo y observa 2650. ¿Es un descubrimiento? ¿Cuántos datos más harían falta para que lo fuera, si la señal es real?

Solución

S=150S = 150, B=50\sqrt B = 50, así que S/B=3,0S/\sqrt B = 3{,}0: tres sigmas, que en física de partículas es «evidencia», no «descubrimiento». Como la significancia crece con datos\sqrt{\text{datos}} —tanto SS como BB escalan con la cantidad de datos, así que S/BS/\sqrt B escala con su raíz—, llegar a 5σ pide (5/3)2=2,78(5/3)^2 = 2{,}78 veces más datos.

La segunda lección: ese factor 2,78 supone que toda la incertidumbre es estadística. En cuanto hay una sistemática que no baja al acumular datos, la significancia deja de crecer con la raíz y se estanca. Por eso los experimentos maduros dejan de anunciar «más datos» y empiezan a anunciar «mejor calibración»: han llegado al punto en que la raíz cuadrada ya no compra nada.

Ejercicio 3

Demuestra que σ2=x2x2\sigma^2 = \langle x^2\rangle - \langle x\rangle^2 es siempre 0\ge 0, y di qué distribución alcanza la igualdad.

Solución

Es inmediato desde la definición: σ2\sigma^2 es el promedio de (xx)2(x-\langle x\rangle)^2, que es una cantidad no negativa, y el promedio de algo no negativo no puede ser negativo. La igualdad exige que (xx)2(x-\langle x\rangle)^2 sea cero en todos los puntos con probabilidad no nula: la distribución tiene que estar concentrada en un solo valor, es decir, ser una delta.

La segunda lección es que esa desigualdad, x2x2\langle x^2\rangle \ge \langle x\rangle^2, es un caso particular de Cauchy-Schwarz, y ése es exactamente el ingrediente del que sale el principio de incertidumbre generalizado. Termario la usa también, sin nombrarla, para justificar que vrmsvˉv_{\text{rms}} \ge \bar v siempre — con igualdad sólo si todas las moléculas fueran a la misma velocidad, que es la delta de antes.

Resumen en frío · Ficha PE.1

Lo que esta ficha deja utilizable, para volver dentro de seis meses sin releerla.

QuéFórmula o valorDónde
Momento de orden n⟨xⁿ⟩ = ∫xⁿf(x)dx, con ∫f = 1§1
Desviación típicaσ² = ⟨x²⟩ − ⟨x⟩²; propiedad de la DISTRIBUCIÓN, no de una medida§1
Maxwell-Boltzmannv_p = √(2kT/m) · v̄ = √(8kT/πm) · v_rms = √(3kT/m)§2
N₂ a 300 K422,0 · 476,2 · 516,8 m/s; σ_v = 200,9 m/s, el 42 % de v̄§2
Cocientes universales1 : 1,1284 : 1,2247, sin depender del gas ni de T§2
Función generatrizM(t) = ⟨e^(tx)⟩; ⟨xⁿ⟩ = M⁽ⁿ⁾(0)§3
GaussianaM(t) = e^(mt + σ²t²/2)§3
PoissonM(t) = e^(µ(e^t − 1)) ⟹ media = varianza = µ§3
Estadística de conteoσ = √N; error relativo 1/√N§3
Cuánto contar10⁴ cuentas → 1 %; dividir el error por 2 cuesta ×4 en tiempoej. res. 1
SignificanciaS/√B; B = 400, S = 100 ⟹ 5σ§4
Los dos listones5σ ⟹ p = 2,87 × 10⁻⁷ (1 entre 3,49 M); 3σ ⟹ 0,135 %§4
De 3σ a 5σ(5/3)² = 2,78 veces más datos§4, ej. 2
Trampa de la gaussianaµ = 5,3, P(≥13): Poisson 3,3 × 10⁻³, gaussiana 4,1 × 10⁻⁴ (×8)callout §4
Lorentziananormalizada pero SIN varianza; ⟨x²⟩_L → 2γL/π§5
La prueba de 30 segundosσ(L)/σ(L/2) = 1 si converge, √2 = 1,4142 si no§5
Rendija duracolas 1/p²: Δp no existe; medido, σ(800)/σ(400) = 1,4151ej. res. 2
Qué usar entoncesanchura a media altura, que existe siempreej. res. 2

Adónde lleva esta ficha. Con esto ya puedes poner una barra de error a cualquier recuento sin repetirlo, decidir qué promedio pide una magnitud física, y detectar en treinta segundos una distribución que no admite el resumen que le estabas poniendo. Lo que falta a continuación es cuándo se puede sustituir una distribución por otra y con qué error — binomial, Poisson y gaussiana—, y el teorema central del límite que explica por qué la campana está en todas partes; las dos tienen ficha propia pendiente en esta área.

Las fichas hermanas son ST.1, donde la lorentziana aparece como transformada de una exponencial y se explica por qué sus rayas se tabulan con anchura a media altura, y CAL.4, que enseña a leer la σ escondida en una escala de decibelios. Para usarlo ya, Cuantario I.3 monta el principio de incertidumbre entero sobre estas dos sigmas, y Particulario I.5 convierte un √B en un descubrimiento.