Ficha PE.3 · Probabilidad y estadística

Propagación de errores y combinación de incertidumbres

Por qué la derivada es una sensibilidad, por qué los errores se suman en cuadratura y no en línea, cómo se promedian dos medidas que no valen lo mismo, y cuál de los errores que tienes no va a bajar por mucho que midas.

Para que un reloj de cesio primario dé la frecuencia con una exactitud de 101610^{-16} hay que conocer la temperatura de su cámara con ±0,44 K. Ese número no sale de ningún experimento: sale de derivar una vez. Y la segunda mitad del mismo cálculo dice algo peor — ese error no baja promediando: se puede medir durante un año y seguirá exactamente donde estaba. Esta ficha va de las tres operaciones que convierten los errores de lo que mides en el error de lo que publicas —la derivada como sensibilidad, la suma en cuadratura y la media ponderada— y de la línea que separa el error que la paciencia arregla del que no.

Quién pide esta ficha
Necesitas: derivar una función de una variable y saber qué es una desviación típica (la ficha PE.1 la define). Las derivadas parciales aparecen sólo en la fórmula general de la sección 3, y la sección se entiende sin ellas.

La derivada es una sensibilidad

Toda esta ficha sale de una línea. Si el resultado yy se calcula a partir de una medida xx mediante y=f(x)y = f(x), y xx trae un error Δx\Delta x, entonces

ΔydfdxΔx.\Delta y \simeq \left|\frac{df}{dx}\right|\,\Delta x.

No hay teoría detrás: es el primer término de una serie de Taylor, el mismo de la ficha CAL.1. La derivada deja de ser «la pendiente» y pasa a ser cuánto se mueve el resultado por unidad de error de entrada, que es la única lectura que hace falta aquí. Y con ella se contesta la pregunta que de verdad se hace un experimentador, que no es «¿cuánto vale el error?» sino «¿cuánto puedo permitirme equivocarme aquí?» — se despeja Δx\Delta x en vez de Δy\Delta y.

El reloj del lead es ese despeje. El desplazamiento que la radiación térmica de las paredes produce en la frecuencia del cesio vale δ(T)=1,71×1014(T/300 K)4\delta(T) = -1{,}71\times10^{-14}\,(T/300\ \text{K})^4, y su derivada en 300 K es

dδdT=4×1,71×1014300=2,28×1016 K1.\frac{d\delta}{dT} = \frac{4\times1{,}71\times10^{-14}}{300} = 2{,}28\times10^{-16}\ \text{K}^{-1}.

Con un presupuesto de error de 101610^{-16} para esta partida, ΔT=1016/2,28×1016=0,44\Delta T = 10^{-16}/2{,}28\times10^{-16} = 0{,}44 K. Ahí está por qué los relojes primarios llevan termómetros calibrados dentro de la zona de vuelo: no es celo, es aritmética. Y también por qué hay laboratorios que han montado la cámara a temperatura criogénica — a 4 K el término entero vale 5×10225\times10^{-22} y el problema desaparece en lugar de medirse.

La linealización tiene su propio error, y a veces se nota. Sustituir la función por su recta tangente vale mientras el trozo de curva que abarca Δx\Delta x sea casi recto. Medido: en el reloj, un error del 1 % en TT mueve δ\delta un 4,06 % exacto frente al 4,00 % que predice la regla — un 1,5 % de discrepancia, invisible. Pero en el termómetro de dos rayas de la sección siguiente, donde el exponente vale 19,7 en vez de 4, un salto del 10 % da 29,1 K exactos frente a los 30,4 K linealizados: un 4,4 % de más. La regla de bolsillo es la del producto exponente × error relativo: mientras valga bastante menos que 1, la recta tangente basta; cuando se acerca a 1, la propagación de errores deja de ser el método y hay que evaluar la función en los dos extremos.

La derivada logarítmica: por qué en los productos se suman errores relativos

Casi ninguna magnitud física se calcula sumando: se calcula multiplicando potencias. Para y=Axazby = A\,x^a z^b, en lugar de derivar la expresión se deriva su logaritmo, que la convierte en una suma:

lny=lnA+alnx+blnzΔyy=aΔxx+bΔzz.\ln y = \ln A + a\ln x + b\ln z \quad\Longrightarrow\quad \frac{\Delta y}{y} = a\,\frac{\Delta x}{x} + b\,\frac{\Delta z}{z}.

Ésa es la regla entera, y con ella se contestan de memoria casi todas las preguntas de error que aparecen en un artículo de Nivel I: en un producto o una potencia no se suman los errores absolutos, se suman los relativos, y cada uno multiplicado por su exponente. Un exponente 4 cuadruplica el error relativo; una raíz cuadrada lo divide por dos.

Con una advertencia sobre cómo se suman, porque la tabla de abajo no dice lo mismo que la línea de arriba. La derivada logarítmica los suma en línea, y ése es el caso peor: supone que todos los errores se equivocan a la vez y en el mismo sentido, que es lo que hay que dar cuando las medidas comparten origen. Si son independientes —y casi siempre lo son— la suma correcta es la de la sección 3, en cuadratura, y así están escritas las cuatro filas que hay que llevarse:

Si el resultado es…Se combinanY la regla es
y = x ± z (suma o resta)los errores absolutosΔy = √(Δx² + Δz²)
y = A·xᵃzᵇ (producto o potencia)los errores relativosΔy/y = √((aΔx/x)² + (bΔz/z)²)
y = A·e^(kx) (exponencial)absoluto → relativoΔy/y = |k|·Δx
y = A·ln x (logaritmo)relativo → absolutoΔy = A·Δx/x

Las dos últimas filas son las que sorprenden, y las dos las usa Atomario sin nombrarlas. La exponencial convierte un error absoluto en uno relativo: como la población de un nivel excitado va con eΔE/kBTe^{-\Delta E/k_BT}, un error absoluto en 1/T1/T sale multiplicado por ΔE/kB\Delta E/k_B y aparece como error relativo de la intensidad. Escrito en función de TT, que es lo que se quiere, el mismo hecho toma la forma de la fila del producto con el propio exponente ΔE/kBT=19,7\Delta E/k_BT = 19{,}7 haciendo de factor de conversión: un error del 10 % en la intensidad de la raya sólo se traduce en un 0,10/19,7=0,51 %0{,}10/19{,}7 = 0{,}51\ \% en la temperatura. Son 30 K sobre 6000: la misma exponencial que hace la intensidad de una raya tan traicionera de interpretar es la que convierte la espectroscopía en un termómetro de precisión.

Y el logaritmo hace lo contrario: convierte un error relativo en uno absoluto. La edad por radiocarbono es t=τln(1/f)t = \tau\ln(1/f), así que Δt=τΔf/f\Delta t = \tau\,\Delta f/f: un error relativo ε\varepsilon en la fracción de 14C^{14}\text{C} produce τε\tau\varepsilon años de error, los mismos a los mil años que a los cuarenta mil, porque τ\tau no depende de la edad. Ese único hecho explica por qué el límite del método no está en la fórmula.

Ejemplo resuelto 1 · El anillo de LIGO, y la magnitud en la que el error es constante

Problema. GW150914 llegó a Livingston y 6,9 ± 0,5 ms después a Hanford, que están a 3002 km. Gravitario deduce θ=46,4\theta = 46{,}4^\circ con un grosor de anillo de ±3,9° y una región de cielo de unos 2000 grados cuadrados, y añade que «como el error angular es Δ(cosθ)/senθ\Delta(\cos\theta)/\mathrm{sen}\,\theta, la precisión mejora cuanto más cerca de 90°». Comprueba los tres números y averigua qué pasa con la región del cielo cuando la precisión angular mejora.

Solución. La luz tarda Δtmax=3,002×106/c=10,01\Delta t_{\max} = 3{,}002\times10^6/c = 10{,}01 ms en ir de un observatorio al otro, y cosθ=Δt/Δtmax=0,689\cos\theta = \Delta t/\Delta t_{\max} = 0{,}689, de donde θ=46,44\theta = 46{,}44^\circ. Lo medido es Δt\Delta t, y lo que se quiere es θ\theta, así que hay que propagar a través del arcocoseno. Derivando cosθ=Δt/Δtmax\cos\theta = \Delta t/\Delta t_{\max}:

senθ  δθ=δ(Δt)Δtmaxδθ=δ(cosθ)senθ=0,049930,724=0,0689 rad=3,95.-\mathrm{sen}\,\theta\;\delta\theta = \frac{\delta(\Delta t)}{\Delta t_{\max}} \quad\Longrightarrow\quad \delta\theta = \frac{\delta(\cos\theta)}{\mathrm{sen}\,\theta} = \frac{0{,}04993}{0{,}724} = 0{,}0689\ \text{rad} = 3{,}95^\circ.

Los ±3,9° publicados. Y el resultado es correcto también sin linealizar: los extremos exactos del anillo, arccos[(6,90,5)/10,01]\arccos[(6{,}9\mp0{,}5)/10{,}01], dan una semianchura de 3,96°, un 0,3 % de diferencia.

Resultado. Y ahora la parte donde propagar bien corrige al artículo que pide la ficha. Gravitario cierra ese ejercicio con «la dirección mejor determinada en ángulo es la que produce la región más grande en el cielo, y viceversa», y la fórmula dice que no. El ángulo sólido de un anillo entre θ\theta^- y θ+\theta^+ vale 2π(cosθcosθ+)2\pi(\cos\theta^- - \cos\theta^+) exactamente, y esos dos cosenos son (Δtδ)/Δtmax(\Delta t\mp\delta)/\Delta t_{\max}, así que

Ω=4πδ(cosθ)=4πδ(Δt)Δtmax=0,627 sr=2060 grados cuadrados,\Omega = 4\pi\,\delta(\cos\theta) = 4\pi\,\frac{\delta(\Delta t)}{\Delta t_{\max}} = 0{,}627\ \text{sr} = 2060\ \text{grados cuadrados},

y en esa expresión θ\theta no aparece. La precisión angular varía muchísimo con la dirección —2,86° en 90°, 3,95° en 46,4°, y divergiendo hacia 0°—, pero el área de cielo es la misma siempre. Lo que el par de detectores mide con error constante no es θ\theta, es cosθ\cos\theta, y por eso ninguna geometría del anillo compra cielo: los 2060 grados cuadrados sólo bajan con δ(Δt)\delta(\Delta t) más pequeño o con Δtmax\Delta t_{\max} más grande — es decir, con relojes mejores o con detectores más separados. Ahí está, medida, la justificación entera de KAGRA y del detector de la India.

Hay una sola excepción y también sale de la fórmula: cerca de θ=0\theta = 0 el anillo deja de ser un anillo porque el polo lo recorta, y el casquete resultante vale 2π[1cos(18,2)]=10302\pi[1-\cos(18{,}2^\circ)] = 1030 grados cuadrados, exactamente la mitad. Nótese que ésa es la única desviación de la constancia y va en el sentido contrario al de la frase: el polo es donde el ángulo se determina peor y también donde la región de cielo es más pequeña. La lección de método es la que hay que llevarse de toda la sección: antes de propagar un error, pregúntate en qué variable lo tienes constante. Esa variable es la que mide tu instrumento, y todas las demás heredan un error que cambia de un punto a otro.

La suma en cuadratura, y por qué no es una suma

Con varias medidas independientes, cada una aporta su término y la fórmula general es

σy2=i(yxi) ⁣2σi2.\sigma_y^2 = \sum_i \left(\frac{\partial y}{\partial x_i}\right)^{\!2}\sigma_i^2.

Lo que se suma son los cuadrados, y la razón es la que da la ficha PE.1: lo que es aditivo para variables independientes es la varianza, no la desviación típica. Sumar las sigmas en línea sería suponer que todos los errores se equivocan a la vez y en el mismo sentido, y eso, para errores independientes, no pasa casi nunca. La diferencia es real: en la tensión de Hubble, 0,5 y 1,04 dan 1,154 en cuadratura y 1,54 sumados, un 33 % más, y la tensión pasaría de 4,9 σ a 3,7 σ. 1,2 σ de discrepancia por elegir mal la operación — la diferencia entre «esto hay que explicarlo» y «esto ya se explicará».

La consecuencia práctica es más útil que la fórmula, y es la brutalidad con que domina el término mayor:

Si el segundo error vale…El total es…Es decir, engorda un…
σ₂ = σ₁/101,005 σ₁0,5 %
σ₂ = σ₁/31,054 σ₁5,4 %
σ₂ = σ₁/21,118 σ₁11,8 %
σ₂ = σ₁1,414 σ₁41,4 %

De ahí sale la regla del tercio, que es la que decide dónde se gasta el dinero en un laboratorio: cualquier fuente de error que valga menos de un tercio de la dominante aporta menos de un 5 % al total y no merece la pena tocarla. Mejorarla un factor diez cambia el resultado en el tercer decimal. En la tensión de Hubble, el ±0,5 de Planck sobre el ±1,04 de SH0ES sólo añade un 11 % al total: la precisión del fondo cósmico es prácticamente gratis, y quien quiera cerrar la disputa tiene que atacar el 1,04.

La resta es la operación peligrosa. Cuando el resultado es la diferencia de dos números parecidos, los errores absolutos se conservan y el error relativo se hunde. Con los números de Gravitario: Planck da H0H_0 con un 0,74 % y SH0ES con un 1,42 %, pero su diferencia, 5,64 ± 1,15, lleva un 20,5 % — catorce veces peor que el peor de sus ingredientes. Ésta es la razón de que en un experimento de precisión se mida siempre la diferencia directamente cuando se puede, en vez de restar dos medidas absolutas: Pound y Rebka no midieron dos frecuencias y las restaron, midieron el desplazamiento. Y es también por lo que la cuadratura tiene una condición que se olvida: exige independencia. Un sistemático compartido por las dos medidas está correlacionado al cien por cien, se suma en línea, y en una resta se cancela entero — que es exactamente para lo que se diseña un experimento diferencial.

La media ponderada: cuando las medidas no valen lo mismo

Dos medidas del mismo número con errores distintos no se promedian sumando y dividiendo entre dos: la buena tiene que pesar más. Cuánto más lo fija el criterio de mínimos cuadrados —minimizar χ2=i(xixˉ)2/σi2\chi^2 = \sum_i(x_i-\bar x)^2/\sigma_i^2—, y la respuesta es que el peso es la inversa de la varianza:

xˉ=ixi/σi2i1/σi2,σ(xˉ)=1i1/σi2.\bar x = \frac{\sum_i x_i/\sigma_i^2}{\sum_i 1/\sigma_i^2}, \qquad \sigma(\bar x) = \frac{1}{\sqrt{\sum_i 1/\sigma_i^2}}.

Dos consecuencias, y la segunda es una trampa. La primera: como el peso va con el cuadrado inverso, una medida tres veces peor cuenta nueve veces menos, y su influencia sobre el resultado es casi decorativa. La segunda: σ(xˉ)\sigma(\bar x) es siempre menor que la mejor de las sigmas individuales, sumes lo que sumes. La fórmula produce siempre una barra de error más estrecha, incluso cuando los datos que la alimentan se contradicen entre sí. Lo que decide si el resultado significa algo es el χ2\chi^2 en el mínimo, que para dos medidas vale

χ2=(x1x2)2σ12+σ22=(la tensioˊn en σ)2,\chi^2 = \frac{(x_1-x_2)^2}{\sigma_1^2+\sigma_2^2} = \left(\text{la tensión en }\sigma\right)^2,

y que con un grado de libertad debería salir del orden de 1. El ejemplo resuelto 2 hace las dos cuentas con la misma fórmula: una legítima y otra no.

Ejemplo resuelto 2 · Un eclipse y una tensión: la misma fórmula, y el número que decide si vale

Problema. (a) Eddington volvió del eclipse de 1919 con dos juegos de placas aceptados: Sobral, 1,98 ± 0,18″, y Príncipe, 1,61 ± 0,45″. Gravitario publica su media ponderada, 1,93 ± 0,17″, sin la fórmula. Recupérala y di qué añadió Príncipe. (b) Haz lo mismo con Planck (67,4 ± 0,5 km/s/Mpc) y SH0ES (73,04 ± 1,04), y explica por qué el resultado no se puede publicar.

Solución (a). Los pesos son 1/0,182=30,91/0{,}18^2 = 30{,}9 y 1/0,452=4,941/0{,}45^2 = 4{,}94, en proporción 6,25 a 1. De ahí xˉ=1,929\bar x = 1{,}929'' y σ=1/35,8=0,167\sigma = 1/\sqrt{35{,}8} = 0{,}167'' — los 1,93 ± 0,17 publicados. Con ellos, la separación del valor de Einstein (1,751″) es de 1,07 σ y la del newtoniano (0,876″) de 6,30 σ; Gravitario publica 1,1 y 6,4. La segunda cifra no se recupera exactamente, y merece decirse en vez de disimularse: reproducir un número de σ ajeno exige saber qué valor exacto de referencia se usó, y una décima de σ es justo el tamaño de esa ambigüedad. No cambia nada aquí —6,3 y 6,4 dicen lo mismo— pero es el recordatorio de que un número de sigmas lleva dentro dos convenios, el de la barra y el de la referencia.

Lo que aportó Príncipe se lee en ese 0,167 frente al 0,18 de Sobral solo: un 7,2 % de mejora. Una segunda expedición, con su barco, su isla y sus nubes, para recortar la barra de error en menos de una décima parte. No es una crítica al plan de 1919 —nadie sabía de antemano cuál de las dos saldría mejor, y llevar dos instrumentos a dos continentes era precisamente la manera de no quedarse sin ninguno—, es la aritmética de la regla del tercio aplicada al revés: cuando un error es 2,5 veces mayor que el otro, lo que trae es corroboración, no precisión, y conviene decirlo así.

La comprobación que legitima el promedio es el χ2\chi^2: (1,981,61)2/(0,182+0,452)=0,58(1{,}98-1{,}61)^2/(0{,}18^2+0{,}45^2) = 0{,}58 con un grado de libertad. Los dos juegos discrepan en 0,76 σ, es decir, no discrepan. Promediarlos está justificado.

Solución (b). La misma fórmula con Planck y SH0ES da Hˉ0=68,46±0,45\bar H_0 = 68{,}46 \pm 0{,}45 km/s/Mpc: un número precioso, con la barra de error más pequeña de las tres, y sin ningún sentido. El χ2\chi^2 vale 5,642/1,1542=23,95{,}64^2/1{,}154^2 = 23{,}9 con un grado de libertad — su raíz son los 4,9 σ de la tensión de Hubble. Con χ2/gdl=24\chi^2/\text{gdl} = 24 lo que dicen los datos no es «el valor está entre los dos»: es que al menos uno de los dos análisis tiene un error que no está en su barra, y promediarlos lo esconde.

Resultado. La receta que usa el Particle Data Group para estos casos es inflar la incertidumbre por el factor de escala de Birge, χ2/gdl=4,89\sqrt{\chi^2/\text{gdl}} = 4{,}89, lo que deja 68,5 ± 2,2 km/s/Mpc. Conviene ver esa cifra por lo que es: no una medida mejor, sino una confesión — la barra se ensancha hasta que las dos entradas quepan, precisamente porque no se sabe cuál falla. Y la lección general: la media ponderada no es un procedimiento, es un procedimiento con una condición de aplicación, y la condición se comprueba con el χ2\chi^2 antes de escribir el resultado, no después. La forma sana de cerrar una tensión no es promediarla: es buscar una tercera medida que no comparta supuestos con ninguna de las dos.

Estadístico y sistemático: el que baja como 1/√N y el que no

Todo lo anterior propaga errores sin preguntar de dónde vienen. Ahora la distinción que dos sitios de la familia usan a la vez sin definirla, y que es la más rentable de toda la ficha:

El primero es el que hace posibles tres cosas imposibles del programa. LIGO mide un desplazamiento de espejo de 4×10184\times10^{-18} m mientras cada átomo del espejo se agita 101110^{-11} m, porque lo que se mide es el centro de masas de 40 kg de sílice fundida — 4,0×10264{,}0\times10^{26} moléculas, cuya raíz reduce la agitación a 5×10255\times10^{-25} m, ocho millones de veces por debajo de la señal. Un receptor GPS recupera una señal 17,5 dB por debajo del ruido sumando coherentemente 20 460 símbolos. Y una muestra de radiocarbono de 40 000 años pasa de ±670 a ±123 años simplemente porque el AMS cuenta 4500 átomos donde el contador de Libby recogía 150 — treinta veces más cuentas, 30=5,5\sqrt{30} = 5{,}5 veces menos error.

El segundo es el que pone el techo. El desplazamiento del cuerpo negro del reloj de cesio sigue donde estaba después de un año de promediar; el sesgo de eficiencia de detección de un experimento de Bell sigue donde estaba después de multiplicar los pares por mil; el celóstato deformado de Sobral seguía deformado en todas las placas. Y de ahí sale la regla de operación más útil de toda la ficha: cuando el error estadístico baja hasta un tercio del sistemático, ya sólo aporta un 5,4 % al total, y a partir de ahí seguir tomando datos no compra nada. Borrar ese 5,4 % hasta dejarlo en un 0,5 % —es decir, bajar σest\sigma_{\text{est}} de un tercio del sistemático a una décima— cuesta once veces más datos, y llegar al 0,05 %, ciento once. Todo eso para mover el resultado en la tercera cifra. Por eso los experimentos maduros dejan de anunciar «más estadística» y empiezan a anunciar «mejor calibración»: no es un cambio de discurso, es que la raíz cuadrada ha dejado de pagar.

Con números: una fuente de cesio parte de una inestabilidad de 1,5×10131{,}5\times10^{-13} a un segundo y baja como 1/τ1/\sqrt\tau, así que llegar a 101610^{-16} le cuesta (1,5×1013/1016)2=2,25×106(1{,}5\times10^{-13}/10^{-16})^2 = 2{,}25\times10^6 segundos: 26 días. El día 27 no mejora nada, porque a partir de ahí manda el ±0,44 K del principio de esta ficha. Ésa es exactamente la razón de que los dos errores se publiquen por separado —la notación «valor ± a (est.) ± b (sist.)» que lleva cualquier resultado de física experimental— y no combinados: el primero dice cuánto falta por medir y el segundo cuánto falta por entender, y al fundirlos en un solo número se pierde precisamente la información que decide qué hacer mañana.

Cómo distinguirlos cuando no lo sabes: la prueba de la mitad. Divide tus datos en dos mitades y recalcula el resultado en cada una. Si las dos mitades discrepan aproximadamente en 2\sqrt2 veces la barra que declaras —cada mitad tiene 2\sqrt2 veces más error estadístico que el conjunto—, tu barra es honesta. Si discrepan mucho más, hay un sistemático que depende de algo que has partido sin darte cuenta (el turno de noche, el segundo detector, la primera semana). Y si no discrepan nada, sospecha también: es la firma de un sesgo común que ninguna partición de los datos puede ver, y que por tanto tampoco va a verse repitiendo. Ninguna de las tres respuestas cuesta más de una tarde, y las tres son más informativas que otro mes de toma de datos.

Ejercicios

Ejercicio 1

La edad por radiocarbono es t=τln(1/f)t = \tau\ln(1/f) con τ=8223\tau = 8223 años. (a) ¿Qué precisión relativa en ff hace falta para dar una fecha con ±100 años, y por qué la respuesta no depende de la edad? (b) El contador de Libby recoge 150 cuentas de una muestra de 40 000 años; el AMS cuenta 4500 átomos de un miligramo de la misma muestra. Comprueba los ±670 y los ±120 años que publica Atomario. (c) ¿Cuál de los dos límites es estadístico?

Solución

(a) Derivando el logaritmo, Δt=τΔf/f\Delta t = \tau\,\Delta f/f, así que ε=100/8223=1,22 %\varepsilon = 100/8223 = 1{,}22\ \%. No depende de la edad porque τ\tau es una constante del núcleo y el error relativo entra multiplicado sólo por ella: comprobado, con ε=1,22 %\varepsilon = 1{,}22\ \% salen 99,4 años de error con f=0,9f = 0{,}9 y los mismos 99,4 con f=0,008f = 0{,}008. Es la fila «logaritmo» de la tabla de la sección 2: un error relativo constante da un error absoluto constante.

(b) Un recuento trae su propia barra, N\sqrt N (ficha PE.1). Con 150 cuentas el error relativo es 1/150=8,16 %1/\sqrt{150} = 8{,}16\ \%, que por τ\tau son 671 años — los ±670 que publica Atomario. Con 4500 cuentas, 1/4500=1,49 %1/\sqrt{4500} = 1{,}49\ \% y 123 años, que Atomario redondea a ±120. La comprobación cruzada es el cociente: treinta veces más cuentas tienen que dar 30=5,48\sqrt{30} = 5{,}48 veces menos error, y 671,4/122,6 = 5,48.

(c) Los dos, y por eso los dos se arreglan contando más — de hecho el AMS no mejoró la física, mejoró la eficiencia de recuento, que es la única variable de la que depende un error de Poisson. La segunda lección es dónde deja de valer eso, y Atomario lo dice sin ponerle nombre: con la muestra de Ötzi el 1,22 % es fácil, y entonces «el problema pasa a ser la calibración de la curva atmosférica, que en ese tramo vale más años de incertidumbre que la propia medida». Eso es un sistemático: la fracción ff se mide de maravilla y lo que no se conoce es contra qué compararla. Contar más átomos no lo arregla; construir mejores curvas de calibración con anillos de árbol, sí. La frontera entre los dos regímenes está justo donde el 1/N1/\sqrt N cruza a la curva.

Ejercicio 2

La señal de un satélite GPS llega 17,5 dB por debajo del ruido térmico del receptor. Electrario explica que el receptor multiplica la señal por una copia local y suma 20 460 símbolos a lo largo de un bit de 20 ms, «con una ganancia de procesado de 43 dB», y concluye que la señal acaba «unos 28 dB por encima» del ruido. Comprueba las dos cifras. ¿Cuánto ganaría integrando cien veces más tiempo?

Solución

La primera sale exacta: 10log10(1,023×106×0,020)=10log10(20460)=43,110\log_{10}(1{,}023\times10^6\times0{,}020) = 10\log_{10}(20\,460) = 43{,}1 dB. Es el 1/N1/\sqrt N traducido a decibelios: la señal correlacionada crece con NN y el ruido con N\sqrt N, así que la relación señal-ruido en potencia crece con NN — y en decibelios eso es 10log10N10\log_{10}N.

La segunda no cuadra con la primera: 17,5+43,1=25,6-17{,}5 + 43{,}1 = 25{,}6 dB, no 28. Lo que falta no es un error de nadie, es la referencia. Los −17,5 dB están medidos contra el ruido en los 2 MHz de banda de entrada, y después de integrar 20 ms la banda de ruido que queda es de unos 50 Hz: contada así, la ganancia es 10log10(2×106/50)=46,010\log_{10}(2\times10^6/50) = 46{,}0 dB y el margen final, 28,5 dB. Las dos cuentas son legítimas y difieren en 2,9 dB, un factor 2 en potencia, por cambiar de referencia a mitad de párrafo. Es el aviso de la ficha CAL.4 con números: un decibelio no significa nada hasta que se dice contra qué.

Cien veces más integración añade 10log10100=2010\log_{10}100 = 20 dB — pero eso son dos segundos de integración coherente, y en dos segundos el satélite se ha movido, el reloj del receptor ha derivado y el bit de datos ha cambiado de signo. La segunda lección es la de siempre en esta ficha: el 1/N1/\sqrt N se agota contra algo que no es estadístico. Aquí ese algo es la coherencia, y por eso los receptores modernos integran coherentemente lo que pueden y después suman potencias, que crece como N\sqrt N en vez de como NN, pero no exige coherencia.

Ejercicio 3

El experimento de Bell de Delft (2015) midió S = 2,42 ± 0,20 con 245 ensayos: (2,422)/0,203=2,1 σ(2{,}42-2)/0{,}203 = 2{,}1\ \sigma. (a) ¿Cuántos ensayos harían falta para 5 σ? (b) Supón que hubiera un sesgo instrumental que inflara S en 0,05. Con 245 ensayos, ¿se notaría? ¿Y multiplicando los ensayos por mil? (c) ¿Por qué Cuantario dice que un resultado de 2,1 σ sin resquicios convence más que uno de 46 σ con uno abierto?

Solución

(a) La significancia crece como la raíz del número de ensayos, así que hacen falta 245×(5/2,06)2=1440245\times(5/2{,}06)^2 = 1440 ensayos, unas seis veces más — los «unos 1400» que publica Cuantario.

(b) Con 245 ensayos, σ(S) = 0,203 y un sesgo de 0,05 vale 0,25 σ: está enterrado, es indetectable y da igual. Con mil veces más ensayos, σ(S) baja a 0,203/1000=0,00640{,}203/\sqrt{1000} = 0{,}0064 y el mismo sesgo, que no se ha movido, pasa a valer 7,8 σ. El experimento habría «descubierto» con enorme confianza un número equivocado. Ésa es, con cifras, la frase de Cuantario: «multiplicar por mil los pares registrados no cambia en nada el sesgo, sólo estrecha la barra de error alrededor de un número equivocado».

(c) Porque las dos cifras miden cosas distintas. Los σ miden la probabilidad de que la fluctuación estadística del fondo produzca lo observado; no dicen absolutamente nada sobre la probabilidad de que la hipótesis alternativa siga viva por otra vía. Un resquicio abierto es una hipótesis alternativa viva, y contra eso los σ no pueden nada porque no son la clase de error que miden. La segunda lección es la que ordena las prioridades de un experimento entero: cuando hay un sistemático sin cerrar, el número de sigmas es la cifra menos informativa del artículo, y veinte años de mejorar detectores valen más que veinte años de tomar datos. Es la misma frontera del reloj de cesio y la del radiocarbono, en un tercer dominio.

Ejercicio 4

La sirena estándar de GW170817 midió H0H_0 sin escalera de distancias y dio 70,0 km/s/Mpc con +12 y −8 de margen; Gravitario escribe que «por ahora no arbitra nada». Ponle números, tomando σ=10\sigma = 10 (la media de las dos colas). (a) ¿A cuántas σ está de Planck (67,4 ± 0,5) y de SH0ES (73,04 ± 1,04)? (b) Promédiala con SH0ES: ¿cuánto mueve el valor y cuánto estrecha la barra? (c) ¿Cuántas sirenas harían falta para separarla de Planck a 3 σ? ¿Y de SH0ES?

Solución

(a) Cuadratura, y con un término que aplasta al otro: 102+0,52=10,01\sqrt{10^2+0{,}5^2} = 10{,}01 frente a Planck y 102+1,042=10,05\sqrt{10^2+1{,}04^2} = 10{,}05 frente a SH0ES. Las separaciones son 2,60/10,01 = 0,26 σ y 3,04/10,05 = 0,30 σ. Compatible con las dos, que es exactamente lo que significa «no arbitra nada»: la barra de la sirena sola fija el resultado, porque las de los otros dos sólo la engordan un 0,1 % y un 0,5 %.

(b) Los pesos van como 1/σ21/\sigma^2, así que la sirena pesa (10/1,04)2=92(10/1{,}04)^2 = 92 veces menos que SH0ES. La media ponderada sale 73,01 ± 1,034: mueve el valor 0,03 km/s/Mpc y mejora la barra un 0,5 %. Es la regla del tercio al revés —un error diez veces mayor no aporta nada— y explica por qué añadir una medida mala a una buena no es «más información»: es decoración. Nótese que la fórmula ha producido igualmente una barra más estrecha, como hace siempre.

(c) Con NN sirenas la barra baja como 10/N10/\sqrt N. Para 3 σ frente a Planck hace falta que σ2+0,52\sqrt{\sigma^2+0{,}5^2} valga 2,60/3 = 0,867, o sea σ=0,708\sigma = 0{,}708 y N=(10/0,708)2200N = (10/0{,}708)^2 \approx 200 sucesos. Frente a SH0ES no hay ningún N que sirva, y ahí está la segunda lección: aun con una sirena perfecta, σ0\sigma \to 0, el máximo alcanzable es 3,04/1,04 = 2,92 σ, porque el denominador nunca baja del 1,04 que trae el otro. El techo de un contraste no lo pone tu error, lo pone el mayor de los dos — y cuando ése es el ajeno, más datos propios no lo tocan, igual que no tocan un sistemático.

Resumen en frío · Ficha PE.3

Lo que esta ficha deja utilizable, para volver dentro de seis meses sin releerla.

QuéFórmula o valorDónde
La línea de la que sale todoΔy = |f′(x)|·Δx: la derivada ES la sensibilidad§1
La pregunta útildespejar Δx, no Δy: «¿cuánto puedo equivocarme aquí?»§1
Reloj de cesiodδ/dT = 4×1,71×10⁻¹⁴/300 = 2,28×10⁻¹⁶ K⁻¹ ⇒ ΔT = 0,44 K§1
Cuándo vale linealizarmientras exponente × error relativo de la ENTRADA ≪ 1; con 19,7 × 0,51 % = 0,10 ya sobra un 4,4 %callout §1
Derivada logarítmicay = A·xᵃzᵇ ⟹ Δy/y = a·Δx/x + b·Δz/z§2
Sumas y restasse combinan los errores ABSOLUTOS§2
Productos y potenciasse combinan los RELATIVOS, cada uno × su exponente§2
Exponencialy = Ae^(kx) ⟹ Δy/y = |k|Δx: absoluto → relativo§2
Logaritmoy = A ln x ⟹ Δy = A·Δx/x: relativo → absoluto§2
Termómetro de dos rayas10 % en la intensidad ⇒ 0,51 % en T = ±30 K en 6000 K (exacto: 29,1)§2
RadiocarbonoΔt = τ·Δf/f: los mismos años de error a los 1000 que a los 40 000§2, ej. 1
Anillo de LIGOδθ = δ(cos θ)/sen θ = 3,95°; exacto 3,96°ej. res. 1
Y lo que no depende de θΩ = 4π·δ(cos θ) = 0,627 sr = 2060 deg², igual en 46,4° que en 90°ej. res. 1
Cuadraturaσ_y² = Σ(∂y/∂x_i)²σ_i²: se suman VARIANZAS, no sigmas§3
Cuánto cuesta sumar en línea0,5 y 1,04 → 1,154 en cuadratura, 1,54 en línea: 4,9σ frente a 3,7σ§3
La regla del tercioσ₂ = σ₁/3 engorda el total un 5,4 %; σ₁/10, un 0,5 %§3
La resta destruye la precisión0,74 % y 1,42 % ⟹ 20,5 % en la diferencia: 14 veces peorcallout §3
La condición de la cuadraturaINDEPENDENCIA; un sistemático compartido se suma en líneacallout §3
Media ponderadax̄ = Σ(x_i/σ_i²)/Σ(1/σ_i²); σ(x̄) = 1/√Σ(1/σ_i²)§4
El peso va al cuadradouna medida 3 veces peor cuenta 9 veces menos§4
La trampaσ(x̄) sale siempre menor que la mejor individual, discrepen o no§4
El guardiánχ² = (x₁−x₂)²/(σ₁²+σ₂²) = tensión²; con 1 gdl debería salir ~1§4
Eddington 19191,98±0,18 y 1,61±0,45 → 1,93±0,17; pesos 6,25:1; χ² = 0,58 ✓ej. res. 2
Lo que aportó Príncipe7,2 % de mejora en σ: corroboración, no precisiónej. res. 2
Planck y SH0ES68,46±0,45 con χ² = 23,9: precioso y sin sentidoej. res. 2
Factor de Birgeinflar σ por √(χ²/gdl) = 4,89 ⟹ 68,5 ± 2,2: una confesión, no una medidaej. res. 2
Estadísticofluctúa; el promedio de N baja como 1/√N§5
Sistemáticoes un sesgo; el promedio de N está igual de sesgado que uno§5
Espejo de LIGO10⁻¹¹ m / √(4,0×10²⁶) = 5×10⁻²⁵ m, 8×10⁶ veces bajo la señal§5
Cuándo dejar de tomar datoscon σ_est = σ_sist/3 ya sólo aporta un 5,4 %; bajar ese 5,4 % a 0,5 % cuesta ×11, y a 0,05 %, ×111§5
Fuente de cesio26 días para promediar hasta 10⁻¹⁶; el día 27 no compra nada§5
Por qué se publican por separado«± est. ± sist.»: uno dice qué falta medir, el otro qué falta entender§5
La prueba de la mitadparte los datos: √2 de discrepancia ⟹ honesto; mucha o ninguna ⟹ sistemáticocallout §5
Un sesgo con más datos0,05 en S: 0,25σ con 245 ensayos, 7,8σ con mil veces másej. 3
GPS10log₁₀(20 460) = 43,1 dB; −17,5 + 43,1 = 25,6, no 28: cambia la referenciaej. 2
GW170817 como árbitro70,0 ± 10: 0,26σ de Planck y 0,30σ de SH0ES; pesa 92 veces menos y mueve 0,03ej. 4
El techo de un contrastelo pone el MAYOR de los dos errores: contra SH0ES no se pasa de 2,92σ ni con σ = 0ej. 4

Adónde lleva esta ficha. Con esto ya puedes poner una barra de error a cualquier cosa que hayas calculado a partir de medidas, decidir cuál de tus fuentes de error merece la pena atacar, promediar dos resultados que no valen lo mismo y —sobre todo— saber cuándo dejar de tomar datos. Lo que falta a continuación es el caso en que las medidas no son dos sino veinte y lo que se ajusta es una recta: χ2\chi^2 como criterio de bondad, los residuos y las barras de error de los parámetros ajustados. Tiene ficha propia pendiente en esta área, y la piden Gravitario, Nucleario y Cristalario.

Las fichas hermanas son PE.1, que es de donde salen la desviación típica y el N\sqrt N de un recuento, y CAL.1, que explica por qué el primer término de Taylor basta y cuándo deja de bastar. Para usarlo ya, Atomario I.4 tiene la mayor corrección de un reloj de cesio contra un presupuesto de 101610^{-16}, y Gravitario I.5 tiene una tensión de 4,9 σ que sigue sin resolverse.