Blog educativo, Marlu Educativa, Matemáticas

Estadística universitaria: intervalos de confianza, contrastes de hipótesis y regresión con ejercicios resueltos

Estadística universitaria con intervalos de confianza, contrastes de hipótesis, distribución normal, regresión y ejercicios resueltos

Estadística universitaria: intervalos de confianza, contrastes de hipótesis y regresión con ejercicios resueltos

Guía completa para primeros cursos universitarios de ADE, Economía, Psicología, Enfermería, Farmacia, Biología, Educación, Ingeniería, Ciencias de la Salud y otros grados donde la estadística deja de ser una lista de fórmulas y pasa a ser una forma de razonar con datos.

Inferencia estadística · Distribuciones muestrales · Intervalos de confianza · Contrastes · Valor p · Chi-cuadrado · Correlación · Regresión

La dificultad real no suele estar en sustituir números. Está en reconocer qué parámetro se estudia, qué supuestos necesita el procedimiento, por qué se utiliza una distribución concreta y cómo se redacta la conclusión sin afirmar más de lo que permiten los datos.

1. Cómo estudiar estadística universitaria

Cada problema debe leerse en cuatro capas. Primero se identifica la pregunta: estimar, comparar, relacionar o decidir. Después se localiza el parámetro: una media, una proporción, una diferencia, una asociación o una pendiente. En tercer lugar se revisan los supuestos. Por último se calcula y se interpreta.

PreguntaParámetroProcedimiento
¿Cuánto vale aproximadamente una media?\(\mu\)Intervalo para una media
¿Qué proporción cumple una condición?\(p\)Intervalo o contraste para una proporción
¿Difieren dos grupos?\(\mu_1-\mu_2\) o \(p_1-p_2\)Comparación de grupos
¿Hay relación entre variables cualitativas?AsociaciónChi-cuadrado
¿Cómo cambia una respuesta con otra variable?\(\beta_1\)Regresión lineal

2. Población, muestra, parámetro y estadístico

La población es el conjunto sobre el que queremos concluir. La muestra es la parte observada. Un parámetro describe la población y suele ser desconocido. Un estadístico se calcula con la muestra y sirve para estimar el parámetro.

\[\mu,\ \sigma,\ p\quad\text{son parámetros poblacionales}\]
\[\overline X,\ S,\ \widehat p\quad\text{son estadísticos muestrales}\]

3. Muestreo, sesgo y error aleatorio

El error aleatorio aparece porque observamos una muestra y no toda la población. Disminuye al aumentar el tamaño muestral. El sesgo aparece cuando la selección o la medición favorecen sistemáticamente unos resultados. Aumentar el tamaño no elimina un sesgo estructural.

Regla práctica. Una muestra moderada bien seleccionada puede ser más útil que una muestra enorme obtenida mediante participación voluntaria o desde un único grupo.

4. Distribuciones muestrales

Si una población tiene media \(\mu\) y desviación típica \(\sigma\), la media de una muestra de tamaño \(n\) tiene:

\[E(\overline X)=\mu,\qquad SE(\overline X)=\frac{\sigma}{\sqrt n}\]

Para una proporción muestral:

\[E(\widehat p)=p,\qquad SE(\widehat p)=\sqrt{\frac{p(1-p)}{n}}\]
μ Distribución de la media muestral

5. Intervalos de confianza

Todo intervalo tiene la misma arquitectura:

\[\text{estimación puntual}\ \pm\ \text{valor crítico}\cdot\text{error típico}\]
SituaciónExpresión
Media, \(\sigma\) conocida\(\overline x\pm z_{\alpha/2}\dfrac{\sigma}{\sqrt n}\)
Media, \(\sigma\) desconocida\(\overline x\pm t_{\alpha/2;n-1}\dfrac{s}{\sqrt n}\)
Proporción\(\widehat p\pm z_{\alpha/2}\sqrt{\dfrac{\widehat p(1-\widehat p)}{n}}\)
Diferencia de medias\((\overline x_1-\overline x_2)\pm\text{valor crítico}\cdot SE\)
Diferencia de proporciones\((\widehat p_1-\widehat p_2)\pm z_{\alpha/2}SE\)
límite inferior estimación límite superior

6. Contrastes de hipótesis

Un contraste no demuestra una hipótesis. Evalúa si los datos son suficientemente incompatibles con una hipótesis nula. El orden correcto es definir las hipótesis, fijar \(\alpha\), elegir el estadístico, calcular el p-valor y redactar la conclusión.

α/2 α/2 zona de no rechazo

7. Valor p, significación y errores

El p-valor es la probabilidad, suponiendo cierta la hipótesis nula, de obtener un resultado tan extremo o más que el observado. No es la probabilidad de que \(H_0\) sea verdadera.

Importante. Un resultado estadísticamente significativo puede ser pequeño y poco relevante en la práctica. Conviene acompañar el p-valor con un intervalo de confianza y una medida del tamaño del efecto.

8. Comparación de grupos

Antes de calcular hay que decidir si los grupos son independientes o emparejados. Dos tratamientos aplicados a personas diferentes generan muestras independientes. Una medición antes-después sobre los mismos sujetos genera datos emparejados.

9. Contrastes chi-cuadrado

\[\chi^2=\sum\frac{(O_i-E_i)^2}{E_i}\]

La bondad de ajuste compara frecuencias observadas con un modelo teórico. La independencia estudia la relación entre dos variables cualitativas.

10. Correlación y regresión

\[\widehat y=b_0+b_1x,\qquad b_1=\frac{S_{xy}}{S_{xx}},\qquad b_0=\overline y-b_1\overline x\]

La correlación describe intensidad y dirección de una asociación lineal. La regresión permite describir y predecir, pero ninguna de las dos demuestra causalidad por sí sola.

xy

11. Cincuenta ejercicios resueltos paso a paso

Ejercicio resuelto 1. Población, muestra, parámetro y estadístico

Una universidad quiere estimar el tiempo medio semanal de estudio de sus 8.400 alumnos. Selecciona aleatoriamente 240 y obtiene una media de 11,6 horas.

La población está formada por los 8.400 alumnos. La muestra son los 240 estudiantes observados.

El tiempo medio real de toda la población es el parámetro \(\mu\). La media obtenida en la muestra es el estadístico \(\overline{x}\).

\[N=8400,\qquad n=240,\qquad \overline{x}=11{,}6\]

Resultado. La muestra estima el parámetro poblacional mediante \(\overline{x}=11{,}6\) horas.

Volver al índice

Ejercicio resuelto 2. Detectar un sesgo de selección

Para medir la satisfacción con una biblioteca se pregunta únicamente a quienes están dentro de ella un lunes por la mañana.

La muestra no representa bien a todos los estudiantes. Sobre-representa a usuarios habituales y excluye a quienes no utilizan el servicio o lo hacen en otros horarios.

Aumentar mucho el número de encuestados dentro de la misma biblioteca no elimina el problema: una muestra grande también puede estar sesgada.

Una selección aleatoria por titulaciones, cursos y franjas horarias sería más defendible.

Resultado. Existe sesgo de selección.

Volver al índice

Ejercicio resuelto 3. Media, varianza y desviación típica muestral

Las horas de estudio diario de seis alumnos son \(4,7,8,8,10,13\). Calcula la media, la varianza muestral y la desviación típica.

\[\overline{x}=\frac{4+7+8+8+10+13}{6}=8{,}333\]

Para la varianza muestral dividimos entre \(n-1\).

\[s^2=\frac{\sum (x_i-\overline{x})^2}{n-1}=9{,}067\]
\[s=\sqrt{9{,}067}=3{,}011\]

Resultado. \(\overline{x}=8{,}333\), \(s^2\approx9{,}067\) y \(s\approx3{,}011\).

Volver al índice

Ejercicio resuelto 4. Comparar dispersión relativa

El grupo A tiene media 70 y desviación típica 7. El grupo B tiene media 40 y desviación típica 6. ¿Cuál presenta mayor dispersión relativa?

\[CV_A=\frac{7}{70}=0{,}10=10\%\]
\[CV_B=\frac{6}{40}=0{,}15=15\%\]

Aunque B tiene menor desviación típica absoluta, su variabilidad es mayor en relación con su media.

Resultado. El grupo B tiene mayor dispersión relativa.

Volver al índice

Ejercicio resuelto 5. Probabilidad binomial acumulada

El 20 % de los alumnos necesita una segunda convocatoria. En un grupo de 10, calcula la probabilidad de que al menos 3 la necesiten.

Definimos \(X\sim B(10,0{,}2)\). Es más cómodo calcular el complementario.

\[P(X\ge3)=1-\sum_{k=0}^{2}\binom{10}{k}(0{,}2)^k(0{,}8)^{10-k}\]
\[P(X\ge3)=0{,}3222\]

Resultado. La probabilidad es aproximadamente \(32{,}22\%\).

Volver al índice

Ejercicio resuelto 6. Probabilidad en una distribución normal

Las puntuaciones siguen \(N(70,8)\), donde 8 es la desviación típica. Calcula \(P(62<X<82)\).

\[z_1=\frac{62-70}{8}=-1,\qquad z_2=\frac{82-70}{8}=1{,}5\]
\[P(62<X<82)=\Phi(1{,}5)-\Phi(-1)\]
\[P(62<X<82)=0{,}9332-0{,}1587=0{,}7745\]

Resultado. La probabilidad es aproximadamente \(77{,}45\%\).

Volver al índice

Ejercicio resuelto 7. Distribución de la media muestral

Una población tiene media 50 y desviación típica 12. Para muestras de tamaño 36, calcula \(P(48<\overline{X}<53)\).

\[SE(\overline{X})=\frac{12}{\sqrt{36}}=2\]
\[z_1=\frac{48-50}{2}=-1,\qquad z_2=\frac{53-50}{2}=1{,}5\]
\[P(48<\overline{X}<53)=0{,}7745\]

Resultado. La probabilidad es aproximadamente \(0{,}7745\).

Volver al índice

Ejercicio resuelto 8. Distribución aproximada de una proporción muestral

En una población, \(p=0,40\). Para \(n=100\), aproxima \(P(0,32<\widehat p<0,48)\).

\[SE(\widehat p)=\sqrt{\frac{0{,}4\cdot0{,}6}{100}}=0{,}04899\]
\[z_1=-1{,}633,\qquad z_2=1{,}633\]
\[P(0{,}32<\widehat p<0{,}48)\approx0{,}8975\]

Resultado. La probabilidad aproximada es \(89{,}75\%\).

Volver al índice

Ejercicio resuelto 9. Intervalo para una media con sigma conocida

Una muestra de 64 estudiantes tiene media 72. Se conoce \(\sigma=10\). Calcula el intervalo del 95 % para \(\mu\).

\[IC:\ \overline{x}\pm z_{\alpha/2}\frac{\sigma}{\sqrt{n}}\]
\[E=1{,}96\frac{10}{8}=2{,}45\]
\[72\pm2{,}45=(69{,}55,\ 74{,}45)\]

El intervalo estima la media poblacional, no el porcentaje de individuos que cae entre sus extremos.

Resultado. El intervalo es \((69{,}55,\ 74{,}45)\).

Volver al índice

Ejercicio resuelto 10. Intervalo del 99 % para la misma media

Con los datos del ejercicio anterior, calcula el intervalo del 99 %.

\[E=2{,}576\frac{10}{8}=3{,}220\]
\[IC_{99\%}=72\pm3{,}220=(68{,}780,\ 75{,}220)\]

Al aumentar la confianza, el intervalo se ensancha.

Resultado. El intervalo del 99 % es aproximadamente \((68{,}78,\ 75{,}22)\).

Volver al índice

Ejercicio resuelto 11. Intervalo t para una media

Una muestra de 16 mediciones tiene media 18,4 y desviación típica muestral 3,2. Calcula el intervalo del 95 %.

Como \(\sigma\) es desconocida y la muestra es pequeña, usamos \(t\) con 15 grados de libertad.

\[t_{0{,}975;15}=2{,}131\]
\[E=2{,}131\frac{3{,}2}{\sqrt{16}}=1{,}705\]
\[IC=(16{,}695,\ 20{,}105)\]

Resultado. El intervalo es aproximadamente \((16{,}70,\ 20{,}11)\).

Volver al índice

Ejercicio resuelto 12. Intervalo t del 90 %

Una muestra de 25 datos tiene media 5,6 y desviación típica 1,5. Calcula el intervalo del 90 %.

\[t_{0{,}95;24}=1{,}711\]
\[E=1{,}711\frac{1{,}5}{5}=0{,}513\]
\[IC=(5{,}087,\ 6{,}113)\]

Resultado. El intervalo es aproximadamente \((5{,}09,\ 6{,}11)\).

Volver al índice

Ejercicio resuelto 13. Intervalo para una proporción

En una encuesta a 400 estudiantes, 228 prefieren modalidad híbrida. Calcula el intervalo del 95 % para la proporción.

\[\widehat p=\frac{228}{400}=0{,}57\]
\[SE=\sqrt{\frac{0{,}57\cdot0{,}43}{400}}=0{,}02475\]
\[E=1{,}96\cdot0{,}02475=0{,}04852\]
\[IC=(0{,}5215,\ 0{,}6185)\]

Resultado. La proporción se estima entre \(52{,}15\%\) y \(61{,}85\%\).

Volver al índice

Ejercicio resuelto 14. Intervalo del 99 % para una proporción

En una muestra de 250 personas, 45 presentan cierta característica. Calcula el intervalo del 99 %.

\[\widehat p=\frac{45}{250}=0{,}18\]
\[SE=\sqrt{\frac{0{,}18\cdot0{,}82}{250}}=0{,}02430\]
\[E=2{,}576\cdot0{,}02430=0{,}06259\]
\[IC=(0{,}1174,\ 0{,}2426)\]

Resultado. El intervalo es aproximadamente \((0{,}117,\ 0{,}243)\).

Volver al índice

Ejercicio resuelto 15. Tamaño muestral para estimar una media

Se quiere estimar una media con \(\sigma=15\), confianza del 95 % y error máximo 2.

\[n\ge\left(\frac{z_{\alpha/2}\sigma}{E}\right)^2\]
\[n\ge\left(\frac{1{,}96\cdot15}{2}\right)^2=216{,}09\]

Redondeamos siempre hacia arriba para garantizar el error máximo.

Resultado. Se necesitan al menos \(217\) observaciones.

Volver al índice

Ejercicio resuelto 16. Tamaño muestral para una proporción sin estimación previa

Se desea estimar una proporción con confianza del 95 % y error máximo 0,03. No se conoce \(p\).

Tomamos el caso más desfavorable: \(p=q=0{,}5\).

\[n\ge\frac{1{,}96^2\cdot0{,}5\cdot0{,}5}{0{,}03^2}=1067{,}11\]

Resultado. Se necesitan al menos \(1068\) personas.

Volver al índice

Ejercicio resuelto 17. Tamaño muestral para una proporción con información previa

Una prueba piloto sugiere \(p=0,20\). Calcula el tamaño mínimo para confianza del 95 % y error 0,04.

\[n\ge\frac{1{,}96^2\cdot0{,}20\cdot0{,}80}{0{,}04^2}=384{,}16\]

La información previa reduce el tamaño respecto del caso conservador.

Resultado. Se necesitan al menos \(385\) observaciones.

Volver al índice

Ejercicio resuelto 18. Intervalo para la diferencia de dos medias

Dos métodos producen medias 82 y 78. Los tamaños son 50 y 60, y las desviaciones poblacionales 10 y 12. Calcula un intervalo del 95 % para \(\mu_1-\mu_2\).

\[\overline{x}_1-\overline{x}_2=4\]
\[SE=\sqrt{\frac{10^2}{50}+\frac{12^2}{60}}=2{,}098\]
\[E=1{,}96\cdot2{,}098=4{,}111\]
\[IC=(-0{,}111,\ 8{,}111)\]

El intervalo contiene el cero, por lo que la diferencia no queda clara al 5 %.

Resultado. El intervalo es aproximadamente \((-0{,}11,\ 8{,}11)\).

Volver al índice

Ejercicio resuelto 19. Intervalo para la diferencia de dos proporciones

En un grupo aprueban 180 de 300 alumnos. En otro, 125 de 250. Calcula el intervalo del 95 % para \(p_1-p_2\).

\[\widehat p_1=0{,}60,\qquad \widehat p_2=0{,}50\]
\[SE=\sqrt{\frac{0{,}60\cdot0{,}40}{300}+\frac{0{,}50\cdot0{,}50}{250}}=0{,}04243\]
\[IC=0{,}10\pm1{,}96\cdot0{,}04243=(0{,}0168,\ 0{,}1832)\]

Resultado. La diferencia se estima entre \(1{,}68\) y \(18{,}32\) puntos porcentuales.

Volver al índice

Ejercicio resuelto 20. Intervalo para datos emparejados

Las mejoras medidas en ocho alumnos son \(2,3,-1,4,2,5,1,3\). Calcula el intervalo del 95 % para la mejora media.

\[\overline d=2{,}375,\qquad s_d=1{,}847,\qquad n=8\]
\[t_{0{,}975;7}=2{,}365\]
\[E=2{,}365\frac{1{,}847}{\sqrt8}=1{,}544\]
\[IC=(0{,}831,\ 3{,}919)\]

Resultado. La mejora media se estima entre \(0{,}831\) y \(3{,}919\).

Volver al índice

Ejercicio resuelto 21. Formular correctamente las hipótesis

Una facultad afirma que el tiempo medio de una prueba es 50 minutos. Se sospecha que ha cambiado.

La igualdad debe aparecer en la hipótesis nula. Como se sospecha cualquier cambio, el contraste es bilateral.

\[H_0:\mu=50,\qquad H_1:\mu\ne50\]

Si solo se sospechara un aumento, la alternativa sería \(H_1:\mu>50\).

Resultado. El contraste es bilateral.

Volver al índice

Ejercicio resuelto 22. Contraste bilateral para una media con sigma conocida

Se contrasta \(H_0:\mu=500\) frente a \(H_1:\mu\ne500\). Con \(n=36\), \(\overline x=506\) y \(\sigma=18\), usa \(\alpha=0,05\).

\[z=\frac{506-500}{18/\sqrt{36}}=2\]
\[p=2P(Z\ge2)\approx0{,}0455\]

Como \(p<0{,}05\), rechazamos \(H_0\).

Resultado. Hay evidencia al 5 % de que la media difiere de 500.

Volver al índice

Ejercicio resuelto 23. Contraste unilateral derecho para una media

Se quiere comprobar si una media supera 50. Con \(n=64\), \(\overline x=52,1\) y \(\sigma=6\), usa \(\alpha=0,05\).

\[H_0:\mu=50,\qquad H_1:\mu>50\]
\[z=\frac{52{,}1-50}{6/\sqrt{64}}=2{,}8\]
\[p=P(Z\ge2{,}8)\approx0{,}0026\]

Resultado. Se rechaza \(H_0\). La media parece superar 50.

Volver al índice

Ejercicio resuelto 24. Contraste unilateral izquierdo

Se estudia si una media ha bajado de 100. Se obtiene \(\overline x=97,8\), \(\sigma=8\), \(n=49\).

\[H_0:\mu=100,\qquad H_1:\mu<100\]
\[z=\frac{97{,}8-100}{8/\sqrt{49}}=-1{,}925\]
\[p\approx0{,}0271\]

Resultado. Se rechaza \(H_0\) al 5 %. Hay evidencia de disminución.

Volver al índice

Ejercicio resuelto 25. Contraste t bilateral con muestra pequeña

Una muestra de 12 observaciones tiene media 24,8 y desviación típica 2,6. Contrasta \(H_0:\mu=23\) bilateralmente.

\[t=\frac{24{,}8-23}{2{,}6/\sqrt{12}}=2{,}398\]

Con 11 grados de libertad, \(p\approx0{,}0353\).

Como \(p<0{,}05\), se rechaza la hipótesis nula.

Resultado. La media parece distinta de 23.

Volver al índice

Ejercicio resuelto 26. Contraste t unilateral

Una muestra de 20 unidades tiene media 105 y desviación típica 12. Contrasta si la media supera 100.

\[t=\frac{105-100}{12/\sqrt{20}}=1{,}863\]

Con 19 grados de libertad, el p-valor unilateral es \(0{,}0390\).

El resultado es significativo al 5 %, pero no al 1 %.

Resultado. Se rechaza \(H_0\) al 5 %.

Volver al índice

Ejercicio resuelto 27. Contraste bilateral para una proporción

En una muestra de 500 personas, 285 cumplen una condición. Contrasta \(H_0:p=0,50\) frente a \(H_1:p\ne0,50\).

\[\widehat p=\frac{285}{500}=0{,}57\]
\[z=\frac{0{,}57-0{,}50}{\sqrt{0{,}50\cdot0{,}50/500}}=3{,}130\]
\[p\approx0{,}00175\]

Resultado. Se rechaza \(H_0\). La proporción difiere de 0,50.

Volver al índice

Ejercicio resuelto 28. Contraste unilateral para una proporción

En una muestra de 200 personas, 130 responden afirmativamente. Contrasta si la proporción supera 0,58.

\[\widehat p=0{,}65\]
\[z=\frac{0{,}65-0{,}58}{\sqrt{0{,}58\cdot0{,}42/200}}=2{,}006\]
\[p\approx0{,}0224\]

Resultado. Se rechaza \(H_0\) al 5 %.

Volver al índice

Ejercicio resuelto 29. Calcular e interpretar un p-valor

En un contraste bilateral se obtiene \(z=1,72\). Calcula el p-valor y decide con \(\alpha=0,05\).

\[p=2P(Z\ge1{,}72)\approx2(0{,}0427)=0{,}0854\]

Como \(p>0{,}05\), no se rechaza \(H_0\).

No rechazar no significa demostrar que la hipótesis nula sea verdadera.

Resultado. \(p\approx0{,}0854\); no se rechaza \(H_0\).

Volver al índice

Ejercicio resuelto 30. Errores de tipo I y II

Una prueba médica contrasta \(H_0\): el paciente no está enfermo, frente a \(H_1\): sí lo está.

Error de tipo I: diagnosticar la enfermedad a una persona sana. Es un falso positivo.

Error de tipo II: considerar sana a una persona enferma. Es un falso negativo.

Reducir ambos errores suele exigir más información, mejor medición o mayor tamaño muestral.

Resultado. Tipo I = falso positivo; tipo II = falso negativo.

Volver al índice

Ejercicio resuelto 31. Comparación de dos medias independientes

Dos grupos tienen \(\overline x_1=74\), \(s_1=8\), \(n_1=25\), y \(\overline x_2=69\), \(s_2=10\), \(n_2=30\). Contrasta si la primera media es mayor.

Usamos el contraste t de Welch, que no exige igualdad de varianzas.

\[SE=\sqrt{\frac{8^2}{25}+\frac{10^2}{30}}=2{,}428\]
\[t=\frac{74-69}{2{,}428}=2{,}060\]

Con aproximadamente 52,9 grados de libertad, \(p\approx0{,}0222\).

Resultado. Se rechaza \(H_0\) al 5 %. La primera media es mayor.

Volver al índice

Ejercicio resuelto 32. Contraste t para datos emparejados

Las diferencias antes-después son \(1,2;2,1;0,5;1,8;2,4;1,0;1,6;2,0;0,9;1,5\). Contrasta si la mejora media es positiva.

\[\overline d=1{,}50,\qquad s_d=0{,}598\]
\[t=\frac{1{,}50}{0{,}598/\sqrt{10}}=7{,}930\]

Con 9 grados de libertad, \(p\approx1{,}19\cdot10^{-5}\).

Resultado. La evidencia de mejora es muy fuerte.

Volver al índice

Ejercicio resuelto 33. Contraste para dos proporciones

En el grupo 1 aprueban 310 de 500. En el grupo 2 aprueban 216 de 400. Contrasta si las proporciones son distintas.

\[\widehat p_1=0{,}62,\qquad \widehat p_2=0{,}54\]
\[\widehat p=\frac{310+216}{900}=0{,}5844\]
\[SE=\sqrt{\widehat p(1-\widehat p)\left(\frac1{500}+\frac1{400}\right)}=0{,}03306\]
\[z=\frac{0{,}08}{0{,}03306}=2{,}420,\qquad p\approx0{,}0155\]

Resultado. Se rechaza la igualdad de proporciones al 5 %.

Volver al índice

Ejercicio resuelto 34. Bondad de ajuste chi-cuadrado

En 100 observaciones aparecen frecuencias \(65,20,15\). El modelo propone proporciones \(0,50;0,30;0,20\).

Las frecuencias esperadas son \(50,30,20\).

\[\chi^2=\frac{(65-50)^2}{50}+\frac{(20-30)^2}{30}+\frac{(15-20)^2}{20}=9{,}083\]

Con 2 grados de libertad, \(p\approx0{,}0107\).

Resultado. Se rechaza el modelo teórico al 5 %.

Volver al índice

Ejercicio resuelto 35. Independencia chi-cuadrado

La tabla observada es \(\begin{pmatrix}40&20\\25&35\end{pmatrix}\). Contrasta la independencia.

Los totales de fila son 60 y 60; los de columna son 65 y 55; el total general es 120.

\[E_{11}=\frac{60\cdot65}{120}=32{,}5,\qquad E_{12}=27{,}5\]
\[\chi^2=7{,}552,\qquad gl=1,\qquad p\approx0{,}0060\]

Resultado. Se rechaza la independencia. Existe asociación estadística.

Volver al índice

Ejercicio resuelto 36. Potencia de un contraste

Se contrasta \(H_0:\mu=100\) frente a \(H_1:\mu>100\), con \(\alpha=0,05\), \(n=25\) y \(\sigma=10\). Calcula la potencia si la media real es 105.

\[\overline x_c=100+1{,}645\frac{10}{5}=103{,}290\]
\[\beta=P(\overline X\le103{,}290\mid\mu=105)=0{,}196\]
\[\text{Potencia}=1-\beta=0{,}804\]

Resultado. La potencia es aproximadamente \(80{,}4\%\).

Volver al índice

Ejercicio resuelto 37. Correlación y recta de regresión

Para \(x=(1,2,3,4,5)\) e \(y=(2,4,5,4,5)\), calcula la recta de regresión y la correlación.

\[\overline x=3,\qquad \overline y=4\]
\[b_1=0{,}6,\qquad b_0=4-0{,}6\cdot3=2{,}2\]
\[\widehat y=2{,}2+0{,}6x\]
\[r\approx0{,}7746\]

Resultado. La recta es \(\widehat y=2{,}2+0{,}6x\) y la asociación lineal es positiva.

Volver al índice

Ejercicio resuelto 38. Construir una recta con sumas centradas

Se sabe que \(\overline x=10\), \(\overline y=25\), \(S_{xx}=40\) y \(S_{xy}=60\).

\[b_1=\frac{S_{xy}}{S_{xx}}=\frac{60}{40}=1{,}5\]
\[b_0=\overline y-b_1\overline x=25-15=10\]
\[\widehat y=10+1{,}5x\]

Cada unidad adicional de \(x\) se asocia con 1,5 unidades más de respuesta media estimada.

Resultado. La recta es \(\widehat y=10+1{,}5x\).

Volver al índice

Ejercicio resuelto 39. Predicción y residuo

Con \(\widehat y=10+1,5x\), predice para \(x=12\). Si el valor observado es 31, calcula el residuo.

\[\widehat y(12)=10+1{,}5\cdot12=28\]
\[e=y-\widehat y=31-28=3\]

El residuo positivo indica que el modelo ha infraestimado la observación.

Resultado. La predicción es 28 y el residuo es 3.

Volver al índice

Ejercicio resuelto 40. Coeficiente de determinación y significación de la pendiente

En una regresión se obtiene \(r=0,80\). Además, \(b_1=2,4\), \(SE(b_1)=0,7\) y \(n=18\). Interpreta \(R^2\) y contrasta si la pendiente es cero.

\[R^2=r^2=0{,}64\]

El modelo lineal explica el 64 % de la variabilidad de la respuesta.

\[t=\frac{2{,}4}{0{,}7}=3{,}429,\qquad gl=16\]
\[p\approx0{,}00345\]

La pendiente es estadísticamente distinta de cero.

Resultado. Existe asociación lineal significativa, con \(R^2=0{,}64\).

Volver al índice

Ejercicio resuelto 41. Aproximación normal a una binomial con corrección de continuidad

Sea \(X\sim B(100,0{,}40)\). Aproxima \(P(35\le X\le45)\) mediante una distribución normal.

La media y la desviación típica de la binomial son:

\[\mu=np=40,\qquad \sigma=\sqrt{np(1-p)}=\sqrt{24}=4{,}899\]

Aplicamos corrección de continuidad. El intervalo discreto de 35 a 45 se aproxima por el intervalo continuo de 34,5 a 45,5.

\[z_1=\frac{34{,}5-40}{4{,}899}=-1{,}123,\qquad z_2=\frac{45{,}5-40}{4{,}899}=1{,}123\]
\[P(35\le X\le45)\approx \Phi(1{,}123)-\Phi(-1{,}123)=0{,}7384\]

Resultado. La probabilidad aproximada es \(0{,}7384\), es decir, un \(73{,}84\%\).

Volver al índice

Ejercicio resuelto 42. Distribución de una suma muestral

Una variable tiene media 12 y desviación típica 3. Para 25 observaciones independientes, calcula aproximadamente \(P(S_{25}>315)\), donde \(S_{25}\) es la suma.

La suma de 25 observaciones tiene media \(25\mu\) y desviación típica \(\sqrt{25}\sigma\).

\[E(S_{25})=25\cdot12=300\]
\[SD(S_{25})=\sqrt{25}\cdot3=15\]
\[z=\frac{315-300}{15}=1\]
\[P(S_{25}>315)=P(Z>1)=0{,}1587\]

Resultado. La probabilidad es aproximadamente \(15{,}87\%\).

Volver al índice

Ejercicio resuelto 43. Intervalo de confianza para una varianza

Una muestra normal de tamaño 20 tiene varianza muestral \(s^2=16\). Calcula el intervalo del 95 % para la varianza poblacional.

Para una población normal utilizamos la distribución chi-cuadrado con \(n-1=19\) grados de libertad.

\[IC_{\sigma^2}=\left(\frac{(n-1)s^2}{\chi^2_{0{,}975;19}},\ \frac{(n-1)s^2}{\chi^2_{0{,}025;19}}\right)\]

Tomando \(\chi^2_{0{,}975;19}=32{,}852\) y \(\chi^2_{0{,}025;19}=8{,}907\):

\[IC_{\sigma^2}=\left(\frac{19\cdot16}{32{,}852},\ \frac{19\cdot16}{8{,}907}\right)\]
\[IC_{\sigma^2}=(9{,}254,\ 34{,}132)\]

Resultado. La varianza poblacional se estima entre \(9{,}254\) y \(34{,}132\).

Volver al índice

Ejercicio resuelto 44. Contraste unilateral para una varianza

Una muestra normal de tamaño 16 tiene \(s^2=16\). Contrasta \(H_0:\sigma^2=9\) frente a \(H_1:\sigma^2>9\), con \(\alpha=0,05\).

\[\chi^2=\frac{(n-1)s^2}{\sigma_0^2}=\frac{15\cdot16}{9}=26{,}667\]

El estadístico sigue una chi-cuadrado con 15 grados de libertad bajo \(H_0\).

\[p=P(\chi^2_{15}\ge26{,}667)\approx0{,}0316\]

Como \(p<0{,}05\), rechazamos la hipótesis nula.

Resultado. Hay evidencia al 5 % de que la varianza poblacional supera 9.

Volver al índice

Ejercicio resuelto 45. ANOVA de un factor

Se comparan tres grupos: \(A=(8,9,6,7)\), \(B=(10,12,9,11)\) y \(C=(13,14,12,15)\). Contrasta si las tres medias son iguales.

Las medias de los grupos son \(7{,}5\), \(10{,}5\) y \(13{,}5\). La media global es \(10{,}5\).

\[SC_{\text{entre}}=72,\qquad SC_{\text{dentro}}=15\]
\[CM_{\text{entre}}=\frac{72}{2}=36,\qquad CM_{\text{dentro}}=\frac{15}{9}=1{,}667\]
\[F=\frac{36}{1{,}667}=21{,}6\]

Con 2 y 9 grados de libertad, \(p\approx0{,}00037\).

El ANOVA indica que no todas las medias son iguales. Para saber qué grupos difieren se necesitaría una comparación posterior.

Resultado. Se rechaza la igualdad de las tres medias.

Volver al índice

Ejercicio resuelto 46. Contraste de significación de una correlación

En una muestra de 20 pares de datos se obtiene \(r=0,55\). Contrasta si la correlación poblacional es cero.

\[H_0:\rho=0,\qquad H_1:\rho\ne0\]
\[t=r\sqrt{\frac{n-2}{1-r^2}}\]
\[t=0{,}55\sqrt{\frac{18}{1-0{,}55^2}}=2{,}794\]

Con 18 grados de libertad, el p-valor bilateral es aproximadamente \(0{,}0120\).

Resultado. Se rechaza \(H_0\) al 5 %. Existe evidencia de asociación lineal.

Volver al índice

Ejercicio resuelto 47. Intervalo de confianza para la pendiente de una regresión

En una regresión con 22 observaciones se obtiene \(b_1=1,8\) y \(SE(b_1)=0,5\). Calcula el intervalo del 95 % para \(\beta_1\).

Los grados de libertad son \(n-2=20\), y \(t_{0{,}975;20}=2{,}086\).

\[IC_{\beta_1}=b_1\pm t\,SE(b_1)\]
\[IC_{\beta_1}=1{,}8\pm2{,}086\cdot0{,}5\]
\[IC_{\beta_1}=(0{,}757,\ 2{,}843)\]

Resultado. La pendiente poblacional se estima entre \(0{,}757\) y \(2{,}843\).

Volver al índice

Ejercicio resuelto 48. Residuo estandarizado

En una regresión, una observación tiene valor real 18 y valor predicho 15. El error típico residual es 2 y su leverage es \(h_{ii}=0,10\). Calcula el residuo estandarizado.

\[e_i=y_i-\widehat y_i=18-15=3\]
\[r_i=\frac{e_i}{s\sqrt{1-h_{ii}}}\]
\[r_i=\frac{3}{2\sqrt{0{,}90}}=1{,}581\]

El valor no supera 2 en magnitud, por lo que no destaca como residuo extraordinariamente grande con esta regla orientativa.

Resultado. El residuo estandarizado es aproximadamente \(1{,}58\).

Volver al índice

Ejercicio resuelto 49. Interpretación de una regresión logística

Un modelo logístico es \(\log\left(\frac{p}{1-p}\right)=-1+0,4x\). Interpreta el coeficiente de \(x\).

En regresión logística, el coeficiente actúa sobre el logaritmo de las odds. Para interpretarlo en una escala más intuitiva calculamos \(e^{0,4}\).

\[OR=e^{0{,}4}=1{,}492\]

Manteniendo constantes las demás variables del modelo, una unidad adicional de \(x\) multiplica las odds del suceso por aproximadamente 1,492.

Esto equivale a un aumento aproximado del 49,2 % en las odds, no necesariamente en la probabilidad.

Resultado. Cada unidad adicional de \(x\) multiplica las odds por aproximadamente \(1{,}49\).

Volver al índice

Ejercicio resuelto 50. Paradoja de Simpson y variable de confusión

En casos leves, el tratamiento A tiene 81 éxitos de 87 y B tiene 234 de 270. En casos graves, A tiene 192 de 263 y B tiene 55 de 80. Compara por estratos y de forma global.

\[P_A(\text{éxito}\mid\text{leve})=\frac{81}{87}=93{,}10\%\]
\[P_B(\text{éxito}\mid\text{leve})=\frac{234}{270}=86{,}67\%\]
\[P_A(\text{éxito}\mid\text{grave})=\frac{192}{263}=73{,}00\%\]
\[P_B(\text{éxito}\mid\text{grave})=\frac{55}{80}=68{,}75\%\]

A es mejor dentro de cada nivel de gravedad. Sin embargo, al combinar los datos:

\[P_A(\text{éxito})=\frac{273}{350}=78{,}00\%,\qquad P_B(\text{éxito})=\frac{289}{350}=82{,}57\%\]

La conclusión global se invierte porque A se utilizó con mucha mayor frecuencia en casos graves. La gravedad actúa como variable de confusión.

Resultado. El tratamiento A supera a B en cada estrato, pero B parece mejor en el total agregado. Es un ejemplo de paradoja de Simpson.

Volver al índice

12. Veinticinco ejercicios propuestos con soluciones

Intenta cada ejercicio antes de desplegar la solución. En inferencia importa tanto elegir el procedimiento como obtener el número.

  1. 1. Una población tiene \(\sigma=15\). Para \(n=25\), calcula el error típico de la media.

    Ver solución

    \(SE=15/\sqrt{25}=3\).

  2. 2. Clasifica: grupo sanguíneo, nivel de satisfacción, número de asignaturas aprobadas y tiempo de estudio.

    Ver solución

    Nominal, ordinal, cuantitativa discreta y cuantitativa continua, respectivamente.

  3. 3. Calcula la media y la desviación típica muestral de \(3,5,7,9,11\).

    Ver solución

    \(\overline x=7\) y \(s=\sqrt{10}\approx3{,}162\).

  4. 4. Si \(X\sim B(8,0{,}3)\), calcula \(P(X=2)\).

    Ver solución

    \(\binom82(0{,}3)^2(0{,}7)^6\approx0{,}2965\).

  5. 5. Si \(X\sim N(100,12)\), donde 12 es la desviación típica, calcula \(P(X<112)\).

    Ver solución

    \(P(Z<1)\approx0{,}8413\).

  6. 6. Con \(\mu=40\), \(\sigma=10\) y \(n=100\), calcula \(P(39<\overline X<42)\).

    Ver solución

    \(P(-1<Z<2)\approx0{,}8186\).

  7. 7. Una muestra de 81 observaciones tiene media 30 y \(\sigma=9\). Calcula el intervalo del 95 %.

    Ver solución

    \(30\pm1{,}96= (28{,}04,\ 31{,}96)\).

  8. 8. Una muestra de 25 datos tiene media 12 y \(s=5\). Usa \(t_{0{,}975;24}=2{,}064\).

    Ver solución

    \(12\pm2{,}064=(9{,}936,\ 14{,}064)\).

  9. 9. En 300 personas, 174 responden sí. Calcula el intervalo del 95 % para la proporción.

    Ver solución

    \(\widehat p=0{,}58\); intervalo aproximado \((0{,}524,\ 0{,}636)\).

  10. 10. Calcula el tamaño mínimo para estimar una media con \(\sigma=20\), error 3 y confianza del 95 %.

    Ver solución

    \(n\ge(1{,}96\cdot20/3)^2=170{,}74\); por tanto, \(n=171\).

  11. 11. Calcula el tamaño mínimo para estimar una proporción con error 0,05 y confianza del 95 %, sin información previa.

    Ver solución

    \(n\ge1{,}96^2(0{,}5)(0{,}5)/0{,}05^2=384{,}16\); por tanto, \(n=385\).

  12. 12. Interpreta un intervalo del 95 % igual a \((14,2,\ 16,8)\).

    Ver solución

    La media poblacional se estima entre 14,2 y 16,8 mediante un procedimiento que cubre el parámetro en el 95 % de las muestras repetidas.

  13. 13. Dos medias son 56 y 52, y el error típico de su diferencia es 1,5. Calcula el intervalo del 95 %.

    Ver solución

    \(4\pm1{,}96(1{,}5)=(1{,}06,\ 6{,}94)\).

  14. 14. Formula las hipótesis para comprobar si una proporción es inferior a 0,40.

    Ver solución

    \(H_0:p=0{,}40\), \(H_1:p<0{,}40\).

  15. 15. En un contraste bilateral se obtiene \(z=2,35\). Calcula el p-valor.

    Ver solución

    \(p=2P(Z\ge2{,}35)\approx0{,}0188\).

  16. 16. En un contraste unilateral derecho se obtiene \(z=1,90\). Decide con \(\alpha=0,05\).

    Ver solución

    \(p\approx0{,}0287\); se rechaza \(H_0\).

  17. 17. Con \(n=49\), \(\overline x=102\), \(\sigma=7\), contrasta \(H_0:\mu=100\) frente a \(H_1:\mu>100\).

    Ver solución

    \(z=2\), \(p\approx0{,}0228\); se rechaza \(H_0\) al 5 %.

  18. 18. Con \(n=16\), \(\overline x=8,5\), \(s=2\), contrasta \(H_0:\mu=8\) bilateralmente.

    Ver solución

    \(t=1\), con 15 grados de libertad; \(p\approx0{,}333\). No se rechaza.

  19. 19. En 400 observaciones, 212 son éxitos. Contrasta \(H_0:p=0,50\) bilateralmente.

    Ver solución

    \(\widehat p=0{,}53\), \(z=1{,}2\), \(p\approx0{,}230\). No se rechaza.

  20. 20. Explica el error de tipo I al contrastar si un medicamento es eficaz.

    Ver solución

    Concluir que el medicamento es eficaz cuando en realidad no lo es.

  21. 21. Explica el error de tipo II en el mismo contraste.

    Ver solución

    No detectar la eficacia cuando el medicamento sí es eficaz.

  22. 22. Una diferencia de medias es 3 y su error típico es 1,2. Calcula el estadístico.

    Ver solución

    \(3/1{,}2=2{,}5\).

  23. 23. En un contraste bilateral de dos proporciones se obtiene \(z=-2,10\). Calcula el p-valor.

    Ver solución

    \(p=2P(Z\ge2{,}10)\approx0{,}0357\).

  24. 24. En una bondad de ajuste con cuatro categorías, ¿cuántos grados de libertad hay si no se estiman parámetros?

    Ver solución

    \(4-1=3\).

  25. 25. En una tabla de contingencia \(3\times4\), calcula los grados de libertad.

    Ver solución

    \((3-1)(4-1)=6\).

13. Dos simulacros universitarios

Simulacro 1. Inferencia estadística

Tiempo recomendado: 90 minutos.

  1. Una muestra de 64 mediciones tiene media 48 y desviación poblacional 12. Construye un intervalo del 95 %.
  2. En 500 encuestados, 290 responden afirmativamente. Construye un intervalo del 99 % para la proporción.
  3. Calcula el tamaño mínimo para estimar una media con \(\sigma=18\), error 2,5 y confianza del 95 %.
  4. Se contrasta \(H_0:\mu=40\) frente a \(H_1:\mu>40\). Con \(n=36\), media 42 y \(\sigma=6\), calcula el p-valor.
  5. Explica los errores de tipo I y II en el apartado anterior.
  6. Dos grupos tienen medias 72 y 68, con error típico de la diferencia 1,6. Contrasta igualdad bilateralmente.
  7. Una tabla \(2\times3\) produce \(\chi^2=8,4\). Indica los grados de libertad y decide al 5 %.
  8. Explica por qué significación estadística e importancia práctica no son sinónimos.
Soluciones orientativas

1. \((45,06,\ 50,94)\). 2. Aproximadamente \((0,524,\ 0,636)\). 3. \(n=200\). 4. \(z=2\), \(p\approx0,0228\), se rechaza. 5. Tipo I: concluir que supera 40 cuando no; tipo II: no detectarlo cuando sí. 6. Estadístico 2,5; p bilateral aproximado 0,0124. 7. \(gl=2\); se rechaza al 5 %. 8. Un efecto puede ser detectable pero demasiado pequeño para tener relevancia real.

Simulacro 2. Regresión, proporciones y chi-cuadrado

Tiempo recomendado: 90 minutos.

  1. En 320 personas, 176 presentan una característica. Contrasta \(H_0:p=0,50\) bilateralmente.
  2. Dos proporciones son 0,62 y 0,53, con tamaños 200 y 240. Construye un intervalo del 95 % para su diferencia.
  3. Una regresión tiene \(\widehat y=5+2,3x\). Interpreta la pendiente y predice para \(x=4\).
  4. Si el valor observado es 16, calcula el residuo.
  5. Con \(r=-0,75\), calcula e interpreta \(R^2\).
  6. En una tabla \(3\times2\), indica los grados de libertad.
  7. En una bondad de ajuste con tres categorías se obtiene \(\chi^2=7,9\). Decide al 5 %.
  8. Explica dos razones por las que una correlación alta no prueba causalidad.
Soluciones orientativas

1. \(\widehat p=0,55\), \(z\approx1,789\), p bilateral aproximado 0,0736. 2. Diferencia 0,09; intervalo aproximado \((-0,003,\ 0,183)\). 3. Cada unidad de x se asocia con 2,3 unidades más de respuesta; predicción 14,2. 4. Residuo 1,8. 5. \(R^2=0,5625\). 6. \(gl=2\). 7. Se rechaza al 5 %. 8. Variables de confusión y causalidad inversa.

14. Errores frecuentes

  • Usar \(z\) cuando la desviación poblacional es desconocida y la muestra es pequeña.
  • Calcular un intervalo con el error típico del contraste, o al revés.
  • Elegir una alternativa unilateral después de observar los datos.
  • Confundir no rechazar \(H_0\) con demostrar que es verdadera.
  • Interpretar el p-valor como probabilidad de la hipótesis.
  • Ignorar que dos mediciones son emparejadas.
  • Aplicar chi-cuadrado sin revisar las frecuencias esperadas.
  • Extrapolar una recta muy lejos del rango observado.
  • Convertir una correlación en una afirmación causal.

15. Ruta de estudio y recursos relacionados

16. Preguntas frecuentes

¿Sirve para Psicología, Enfermería o Farmacia?

Sí. Intervalos, contrastes, chi-cuadrado y regresión aparecen en numerosos grados de Ciencias de la Salud y Ciencias Sociales, aunque cada facultad puede utilizar una notación o profundidad diferente.

¿Necesito dominar antes toda la probabilidad?

No toda, pero sí sucesos, binomial, normal, tipificación y lectura de probabilidades.

¿Debo memorizar todas las fórmulas?

Conviene conocer su estructura, pero es más importante reconocer cuándo se aplica cada procedimiento, qué datos exige y cómo se interpreta.

Trabajar Estadística universitaria con método

En Estadística no basta con colocar números en una fórmula. Hay que reconocer el modelo, comprobar condiciones, calcular con orden y explicar qué dicen realmente los datos. En Marlu Educativa trabajamos Matemáticas universitarias online con pizarra compartida, ejercicios del temario real y seguimiento paso a paso.

Matemáticas universitarias online · Clases online por la mañana · Consultar prematrícula

Autoría y revisión. Recurso elaborado por José María · Marlu Educativa. Material de apoyo para primeros cursos universitarios, Bachillerato avanzado y asignaturas de Estadística e Inferencia.