Blog
Estadística bidimensional y regresión 1º Bachillerato · 48 ejercicios resueltos
Estadística bidimensional y regresión 1º Bachillerato · 48 ejercicios resueltos
Covarianza, correlación de Pearson, rectas de regresión, coeficiente de determinación, predicciones y regresión cuadrática explicados desde la nube de puntos hasta la interpretación final. El objetivo no es copiar una pantalla de calculadora: es saber cuándo un modelo tiene sentido y hasta dónde puede utilizarse.
Biblioteca Marlu Educativa. Material propio, preparado y revisado por el equipo académico y editorial conforme al Método Marlu. Los ejercicios, datos y gráficos son de elaboración propia y no se presentan como ejercicios oficiales.
El botón genera una edición A4 propia de Marlu con marca de agua, pie editorial y paginación. Los enlaces permanecen clicables al guardar como PDF.
Método Marlu
Primero mira la nube; después calcula
La estadística bidimensional pierde sentido cuando se empieza directamente por una fórmula. Antes de calcular covarianza, r o una regresión hay que identificar qué representa cada par, dibujar o imaginar la nube, decidir si la forma parece lineal, detectar valores atípicos y fijar qué variable queremos predecir.
Si todavía cuestan media, varianza, desviación típica o lectura de gráficos, conviene recuperar primero Estadística de 4.º ESO. El recurso general de Estadística de ESO, Bachillerato y PAU permanece como recorrido descriptivo y puente hacia normal e inferencia; este cuaderno profundiza exclusivamente en dos variables y regresión.
Antes de empezar
Diagnóstico rápido: ocho decisiones
Teoría esencial I
Dos variables: organizar, representar y condicionar
Una observación bidimensional es un par (xi,yi). Cuando los datos se repiten, pueden organizarse en una tabla conjunta. Las sumas por filas y columnas producen distribuciones marginales; si fijamos un valor de una variable y redistribuimos las frecuencias de la otra, obtenemos distribuciones condicionadas.
Las dos rectas de regresión pasan por el punto (x̄,ȳ).
Teoría esencial II
Covarianza, correlación de Pearson y coeficiente de determinación
| Medida | Expresión | Qué aporta |
|---|---|---|
| Covarianza | sxy = Σ[(x−x̄)(y−ȳ)]/n | Signo de la asociación lineal; depende de unidades. |
| Pearson | r = sxy/(sxsy) | Dirección e intensidad lineal; no tiene unidades. |
| Determinación | R² = r² | En regresión lineal simple, proporción de variabilidad de Y explicada por la recta. |
Teoría esencial III
Rectas de regresión, residuos y predicción
No es, en general, la primera recta despejada.
Un residuo es e=y−ŷ. Interpolar significa predecir dentro del rango observado de la variable explicativa. Extrapolar significa salir de ese rango; cuanto más lejos, más débil es la justificación aunque la calculadora siga devolviendo números.
Teoría esencial IV
Regresión cuadrática y herramientas tecnológicas
El currículo vigente no se limita a una recta. También incluye regresión cuadrática y la valoración gráfica de qué ajuste es pertinente. Una hoja de cálculo o calculadora puede obtener el modelo ŷ=ax²+bx+c y su R²; el alumno debe decidir si la forma de la nube justifica usarlo.
Nube de puntos, dirección, causalidad y decisiones iniciales
Los ejercicios 1–8 avanzan desde la interpretación hasta el cálculo y la decisión sobre la fiabilidad del modelo.
Identificar una variable bidimensional
- Cada estudiante aporta dos datos observados conjuntamente; por eso la unidad de información es el par (x,y), no dos listas independientes.
- X = horas de estudio y Y = nota son variables cuantitativas.
- Si el objetivo es estimar la nota a partir de las horas, tomamos X como variable explicativa y Y como variable respuesta.
Resultado. La muestra está formada por 6 pares. Para predecir nota desde horas, usamos la regresión de Y sobre X.
Comprobación. Si intercambiásemos X e Y, cambiaría la pregunta y también la recta de regresión que corresponde.
Leer el signo antes de calcular
- La dirección descendente indica que, en promedio, valores grandes de X se asocian con valores pequeños de Y.
- Por tanto, la covarianza y r deben ser negativos.
- La cercanía visual a una recta sugiere |r| alto, aunque el valor exacto solo se obtiene calculando.
Resultado. Esperamos una correlación lineal negativa y fuerte, por ejemplo un r próximo a −1.
Comprobación. El signo se deduce de la dirección; la intensidad se relaciona con cuánto se separan los puntos de una tendencia lineal.
Correlación no implica causalidad
- La correlación describe asociación, no un mecanismo causal.
- Ambas variables pueden estar influidas por una tercera: la temperatura.
- Para hablar de causalidad harían falta un diseño y evidencias adicionales que controlasen explicaciones alternativas.
Resultado. Existe asociación compatible con una causa común; no puede afirmarse causalidad entre las dos variables solo con r.
Comprobación. El currículo distingue expresamente correlación y causalidad: es una interpretación obligatoria, no un detalle teórico.
Cambiar unidades no cambia r
- Multiplicar una variable por una constante positiva cambia su media, desviación y covarianza en la misma proporción.
- En r = sxy/(sx·sy), ese factor se cancela.
- Como la constante es positiva, tampoco cambia el signo.
Resultado. No. El coeficiente r conserva exactamente el mismo valor.
Comprobación. La correlación lineal no depende de las unidades de medida; la pendiente de la recta sí cambia.
r = 0 y, sin embargo, relación exacta
- La nube tiene forma de U: Y disminuye hasta X=0 y después vuelve a aumentar.
- La relación es exactamente Y = X² + 1, por lo que existe dependencia muy fuerte, pero no lineal.
- Por simetría, los productos (x−x̄)(y−ȳ) se compensan y la covarianza lineal vale 0.
Resultado. Hay una relación cuadrática perfecta, pero r = 0.
Comprobación. Esto demuestra que r solo cuantifica relación lineal. Antes de usar una recta hay que mirar la nube.
Detectar un valor atípico
- Sin el último punto, la relación es Y = 2X y r = 1.
- El punto (6,20) queda muy por encima de esa tendencia y tiene además un valor X extremo.
- Puede aumentar la pendiente, mover la ordenada en el origen y reducir la calidad del ajuste para los cinco primeros puntos.
Resultado. El valor atípico tiene influencia alta sobre la recta y sobre r; debe investigarse antes de aceptar el modelo.
Comprobación. Eliminarlo solo porque “molesta” sería incorrecto: primero hay que comprobar si es error de medida o una observación real.
Elegir la recta según la variable que se predice
- La variable conocida en la predicción es Y.
- La incógnita que queremos estimar es X.
- Por tanto, necesitamos la recta de regresión de X sobre Y.
Resultado. Se utiliza la regresión X|Y, no la regresión Y|X despejada.
Comprobación. Las dos rectas solo coinciden en una única línea cuando |r|=1.
Interpolar o extrapolar
- 4 está dentro del intervalo observado [1,6]: es interpolación.
- 15 queda muy lejos de los valores utilizados para ajustar el modelo: es extrapolación.
- La relación observada dentro de un rango no tiene por qué mantenerse fuera de él.
Resultado. La predicción en 4 h es razonable si el ajuste es bueno; la de 15 h es una extrapolación muy poco defendible.
Comprobación. Una calculadora siempre puede devolver un número; la estadística debe decidir si ese número tiene sentido.
Tablas conjuntas, marginales y distribuciones condicionadas
Los ejercicios 9–16 avanzan desde la interpretación hasta el cálculo y la decisión sobre la fiabilidad del modelo.
Construir y leer una tabla bidimensional
| X\Y | 4 | 6 | 8 | Total X |
|---|---|---|---|---|
| 1 | 3 | 1 | 0 | 4 |
| 2 | 2 | 4 | 1 | 7 |
| 3 | 0 | 2 | 3 | 5 |
| Total Y | 5 | 7 | 4 | 16 |
- La celda de X=2 e Y=6 contiene frecuencia 4: hay cuatro observaciones con ese par de valores.
- Sumamos por filas para obtener la marginal de X: 4, 7 y 5.
- Sumamos por columnas para obtener la marginal de Y: 5, 7 y 4.
- La suma total es N=16.
Resultado. f(2,6)=4; marginal X=(4,7,5); marginal Y=(5,7,4); N=16.
Comprobación. Las sumas de ambas marginales deben coincidir: 4+7+5 = 5+7+4 = 16.
Distribución condicionada de Y sabiendo X=2
| X\Y | 4 | 6 | 8 | Total X |
|---|---|---|---|---|
| 1 | 3 | 1 | 0 | 4 |
| 2 | 2 | 4 | 1 | 7 |
| 3 | 0 | 2 | 3 | 5 |
| Total Y | 5 | 7 | 4 | 16 |
- En la fila X=2 hay 7 observaciones.
- Las frecuencias son 2 para Y=4, 4 para Y=6 y 1 para Y=8.
- Dividimos cada frecuencia por el total de la fila: 2/7, 4/7 y 1/7.
Resultado. P(Y=4|X=2)=2/7≈0,286; P(Y=6|X=2)=4/7≈0,571; P(Y=8|X=2)=1/7≈0,143.
Comprobación. Las tres probabilidades condicionadas suman 1.
Distribución condicionada de X sabiendo Y=8
| X\Y | 4 | 6 | 8 | Total X |
|---|---|---|---|---|
| 1 | 3 | 1 | 0 | 4 |
| 2 | 2 | 4 | 1 | 7 |
| 3 | 0 | 2 | 3 | 5 |
| Total Y | 5 | 7 | 4 | 16 |
- La columna Y=8 tiene total 4.
- Las frecuencias por X son 0,1 y3.
- Dividimos por 4.
Resultado. P(X=1|Y=8)=0; P(X=2|Y=8)=0,25; P(X=3|Y=8)=0,75.
Comprobación. Condicionar por Y obliga a trabajar por columnas; es un error común usar el total de la fila.
Medias marginales a partir de una tabla conjunta
| X\Y | 4 | 6 | 8 | Total X |
|---|---|---|---|---|
| 1 | 3 | 1 | 0 | 4 |
| 2 | 2 | 4 | 1 | 7 |
| 3 | 0 | 2 | 3 | 5 |
| Total Y | 5 | 7 | 4 | 16 |
- f_X = (4,7,5), de modo que x̄=(1·4+2·7+3·5)/16.
- f_Y = (5,7,4), de modo que ȳ=(4·5+6·7+8·4)/16.
- Calculamos: x̄=33/16 y ȳ=94/16.
Resultado. x̄ = 2,062 y ȳ = 5,875.
Comprobación. Las medias se calculan con las distribuciones marginales, no sumando todos los encabezados sin ponderar.
Covarianza desde una tabla de doble entrada
| X\Y | 4 | 6 | 8 | Total X |
|---|---|---|---|---|
| 1 | 3 | 1 | 0 | 4 |
| 2 | 2 | 4 | 1 | 7 |
| 3 | 0 | 2 | 3 | 5 |
| Total Y | 5 | 7 | 4 | 16 |
- Calculamos E(XY)=Σ x·y·fij/N.
- La suma ponderada da E(XY)=12,875.
- Usamos x̄=2,062 e ȳ=5,875.
- sxy=12,875−2,062·5,875=0,758.
Resultado. sxy = 0,758.
Comprobación. El signo positivo indica que, en esta tabla, los valores altos de X tienden a aparecer con valores altos de Y.
Dependencia a partir de distribuciones condicionadas
| X\Y | 4 | 6 | 8 | Total X |
|---|---|---|---|---|
| 1 | 3 | 1 | 0 | 4 |
| 2 | 2 | 4 | 1 | 7 |
| 3 | 0 | 2 | 3 | 5 |
| Total Y | 5 | 7 | 4 | 16 |
- P(Y=8|X=1)=0/4=0.
- P(Y=8|X=3)=3/5=0,6.
- Si X e Y fueran independientes, la distribución de Y no cambiaría al fijar X.
Resultado. Las condicionadas son muy diferentes; los datos muestran dependencia estadística.
Comprobación. Dependencia estadística no equivale a causalidad.
Frecuencia conjunta frente a frecuencia marginal
| X\Y | 4 | 6 | 8 | Total X |
|---|---|---|---|---|
| 1 | 3 | 1 | 0 | 4 |
| 2 | 2 | 4 | 1 | 7 |
| 3 | 0 | 2 | 3 | 5 |
| Total Y | 5 | 7 | 4 | 16 |
- La frecuencia conjunta 4 exige simultáneamente X=2 e Y=6.
- La marginal 7 cuenta todos los casos con X=2, cualquiera que sea Y.
- Por eso la conjunta forma parte de la marginal: 2+4+1=7.
Resultado. Conjunta = 4; marginal de X=2 = 7.
Comprobación. Una tabla bidimensional se entiende mejor si cada celda se lee como “X e Y a la vez”.
Pasar de datos individuales a tabla de frecuencias
- Contamos repeticiones de cada par.
- (1,4) aparece 2 veces; (1,6), 1.
- (2,4) aparece 1 vez; (2,6), 2.
- (3,6) aparece 1 vez; (3,8), 1.
Resultado. f11=2, f12=1, f21=1, f22=2, f32=1, f33=1 si ordenamos X={1,2,3} e Y={4,6,8}.
Comprobación. La suma de las frecuencias no nulas es 8, igual al número de pares originales.
Covarianza, Pearson y coeficiente de determinación
Los ejercicios 17–28 avanzan desde la interpretación hasta el cálculo y la decisión sobre la fiabilidad del modelo.
Tabla de cálculo completa: medias, varianzas y covarianza
| x | y | x² | y² | xy |
|---|---|---|---|---|
| 2 | 4 | 4 | 16 | 8 |
| 3 | 5 | 9 | 25 | 15 |
| 4 | 5 | 16 | 25 | 20 |
| 5 | 7 | 25 | 49 | 35 |
| 6 | 8 | 36 | 64 | 48 |
| 7 | 9 | 49 | 81 | 63 |
| 27 | 38 | 139 | 260 | 189 |
- x̄=Σx/n=27/6=4,5 y ȳ=Σy/n=38/6=6,333.
- s²x=Σx²/n−x̄²=139/6−(4,5)²=2,917.
- s²y=Σy²/n−ȳ²=260/6−(6,333)²=3,222.
- sxy=Σxy/n−x̄ȳ=189/6−4,5·6,333=3.
Resultado. x̄=4,5, ȳ=6,333, s²x=2,917, s²y=3,222, sxy=3.
Comprobación. Las varianzas son no negativas y la covarianza positiva encaja con la tendencia ascendente de los pares.
Covarianza positiva
- x̄=3 y ȳ=7.
- Usamos sxy = Σ[(xi−x̄)(yi−ȳ)]/n.
- El promedio de los productos cruzados es 4.
Resultado. sxy = 4: covarianza positiva.
Comprobación. El signo debe coincidir con la orientación global de la nube; si sxy=0, solo podemos descartar relación lineal, no toda relación.
Covarianza negativa
- x̄=6 y ȳ=10,8.
- Usamos sxy = Σ[(xi−x̄)(yi−ȳ)]/n.
- El promedio de los productos cruzados es -10.
Resultado. sxy = -10: covarianza negativa.
Comprobación. El signo debe coincidir con la orientación global de la nube; si sxy=0, solo podemos descartar relación lineal, no toda relación.
Covarianza nula con relación no lineal
- x̄=0 y ȳ=5.
- Usamos sxy = Σ[(xi−x̄)(yi−ȳ)]/n.
- El promedio de los productos cruzados es 0.
Resultado. sxy = 0: covarianza nula.
Comprobación. El signo debe coincidir con la orientación global de la nube; si sxy=0, solo podemos descartar relación lineal, no toda relación.
Coeficiente de Pearson: caso perfecto
- sxy=4; sx=1,414; sy=2,828.
- r=sxy/(sx·sy)=4 / (1,414·2,828).
- r=1.
Resultado. r = 1 y R² = 1.
Comprobación. Siempre se cumple −1≤r≤1. El signo e intensidad deben ser compatibles con la nube de puntos.
Coeficiente de Pearson negativo
- sxy=-10; sx=2,828; sy=3,544.
- r=sxy/(sx·sy)=-10 / (2,828·3,544).
- r=-0,998.
Resultado. r = -0,998 y R² = 0,995.
Comprobación. Siempre se cumple −1≤r≤1. El signo e intensidad deben ser compatibles con la nube de puntos.
Coeficiente de Pearson intermedio
- sxy=3,75; sx=1,708; sy=2,409.
- r=sxy/(sx·sy)=3,75 / (1,708·2,409).
- r=0,911.
Resultado. r = 0,911 y R² = 0,83.
Comprobación. Siempre se cumple −1≤r≤1. El signo e intensidad deben ser compatibles con la nube de puntos.
Correlación débil: no forzar una recta
- sxy=0,25; sx=1,708; sy=1,708.
- r=sxy/(sx·sy)=0,25 / (1,708·1,708).
- r=0,086.
Resultado. r = 0,086 y R² = 0,007.
Comprobación. Siempre se cumple −1≤r≤1. El signo e intensidad deben ser compatibles con la nube de puntos.
Interpretar R² sin exagerar
- R²=r²=0,80²=0,64.
- En regresión lineal simple, R² mide la fracción de variabilidad de Y explicada por el modelo lineal con X.
- No significa que “X cause el 64 % de Y”.
Resultado. R²=0,64: el ajuste lineal explica aproximadamente el 64 % de la variabilidad observada de Y.
Comprobación. La interpretación es sobre ajuste lineal y variabilidad, no sobre causalidad.
Calcular r desde sumas resumidas
- x̄=15/5=3 y ȳ=35/5=7.
- s²x=55/5−3²=2.
- s²y=285/5−7²=8.
- sxy=105/5−3·7=0.
- Por tanto r=0/(√2·√8)=0.
Resultado. r=0.
Comprobación. Antes de concluir “no hay relación”, habría que mirar la nube: r=0 solo habla de relación lineal.
Efecto de sumar una constante
- Las desviaciones yi−ȳ no cambian al sumar la misma constante a todos los valores.
- Por ello no cambian sy, sxy ni r.
- La pendiente byx=sxy/s²x tampoco cambia; solo aumenta en 100 la ordenada en el origen.
Resultado. r y la pendiente permanecen iguales; la recta se desplaza 100 unidades hacia arriba.
Comprobación. Una traslación cambia el nivel de Y, no la forma de la asociación.
Qué debe devolver la calculadora
- x̄ y ȳ sitúan el centro de la nube.
- r cuantifica la asociación lineal.
- a y b determinan la recta de regresión, según la convención de la calculadora.
- Antes de usar a y b hay que comprobar si la máquina expresa y=a+bx o y=ax+b.
Resultado. No basta con copiar la pantalla: hay que identificar la ecuación que usa la calculadora y valorar la nube.
Comprobación. Dos calculadoras pueden llamar a y b de forma distinta; la ecuación visible evita intercambiarlos.
Regresión lineal, residuos, interpolación y extrapolación
Los ejercicios 29–40 avanzan desde la interpretación hasta el cálculo y la decisión sobre la fiabilidad del modelo.
Recta de regresión Y sobre X
- Calculamos x̄=3 y ȳ=7.
- La pendiente es b=sxy/s²x=4 / 2=2.
- La ordenada es a=ȳ−b·x̄=7−2·3=1.
- La recta es ŷ = 1 + 2x.
Resultado. ŷ = 1 + 2x; r=1.
Comprobación. La recta siempre pasa por el centro (x̄,ȳ). Sustituyendo x̄ debe salir ȳ.
Las dos rectas de regresión no son la misma
- Para Y|X: b=sxy/s²x=0,92 y a=-90,8; ŷ=-90,8+0,92x.
- Para X|Y: b'=sxy/s²y=1,08 y a'=99,131; x̂=99,131+1,08y.
- Cada recta minimiza errores en una dirección distinta: verticales para Y|X y horizontales para X|Y.
- Solo con |r|=1 ambas describen la misma línea geométrica.
Resultado. Y|X: ŷ=-90,8+0,92x. X|Y: x̂=99,131+1,08y.
Comprobación. Ambas pasan por (x̄,ȳ), pero sus pendientes no son recíprocas salvo correlación perfecta.
Recta de regresión con datos de examen
- Calculamos x̄=4,5 y ȳ=6,333.
- La pendiente es b=sxy/s²x=3 / 2,917=1,029.
- La ordenada es a=ȳ−b·x̄=6,333−1,029·4,5=1,705.
- La recta es ŷ = 1,705 + 1,029x.
Resultado. ŷ = 1,705 + 1,029x; r=0,979.
Comprobación. La recta siempre pasa por el centro (x̄,ȳ). Sustituyendo x̄ debe salir ȳ.
Predicción por interpolación
- La recta es ŷ = 1,705 + 1,029x.
- Sustituimos x=5,5: ŷ=1,705+1,029·5,5.
- Obtenemos ŷ=7,362.
- Como 5,5 está dentro del rango observado [2,7], es una interpolación.
Resultado. Predicción ŷ≈7,362.
Comprobación. La predicción debe quedar cerca de las observaciones vecinas y dentro de la escala de Y.
Extrapolación: un número puede ser estadísticamente débil
- La fórmula da ŷ=1,705+1,029·20=22,276.
- Pero los datos usados para ajustar X solo están entre 2 y 7.
- La predicción 20 está muy lejos del rango muestral; no sabemos si la relación seguirá siendo lineal.
Resultado. La calculadora produce 22,276, pero la extrapolación no es fiable.
Comprobación. La calidad de una predicción depende de la distancia al rango observado, la forma de la nube y r, no solo de disponer de una ecuación.
Regresión negativa en un contexto científico
- Calculamos x̄=14 y ȳ=110.
- La pendiente es b=sxy/s²x=-71,6 / 8=-8,95.
- La ordenada es a=ȳ−b·x̄=110−-8,95·14=235,3.
- La recta es ŷ = 235,3 − 8,95x.
Resultado. ŷ = 235,3 − 8,95x; r=-0,998.
Comprobación. La recta siempre pasa por el centro (x̄,ȳ). Sustituyendo x̄ debe salir ȳ.
Residuo de una observación
- Predicción en x=5: ŷ=6,848.
- Residuo e = y−ŷ.
- e=7−6,848=0,152.
Resultado. Residuo e=0,152.
Comprobación. Un residuo positivo significa que el punto observado queda por encima de la recta.
Regresión en un contexto social
- Calculamos x̄=3,5 y ȳ=176,667.
- La pendiente es b=sxy/s²x=61,667 / 2,917=21,143.
- La ordenada es a=ȳ−b·x̄=176,667−21,143·3,5=102,667.
- La recta es ŷ = 102,667 + 21,143x.
Resultado. ŷ = 102,667 + 21,143x; r=0,996.
Comprobación. La recta siempre pasa por el centro (x̄,ȳ). Sustituyendo x̄ debe salir ȳ.
Las rectas de regresión se cortan en el centro
- El centro es (x̄,ȳ)=(165,61).
- En Y|X, sustituimos x̄: -90,8+0,92·165=61.
- En X|Y, sustituimos ȳ: 99,131+1,08·61=165.
Resultado. Ambas rectas contienen el punto (165,61).
Comprobación. Es una propiedad general y un excelente control de cálculo.
Predecir X a partir de Y
- x̂=99,131+1,08y.
- Para y=63: x̂=99,131+1,08·63.
- x̂≈167,16 cm.
Resultado. Altura estimada ≈ 167,16 cm.
Comprobación. 63 kg está dentro del rango de masas observado, por lo que la predicción es una interpolación.
Comparar dos ajustes mediante R²
- Calculamos R²_A=0,92²=0,8464.
- R²_B=(−0,70)²=0,49.
- El signo de r indica dirección, pero R² compara intensidad del ajuste lineal.
Resultado. El modelo A tiene mayor R²: 0,846 frente a 0,49.
Comprobación. Una correlación negativa puede ser excelente; el signo no mide calidad.
Cuantificar el efecto de un valor atípico
- Sin el atípico: r=1, recta ŷ=0+2x.
- Con el atípico: r=0,922, recta ŷ=-2,667+3,143x.
- El punto extremo arrastra la pendiente y modifica todas las predicciones.
Resultado. La pendiente pasa de 2 a 3,143 y r pasa de 1 a 0,922.
Comprobación. El análisis gráfico debe acompañar siempre a los parámetros numéricos.
Regresión cuadrática, tecnología y problemas integrados
Los ejercicios 41–48 avanzan desde la interpretación hasta el cálculo y la decisión sobre la fiabilidad del modelo.
Regresión cuadrática cuando la nube lo pide
- La nube tiene forma de U y la regresión lineal no es pertinente.
- Una calculadora o hoja de cálculo con regresión cuadrática devuelve y=ax²+bx+c.
- En estos datos se obtiene a=1, b=0, c=1.
- El ajuste es exacto: R²=1.
Resultado. ŷ = x² + 1, con R²=1.
Comprobación. La curva pasa por todos los puntos y reproduce la simetría visual que la recta no podía captar.
Por qué r=0 no invalida una regresión cuadrática
- El coeficiente r mide únicamente asociación lineal.
- La nube presenta una forma parabólica exacta.
- El modelo cuadrático explica toda la variabilidad, aunque el lineal no explique ninguna.
Resultado. r=0 y R²_lineal=0 pueden coexistir con R²_cuadrático=1.
Comprobación. La forma gráfica decide qué familia de modelos es razonable explorar.
Predicción con un modelo cuadrático
- ŷ=(2,5)²+1=6,25+1=7,25.
- El valor 2,5 está dentro del intervalo observado [−3,3].
- Es una interpolación dentro de un modelo que ajusta perfectamente los datos disponibles.
Resultado. ŷ=7,25.
Comprobación. La predicción queda entre los valores observados en x=2 (5) y x=3 (10), coherente con la curva.
Comparar ajuste lineal y cuadrático
- El ajuste lineal tiene R²=r²≈0,001.
- La regresión cuadrática obtiene aproximadamente R²=0,995.
- La nube confirma una curvatura clara y el modelo cuadrático reduce mucho los residuos.
- Elegimos el modelo cuadrático por forma gráfica y calidad de ajuste, no solo por tener más parámetros.
Resultado. El cuadrático es claramente más pertinente en estos datos (R²≈0,995).
Comprobación. Un modelo más complejo no es automáticamente mejor: debe responder a una estructura visible y mejorar el ajuste de forma relevante.
Flujo de calculadora u hoja de cálculo
- Introduce los pares en dos columnas, manteniendo el emparejamiento fila a fila.
- Genera primero el diagrama de dispersión.
- Obtén x̄, ȳ, sx, sy, r y la regresión lineal; si la nube es curva, prueba también una regresión cuadrática.
- Lee R² y comprueba residuos o desviaciones visibles.
- Escribe una conclusión en contexto y limita la predicción al rango razonable.
Resultado. Gráfico → parámetros → modelo → R² → predicción → interpretación.
Comprobación. La tecnología acelera las cuentas, pero no decide por sí sola qué modelo tiene sentido.
Problema integrado: temperatura y consumo
- x̄=14; ȳ=110; sxy=-71,6.
- r=-0,998: relación lineal negativa muy fuerte.
- La recta es ŷ = 235,3 − 8,95x.
- Para x=15: ŷ=101,05 kWh.
- 15 °C está dentro del rango observado, por lo que es interpolación.
Resultado. r=-0,998; ŷ = 235,3 − 8,95x; para 15 °C, ŷ≈101,05 kWh.
Comprobación. La pendiente debe ser negativa: al aumentar la temperatura exterior, el consumo de calefacción disminuye.
Problema integrado: inversión y ventas
- r=0,996 y R²=0,992.
- Recta ŷ = 102,667 + 21,143x.
- Para x=4,5, ŷ=197,81.
- La asociación es fuerte, pero no prueba que toda variación de ventas sea causada por la inversión: pueden existir otras variables.
Resultado. r=0,996; R²=0,992; predicción ≈197,81 miles de euros.
Comprobación. 4,5 está dentro del rango [1,6], así que la predicción es interpolada.
Síntesis de examen: de la nube a la conclusión
- Representamos mental o gráficamente los puntos: tendencia ascendente sin curvatura fuerte.
- x̄=4; ȳ=5,429; sxy=4,714; sx=2; sy=2,441.
- r=0,966 y R²=0,932.
- Recta ŷ = 0,714 + 1,179x.
- Para x=5,5: ŷ≈7,196.
- La predicción está dentro del rango observado y el ajuste lineal es fuerte; aun así, no se interpreta causalmente sin más evidencia.
Resultado. r=0,966; R²=0,932; ŷ = 0,714 + 1,179x; ŷ(5,5)≈7,196.
Comprobación. El resultado combina cálculo, control gráfico, interpolación y una conclusión limitada: exactamente el tipo de cierre que debe aparecer en un examen.
12 ejercicios para resolver sin mirar el método
Hazlos después de los 48 resueltos. Las respuestas permiten comprobar el resultado, pero no sustituyen el planteamiento ni la interpretación.
Propuestos
- Observa una nube ascendente con un punto alejado. Explica qué revisarías antes de calcular una regresión.
- Para r=−0,85 calcula R² e interpreta dirección e intensidad.
- Dados x̄=4, ȳ=10, s²x=2 y sxy=3, halla la recta Y|X.
- Una regresión ajustada con X entre 20 y 40 se usa para X=95. Clasifica y valora la predicción.
- Explica por qué la recta X|Y no se obtiene despejando Y|X.
- Una tabla conjunta tiene filas 3,5,2 y columnas 4,4,2. Comprueba el tamaño de la muestra.
- Si r=0 pero la nube tiene forma de parábola, ¿qué modelo explorarías?
- En y=5+2x, calcula la predicción para x=7 y el residuo si el valor observado es 18.
- Dos modelos tienen R²=0,72 y R²=0,91. ¿Cuál ajusta mejor linealmente y qué no puedes concluir?
- Al sumar 50 a todos los valores Y, ¿qué cambia en r, pendiente e intercepto?
- Explica con una frase la diferencia entre correlación y causalidad.
- Diseña un ejemplo de dos variables de ciencias sociales donde tenga sentido estudiar una regresión lineal.
Resultados de control
- Revisar posible error de medida, influencia del punto y la nube con/sin él antes de decidir.
- R²=0,7225. Asociación lineal negativa fuerte; aproximadamente 72,25 % de variabilidad de Y explicada linealmente.
- b=3/2=1,5; a=10−1,5·4=4; ŷ=4+1,5x.
- Extrapolación lejana: el número puede calcularse, pero su fiabilidad es baja.
- Porque cada regresión minimiza errores en una dirección distinta; solo coinciden geométricamente si |r|=1.
- N=10 por filas y también N=10 por columnas.
- Regresión cuadrática, después de comprobar la forma y R².
- ŷ(7)=19; residuo e=18−19=−1.
- El de R²=0,91 ajusta mejor en términos lineales; no demuestra causalidad.
- r y pendiente no cambian; el intercepto aumenta en 50.
- Correlación describe asociación; causalidad exige evidencia de que un cambio produce el otro.
- Respuesta abierta, por ejemplo inversión publicitaria y ventas, siempre interpretando factores de confusión.
Revisión
Diez errores que hacen fallar un ejercicio aunque la calculadora funcione
Para seguir estudiando
Qué conviene repasar antes y cómo continuar
Dudas frecuentes
Preguntas que conviene cerrar antes del examen
¿Este recurso sirve para Matemáticas I y para Matemáticas Aplicadas a las Ciencias Sociales I?
Sí. El núcleo de variables bidimensionales, regresión lineal y cuadrática, correlación, R² y uso de herramientas tecnológicas aparece en ambos itinerarios estatales. Los contextos de los problemas se alternan entre ciencias, tecnología y ciencias sociales.
¿Hay que calcular siempre covarianza y r a mano?
Conviene saber de dónde salen y resolver algunos modelos manuales. En otros ejercicios es razonable utilizar calculadora u hoja de cálculo, especialmente para regresión y modelos cuadráticos. Lo esencial es interpretar correctamente la salida.
¿r cercano a 1 significa que X causa Y?
No. Indica una asociación lineal positiva fuerte. La causalidad exige información adicional sobre el diseño del estudio y posibles variables de confusión.
¿Qué diferencia hay entre r y R²?
r indica dirección e intensidad de la relación lineal. En regresión lineal simple, R²=r² y expresa la proporción de variabilidad de Y explicada por el ajuste lineal.
¿Por qué no puedo despejar una recta para obtener la otra regresión?
Porque la regresión Y sobre X minimiza desviaciones verticales y la regresión X sobre Y minimiza desviaciones horizontales. Solo coinciden en la misma línea cuando la correlación es perfecta.
¿Cuándo una predicción es poco fiable?
Cuando el ajuste es débil, la nube no es lineal, existen valores atípicos influyentes o se extrapola lejos del rango observado.
¿Qué aporta la regresión cuadrática en 1.º de Bachillerato?
Permite reconocer relaciones curvas que una recta describe mal. El currículo estatal vigente incluye explícitamente regresión lineal y cuadrática y la valoración gráfica de la pertinencia del ajuste.
¿Este recurso sustituye a Inferencia de 2.º de Bachillerato?
No. Aquí se estudian datos bidimensionales y modelos de relación. Intervalos de confianza, error y tamaño muestral pertenecen al recurso específico de Inferencia de 2.º Bachillerato y PAU/EBAU.
Base académica
Currículo y fuentes de referencia
- Real Decreto 243/2022, enseñanzas mínimas de Bachillerato. En Matemáticas I y Matemáticas Aplicadas a las Ciencias Sociales I incluye organización de variables bidimensionales, regresión lineal y cuadrática, diferencia entre correlación y causalidad, coeficientes de correlación y determinación, predicción y uso de calculadora/hoja de cálculo.
- Decreto 40/2022 de Castilla y León, currículo autonómico de Bachillerato. La secuenciación concreta puede variar entre comunidades y centros.
- Los 48 ejercicios, tablas y nubes de puntos de este cuaderno son de elaboración propia de Marlu Educativa. Los ejemplos externos revisados se han utilizado únicamente para contrastar alcance, terminología y competencia, no para reproducir enunciados.