Estadística Correlacional
  • Informaciones
  • Programa
  • Planificación
  • Clases
  • Prácticos
  • Recursos
  • Ayudantes

Inferencia en correlación y criterios de magnitud

Sesión del miércoles, 30 de septiembre de 2026

Ejercita R · Social R interactivo ↗

Recurso complementario · Estadística Correlacional Interactiva ↗

Objetivo de la sesión

Este práctico tiene como objetivo aprender una serie de criterios para estudiar la asociación entre dos variables mediante R. Considerando esto, la sesión se compone de cuatro objetivos específicos:

  • Repasar los fundamentos de la correlación de Pearson

  • Aprender los criterios de Cohen para tamaños de efecto

  • Aplicar pruebas de hipótesis en correlación

  • Entender cómo estimar e interpretar el Coeficiente de determinación (\(R^{2}\))

1 Correlación de Pearson

Recordemos que la Correlación de Pearson (\(r\)) es un valor numérico que representa la asociación lineal entre dos variables. Algunas de sus propiedades son:

  1. Valor estandarizado: la correlación no considera las unidades de medidas originales de las variables, pues está construida en una escala común (lo cual facilita su interpretación)

  2. Direccionalidad: una correlación siempre presenta alguna dirección, ya sea negativa o positiva. El rango de valores varía entre -1 y +1

\[ r>0 \rightarrow \text{asociación directa (positiva)} \]

\[ r<0 \rightarrow \text{asociación inversa (negativa)} \]

  1. Magnitud: refiere a la intensidad del patrón lineal que reconoce la correlación

\[ |r| \]

Preparación de datos

Al igual que el práctico anterior, trabajaremos con un subconjunto de datos de CASEN 2024.

Para esto, cargamos la base de datos desde el sitio del Ministerio de Desarrollo Social y Familia a partir del link que se guarda en el objeto url_casen.

Esto genera el objeto con el link asociado a la base de datos, pero no carga automáticamente la base de datos en nuestro entorno de trabajo. Para ello, debemos ejecutar la función load, la cual llama al objeto url_casen.

url_casen <- "https://bid-ckan.ministeriodesarrollosocial.gob.cl/dataset/105286d9-10a8-410a-b060-a335f3168a46/resource/cacc6ad5-fca1-4476-82f1-b7ea119fae98/download/casen_2024.rdata"  # Dirección oficial de CASEN 2024

load(
  url(url_casen)  # Carga la base directamente desde Internet
)

Una vez tenemos la base en nuestro entorno, cargamos las librerías con las que trabajaremos

library(dplyr)    # Para trabajar con los datos
library(ggplot2)  # Para crear gráficos
library(haven)  # Para trabajar con las etiquetas de CASEN

Para este práctico utilizaremos 5 variables:

Variable Qué representa
escolaridad Años de escolaridad
metros_vivienda Tamaño de superficie del hogar, en metros cuadrados
ingreso_laboral Ingreso de la ocupación principal, en pesos
horas_trabajo Horas trabajadas habitualmente por semana en la actividad principal
edad Edad del respondente
set.seed(2026)  # Hace que todas y todos obtengamos los mismos casos

datos <- casen_2024 |>                                # Partimos desde la base oficial
  filter(edad > 18) |>                                 # Solo personas mayores de 18 años
  transmute(                                           # Conservamos y renombramos tres variables
    escolaridad = haven::zap_labels(esc),
    metros_vivienda = haven::zap_labels(v12mt),             # Años de escolaridad
    horas_trabajo = na_if(haven::zap_labels(o10), -88), # Horas semanales; -88 significa "No sabe"
    ingreso_laboral = haven::zap_labels(yoprcor), # Ingreso de la ocupación principal
    edad = haven::zap_labels(edad)       # se aplica el código para crear la columna edad dentro de la nueva base de datos
  ) |>
  na.omit() |>                                         # Conservamos casos con información completa
  slice_sample(n = 700)

1.1 Análisis de correlaciones

Para analizar una correlación de Pearson debemos observar sus 3 atributos principales:

1) Patrón de los datos

2) Dirección del patrón

3) Magnitud de la asociación

Apliquemos esto para estudiar la asociación entre la edad y el ingreso laboral.

Primero visualizamos su relación mediante una nube de puntos (scatterplot)

ggplot(datos, aes(                 # Usamos nuestra submuestra
  x = edad,                    # Eje X: edad
  y = ingreso_laboral                 # Eje Y: ingreso laboral
)) +
  geom_point()                        # Cada punto representa un caso

Edad e ingreso de la ocupación principal · CASEN 2024

Al observar el gráfico, ¿podemos observar una tendencia lineal clara entre ambas variables?

Ya tenemos una idea del comportamiento de los datos. Ahora estimemos la correlación.

Para calcular la correlación entre dos variables debemos utilizar la función cor de esta manera:

cor(datos$edad,
    datos$ingreso_laboral)
[1] -0.05286131

Donde:

cor: Calcula la correlación de las variables que se encuentran dentro de la función, es decir, dentro del paréntesis

datos$edad: Se ingresa a la función la variable edad, que está dentro de la base datos

datos$ingreso_laboral: Se ingresa a la función la variable ingreso_laboral, que está dentro de la base datos

Para que la correlación se calcule correctamente debemos asegurarnos de:

1) Especificar bien las variables dentro de la función

2) Separar las variables mediante una coma (,)

3) Ingresar sólo dos variables a la función

Pongamos a prueba estos tres puntos para ver qué ocurre con el código

1) Falta de especificación de variables

cor(edad,
    ingreso_laboral)

La correlación no se estima debido a que las variables edad e ingreso laboral no existen por sí solas, si no que están dentro de la base llamada datos.

Importante

Las variables siempre se encuentran alojadas en una base de datos, y al momento de trabajar con ellas debemos señalar de dónde provienen. Esto es algo que hacemos de manera recurrente y se expresa de la siguiente manera: base de datos$variable

2) No separación de variables

cor(datos$edad
    datos$ingreso_laboral)

El código reconoce la falta del símbolo ,, lo cual no le permite identificar las variables dentro de la función

3) Ingresar más de dos variables a la función cor

cor(datos$edad,
    datos$ingreso_laboral,
    datos$horas_trabajo)

La función cor sólo permite estimar la asociación entre dos variables. Existen formas de observar la correlación entre una mayor cantidad de variables, pero lo veremos en las próximas sesiones

Volvamos al ejercicio. Tenemos la correlación de Pearson entre la edad y el ingreso laboral mensual de nuestra muestra:

cor(datos$edad,
    datos$ingreso_laboral)
[1] -0.05286131

¿Qué podemos decir de esta correlación?

AdvertenciaInterpretación

A partir de la submuestra de la CASEN 2024, se pudo observar que correlación entre la edad y el ingreso laboral mensual es \(r\) = -0.05, presentando una dirección negativa. En términos sustantivos, se puede concluir que, a medida que las personas alcanzan edades mayores, sus ingresos laborales disminuyen

Dependiendo del signo de la correlación, la lógica de asociación entre variables es distinta. Esto se puede resumir en la siguiente tabla:

Signo de la asociación Tipo de asociación Interpretación
Positivo (+) Directa Si una variable aumenta, la otra también
Negativo (-) Inversa Si una variable aumenta, la otra disminuye

2 Criterios de magnitud

Ya sabemos cómo interpretar una correlación en términos de su direccionalidad, pero ¿podemos decir algo sobre su efecto?

¿Una correlación positiva tiene un efecto más grande que una correlación negativa?

No necesariamente. El signo sólo nos habla sobre la dirección del patrón lineal compuesto por las dos variables que observamos, pero no dice nada respecto al tamaño del efecto.

Para darle una interpretación a la magnitud de una correlación recurrimos a los Criterios de Cohen (1988). Estos criterios representan un estándar en las ciencias sociales para determinar qué tan fuerte es una asociación.

r Significado aproximado (Cohen 1988)
< ±0.1  Muy pequeño
±0.1–0.3 Pequeño
±0.3–0.5 Moderado
>±0.5 Grande

Gracias a estos criterios, podemos profundizar en la interpretación de las correlaciones que estudiemos. Tomando en cuenta el ejemplo de asociación entre edad e ingreso laboral, ahora podemos agregar lo siguiente:

AdvertenciaInterpretación

A partir de la submuestra de la CASEN 2024, se pudo observar que correlación entre la edad y el ingreso laboral mensual es \(r\) = -0.05, presentando una dirección negativa con un efecto muy pequeño. En términos sustantivos, se puede concluir que, a medida que las personas alcanzan edades mayores, sus ingresos laborales disminuyen.

3 Ejercicio intermedio

Pongamos en práctica los contenidos que hemos visto hasta ahora siguiendo los siguientes pasos:

Utilicen las variables horas_trabajo y escolaridad de la base de datos datos y realicen lo siguiente:

  1. Analicen el patrón de su asociación mediante una nube de puntos o scatterplot. Para ello, completen el código de abajo:
ggplot(____, aes(                
  x = ____,                    
  y = _____               
)) +
  geom_point()                        
  1. Estimen la correlación entre horas_trabajo y escolaridad y reporten:
  • Dirección

  • Magnitud

  • Interpretación sustantiva

Completen el siguiente código para desarrollar el punto 2):

cor(datos$____,
    datos$____)

4 Inferencia en correlación

Ahora vincularemos el contenido de esta Segunda Unidad con el concepto central de la Unidad 1: la inferencia. En el práctico pasado nos preguntamos cómo se asocian dos variables, pero ahora pasamos a una pregunta distinta: ¿La asociación observada entre dos variables es representativa a nivel de la población?

Retomamos el foco: la estadística en ciencias sociales busca encontrar hallazgos no sólo a nivel de la muestra, sino que en la población.

Para realizar el cálculo inferencial en correlación seguiremos los mismos 5 pasos que en la Unidad 1:

1) Formulación de hipótesis 2) Cálculo de error estándar y estadístico de prueba (t) 3) Probabilidad de error y valor crítico para t 4) Contraste de valores empírico y crítico 5) Interpretación

4.1 Ejemplo 1

Para aplicar este contenido seguiremos utilizando las variables edad e ingreso laboral de nuestro subconjunto de datos.

1) Formulación de hipótesis

Para inferencia en correlación, nuestro objetivo es comprobar si un respectivo \(r\) existe en la población, cuya expresión formal es \(\rho\) (rho). Entonces, nuestra hipótesis quedaría:

\(H_{0}\): \(cor(edad, ingreso laboral)\) = 0

\(H_{1}\): \(cor(edad, ingreso laboral)\) \(\neq\) 0

Pasos 2), 3) y 4) con R

Mostrar fórmulas de Desviación Estándar y Estadístico de prueba (t)

Estimación de error estándar para test de hipótesis en correlación:

\(SE_r=\sqrt{\frac{1-r²}{n-2}}\)

Estadístico de prueba (t):

\(t_r=\frac{r}{SE_r}\)

R nos permite estimar los siguientes 3 pasos de la inferencia en correlación mediante la función cor.test

Esta función se compone de una manera un poco distinta a cor:

  • Además de especificar las variables, se debe explicitar el método de correlación (de momento sólo utilizaremos Pearson)
Importante

Si no especificamos el método para estimar la correlación en el argumento method, la función estimará por defecto la correlación de Pearson, lo cual nos sirve de momento, pero más adelante utilizaremos otros métodos de estimación para correlación, por lo que al utilizar cor.test siempre es recomendable especificar el método

En este código realizamos lo siguiente: Estimamos cor.test utilizando las variables edad e ingreso laboral que se encuentran dentro de la base datos. Los resultados de cor.test se almacenan en el objeto cor_results. Por último, imprimimos los resultados de cor_results.

cor_results <- cor.test(x = datos$edad,
                        y = datos$ingreso_laboral,
                        method = "pearson")

cor_results

    Pearson's product-moment correlation

data:  datos$edad and datos$ingreso_laboral
t = -1.3985, df = 698, p-value = 0.1624
alternative hypothesis: true correlation is not equal to 0
95 percent confidence interval:
 -0.12646875  0.02132507
sample estimates:
        cor 
-0.05286131 

Este output es legible pero no muy amigable visualmente, así que lo adaptaremos a un formato tabla:

Elemento Valor
Coeficiente de correlación (\(r\)) -0,05
Estadístico de prueba (\(t\)) -1,4
Grados de libertad (\(gl\)) 698
Valor p 0,162
Intervalo de confianza 95% [-0,1, 0,0]

5) Interpretación

La asociación entre la edad y los ingresos mensuales es negativa, con un efecto muy pequeño y no es estadísticamente significativa (\(r\) = -0.5, \(p\) > 0.05). Por tanto, no se puede rechazar la \(H_{0}\) de no asociación entre variables, existiendo evidencia a favor de que no hay asociación a nivel poblacional entre la edad y los ingresos laborales

4.2 Ejemplo 2

Ahora realicemos el mismo procedimiento pero utilizando las variables escolaridad e ingreso_laboral

1) Formulación de hipótesis

\(H_{0}\): \(cor(escolaridad, ingresolaboral)\) = 0

\(H_{1}\): \(cor(escolaridad, ingresolaboral)\) \(\neq\) 0

Pasos 2), 3) y 4) con R

cor_results_2 <- cor.test(x = datos$escolaridad,
                        y = datos$ingreso_laboral,
                        method = "pearson")
Elemento Valor
Coeficiente de correlación (\(r\)) 0,37
Estadístico de prueba (\(t\)) 10,6
Grados de libertad (\(gl\)) 698
Valor p < 0.001
Intervalo de confianza 95% [0,3, 0,4]

5) Interpretación

La asociación entre los ingresos reales y los ingresos justos es positiva, moderada y estadísticamente significativa (\(r\) = 0.37; \(p\) < .001). Por tanto, con un 95% de confianza se puede rechazar la \(H_{0}\) de no asociación entre variables, existiendo evidencia a favor de la \(H_{1}\) sobre una asociación significativa entre los años de escolaridad y los ingresos mensuales.

Ahora, imaginemos un escenario en donde nuestro tamaño muestral disminuye considerablemente, ¿La correlación sufre algún cambio?

Para responder a esta pregunta generamos una muestra de sólo 50 casos a partir de la base datos que ya procesamos al inicio de la sesión, y seleccionaremos las variables que utilizamos en el último ejemplo.

set.seed(3009) # creamos una nueva semilla para esta base de datos

datos_2 <- datos |>
  select(escolaridad, ingreso_laboral) |>
  slice_sample(n = 50)

Vamos directo a la estimación: aplicamos la función cor.test con escolaridad e ingreso_laboral de la nueva base de datos

cor_results_3 <- cor.test(x = datos_2$escolaridad,
                          y = datos_2$ingreso_laboral,
                          method = "pearson")

Para responder a la pregunta, visualizaremos las pruebas estadísticas que realizamos con escolaridad e ingreso_laboral en una tabla, así podremos comparar los resultados de la muestra con 700 casos con la muestra de 50 casos

Elemento N = 700 N = 50
Coeficiente de correlación (\(r\)) 0,37 0,31
Estadístico de prueba (\(t\)) 10,6 2,3
Grados de libertad (\(gl\)) 698 48
Valor p < 0.001 0,028
Intervalo de confianza 95% [0,3, 0,4] [0,0, 0,5]

Analicemos la tabla:

1) El coeficiente de correlación es levemente menor en la muestra con menos casos, pero ambas mantienen su dirección y magnitud

2) El valor empírico (t) es mucho mayor en la muestra con más casos

Esto se debe a que el cálculo del estadístico de prueba se realiza con los valores de la muestra y el coeficiente de correlación. En resumen, si tuviéramos el mismo coeficiente de correlación, mientras mayor sea el tamaño muestral, mayor será el estadístico de prueba

3) Los grados de libertad se calculan directamente con el tamaño de la muestra, por lo que una muestra más grande nos otorga más grados de libertad en nuestras estimaciones

4) A medida que aumenta el tamaño muestral, el valor \(p\) disminuye, permitiendo observar que, correlaciones con un tamaño de efecto muy pequeño, pueden ser significativas en una muestra grande

5) Recordemos que el intervalo de confianza se calcula utilizando el error estándar. Al igual que en los test de hipótesis de la Unidad Uno, aquí se sigue la misma regla: Un mayor tamaño muestral permite obtener un error estándar más pequeño y, por lo tanto, una estimación más precisa

Adicionalmente, observemos cómo varían los patrones de la correlación al diferenciar su tamaño muestral

  • Ejemplo 1
  • Ejemplo 2
Figura 1: Años de escolaridad e ingreso mensual - CASEN 2024 (N = 1000)
Figura 2: Años de escolaridad e ingreso mensual - CASEN 2024 (N = 50)

¿Cómo varían los patrones entre variables al modificar su tamaño muestral?

5 Coeficiente de determinación

A lo largo del práctico hemos profundizado en cómo estudiar la correlación entre dos variables, cuyo valor se desprende de la covarianza. Entonces, siguiendo el ejemplo de asociación entre los años de escolaridad y el ingreso laboral, si ambas variables presentan una correlación, podemos asumir que también covarían, es decir, comparten varianza. Ahora la pregunta es: ¿Cuánta varianza comparten?

Para responder a esta pregunta atendemos al coeficiente de determinación (\(R²\)), una medida estadística que indica la proporción de la varianza total de una variable que es explicada por otra(s) variable(s). En pocas palabras:

  • Evaluar cuánta de la variabilidad de una variable se debe a otra variable.

  • Sus valores van desde 0 a 1, en donde 0 indica que ambas variables comparten el 0% de su varianza, y 1 que comparten el 100% de su varianza.

En el contexto de la correlación entre solo dos variables, el \(R²\) es igual a elevar al cuadrado el coeficiente de correlación de Pearson, quedando expresado de la siguiente manera: \((r)^2\). Esto nos permite conocer qué tanto la variabilidad de una variable X estaría asociado a la variabilidad de otra variable Y.

Apliquemos esto en R:

coef_corr <- cor(datos$escolaridad,
                datos$ingreso_laboral) # estimamos la correlación y la guardamos en el objeto coef_corr

(coef_corr)^2
[1] 0.1377596

A partir del resultado, podemos decir que los años de escolaridad y el ingreso laboral mensual comparten un 14% de su varianza. Por lo tanto,

6 Ejercicios autónomos

6.1 Ejercicio 1

A partir de la base datos respondan la siguiente pregunta: ¿En qué medida el tamaño de superficie del hogar está asociado al ingreso laboral mensual?

  1. Construya una nube de puntos y comente el patrón de la asociación

  2. Estime la correlación de Pearson entre ambas variables y reporte su dirección, tamaño de efecto y cómo se interpreta la asociación

  3. Calcule el coeficiente de determinación de esta relación e interprete el resultado

6.2 Ejercicio 2

Utilizando la misma base de datos que el Ejercicio 1, respondan esta interrogante: ¿En qué medida el tamaño de superficie del hogar está asociado a los años de escolaridad?

  1. Visualice la asociación de las variables mediante una nube de puntos o scatterplot

  2. Realice una prueba de hipótesis para esta asociación mediante cor.test, siguiendo los 5 pasos de la inferencia

  3. Interprete la correlación en cuanto a su direccionalidad, magnitud y significancia estadística

  4. Responda la pregunta: A partir de los resultados ¿Existe evidencia a favor de rechazar \(H_{0}\)?

  5. Calcule la correlación entre ambas variables utilizando cor, guarde este resultado en un objeto llamado resultado_cor y estime su coeficiente de determinación. Interprete el resultado

Para cerrar

  • Los criterios de Cohen (1988) nos permiten establecer la magnitud de la asociación entre variables, mientras que el signo de la asociación sólo nos indica direccionalidad

  • En la prueba de hipótesis para correlación buscamos evidencia a favor de rechazar la hipótesis de no asociación (\(H_{0}\))

  • El coeficiente de determinación establece el grado de varianza compartida entre dos variables

Content 2026 by Juan Castillo
All content licensed under a Creative Commons Attribution-NonCommercial 4.0 International license (CC BY-NC 4.0)

 

Made with and Quarto
View the source at GitHub