# 1. Cargar los datos
load(url("https://github.com/cursos-metodos-facso/datos-ejemplos/raw/main/proc_casen.RData"))
# 2. Cargar paquetes
if (!requireNamespace("pacman", quietly = TRUE)) install.packages("pacman")
library(pacman)
p_load(sjmisc) # sjmisc y sjPlot son paquetes que nos permiten visualizar datos
# 3. Etiquetar variables de interes
# Etiquetamos la variable `universitaria`
proc_casen$universitaria <- factor(
proc_casen$universitaria,
levels = c(0, 1),
labels = c(
"No universitaria",
"Universitaria"
)
)
# Etiquetamos la variable `sexo`
proc_casen$sexo <- factor(
proc_casen$sexo,
levels = c(1, 2),
labels = c(
"Hombre",
"Mujer"
)
)Proporciones, integración e interpretación de inferencia
Sesión del miércoles, 2 de septiembre de 2026
En este práctico vamos a partir revisando el test de diferencia de proporciones, que es análogo al test de diferencia de medias (con t) pero ahora comparamos distintos porcentajes en dos grupos. Luego, haremos una revisión de los contenidos de la primera unidad de Inferencia, y posteriormente ejercicios de integración e interpretación.
1 Test para proporciones
Vamos a empezar este práctico revisando un último contenido pendiente de la primera unidad de curso: Test para proporciones. Hasta el momento, hemos realizado inferencias con medidas de tendencia central, fundamentalmente los promedios. Sin embargo, es posible también realizar inferencias sobre porcentajes y proporciones. La siguiente tabla ilustra ejemplos de hipótesis para proporciones y su diferencia con lo que he¿mos revisado hasta ahora
| Tipo de hipótesis | Hipótesis para media | Hipótesis para proporciones |
|---|---|---|
| Hipótesis puntual | La escolaridad promedio de los chilenos es de 11,9 años | EL 20% de los chilenos asiste a la educación superior |
| Hipótesis de diferencia | La escolaridad promedio de los hombres y las mujeres es diferente | Los hombres y las mujeres tienen un distinto porcentaje de educación superior |
| Hipótesis direccional | La escolaridad promedio de las mujeres es mayor que la de los hombres | Un porcentaje mayor de mujeres que de hombres asiste a la educación superior |
Como ven, podemos seguir trabajando con hipótesis puntuales, de diferencia y direccionales, tal como con las medias. Vamos a trabajar con la siguiente pregunta de investigación para ilustrarlo de forma práctica: ¿Existen diferencias de género en el porcentaje de hombres y mujeres con educación universitaria o más en Chile? Utilizaremos la variable universitaria presente en proc_casen que codifica como 0 a quienes no cuentan con educación universitaria y como 1 a quienes tienen educación universitaria o más (magíster, doctorado, postítulo, etc).
Preparar los datos
Primero veamos las frecuencias relativas para el total de la muestra:
sjmisc::frq(proc_casen$universitaria)x <categorical>
# total N=202111 valid N=202111 mean=1.24 sd=0.43
Value | N | Raw % | Valid % | Cum. %
----------------------------------------------------
No universitaria | 152798 | 75.60 | 75.60 | 75.60
Universitaria | 49313 | 24.40 | 24.40 | 100.00
<NA> | 0 | 0.00 | <NA> | <NA>
Podemos observar que el 24% de la muestra cuenta con educación universitaria. ¿Existen diferencias de genero? Revisemos la siguiente tabla
flat_table(proc_casen, universitaria, sexo, margin = "col") sexo Hombre Mujer
universitaria
No universitaria 76.84 74.49
Universitaria 23.16 25.51
El porcentaje de mujeres con educación universitaria es del 25,51%, mientras que el de hombres es de 23,16%. Es decir, el porcentaje de mujeres con educación universitaria es un 2,35% superior que el de los hombres. Pero, ¿es esta diferencias estadísticamente significativa? En otras palabras, ¿existe está diferencia en la población?
Establecer las hipótesis
¿Existen diferencias entre el porcentaje de mujeres y hombres con nivel educacional universitario? En este caso tenemos una hipótesis no direccional, por lo que nuestras hipótesis serían:
\[ H_a : p_{mujeres} - p_{hombres} \neq 0 \] \[ H_ 0: p_{mujeres} - p_{hombres} = 0 \] Calcular el error estándar
Este es el mayor cambio que implica pasar de medias a proporciones. Revisemos la formula para el error estándar de una proporción.
\[ SE_p = \sqrt{\frac{p(1-p)}{n}} \]
Donde p es la proporción observada en la muestra. Noten que \(p(1-p)\) ocupa el lugar donde hasta ahora habíamos puesto la desviación estándar. Esto es porque la varianza de una proporción está definida por el producto entre la probabilidad de éxito p y la probabilidad de fracaso 1-p.
En una proporción cada dato es un 0 (por ejemplo, no tiene educación universitaria) o 1 (tiene educación universitaria). Si la proporción está muy cerca de 0 o de 1, eso implica que los datos son muy similares entre sí – o todos tienen educación universitaria o nadie tiene, por lo que su variabilidad es muy pequeña. En cambio, entre más se acerque la proporción de 0,5, los datos están más repartidos entre 0 y 1. Si la proporción es exactamente igual a 0,5, entonces estamos en el escenario de máxima variabilidad.
Para la diferencia de proporciones agregamos a la formula la varianza de cada grupo por separado:
\[ SE_{p_1-p_2} = \sqrt{\frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}} \]
Veamoslos en R aplicado a nuestro caso:
p1 <- mean(proc_casen$universitaria[proc_casen$sexo == "Mujer"] == "Universitaria")
p2 <- mean(proc_casen$universitaria[proc_casen$sexo == "Hombre"] == "Universitaria")
n1 <- sum(proc_casen$sexo == "Mujer")
n2 <- sum(proc_casen$sexo == "Hombre")
# Para simplificar, vamos a separar la formula
se_p1 <- (p1*(1-p1))/n1
se_p2 <- (p2*(1-p2))/n2
# Sumamos y calculamos el error estándar
se <- sqrt(se_p1+se_p2)
se[1] 0.001909335
El error estándar de la diferencia de proporciones con educación universitaria entre hombres y mujeres es de 0.0019.
Intervalos de confianza
A partir de aquí, los procedimientos estadísticos siguen fundamentalmente la misma línea que la diferencia de proporciones, reemplazando la diferencia de medias por la diferencia de proporciones. Por ejemplo, para calcular un intervalo de confianza para proporciones la formula es:
\[ p_1 - p_2 \pm Z_{\alpha/2} * SE_{p_1-p_b} \]
Siguiendo nuestro ejemplo, y considerando un \(\alpha\) de 0,05, que equivale a un Z de 1,96
# Creamos un objeto con la diferencia
dif_p <- p1-p2
lim_inf <- dif_p - 1.96 * se
lim_sup <- dif_p + 1.96 * se
lim_inf[1] 0.01978482
lim_sup[1] 0.02726941
Con un 95% de confianza podemos decir que la diferencia de proporción de educación universitaria entre hombres y mujeres se encuentra entre un 1,97% y un 2,72%
En R
Para hacer la prueba t para proporciones en R necesitamos saber la frecuencia absoluta de mujeres y hombres con educación universitaria, así como la cantidad total de hombres y mujeres en la muestra. Calculemos:
x1 <- sum(proc_casen$universitaria[proc_casen$sexo == "Mujer"] == "Universitaria")
x2 <- sum(proc_casen$universitaria[proc_casen$sexo == "Hombre"] == "Universitaria")EL tamaño muestral de cada género los calculamos anteriormente y se encuentran en los objetos n1 y n2. Hacemos la prueba con prop.test e interpretamos los resultados.
# Prueba de proporciones de dos colas
test <- prop.test(
x = c(x1, x2),
n = c(n1, n2),
alternative = "two.sided",
correct = FALSE)
# Ordenamos los resultados en una tabla
stats.table <- broom::tidy(
test,
conf.int = TRUE
)
# Presentamos la tabla en un formato más fácil de leer
rempsyc::nice_table(stats.table)estimate1 | estimate2 | statistic | p | parameter | Method | Alternative | 95% CI |
|---|---|---|---|---|---|---|---|
0.26 | 0.23 | 151.19 | < .001*** | 1.00 | 2-sample test for equality of proportions without continuity correction | two.sided | [0.02, 0.03] |
La prueba arroja un estadístico t de 151,19. Como esta cifra es mucho mayor que el valor crítico de 1,96, entonces se rechaza la hipótesis nula de igualdad de proporciones entre hombres y mujeres con educación universitaria con un 95% de confianza.
Importante: La prueba de proporciones direccional sigue la misma lógica que la prueba t para medias. La diferencia es que en vez de comparar medias, comparamos proporciones. Por lo tanto, si quisiéramos hacer una prueba direccional, por ejemplo, para evaluar si el porcentaje de mujeres con educación universitaria es mayor que el de hombres, bastaría con cambiar alternative a "greater" y la interpretación sería análoga a la que hemos hecho hasta ahora.
2 Integración e Interpretación
Hasta ahora hemos aprendido, progresivamente:
- A calcular puntajes Z, t y errores estándar
- A calcular e interpretar intervalos de confianza
- A plantear y contrastar hipótesis direccionales y no direccionales de diferencia de medias y de proporciones
El objetivo de esta sesión recurrir a estos aprendizajes e intergrarlos en nuestros análisis de datos sociales, lo cual implica tomar decisiones pertinentes, ejecutarlas en R, e interpretarlas estadística y sociológicamente
2.1 Repaso
A lo largo de esta unidad hemos trabajado bajo una misma lógica: rara vez tenemos acceso a la población completa que nos interesa estudiar, por lo que debemos conformarnos con observar una muestra de ella. A partir de esa muestra calculamos estadísticos — un promedio, una proporción, una diferencia de medias — pero nuestro verdadero interés nunca es la muestra en sí misma, sino lo que esos estadísticos nos permiten decir sobre los parámetros poblacionales, es decir, los valores reales (y desconocidos) que caracterizan a la población de la que esa muestra proviene.
La estadística inferencial es, precisamente, el conjunto de herramientas que nos permite dar ese salto desde lo observado (la muestra) hacia lo que queremos conocer (la población), reconociendo al mismo tiempo que ese salto siempre conlleva un margen de error e incertidumbre. Antes de avanzar, repasemos brevemente los conceptos y herramientas que ya hemos construido para dar ese salto.
2.2 Los 5 pasos de la inferencia estadística
| Paso | Detalle |
|---|---|
| 1 | Formula \(H_0\) y \(H_A\) y estipula la dirección de la prueba |
| 2 | Calcula el error estándar (SE) y el valor estimado de la prueba |
| 3 | Especifica la probabilidad de error \(\alpha\) y el valor crítico |
| 4 | Contrasta el valor estimado con el valor crítico |
| 5 | Interpreta los resultados |
2.3 Glosario
Curva Normal: Distribución teórica que nos entrega un estándar para comparar distribuciones empíricas.
Puntajes Z: Medida estandarizada que se expresa en desviaciones estándar respecto a la media.
Teorema central del límite: Define que al tomar muchas muestras de una misma población, la distribución de sus medias muestrales tiende a aproximarse a una distribución normal a medida que aumenta el tamaño de la muestra.
Error estándar: describe cuánto esperamos que varíe una media muestral entre diferentes muestras de una misma población y nos informa sobre la precisión de la estimación.
No se debe confundir error estándar con distribución estándar. Mientras que el error estándar se refiere a la variabilidad de diferentes muestras, la desviación estándar describe cuánto se dispersan los valores individuales de una muestra alrededor de la media.
Intervalos de confianza: rango de valores construido a partir de una muestra para estimar un parámetro poblacional. En un IC del 95%, el procedimiento produciría intervalos que contienen el verdadero parámetro en aproximadamente el 95% de muestras repetidas.
Nivel de Confianza: Proporción en que el rango acierta. Se define como \(1-\alpha\), siendo \(\alpha\) la probabilidad de error.
Hipótesis: Aseveración o predicción que se desprende una teoría sobre una situación que ocurren en la población.
Hipótesis nula: Escenario de referencia que plantea la ausencia de la diferencia o relación que queremos evaluar. Analizamos si los datos entregan evidencia suficiente para rechazarlo.. Se expresa como \(H_0\)
Valor p: La probabilidad de observar un resultado igual o más extremo que el obtenido, si H0 fuera verdadera
Alpha (\(\alpha\)): Es el umbral de probabilidad p que el investigador fija de antemano para decidir cuando un resultado se considera lo suficientemente improbable bajo \(H_0\) como para rechazarla. Convencionalmente, este valor corresponde a 0,05.
Valor crítico: Es el punto en la distribución muestral del estadístico que limita la zona de rechazo sobber la cual consideramos que un valor poco probable si \(H_0\) fuera verdadera. Se calcula a partir de \(\alpha\) y de la distribución teórica correspondiente (t, normal, etc.)
2.4 Dos colas o una cola?
Si nuestra pregunta requiere realizar una prueba t, debemos decidir cuál es la dirección de nuestra hipótesis:
| Pregunta | Hipótesis alternativa | alternative |
|---|---|---|
| ¿A y B son diferentes? | \(\mu_A - \mu_B \neq 0\) | "two.sided" |
| ¿A > B? | \(\mu_A - \mu_B > 0\) | "greater" |
| ¿A < B? | \(\mu_A - \mu_B < 0\) | "less" |
Antes de elegir "greater" o "less": revise qué grupo corresponde a Mean 1 y cuál a Mean 2 en la salida de R. La dirección de la prueba se refiere a la diferencia Mean 1 - Mean 2, así que invertir el orden de los grupos invierte también el sentido de la hipótesis.
Si quisiéramos comparar el ingreso promedio entre personas de dos comunas del Gran Santiago. Si es una prueba t, ¿de una cola o de dos?
2.5 Interpretación
Hasta ahora, nos hemos enfocado en entender y aplicar conceptos claves en la estadística inferencial. Sin embargo, tan importante como eso es interpretar y reportar correctamente los hallazgos que entreguen las pruebas estadísticas. Por ejemplo, observemos la siguiente interpretación a la pregunta planteada en el práctico 3: ¿Existen diferencias entre los ingresos laborales promedio de las mujeres con hijos y las mujeres sin hijos?
Method | Alternative | Mean 1 | Mean 2 | M1 - M2 | t | df | p | 95% CI |
|---|---|---|---|---|---|---|---|---|
Welch Two Sample t-test | two.sided | 706,113.65 | 590,847.70 | 115,265.96 | 2.39 | 492.66 | .017* | [20564.30, 209967.62] |
Observamos que el ingreso de las mujeres sin hijos es diferente al de las mujeres con hijos, y que p es menor a 0.05. De tal modo, podemos comprobar que nuestra hipótesis es verdadera.
Antes de seguir, identifique al menos tres problemas en esta interpretación. Tome las siguientes preguntas como referencia:
- ¿Describe adecuadamente los resultados observados?
- ¿Presenta la evidencia inferencial necesaria?
- ¿Informa su decisión respecto a \(H_0\)?
- ¿Realmente comprueba que la hipótesis planteada es verdadera?
Notarán que la interpretación propuesta no cumple varias de estas condiciones. A continuación, vamos dar algunas recomendaciones para una buena interpretación estadística y plantear una nueva interpretación.
¿Qué debe tener una buena interpretación estadística?
- Resultado descriptivo: qué se observó en la muestra y en qué dirección. El tamaño de la muestra, la media, la desviación estándar, la diferencia, etc., según corresponda.
- Resultado inferencial: Mencionar de manera explícita las técnicas estadísticas utilizadas, reportando el estadístico que corresponda (el valor t en este caso), el valor p y el IC — reportados con sus valores, no solo mencionados.
- Decisión estadística explícita: se rechaza o no se rechaza \(H_0\) y con qué \(\alpha\).
- Conclusión sustantiva: Se debe responder la pregunta de investigación en lenguaje sociológico, no solo estadístico.
- Limitaciones: Se debe tener claro el alcance de los hallazgos, evitando sobreinterpretaciones (por ejemplo, un p significativo pero un efecto pequeño) afirmaciones grandilocuentes del tipo “comprobamos que la hipótesis es verdadera” o “establecemos que x es la causa de y”.
Teniendo en cuenta estas recomendaciones, volvemos a escribir la interpretación a los resultados.
“Los datos muestran que existe una diferencia de $115.265,96 entre los ingresos de las mujeres sin hijos (\(\bar{x}_1\)=706.113,65) y de las mujeres con hijos (\(\bar{x}_2\)=590.847,69). A través de una prueba t para diferencia de medias, se observó que esta diferencia es estadísticamente significativa al 95% de confianza (t=2,39; df=492,66; p=0.017, CI[20.564,30-209.967,62]). Por lo tanto, se rechaza la \(H_0\) de igualdad de medias entre los ingresos de mujeres con hijos y mujeres sin hijos. Los datos entregan evidencia de que el ingreso laboral promedio difiere entre las mujeres ocupadas con hijos y las mujeres ocupadas sin hijos. Ahora bien, los datos no permiten concluir que tener hijos sea la causa de esa diferencia.”
¿Qué interpretación sociológica le podemos dar estos hallazgos?
Lectura sugerida: Budig, M. J., & England, P. (2001). The wage penalty for motherhood. American Sociological Review, 66(2), 204–225. https://doi.org/10.2307/2657415
Adicionalmente, existen paquetes en R que pueden escribir interpretaciones de manera automática (en inglés), como report:
if (!require(report)) install.packages("report")
library(report)
test_goldin <- t.test(
ytrabajocor ~ grupo_hijo,
data = goldin_data,
alternative = "two.sided"
)
report::report(test_goldin)Effect sizes were labelled following Cohen's (1988) recommendations.
The Welch Two Sample t-test testing the difference of ytrabajocor by grupo_hijo
(mean in group Sin hijos = 7.06e+05, mean in group Con hijos = 5.91e+05)
suggests that the effect is positive, statistically significant, and small
(difference = 1.15e+05, 95% CI [20564.30, 2.10e+05], t(492.66) = 2.39, p =
0.017; Cohen's d = 0.22, 95% CI [0.04, 0.39])
Nunca se debe copiar y pegar la salida de report. Además de traducirla (si el reporte es en español), es necesario hacer ediciones, particularmente en el nombre de las variables y sus categorías. Una versión traducida y editada debería verse así:
La prueba t de Welch para dos muestras que evalúa la diferencia en los ingresos labores de mujeres con y sin hijos (\(\bar{x}_{sin hijos}\)=706.113,65, \(\bar{x}_{con hijos}\)=590.847,69) sugiere que el efecto es positivo, estadísticamente significativo y pequeño (diferencia = 115.265,96, IC 95% [20564,30, 209.967], t(492,66) = 2,39, p = 0,017; d de Cohen = 0,22, IC 95% [0,04, 0,39])
¿Por qué report indica que la diferencia es pequeña?
Porque estima un estadístico conocido como d de Cohen que permite estimar la magnitud del efecto. Se define como la diferencia entre las medias grupales divido por la desviación estándar agrupada de ambos grupos.
Cohen (1988) indicó que:
- d>0.2 son considerados pequeños
- d>0.5 son considerados medianos
- d>0.8 son considerado grandes
Por lo tanto, el efecto observado en este ejercicio (d=0.22) sería pequeño en relación a la desviación estándar observada.
3 Ejercicios de Integración e Interpretación
Trabajaremos nuevamente con proc_casen, que se carga con el código de más abajo.
load(url("https://github.com/cursos-metodos-facso/datos-ejemplos/raw/main/proc_casen.RData"))Buscaremos responder dos preguntas de investigación.
- ¿Cuál es la edad promedio de las personas que necesitan ayuda para moverse dentro de su casa?
- ¿Existen diferencias en el ingreso promedio de las personas con discapacidad y sin discapacidad?
3.0.1 Pregunta 1
¿Cuál es la edad promedio de las personas que necesitan ayuda para moverse dentro de su casa?
Preparar los datos
Ya cargamos la base de datos, ahora vamos a procesar la variable ayuda_moverse para responder la pregunta de investigación.
# Creamos un subset
subset_1 <- proc_casen |>
# Filtramos para dejar solo las personas que necesitan ayuda muchas veces (4) o siempre (5)
dplyr::filter(ayuda_moverse >= 4)Estadísticos descriptivos
Como sabemos que vamos a necesitar el tamaño de la muestra, así como el promedio y la desviación estándar de edad.
n_edad <- nrow(subset_1)
media_edad <- mean(subset_1$edad)
sd_edad <- sd(subset_1$edad)
n_edad[1] 2364
media_edad[1] 73.15398
sd_edad[1] 18.78623
Con esto ya tenemos una estimación puntual de la edad de las personas que necesitan ayuda para moverse en su casa: 73,15 años para nuestra muestra de 2364 casos, con una desviación estándar de 18.79.
Calcular el error estándar
Recordemos que el error estándar del promedio está definido por:
\[ SE = \frac{s}{\sqrt{n}} \]
En R, esto se calcularía así:
se_edad <- sd_edad/sqrt(n_edad)
se_edad[1] 0.3863812
El error estándar de la media de edad de 0.39 años.
Definir la probabilidad de error \(\alpha\) y el valor crítico
Seguiremos la convención de de \(\alpha\)=0.05, lo que se corresponde con el valor crítico de 1,96.
Calcular el intervalo de confianza
La formula del intervalo de confianza para el promedio es:
\[ IC = \bar{x} \pm z_{\alpha/2} \cdot SE \]
Calculemos en R:
lim_inferior <- media_edad - 1.96 * se_edad
lim_superior <- media_edad + 1.96 * se_edad
lim_inferior[1] 72.39667
lim_superior[1] 73.91128
Noten que en este ejercicio no es necesario realizar una prueba t, pues no estamos comparando grupos. Basta estimar de forma correcta un intervalo de confianza para responder la pregunta de investigación.
Interpretación
A partir de una muestra 2364 personas, se estimó que la edad promedio de las personas que necesitan ayuda para moverse en su casa es de 73.15 años, con una desviación estándar de 18.79 años. Considerando un nivel de 95% de confianza (SE=0.39), se puede afirmar que la edad promedio en la población se encuentra entre los 72.4 y los 73.9 años.
Lo de arriba es una interpretación estadística de los resultados. Para dar una interpretación sociológica valdría la pena remitirnos, por ejemplo, a la literatura sobre envejecimiento o tareas de cuidado en Chile.
3.0.2 Pregunta 2
¿Existen diferencias en el ingreso promedio de las personas con discapacidad y sin discapacidad?
Procesar los datos
Ya hemos trabajado antes con la variable ytrabajocor, que indica los ingresos laborales de los individuos. Identificaremos las personas con y sin discapacidad con la variable disc_fisica, que indica que 1=no tiene discapacidad y 2=tiene discapacidad. Vamos a limpiar los casos perdidos y ponerle etiquetas a disc_fisica
# Creamos un subset con las variables de interés
subset_2 <- proc_casen |>
dplyr::select(ytrabajocor, disc_fisica)
# Eliminamos los casos con información faltante
subset_2 <- na.omit(subset_2)
# Reemplazamos los códigos de la variable `disc_fisica` por etiquetas
subset_2$disc_fisica <- factor(
subset_2$disc_fisica,
levels = c(1, 2),
labels = c(
"No tiene discapacidad",
"Tiene discapacidad"
)
)Aprovechemos también de hacer una exploración descriptiva de los datos
subset_2 |>
dplyr::group_by(disc_fisica) |>
dplyr::summarise(
N = dplyr::n(),
Media = mean(ytrabajocor),
SD = sd(ytrabajocor)
)# A tibble: 2 × 4
disc_fisica N Media SD
<fct> <int> <dbl> <dbl>
1 No tiene discapacidad 86245 667067. 814001.
2 Tiene discapacidad 2615 687027. 893880.
¿Qué podemos observar en esta tabla?
Ejercicio autónomo
Para seguir, responda las siguientes preguntas:
- ¿Cuál es la hipótesis nula? ¿Y la alternativa?
- ¿La pregunta de investigación requiere de una hipótesis direccional o no direccional? ¿Por qué?
- Complete y ejecute la prueba
t.test(
ytrabajocor ~ disc_fisica,
data = subset_2,
alternative = "________"
)- Interprete estadística y sociológicamente.
4 Síntesis
Hoy integramos lo aprendido en sesiones anteriores: estimación de intervalo de confianza y contraste con valor crítico para diferencia de medias (prueba t) y de proporciones (Z). Además, vimos la dirección de la hipótesis, ejecutar el análisis en R, e interpretar los resultados de manera correcta.
El dominio de estas herramientas nos permite pasar desde la mera descripción de una muestra a ser capaces de inferir y sacar conclusiones sobre la población de estudio. En la sociología, utilizamos estás técnicas para generar conocimiento sobre la sociedad basada en evidencia estadística.