pacman::p_load(dplyr, # Manipulación datos
gginference, # Visualización
rempsyc, # Reporte
kableExtra, # Tablas
broom, # Varios
flextable # nice table
)
options(scipen = 999) # para desactivar notación científica
rm(list = ls()) # para limpiar el entorno de trabajoResolución ejercicio 2 - práctico 2
Sesión del miércoles, 19 de agosto de 2026
1 Solución ejercicio 2 práctico 2
Carga de paquetes
Carga de la base de datos
load(url("https://github.com/cursos-metodos-facso/datos-ejemplos/raw/main/proc_casen.RData")) #Cargar base de datosSelección de variables y generación de subset de datos
set.seed(123)
goldin_data <- proc_casen %>% # crear subset a partir de la base proc_casen
dplyr::select(ocupado, sexo, ytrabajocor, hijo) %>% # selección de variables
dplyr::filter(ocupado == 1 & sexo == 2) %>% # se filtra solo por mujeres ocupadas
sample_n(1500) %>% # submuestra de 1500
na.omit()# creamos subset Ahora generamos una tabla de descriptivos de los ingresos (ytrabajocor) según si las observaciones tienen hijos o no (hijo),
goldin_data %>%
dplyr::group_by(hijo) %>%
dplyr::summarise(Obs. = n(),
Media = mean(ytrabajocor, na.rm = T),
DS = sd(ytrabajocor, na.rm = T)) %>%
kableExtra::kable(format = "markdown") # hacemos la tabla| hijo | Obs. | Media | DS |
|---|---|---|---|
| 0 | 353 | 706113.7 | 830191.0 |
| 1 | 1098 | 590847.7 | 638006.8 |
Ahora vamos con los 5 pasos de la inferencia
1. Formulación de hipótesis
El primer paso es traducir nuestra pregunta a una hipótesis estadística contrastable. Para ello cabe preguntarse, ¿direccional o no direccional? En este caso, es una hipótesis no direccional (distinto que)
Luego, debemos establecer las hipótesis nula y alternativa:
(\(H_0\)): El promedio salarial de las mujeres sin hijos es distinto que el promedio salarial de las mujeres con hijos.
(\(H_A\)): El promedio salarial de mujeres sin hijos no será diferente al promedio salarial de las mujeres con hijos.
Pasos 2, 3 y 4 de una vez con R
Siguiendo el ejemplo del Ejercicio 1, utilizaremos el software para estimar el test de hipótesis con un 95% de confianza.
test_ej2 <- t.test(goldin_data$ytrabajocor ~ goldin_data$hijo,
alternative = "two.sided",
conf.level = 0.95)
test_ej2
Welch Two Sample t-test
data: goldin_data$ytrabajocor by goldin_data$hijo
t = 2.3914, df = 492.66, p-value = 0.01716
alternative hypothesis: true difference in means between group 0 and group 1 is not equal to 0
95 percent confidence interval:
20564.3 209967.6
sample estimates:
mean in group 0 mean in group 1
706113.7 590847.7
stats.table <- tidy(test_ej2, conf_int = T)
nice_table(stats.table, broom = "t.test")Method | Alternative | Mean 1 | Mean 2 | M1 - M2 | t | df | p | 95% CI |
|---|---|---|---|---|---|---|---|---|
Welch Two Sample t-test | two.sided | 706,113.65 | 590,847.70 | 115,265.96 | 2.39 | 492.66 | .017* | [20564.30, 209967.62] |
A partir de los resultados obtenidos: ¿es posible rechazar la hipótesis planteada?
Con un 95% de confianza es posible rechazar la hipótesis nula planteada. La diferencia del promedio salarial entre las mujeres sin hijos y con hijos es estadísticamente significativa.