cuánta de la variabilidad de una variable se debe a otra variable.
“Se debe a” implica causalidad. Mejor: “qué proporción de variabilidad comparten ambas variables”.
cuánta de la variabilidad de una variable se debe a otra variable.
“Se debe a” implica causalidad. Mejor: “qué proporción de variabilidad comparten ambas variables”.
varianza total de una variable que es explicada por otra
“Explicada por” puede sonar causal. Mejor hablar de varianza compartida o asociada.
correlaciones con un tamaño de efecto muy pequeño,
Aquí (r=.31) y (r=.37) son moderadas según los criterios presentados, no muy pequeñas.
4) A medida que aumenta el tamaño muestral, el valor
Agregar “manteniendo un tamaño de efecto similar”. Un mayor (N) no garantiza siempre un (p) menor.
evidencia a favor de que no hay asociación
(p>.05) no demuestra ausencia de asociación; solo indica evidencia insuficiente para rechazar (H_0).
cor_results <- cor.test
Conviene fijar (alpha=.05) antes de observar el valor (p).
comprobar si un respectivo r existe en la población,
Aquí conviene distinguir (r) muestral de (rho) poblacional y evitar “comprobar”.
¿La asociación observada entre dos variables es representativa a nivel de la población?
“Representativa” puede confundirse con representatividad muestral. Mejor preguntar si existe evidencia de asociación a nivel poblacional.
Si una variable aumenta, la otra también
Mejor usar “tiende a aumentar”. La correlación describe un patrón, no una relación determinista. Igual para el de abajo.
a medida que las personas alcanzan edades mayores, sus ingresos laborales disminuyen
Con (r=-.05), la asociación es prácticamente nula. Conviene evitar una conclusión sustantiva tan fuerte.
url_casen <- "https://bid-ckan.ministeriodesarrollosocial.gob.cl/dataset/105286d9-10a8-410a-b060-a335f3168a46/resource/cacc6ad5-fca1-4476-82f1-b7ea119fae98/download/casen_2024.rdata" # Dirección oficial de CASEN 2024 load( url(url_casen) # Carga la base directamente desde Internet )
Yo tuve algunos problemas cargando esta base al ser tan pesada en algunos compus de la sala. Podriamos agregarla al github de datos y cortada para estar seguros que a todos le funcione.
Tengo que el promedio de salarios de la muestra es: 900.000
Revisaría este valor: al inicio del ejercicio se establece un promedio de salarios de $850.000 y el intervalo posterior también se calcula utilizando $850.000. Acá probablemente debería decir $850.000.
El análisis resultó en un valor t de 50.00, indicando una diferencia estadísticamente significativa entre los dos grupos (p < .01).
Arriba establecimos 300.000 de dif y un T de 20. Aquí se cambiaron los valores.
p < .01
Creo que acá sería útil detenerse en la interpretación de p. Podría agregar algo Asi: Si p < alpha permite rechazar H0, pero p no representa la probabilidad de que H0 sea verdadera. También podríamos recordar que al rechazar H0 sigue existiendo la posibilidad de cometer Error Tipo I.
Intervalo al 95% de confianza:
Acá conviene recordar explícitamente que, cuando trabajamos con una diferencia de medias, el valor de referencia de H0 es 0. Podríamos preguntar: ¿qué implicaría que el intervalo incluya 0?
intervalo de confianza al 95%
Podríamos agregar una pregunta breve abajo: si con los mismos datos construyéramos un IC99%, ¿sería más ancho o más estrecho que el IC95%?
El error estándar (SE, por Standard Error) del promedio es:
Quizás podríamos aprovechar este punto para hacer explícita la relación entre tamaño muestral y error estándar. Preguntar brevemente: si mantenemos una desviación estándar similar pero aumenta \(n\), ¿qué ocurre con el SE y con la precisión de la estimación? Esto ayudaría a preparar el razonamiento conceptual que después se evalúa.
Hoy integramos lo aprendido en sesiones anteriores:
Como este es el último práctico antes de la evaluación, se podria agregar un checklist. distinguir estimación de comparación de grupos; explicar la diferencia entre SD y SE; construir e interpretar un intervalo de confianza; formular H0 y HA cuando corresponde; distinguir una prueba de una o dos colas; identificar Mean 1, Mean 2 y el signo de Mean 1 - Mean 2; interpretar t, p e IC de manera conjunta; comparar p con alpha y decidir respecto de H0; responder finalmente la pregunta sustantiva; distinguir una diferencia estadística de una afirmación causal.
Decisión estadística explícita
Aclararía que la decisión debe formularse como rechazar o no rechazar H0
Por lo tanto, se rechaza la
agregaría inmediatamente una conclusión sustantiva que responda la pregunta de investigación.--> En términos sustantivos, los datos entregan evidencia de que el ingreso laboral promedio difiere entre las mujeres ocupadas con hijos y las mujeres ocupadas sin hijos. Estos resultados muestran una diferencia entre grupos, pero no permiten concluir que tener hijos sea la causa de esa diferencia.
¿Que está mal con esta interpretación?
Mantendría este ejercicio y lo aprovecharía más. Algo así: Antes de seguir, identifique al menos tres problemas en esta interpretación.
Piense especialmente:
¿Describe adecuadamente los resultados observados? ¿Presenta la evidencia inferencial necesaria? ¿La decisión respecto de H0 está correctamente formulada? ¿Es correcto decir que “comprobamos que nuestra hipótesis es verdadera”?
Pregunta Hipótesis alternativa alternative
Agregaría debajo de la tabla un recordatorio sobre el orden de los grupos: Antes de elegir "greater" o "less": revise qué grupo corresponde a Mean 1 y cuál a Mean 2. La dirección de la prueba se refiere a la diferencia Mean 1 - Mean 2.
Pero primero, volvamos a los contenidos que desarrollados en esta unidad.
Agregaría aquí una frase muy breve sobre muestra/población y estadístico/parámetro. Algo Asi: Antes de comenzar, recordemos la idea que conecta toda la unidad: observamos estadísticos en una muestra para obtener información sobre parámetros de una población.
Error estándar: Desviación estándar de los promedios de distintas muestras de una misma población.
Agregaría explícitamente la distinción entre desviación estándar y error estándar. Desviación estándar: describe cuánto se dispersan los valores individuales alrededor de la media.
Error estándar: describe cuánto esperamos que varíe una media muestral entre diferentes muestras de una misma población y nos informa sobre la precisión de la estimación.
Intervalos de confianza: Rango de probabilidad de un parámetro poblacional
Intervalo de confianza: rango de valores construido a partir de una muestra para estimar un parámetro poblacional. En un IC del 95%, el procedimiento produciría intervalos que contienen el verdadero parámetro en aproximadamente el 95% de muestras repetidas.
Teorema central del límite: Define que al calcular un estadístico de distintas muestra de una misma población, estos valores seguirán una distribución normal
Teorema central del límite: al tomar muchas muestras de una misma población, la distribución de sus medias muestrales tiende a aproximarse a una distribución normal a medida que aumenta el tamaño de la muestra.
Hipótesis nula: Hipótesis contraria a nuestra teoría. Se expresa como
Conviene mantener el lenguaje utilizado en el Práctico 3: Hipótesis nula (H0): escenario de referencia que plantea la ausencia de la diferencia o relación que queremos evaluar. Analizamos si los datos entregan evidencia suficiente para rechazarlo.
Realice la inferencia y haga la interpretación de los resultados
Daría el esqueleto de t.test() y dejaría solamente alternative por completar. Así el foco del ejercicio queda en tomar decisiones inferenciales, no en recordar la sintaxis de R.
Ejercicio autónomo
Podria quedar asi?
¿Esta pregunta busca estimar un parámetro o comparar grupos? ¿Qué procedimiento corresponde? Identifique Mean 1 y Mean 2. ¿Qué diferencia calculará R como Mean 1 - Mean 2? Formule H0 y HA. ¿La hipótesis es direccional o no direccional? ¿Corresponde utilizar "two.sided", "greater" o "less"? Antes de observar los resultados, establezca alpha = .05.
*Después de ejecutar la prueba
¿Qué muestran descriptivamente las medias y su diferencia? ¿Qué signo tiene t y qué indica sobre la dirección de la diferencia? ¿El valor p es menor o mayor que alpha? ¿El IC del 95% contiene el valor 0? ¿Rechazamos o no rechazamos H0? Responda la pregunta de investigación en lenguaje sustantivo. ¿Qué conclusión no podemos establecer a partir de esta comparación?
Para seguir, responda las siguientes preguntas:
Como este es el último práctico antes de la evaluación, haría que esta segunda pregunta sea el ejercicio integrador principal. Daría más andamiaje, pero sin entregar las respuestas.
Los 5 pasos de la inferencia
Cambiaría el nombre a “Los 5 pasos de una prueba de hipótesis”.
2.2
antes de la tabla agregaría algo muy breve:
En esta unidad hemos trabajado dos formas de hacer inferencia:
Estimar un parámetro → estimación puntual + SE + IC
Comparar grupos → hipótesis + prueba t + p/IC + decisión
Los 5 pasos de la inferencia estadística
En esta pregunta reemplazaría los 5 pasos por una ruta específica de estimación. Como queremos estimar una edad promedio poblacional, no necesitamos formular H0 y HA. Sería mejor organizar el ejercicio como: parámetro → estimación puntual → error estándar → intervalo de confianza → interpretación.
Redacción sugerida: Pasos para estimar un parámetro poblacional
Identificar el parámetro que queremos estimar. Obtener una estimación puntual a partir de la muestra. Calcular el error estándar de la estimación. Construir el intervalo de confianza. Interpretar el resultado en función de la pregunta de investigación.
¿Se podría realizar un test de hipótesis en este caso? En estricto rigor, sí. Sin embargo, la conclusión que obtendríamos es que la edad promedio de las personas que necesitan ayuda para moverse en casa es distinta a 0.
Eliminaría este párrafo del recorrido principal. Acabamos de establecer que esta es una pregunta de estimación, por lo que introducir inmediatamente una prueba contra u=0 puede confundir la distinción entre estimar un parámetro y contrastar una hipótesis. Además, que la edad media sea distinta de 0 no responde sustantivamente nuestra pregunta.
Integración e Interpretación de Inferencia
Creo que sería importante hacer más visible desde el comienzo que en esta unidad hemos trabajado dos caminos distintos de inferencia:
Estimación → media → error estándar → intervalo de confianza → interpretación
Comparación de grupos → H0/HA → dirección → prueba t → p e IC → decisión → conclusión sustantiva
Actualmente esta distinción aparece, pero después se mezcla un poco, especialmente en la primera pregunta. Creo que ordenar el práctico alrededor de estas dos rutas ayudaría mucho para la evaluación.
Integración e Interpretación de Inferencia
Como este es el último práctico antes de la evaluación. La prioridad debería ser que al finalizar los estudiantes puedan reconocer qué procedimiento corresponde según la pregunta, ejecutarlo e interpretar correctamente los resultados.
Generalmente, nuestro objetivo será rechazar la hipótesis nula
Reemplazar por: “Nuestro objetivo no es rechazar H₀ a toda costa, sino evaluar si los datos entregan evidencia suficiente para rechazarla. Un resultado en que no rechazamos H₀ también es un resultado estadístico válido.
95 percent confidence interval: 31054.71 Inf
Hasta ahora los estudiantes han trabajado intervalos con límite inferior y superior. R entrega un intervalo unilateral. Esto es clave o se modifica el ejerció para trabajar con ambos intervalos o explicamos esto antes.
Por tanto, con un 95% de confianza, rechazamos
La decisión del test debería vincularse directamente con p y α, no expresarse como “con un 95% de confianza”. Reemplazar por: “Como p = 0,0099 es menor que α = 0,05, rechazamos H₀. Los datos entregan evidencia estadística a favor de que la diferencia va en la dirección planteada: el promedio del grupo 1 es mayor que el del grupo 2.”
alternative = "greater", # define la hipótesis alternativa
alternative = "greater", # Hₐ: media del grupo 1 - media del grupo 2 > 0. “Como sexo = 1 aparece como primer grupo y sexo = 2 como segundo, debemos saber qué representa cada código antes de interpretar greater.
A esto también se le llama hipótesis de dos colas
No toda comparación entre grupos es una prueba de dos colas. Es de dos colas cuando la hipótesis alternativa plantea simplemente que los grupos son diferentes, sin anticipar cuál será mayor. Reemplazar por: “Si nuestra hipótesis plantea solamente que los grupos son diferentes, sin especificar cuál tendrá un promedio mayor, utilizamos una prueba de dos colas o no direccional.”
Hasta ahora, hemos aprendido a contrastar hipótesis sobre diferencias entre grupos
ahora estamos introduciendo formalmente el contraste de hipótesis. Reemplazar por: “Ahora vamos a aprender a contrastar hipótesis sobre diferencias entre grupos.”
las pruebas de hipótesis nos ayudan a determinar si el resultado que obtenemos en nuestra muestra es un efecto real/extrapolable a la población o un error.
Reemplazar por: “Las pruebas de hipótesis nos permiten evaluar qué tan compatibles son los resultados observados en nuestra muestra con una hipótesis planteada sobre la población.”
Para este punto, recurriremos a todas las herramientas que hemos aprendido hasta ahora:
La tabla que sigue vuelve a presentar cinco definiciones, pero no muestra qué papel cumplirá cada una en el nuevo problema.
2 Test de hipótesis
salto conceptual de la guía. Conviene conectar explícitamente la incertidumbre trabajada con IC con la nueva pregunta de contraste. Agregar inmediatamente después del título: “Hasta ahora utilizamos el error estándar para expresar la incertidumbre de una estimación mediante intervalos de confianza. Ahora usaremos esa misma idea de variabilidad muestral para responder una nueva pregunta: ¿una diferencia observada entre dos grupos es suficientemente incompatible con lo que esperaríamos si en la población no existiera esa diferencia?”
En términos convencionales, el resultado será significativo si podemos establecerlo con un nivel de confianza del 95%.
Aquí se mezclan nivel de confianza y significación estadística. Construir un IC95% no hace que un “resultado sea significativo”; la significación aparecerá después al contrastar una hipótesis respecto de un valor de referencia. se podria reemplazar por: “Utilizaremos un nivel de confianza del 95%, uno de los niveles convencionales trabajados en la clase anterior.”
ee_100 <- desv_estandar / sqrt(100) # Calcula el error estándar para 25 casos ee_500 <- desv_estandar / sqrt(500) # Calcula el error estándar para 100 casos
Cambiar el comentario por: # Calcula el error estándar para 100 casos Idem para el de 500 con 100.
Esto quiere decir que las medias de las distintas muestras de una misma población varían en 0.18.
Puede interpretarse como si todas las medias se alejaran exactamente 0,18. El error estándar describe la dispersión esperada de la distribución de medias muestrales. Reemplazar por: “Esto quiere decir que el error estándar estimado de la distribución de medias muestrales es 0,18: nos indica cuánto tienden a variar las medias entre posibles muestras de igual tamaño.”
No son necesarios para que el código funcione, pero son útiles en este caso para poder explicar que función cumple cada sección del código. Todo lo que aparece a la derecha de un # no es ejecutado por el programa.
Se podría simplificar a: “todo lo escrito después de # es un comentario para explicar el código o texto. R no lo ejecuta.”
calculemos un intervalo de confianza para una muestra de 200 casos, con media = 10 y desviación estándar = 4.
Hay una inconsistencia entre el texto y el código: el texto anuncia n = 200, media 10 y DE 4, pero el código genera 100 valores con media 5 y DE 2. Reemplazar por: “Retomemos el mismo ejemplo del práctico anterior: un vector de 100 valores simulados con media 5 y desviación estándar 2.”
los intervalos de confianza representan la probabilidad de que la media poblacional se encuentre en su rango
Reemplazar por: “El nivel de confianza describe qué tan frecuentemente este procedimiento produciría intervalos que contienen la verdadera media poblacional si repitiéramos muchas veces el muestreo.”
un intervalo de confianza es un rango de valores plausibles que contiene la media poblacional
Error conceptual. Reemplazar por: “un intervalo de confianza es un rango de valores plausibles para la media poblacional, construido a partir de la información de nuestra muestra.”
ealizar pruebas de hipótesis, tanto para diferencias de medias como direccionales utilizando la prueba t.
Reemplazar por: “realizar pruebas de hipótesis para comparar medias entre dos grupos mediante la prueba t, distinguiendo entre hipótesis direccionales y no direccionales.”
Ejercicios de test de hipótesis
El segundo objetivo queda demasiado general. Reemplazar por: “2. Formular hipótesis, realizar una prueba t en R e interpretar sus principales resultados.”
Distribución Normal e Intervalos de Confianza
Antes de cada bloque de código, convendría señalar qué se hará y para qué sirve. Después, se podría indicar qué resultado deberían observar y cómo interpretarlo.
Se introducen varios conceptos nuevos al mismo tiempo. Quizás sería mejor avanzar de manera más gradual
Sería importante diferenciar con mayor claridad la desviación estándar del error estándar: la primera describe la dispersión de los datos, mientras que el segundo indica cuánto podría variar una media entre distintas muestras.
También convendría distinguir la distribución de los datos de la distribución muestral de las medias, porque pueden confundirse fácilmente.
Los puntajes z aparecen de manera un poco rápida. Podría explicarse primero, de forma intuitiva, que indican a cuántas desviaciones estándar se encuentra un valor respecto de la media.
Al presentar pnorm(), sería útil aclarar que entrega la probabilidad acumulada a la izquierda de un valor y no la probabilidad de obtener exactamente ese valor.
En este gráfico, plot() y abline() deben ejecutarse en líneas separadas. El signo + se utiliza para agregar capas en ggplot2, pero no funciona de esa forma con los gráficos de R base.
En el eje vertical de la curva normal corresponde hablar de “densidad” y no de “probabilidad”, porque dnorm() calcula valores de densidad.
Sería mejor evitar instalar y cargar varios paquetes si el práctico puede realizarse con R base. Esto reduce posibles errores y permite concentrarse en los contenidos estadísticos.
Para calcular manualmente el intervalo de confianza, convendría utilizar el valor crítico de la distribución t. Si se usa 1,96, el resultado no coincidirá exactamente con el obtenido mediante t.test().
Para construir un intervalo de confianza del 99 %, corresponde utilizar alpha = 0.01, no alpha = 0.05.
La interpretación del intervalo de confianza podría ajustarse. No significa que exista un 95 % de probabilidad de que el parámetro esté dentro del intervalo ya calculado, sino que el procedimiento utilizado produce intervalos que contienen el parámetro en aproximadamente el 95 % de las muestras repetidas.
Conviene utilizar de manera consistente el término “error estándar” y no emplear “error muestral” como si fueran equivalentes.
Sería útil incluir primero un ejercicio completamente guiado y luego otro con una plantilla o algunas pistas, antes de pedir una actividad autónoma.
Algunas preguntas, como “calcule”, “describa” o “analice”, podrían ser más específicas. Por ejemplo, se puede indicar qué medida calcular, qué resultado observar y qué aspectos debe mencionar la interpretación.
el práctico parece bastante extenso. Sugiero concentrar la sesión en, la desviación estándar, el error estándar y el intervalo de confianza del 95 %. puntajes z
pnorm(), el intervalo del 99 % y la comparación entre distintos tamaños muestrales podrían dejarse como profundización o trabajo autónomo.
eds x
se paso
Ver si el % de missing se calcular por toda la master o x modulos de cada una
Entregable Mes 2 (fin semana 8): Insumos para “Informe regional preliminar” + paquete de visualizaciones (editable) + scripts reproducibles.
Acá podríamos aclarar qué significa insumos para informe. También convendría ajustar el “+” en la frase, porque puede leerse como si el paquete de visualizaciones fuera algo aparte de los insumos, cuando en realidad las visualizaciones también son insumos del informe. Una posible redacción seria: “Insumos para el informe (base final + tablas + visualizaciones) + scripts reproducibles”.
Scripts reproducibles
Acá podríamos definir qué entendemos por reproducible, como estructura de carpetas (IPO)
tab_corr.
Se podria agregar una segunda tabla con Spearman
1021
No está de acuerdo con el output de los casos perdidos (1025)