miércoles, 10 de octubre de 2018

ji cuadrada

En primer lugar usaremos el estadístico ji-cuadrado para probar la asociación entre dos variables, y luego lo usaremos para evaluar en qué medida se ajusta la distribución de frecuencias obtenida con los datos de una muestra, a una distribución teórica o esperada.
En términos generales, esta prueba contrasta frecuencias observadas con las frecuencias esperadas de acuerdo con la hipótesis nula. Al igual que en el caso de las pruebas anteriormente presentadas, ilustraremos con ejemplos.
Ji- cuadrado como prueba de asociación
Supongamos que un investigador está interesado en evaluar la asociación entre uso de cinturón de seguridad en vehículos particulares y el nivel socioeconómico del conductor del vehículo. Con este objeto se toma una muestra de conductores a quienes se clasifica en una tabla de asociación, encontrando los siguientes resultados:

Uso de cinturónNivel socioeconómico bajoNivel socioeconómico medioNivel socioeconómico altoTOTAL
SI8152851
NO13161443
TOTAL21314294
Tabla I. Tabla de asociación, valores observados.
¿Permiten estos datos afirmar que el uso del cinturón de seguridad depende del nivel socioeconómico? Usaremos un nivel de significación alfa=0,05.
Los pasos del análisis estadístico en este caso son los siguientes:
1. En primer lugar se debe plantear las hipótesis que someteremos a prueba
H0: “El uso de cinturón de seguridad es independiente del nivel socioeconómico”.
H1: “El uso de cinturón de seguridad depende del nivel socioeconómico”.
En esta prueba estadística siempre la hipótesis nula plantea que las variables analizadas son independientes.
2. En segundo lugar, obtener (calcular) las frecuencias esperadas
Estas son las frecuencias que debieran darse si las variables fueran independientes, es decir, si fuera cierta la hipótesis nula.
Las frecuencias esperadas se obtendrán de la distribución de frecuencias del total de los casos, 51 personas de un total de 94 usan el cinturón y 43 de 94 no lo usan. Esa misma proporción se debería dar al interior de los tres grupos de nivel socioeconómico, de manera que el cálculo responde al siguiente razonamiento: si de 94 personas 51 usan cinturón; de 21 personas, ¿cuántas debieran usarlo?
La respuesta a esta pregunta se obtiene aplicando la “regla de tres” y es 11,4. Este procedimiento debe repetirse con todas las frecuencias del interior de la tabla.
El detalle de los cálculos es el siguiente:
Nivel bajo: (21x51/94)=11,4-(21x43/94)=9,6
Nivel medio: (31x51/94)=16,8-(31x43/94)=14,2
Nivel alto: (42x51/94)=22,8-(42x43/94)=19,2
Estas son las frecuencias que debieran presentarse si la hipótesis nula fuera verdadera y, por consiguiente, las variables fueran independientes.
Estos valores los anotamos en una tabla con las mismas celdas que la anterior; así tendremos una tabla con los valores observados y una tabla con los valores esperados, que anotaremos en cursiva, para identificarlos bien.
Uso de cinturónNivel bajoNivel medioNivel altoTOTAL
SI11,416,822,851
NO9,614,219,243
TOTAL21314294
Tabla II. Tabla de asociación, valores esperados.
3. En tercer lugar se debe calcular el estadístico de prueba
En este caso, el estadístico de prueba es Ji-cuadrado que, como dijimos al comienzo, compara las frecuencias que entregan los datos de la muestra (frecuencias observadas) con las frecuencias esperadas, y tiene la siguiente fórmula cálculo:

 donde oi  representa a cada frecuencia observada y ei representa a cada frecuencia esperada.
De este modo el valor del estadístico de prueba para este problema será:
Entonces  Este es el valor de nuestro estadístico de prueba que ahora, siguiendo el procedimiento de problemas anteriores (paso 4), debemos comparar con un valor de la tabla de probabilidades para ji-cuadrado (x2). Esta tabla es muy parecida a la tabla t de student, pero tiene sólo valores positivos porque ji-cuadrado sólo da resultados positivos. Véase gráfico 1, que muestra la forma de la curva, con valores desde 0 hasta infinito.
 
Gráfico 1.
Dado que el estadístico ji cuadrado sólo toma valores positivos, la zona de rechazo de la hipótesis nula siempre estará del lado derecho de la curva.
Uso de tabla ji-cuadrado
La tabla de ji-cuadrado tiene en la primera columna los grados de libertad y en la primera fila la probabilidad asociada a valores mayores a un determinado valor del estadístico (véase gráfico de la tabla III).
Los grados de libertad dependen del número de celdas que tiene la tabla de asociación donde están los datos del problema y su fórmula de cálculo es muy sencilla:
Grados de libertad (gl)=(nº de filas–1)x(nº de columnas–1)
Así, en nuestro ejemplo, en que hay 2 filas y 3 columnas, los grados de libertad serán:
gl=(2-1)x(3-1)=2
Nótese que no se consideran la fila ni la columna de los totales.

 

jueves, 13 de septiembre de 2018

DISTRIBUCCION MUESTRAL DE PROPORCIONES

Existen ocasiones en las cuales no estamos interesados en la media de la muestra, sino que queremos investigar la proporción de artículos defectuosos o la proporción de personas con teléfono, etc en la muestra. La distribución muestral de proporciones es la adecuada para dar respuesta a estas situaci ones. Esta distribución se genera de igual manera que la distribución muestral de medias, a excepción de que al extraer las muestras de la población s e calcula el estadístico proporción (p=x/n en donde “ x” es el número de éxitos u observaciones de interés y “ n” el tamaño de la muestra) en lugar de la media de cada muestra que era lo que calculamos antes.

La distribución muestral de proporciones está estrechamente relacionada con la distribución binomial; una distribución binomial es una distribución del total de éxitos en las muestras, mientras que una distribución de proporciones es la distribución de un promedio (media) de los éxitos. Como consecuencia de esta relación, las afirmaciones probabilísticas referentes a la proporción muestral pueden evaluarse usando la aproximación normal a la binomial, siempre que: np ≥ 5 y n(1- p) ≥ 5 Una distribución binomial es, por ejemplo, si echamos una moneda al aire y observamos el lado que cae. Está claro que sólo hay dos posibilidades. Ahora bien, la probabilidad de que caiga la moneda de cualquier lado es la misma siempre que ésta no esté cargada. C omo cada caso tiene igual probabilidad de ocurrir, y siendo la s uma de probabilidades siempre igual a 1, entonces la probabilidad de que caiga la moneda de algún lad o es 0.5. Si realizamos el experimento n veces y queremos saber la probabilida d de que salga águila o sol x veces, entonces usamos una distribución binomial.

jueves, 6 de septiembre de 2018

DISTRIBUCIÓN DE MUESTRAS DE MEDIA



Distribución Muestral de Diferencia de Medias

Suponga que se tienen dos poblaciones distintas, la primera con media 1 y desviación estándar 1, y la segunda con media y desviación estándar 2. Más aún, se elige una muestra aleatoria de tamaño n1 de la primera población y una muestra independiente aleatoria de tamaño n2 de la segunda población; se calcula la media muestral para cada muestra y la diferencia entre dichas medias. La colección de todas esas diferencias se llama distribución muestral de las diferencias entre medias o la distribución muestral del estadístico 

La distribución es aproximadamente normal para n130 y n230. Si las poblaciones son normales, entonces la distribución muestral de medias es normal sin importar los tamaños de las muestras.

En ejercicios anteriores se había demostrado que y que , por lo que no es difícil deducir que  y que .
La fórmula que se utilizará para el calculo de probabilidad del estadístico de diferencia de medias es:
Ejemplo:
En un estudio para comparar los pesos promedio de niños y niñas de sexto grado en una escuela primaria se usará una muestra aleatoria de 20 niños y otra de 25 niñas. Se sabe que tanto para niños como para niñas los pesos siguen una distribución normal. El promedio de los pesos de todos los niños de sexto grado de esa escuela es de 100 libras y su desviación estándar es de 14.142, mientras que el promedio de los pesos de todas las niñas del sexto grado de esa escuela es de 85 libras y su desviación estándar es de 12.247 libras. Si  representa el promedio de los pesos de 20 niños y es el promedio de los pesos de una muestra de 25 niñas, encuentre la probabilidad de que el promedio de los pesos de los 20 niños sea al menos 20 libras más grande que el de las 25 niñas.

Solución:
Datos:
= 100 libras
2 = 85 libras
= 14.142 libras
= 12.247 libras
n1 = 20 niños 
n2 = 25 niñas
 = ?

Por lo tanto, la probabilidad de que el promedio de los pesos de la muestra de niños sea al menos 20 libras más grande que el de la muestra de las niñas es 0.1056.

martes, 4 de septiembre de 2018

TEOREMA DE LIMITE CENTRQL (TLC)

El teorema del límite central es un teorema fundamental de probabilidad y estadística. El teorema describe la distribución de la media de una muestra aleatoria proveniente de una población con varianza finita. Cuando el tamaño de la muestra es lo suficientemente grande, la distribución de las medias sigue aproximadamente una distribución normal. El teorema se aplica independientemente de la forma de la distribución de la población. Muchos procedimientos estadísticos comunes requieren que los datos sean aproximadamente normales. El teorema de límite central le permite aplicar estos procedimientos útiles a poblaciones que son considerablemente no normales. El tamaño que debe tener la muestra depende de la forma de la distribución original. Si la distribución de la población es simétrica, un tamaño de muestra de 5 podría producir una aproximación adecuada. Si la distribución de la población es considerablemente asimétrica, es necesario un tamaño de muestra más grande. Por ejemplo, la distribución de la media puede ser aproximadamente normal si el tamaño de la muestra es mayor que 50. Las siguientes gráficas muestran ejemplos de cómo la distribución afecta el tamaño de la muestra que se necesita. Muestras de una población uniforme
Una población que sigue una distribución uniforme es simétrica, pero marcadamente no normal, como lo demuestra el primer histograma. Sin embargo, la distribución de las medias de 1000 muestras de tamaño 5 de esta población es aproximadamente normal debido al teorema del límite central, como lo demuestra el segundo histograma. Este histograma de las medias de las muestras incluye una curva normal superpuesta para ilustrar esta normalidad. Distribución exponencial Medias de las muestras
Muestras de una población exponencial
Una población que sigue una distribución exponencial es asimétrica y no normal, como lo demuestra el primer histograma. Sin embargo, la distribución de las medias de 1000 muestras de tamaño 50 de esta población es aproximadamente normal debido al teorema del límite central, como lo demuestra el segundo histograma. Este histograma de las medias de las muestras incluye una curva normal superpuesta para ilustrar esta normalidad.







APP GEO GEBRA