jueves, 15 de abril de 2010

Estadistica Inferencial


Estudia como sacar conclusiones generales para toda la población a partir del estudio de una muestra, y el grado de fiabilidad o significación de los resultados obtenidos.
El objetivo de la estadística inferencia es obtener la información acerca de una población partiendo de la información que contiene una muestra. El proceso que se sigue para seleccionar una muestra se denomina muestreo.

Muestra


"Se llama muestra a una parte de la población a estudiar que sirve para representarla. "Una muestra es una colección de algunos elementos de la población, pero no de todos “Una muestra debe ser definida en base de la población determinada, y las conclusiones que se obtengan de dicha muestra solo podrán referirse a la población en referencia.
Ejemplo:
El estudio realizado a 50 miembros del Colegio de Ingenieros del Estado Cojedes.
El estudio de muestras es más sencillo que el estudio de la población completa; cuesta menos y lleva menos tiempo. Por último se aprobado que el examen de una población entera todavía permite la aceptación de elementos defectuosos, por tanto, en algunos casos, el muestreo puede elevar el nivel de calidad. Una muestra representativa contiene las características relevantes de la población en las mismas proporciones que están incluidas en tal población. Los expertos en estadística recogen datos de una muestra. Utilizan esta información para hacer referencias sobre la población que está representada por la muestra. En consecuencia muestra y población son conceptos relativos. Una población es un todo y una muestra es una fracción o segmento de ese todo.

Muestreo


Esto no es más que el procedimiento empleado para obtener una o más muestras de una población; el muestreo es una técnica que sirve para obtener una o más muestras de población.Este se realiza una vez que se ha establecido un marco muestral representativo de la población, se procede a la selección de los elementos de la muestra aunque hay muchos diseños de la muestra.
TIPOS DE MUESTREO:

:
Muestreo probabilístico:
En el muestreo aleatorio todos los elementos tienen la misma probabilidad de ser elegidos. Los individuos que formarán parte de la muestra se elegirán al azar mediante números aleatorios. Existen varios métodos para obtener números aleatorios, los más frecuentes son la utilización de tablas de números aleatorios o generarlos por ordenador.
El muestreo aleatorio puede realizarse de distintas maneras, las más frecuentes son el muestreó simple, el sistemático, el estratificado y el muestreo por conglomerados.
Muestreo Aleatorio Simple:

Es el método conceptualmente más simple. Consiste en extraer todos los individuos al azar
de una lista (marco de la encuesta). En la práctica, a menos que se trate de poblaciones pequeñas o de estructura muy simple, es difícil de llevar a cabo de forma eficaz.

Ejemplo:
Se pretende determinar la prevalencia de Maedi en una explotación de 250 ovejas: para ello se deben examinar 61 animales (se supone una prevalencia del 30% y se desea una precisión del 10% para un nivel de confianza del 95%): se obtienen 61 números entre el 1 y el 250 de una tabla de números aleatorios y se sangran los animales correspondientes (en función del número de crotal o según el orden por el que se hacen pasar por una manga).
Muestreo sistemático:

En este caso se elige el primer individuo al azar y el resto viene condicionado por aquél. Este método es muy simple de aplicar en la práctica y tiene la ventaja de que no hace falta disponer de un marco de encuesta elaborado. Puede aplicarse en la mayoría de las situaciones, la única precaución que debe tenerse en cuenta es comprobar que la
Característica que estudiamos no tenga una periodicidad que coincida con la del muestreo (por ejemplo elegir un día de la semana para tomar muestras en un matadero, ya que muchos ganaderos suelen sacrificar un día determinado).

Ejemplo:
En el caso anterior debemos tomar uno de cada cuatro animales (250/61); en vez
de tomar 61 números aleatorios tomamos sólo uno (entre el uno y el cuatro), por ejemplo el número 3, de modo que tomaremos la oveja número 3, y a continuación cada cuarto animal (la 7, la 11, la 15 y así sucesivamente hasta llegar a la 247).
Muestreo aleatorio estratificado:

Se divide la población en grupos en función de un carácter determinado y después se
Muestrea cada grupo aleatoriamente, para obtener la parte proporcional de la muestra. Este
método se aplica para evitar que por azar algún grupo de animales este menos representado que los otros. El muestreo estratificado tiene interés cuando la característica en cuestión
puede estar relacionada con la variable que queremos estudiar.

Ejemplo: La probabilidad de que una oveja esté infectada de Maedi está directamente
relacionada con la edad. En el ejemplo anterior, la explotación tiene el 44% de los
animales de menos de 2 años, el 28% de 3-4 años, el 18% de 5-6 y el 10% son animales de
más de seis años: el 44% de los 61 animales de la muestra (27 animales) se tomará al azar
entre los de 1-2 años, el 28% entre los de 3-4 años y así sucesivamente (17, 11 y 6 animales de los otros tres grupos). Este método evita que por casualidad (por azar) se tomen más individuos de un grupo que de los demás y esto pueda condicionar el resultado.
Muestreo aleatorio por conglomerados:

Se divide la población en varios grupos de características parecidas entre ellos y luego se analizan completamente algunos de los grupos, descartando los demás. Dentro de cada conglomerado existe una variación importante, pero los distintos conglomerados son parecidos. Requiere una muestra más grande, pero suele simplificar la recogida de muestras. Frecuentemente los conglomerados se aplican a zonas geográficas

Intervalo de confianza






Las líneas verticales representan 50 construcciones diferentes de intervalos de confianza para la estimación del valor μ.
Se llama intervalo de confianza en estadística a un par de números entre los cuales se estima que estará cierto valor desconocido con una determinada probabilidad de acierto. Formalmente, estos números determinan un intervalo, que se calcula a partir de datos de una muestra, y el valor desconocido es un parámetro poblacional. La probabilidad de éxito en la estimación se representa por 1 - α y se denomina nivel de confianza. En estas circunstancias, α es el llamado error aleatorio o nivel de significación, esto es, una medida de las posibilidades de fallar en la estimación mediante tal intervalo.[]
El nivel de confianza y la amplitud del intervalo varían conjuntamente, de forma que un intervalo más amplio tendrá más posibilidades de acierto (mayor nivel de confianza), mientras que para un intervalo más pequeño, que ofrece una estimación más precisa, aumentan sus posibilidades de error. Para la construcción de un determinado intervalo de confianza es necesario conocer la distribución teórica que sigue el parámetro a estimar, θ. Es habitual que el parámetro se distribuya normalmente. También pueden construirse intervalos de confianza con la desigualdad de Chebyshov.
0,44 = Valor de la proporción en el grupo del nuevo tratamiento, intervención o técnica.
0,29 = Media de las dos proporciones p1 y p2.
Coeficiente de correlación
La asociación entre dos variables cuantitativas necesita normalmente la utilización del coeficiente de correlación r de Pearson.
Equivalencia de dos intervenciones
Portal: Matemática. Contenido relacionado con Matemática.




· Ejemplo


Suponga que observamos que en nuestra muestra de 50 personas que realizan diariamente un trayecto, la distancia media de viaje es 30 minutos con una desviación estándar de la población de 2,5. Con alfa = 0,05, INTERVALO.CONFIANZA (0,05, 2,5, 50) devuelve 0,69291. El intervalo de confianza correspondiente será entonces 30 ± 0,69291 = aprox. [29,3, 30,7]. Para cualquier media de población μ0 (en este intervalo), la probabilidad de obtener una media de muestra más alejada de μ0 que de 30 es mayor que 0,05. Asimismo, para cualquier media de población μ0 (fuera de este intervalo), la probabilidad de obtener una media de muestra más alejada de μ0 que de 30 es menor que 0,05.
El ejemplo puede resultar más fácil de entender si lo copia en una hoja de cálculo en blanco.






Fórmulas de Distribución e intervalos de confianza:



Teorema de Límite Central










Indica que, en condiciones muy generales, la distribución de la suma de variables aleatorias tiende a una distribución normal (también llamada distribución gaussiana o curva de Gauss o campana de Gauss) cuando la cantidad de variables es muy grande.[1]
Teorema: Sea X1, X2, ..., Xn una muestra aleatoria de una distribución con media μ y varianza σ2. Entonces, si n es suficientemente grande, la variable aleatoria
tiene aproximadamente una distribución normal con
También se cumple que si

tiene aproximadamente una distribución normal con y , cuanto más grande sea el valor de n, mejor será la aproximación. El teorema del límite central garantiza una distribución normal cuando n es suficientemente grande. Existen diferentes versiones del teorema, en función de las condiciones utilizadas para asegurar la convergencia. Una de las más simples establece que es suficiente que las variables que se suman sean independientes, idénticamente distribuidas, con valor esperado y varianza finitas.
La aproximación entre las dos distribuciones es, en general, mayor en el centro de las mismas que en sus extremos o colas, motivo por el cual se prefiere el nombre "teorema del límite central" ("central" califica al límite, más que al teorema).
Este teorema, perteneciente a la teoría de la probabilidad, encuentra aplicación en muchos campos relacionados, tales como la inferencia estadística o la teoría de renovación. Si se obtiene una muestra de una población normal, entonces la media muestra tiene una distribución normal sin importar el tamaño de la muestra. Sin embargo se puede demostrar que de hecho no importa el modelo de probabilidad del cual se obtenga la muestra; mientras la media y la varianza existan, la distribución del muestreo de x se aproximara a una distribución normal conforme aumente la aproximación buena mientras 2730.


Campana de Gauss



Si se obtiene una muestra de una población normal, entonces la media muestral tiene una distribución normal sin importar el tamaño de la muestra. Sin embargo, se puede demostrar que de hecho no importa el modelo de probabilidad del cual se obtenga la muestra; mientras la media y la varianza existan, la distribución de muestreo de `X se aproximará a una distribución normal conforme n aumente. Lo anterior constituye uno de los más importantes teoremas en inferencia estadística y se conoce como TEOREMA DEL LÍMITE CENTRAL.


En muchos casos, puede concluirse en forma segura que la aproximación será buena mientras n > 30.


Para mostrar la validez del teorema del límite central veamos el siguiente ejemplo

Suponga que de una población consistente en los valores 0, 2, 4, 6 y 8, se toman muestras de tamaño 2 con remplazo.
Solución:

1. Paso
Se calcula la media poblacional, la varianza y desviación estándar poblacional.










Paso
· Gráfica de la distribución de frecuencia para la población



Esta gráfica no puede considerarse acampanada o normal.





Paso
Se toman muestras de tamaño dos con remplazo.









Paso
Se agrupa a las medias muéstrales en la tabla de frecuencia siguiente:



Paso
Se calcula la media poblacional de medias, la varianza de la medias y desviación estándar de las medias ó error estándar de las medias.