jueves, 6 de noviembre de 2008

Avanzando en la recolección de datos

De la conversación con Ricardo me surgió la inquietud de repasar el concepto de sesgo antes de iniciar la recolección de los datos. Volví a los apuntes de Alejandra Clemente. La selección muestral puede ser "probabilística"(sorteo) o "no probabilística"(elección dirigida). En el primer caso puedo realizar generalizaciones más precisas sobre la población. Para su construcción debo contar con un listado de la población a partir del cual seleccionar la muestra. En el segundo caso, no hay un método claro para el cálculo de medidas de validez o precisión de las estimaciones y se dificulta el estudio de las propiedades de los estimadores. Cuando uno hace un plan muestral desea que las estimaciones que se obtengan, en promedio, sean muy parecidas al verdadero parámetro desconocido y que el error standar sea lo más pequeño posible. El sesgo de un estimador es la diferencia entre la media de los valores posibles del estimador (obtenida a través de todas las muestras posibles) y el verdadero valor del parámetro desconocido. El estimador es insesgado si la media de su distribución muestral es igual al valor del parámetro que se desea estimar. El sesgo es la diferencia entre el error cusdrático medio de un estimador y su variancia. Se parte deseando usar diseños muestrales que produzcan estimaciones válidas y confiables. la confiabilidad se analiza en base a la variancia muestral o error standar. la validez se evalúa por medio del sesgo. El ECM se transforma así en un criterio para elegir un diseño muestral, dado el costo presupuestario del que se parte. Si la muestra es grande podemos construir un intervalo de confianza del parámetro M (media poblacional) del 95,5% donde M será mayor o igual a la media muestral menos 2 veces el desvío estimado dividido por la raíz cuadrada del total de observaciones y mayor o igual a la media estimada más 2 veces el desvío estimado dividido por la raíz cuadrada del total de observaciones. Una vez calculado el intervalo el resultado es dicotómico, contiene o no el valor del parámetro. Se puede esperar que el 95,5% de las veces, lo contendrá. Cuando el tamaña muestral es pequeño, menos de 30 observaciones, no se usa la aproximación normal sino la t-Student con n-1 grados de libertad.

1 comentario:

Ricardo Pasquini dijo...

Me parece muy bueno que te hayas tomado el trabajo de mirar este punto.
El diseño de tu muestra está relacionado al objetivo que vos persigues. Si tu objetivo es caracterizar el mercado de alquileres en una villa, entonces para que los resultados sean representativos de toda la villa, vas a tener que elegir al azar una muestra de hogares de la villa completa. Si tu objetivo fuese, en cambio, utilizando información de más de una villa, ver si la localización juega un papel en la determinacion del precio (como era tu objetivo inicialmente), entonces tendrías que tomar un conjunto de hogares de caracteristicas similares en todas las villas (y/o incorporar algunas diferencias como controles).
Personalmente creo que el primer objetivo podría ser menos propenso a error metodologicamente hablando.
Hay más de una forma de hacer el muestreo aleatorio. Una forma sería, utilizando una foto aerea como la que se puede sacar de google earth, enumerar edificios (o parcelas) y despues sortearlas. Es importante intentar conseguir todas las respuestas que fueron sorteadas, pues la no-respuesta podría estar relacionada a la característica que te interesa identificar (por ejemplo si es unna vivienda para alquiler o no)