Continuando con las entregas sobre la ciencia de datos para la modelación estadística (El uso de la ciencia de datos para preparar información de modelación estadística), esta semana está relacionado con la forma correcta de obtener los datos para el modelo a desarrollar.
Parte 2 de 5: Obtener lo datos adecuados para el modelo estadístico a desarrollar
Un buen modelo estadístico comienza con una pregunta sencilla: ¿de dónde vienen los datos? Conocer la fuente original permite evaluar si la información sirve para responder la pregunta de investigación. No basta con descargar un archivo cualquiera y empezar a calcular. Es necesario comprender quién reunió los datos, qué población representan, cuándo se recopilaron, cómo se midieron las variables y qué cambios ocurrieron durante el periodo estudiado.
Las fuentes pueden ser primarias o secundarias. Una fuente primaria se genera directamente para el estudio, por ejemplo, mediante una encuesta o un experimento. Una fuente secundaria ya existe y fue creada por una institución, empresa o investigador. Ambas pueden ser útiles. Lo importante es revisar de ella la metodología, cobertura, periodicidad y nivel de detalle. Una base nacional, por ejemplo, puede no ser adecuada para analizar diferencias entre cantones si no ofrece ese nivel geográfico o no es posible desagregar más los datos.
Los datos originales siempre se resguardan y antes de transformar cualquier archivo, conviene guardar una copia original en una carpeta protegida. Luego se crea una copia para el trabajo. Esta práctica permite volver al punto inicial en cualquier momento, comparar resultados y corregir errores sin perder información. También es recomendable registrar el nombre de la fuente, la fecha de descarga o recepción, el enlace o responsable, la versión del archivo y las condiciones de uso. Ese registro forma parte de la trazabilidad del análisis del modelo elaborado.
Después debe revisarse la documentación adicional disponible: diccionario de variables, cuestionario, manual metodológico, catálogo de códigos o notas técnicas. El nombre de una columna rara vez explica por sí solo todo su significado. La variable “ingreso”, por ejemplo, podría representar ingreso mensual, anual, bruto, neto, individual o del hogar. Utilizarla sin confirmar su definición puede alterar por completo la interpretación del modelo y los resultados finales.
También deben identificarse las restricciones. Algunas bases aplican redondeos, omiten casos, cambian metodologías o contienen datos sujetos a confidencialidad. Estas condiciones no invalidan necesariamente la fuente, pero deben quedar registradas. Cuando se combinan archivos de distintos años, es indispensable comprobar si las variables conservan el mismo significado y formato o si en el camino surgen cambios que deben ser considerados en el modelo.
Otro aspecto importante es que conviene elaborar una ficha breve de procedencia para cada conjunto de datos. Debe indicar su propósito, unidad de análisis, periodo, cobertura, variables principales y limitaciones conocidas. Esta ficha ayuda a otras personas a comprender el material y evita depender de la memoria de quien inició el proyecto.
Una buena obtención de datos no garantiza por sí sola un buen modelo, pero establece una base sólida por donde comenzar. En la ciencia de datos, saber de dónde proviene la información es el primer paso para usarla con criterio, explicar sus límites y generar resultados que puedan revisarse y aprovecharse cuando sea necesario por lo tomadores de decisiones.
En la siguiente parte continuaremos con más de este tema.