Skip to content

📊Oficio y saber hacer

Científico de datos · Encuentra patrones y construye modelos predictivos a partir de datos: un título laboral de 2008 asentado sobre tres siglos de contar, contrastar y visualizar evidencia.

Compartir esta página

La imagen popular de un científico de datos construyendo modelos predictivos ingeniosos es real pero incompleta. Las encuestas a profesionales y los relatos de primera mano describen de forma consistente un trabajo en el que encontrar, limpiar y reestructurar datos desordenados consume más horas que el paso de modelado que la mayoría imagina.

El oficio que se transmite dentro del campo tiene menos que ver con memorizar un algoritmo concreto y más con un escepticismo disciplinado: mirar los datos antes de confiar en cualquier modelo de ellos, comprobar si un patrón se sostiene dentro de subgrupos, y saber cuándo la respuesta honesta a la pregunta de un interlocutor es que los datos no pueden respaldar una.

Lo que exige el trabajo

857870726258
Estadística y probabilidad
85
Programación (Python, SQL, R)
78
Preparación de datos y pipelines
70
Modelado de aprendizaje automático
72
Comunicar hallazgos
62
Contexto de negocio o de dominio
58

Estadística y probabilidad

Contraste de hipótesis, regresión y entender qué afirma realmente un p-valor o un intervalo de confianza: la base inferencial sobre la que se asienta todo lo demás del trabajo.

Programación (Python, SQL, R)

Escribir código lo bastante fluido como para sacar, limpiar y transformar datos a escala, no solo prototipar un análisis en un cuaderno que no tiene que volver a ejecutarse.

Preparación de datos y pipelines

Convertir datos reales, desordenados e inconsistentes —valores faltantes, registros duplicados, formatos que no coinciden— en algo que un modelo o un gráfico pueda usar de verdad.

Modelado de aprendizaje automático

Elegir, entrenar y validar un modelo adecuado al problema, y saber cuándo una regresión simple gana a una red neuronal elaborada.

Comunicar hallazgos

Traducir un resultado estadístico a un gráfico, un memorándum o una recomendación sobre la que un ejecutivo no técnico pueda actuar, sin simplificar en exceso ni enterrar la incertidumbre real.

Contexto de negocio o de dominio

Entender qué significa realmente una métrica dentro de un negocio o campo científico concreto, para que un análisis responda a la pregunta que se hizo de verdad.

Un día en la vida

Standup y revisión de panelesExtracción y limpieza de datosComidaModelado y análisisReuniones con interlocutores y revisionesFuera del horario (en su mayoría) 036912151821 24h
  1. 8–9 Standup y revisión de paneles

    Revisar las ejecuciones nocturnas de pipelines y los paneles de métricas clave, y una breve sincronización con el equipo sobre las prioridades del día.

  2. 9–12 Extracción y limpieza de datos

    Escribir consultas SQL contra un almacén de datos, unir y reestructurar tablas, y tratar valores faltantes o inconsistentes: a menudo el bloque más grande de un día de trabajo.

  3. 12–13 Comida

    Una pausa genuina, y a menudo un entorno informal donde los problemas entre equipos se plantean antes de llegar a una reunión programada.

  4. 13–15 Modelado y análisis

    Construir o refinar un modelo estadístico, ejecutar la prueba de significación de un experimento, o indagar por qué se movió una métrica.

  5. 15–17 Reuniones con interlocutores y revisiones

    Presentar hallazgos a un equipo de producto o de negocio, revisar los resultados de una prueba A/B, o defender los supuestos de un análisis bajo cuestionamiento.

  6. 17–8 Fuera del horario (en su mayoría)

    Tiempo personal, excepto en torno a un lanzamiento de producto o una revisión trimestral de negocio, cuando las tardes pueden absorber peticiones de análisis de última hora.

El saber hacer

Conocimiento de oficio que se transmite de verdad — no motivación vacía.

01

Mira los datos antes de modelarlos

Traza las distribuciones en bruto, los diagramas de dispersión y los resúmenes simples antes de ajustar nada: un hábito que detecta datos rotos, errores de unidades y valores atípicos que un modelo absorbería y ocultaría en silencio.

John Tukey, 'Exploratory Data Analysis,' 1977
02

Comprueba si la tendencia sobrevive dentro de subgrupos

Una tendencia agregada puede invertirse por completo una vez que los datos se dividen por una categoría relevante: un patrón conocido como la paradoja de Simpson, nombrada por un artículo de 1951 del estadístico Edward H. Simpson.

Edward H. Simpson, artículo de 1951; fenómeno señalado antes por Karl Pearson y otros
03

Reserva un conjunto de prueba y no lo mires hasta el final

Comprobar repetidamente el rendimiento contra los mismos datos retenidos y luego ajustar el modelo filtra en silencio información de esos datos hacia el modelo: tocarlo solo una vez es lo que mantiene honesto un resultado final.

Práctica estándar, formalizada en Hastie, Tibshirani y Friedman, 'The Elements of Statistical Learning,' 2001
04

Presupuesta la mayor parte del proyecto para limpiar, no para modelar

Los proyectos reales se acercan de forma consistente a un 80% de preparación de datos y un 20% de modelado más que al revés: planificar un calendario en torno al supuesto contrario es una forma habitual de que los proyectos se retrasen.

Eco amplio desde Steve Lohr, 'For Big-Data Scientists, "Janitor Work" Is Key Hurdle to Insight,' New York Times, 2014
05

Entrega primero el modelo más simple que podría funcionar de forma plausible

Una línea base —a veces solo una regla o un modelo lineal— aclara cuánto añade realmente un modelo más complejo, y a menudo es lo bastante buena para entregarse por sí sola.

Martin Zinkevich, 'Rules of Machine Learning: Best Practices for ML Engineering,' Google, regla #4
06

Cuando un patrón parece demasiado bueno, busca el confusor

Una correlación sorprendente es más a menudo un artefacto de una tercera variable oculta que un descubrimiento genuino: busca activamente qué más podría explicarla antes de presentar un resultado.

Arraigado en la tradición de diseño experimental de Fisher; formalizado en Judea Pearl, 'The Book of Why,' 2018

Herramientas del oficio

Python (pandas, scikit-learn, NumPy)

El lenguaje dominante para la manipulación de datos y el aprendizaje automático clásico, con pandas para datos tabulares y scikit-learn para algoritmos de modelado estándar.

SQL

El lenguaje de consulta para sacar datos de los almacenes de datos relacionales y en la nube —Snowflake, BigQuery, Redshift— donde viven realmente los datos de la mayoría de las empresas.

Jupyter Notebook

El entorno interactivo estándar para el análisis exploratorio, que permite a un científico de datos ejecutar código, ver un gráfico y tomar notas en el mismo documento.

Tableau / Power BI

Herramientas de paneles de inteligencia de negocio usadas para convertir un análisis terminado en algo que un interlocutor no técnico pueda explorar y monitorizar sin escribir código.

Git y plataformas en la nube (AWS, GCP, Azure)

Control de versiones para el código y, cada vez más, para los modelos, junto a la infraestructura en la nube que almacena datos y ejecuta trabajos de entrenamiento a una escala que un portátil no puede manejar.

Cómo se falla en esto

Contrastar hasta que algo sea significativo

Ejecutar muchas comparaciones estadísticas e informar solo de la que cruza un umbral de significación produce falsos descubrimientos que no se replicarán: un modo de fallo bien documentado conocido como p-hacking.

Entregar un modelo que filtra el objetivo

Incluir accidentalmente una característica que codifica el resultado que se predice produce resultados offline irrealmente fuertes que se derrumban cuando el modelo corre sobre datos de producción genuinamente no vistos.

Construir una respuesta sofisticada a la pregunta equivocada

Un modelo de aprendizaje automático cuidadosamente afinado que resuelve un problema que una consulta SQL simple o una fórmula de hoja de cálculo habrían respondido igual de bien malgasta esfuerzo y puede perder la pregunta de negocio real.

Profesiones similares

Vecinos más cercanos en el perfil de seis puntuaciones, no solo el mismo campo.

Seguir explorando

Seguir explorando

Más en Ciencia e investigación