Skip to content

🧫Oficio y saber hacer

Científico de Datos Clínicos · Usa datos clínicos, de ensayos y de sistemas de salud para generar evidencia fiable con la que mejorar la atención, la investigación y las decisiones operativas.

Compartir esta página

La imagen popular de un científico de datos clínicos construyendo modelos predictivos ingeniosos es real pero incompleta. Las encuestas a profesionales y los relatos de primera mano describen sistemáticamente un trabajo donde encontrar, limpiar y remodelar datos desordenados consume más horas que el paso de modelado que la mayoría de la gente imagina.

El oficio que se transmite dentro del campo tiene menos que ver con memorizar un algoritmo específico y más con el escepticismo disciplinado: mirar los datos antes de confiar en cualquier modelo de ellos, comprobar si un patrón se mantiene dentro de los subgrupos, y saber cuándo la respuesta honesta a la pregunta de una parte interesada es que los datos no pueden respaldar una.

Lo que exige el trabajo

857870726258
Estadística y probabilidad
85
Programación (Python, SQL, R)
78
Manejo de datos y canalizaciones
70
Modelado de aprendizaje automático
72
Comunicar hallazgos
62
Contexto de negocio o del dominio
58

Estadística y probabilidad

Prueba de hipótesis, regresión, y entender qué afirma realmente un valor p o un intervalo de confianza: el fundamento inferencial sobre el que se asienta todo lo demás del puesto.

Programación (Python, SQL, R)

Escribir código lo bastante fluido para extraer, limpiar y transformar datos a escala, no solo prototipar un análisis en un notebook que nunca tendrá que volver a ejecutarse.

Manejo de datos y canalizaciones

Convertir datos desordenados, inconsistentes y del mundo real —valores faltantes, registros duplicados, formatos incompatibles— en algo que un modelo o gráfico pueda usar realmente.

Modelado de aprendizaje automático

Elegir, entrenar y validar un modelo apropiado para el problema, y saber cuándo una regresión simple supera a una red neuronal elaborada.

Comunicar hallazgos

Traducir un resultado estadístico en un gráfico, un memorando o una recomendación sobre la que un ejecutivo no técnico pueda actuar, sin simplificar en exceso ni ocultar la incertidumbre real.

Contexto de negocio o del dominio

Entender qué significa realmente una métrica dentro de un negocio o campo científico específico, para que un análisis responda a la pregunta que realmente se hizo.

Un día en la vida

Reunión de pie y revisión de panelesExtracción y limpieza de datosAlmuerzoModelado y análisisReuniones y revisiones con partes interesadasFuera de servicio (mayormente) 036912151821 24h
  1. 8–9 Reunión de pie y revisión de paneles

    Revisar las ejecuciones nocturnas de canalizaciones y los paneles de métricas clave, y una breve sincronización con el equipo sobre las prioridades del día.

  2. 9–12 Extracción y limpieza de datos

    Escribir consultas SQL contra un almacén de datos, unir y remodelar tablas, y manejar valores faltantes o inconsistentes, habitualmente el mayor bloque individual de una jornada laboral.

  3. 12–13 Almuerzo

    Un descanso genuino, y a menudo un entorno informal donde se plantean problemas entre equipos antes de que lleguen a una reunión programada.

  4. 13–15 Modelado y análisis

    Construir o refinar un modelo estadístico, ejecutar la prueba de significación de un experimento, o indagar por qué se movió una métrica.

  5. 15–17 Reuniones y revisiones con partes interesadas

    Presentar hallazgos a un equipo de producto o negocio, revisar los resultados de una prueba A/B, o defender las suposiciones de un análisis bajo cuestionamiento.

  6. 17–8 Fuera de servicio (mayormente)

    Tiempo personal, salvo en torno a un lanzamiento de producto o una revisión de negocio trimestral, cuando las tardes pueden absorber solicitudes de análisis de última hora.

El saber hacer

Conocimiento de oficio que se transmite de verdad — no motivación vacía.

01

Mira los datos antes de modelarlos

Grafica las distribuciones en bruto, los diagramas de dispersión y los resúmenes simples antes de ajustar nada, un hábito que detecta datos rotos, errores de unidades y valores atípicos que un modelo de otro modo absorbería y ocultaría en silencio.

John Tukey, 'Exploratory Data Analysis', 1977
02

Comprueba si la tendencia sobrevive dentro de los subgrupos

Una tendencia agregada puede revertirse por completo una vez que los datos se dividen por una categoría relevante, un patrón conocido como la paradoja de Simpson, en honor a un artículo de 1951 del estadístico Edward H. Simpson.

Artículo de Edward H. Simpson de 1951; fenómeno señalado antes por Karl Pearson y otros
03

Reserva un conjunto de pruebas y no lo mires hasta el final

Comprobar repetidamente el rendimiento contra los mismos datos reservados, y luego ajustar el modelo, filtra silenciosamente información de esos datos hacia el modelo; tocarlo solo una vez es lo que mantiene honesto un resultado final.

Práctica estándar, formalizada en Hastie, Tibshirani y Friedman, 'The Elements of Statistical Learning', 2001
04

Presupuesta la mayor parte del proyecto para la limpieza, no el modelado

Los proyectos reales suelen acercarse más al 80% de preparación de datos y el 20% de modelado que a lo contrario; planificar un cronograma en torno a la suposición opuesta es una forma común de que los proyectos se retrasen.

Ampliamente repetido desde Steve Lohr, 'For Big-Data Scientists, "Janitor Work" Is Key Hurdle to Insight', New York Times, 2014
05

Lanza primero el modelo más simple que pueda funcionar

Una referencia base —a veces solo una regla o un modelo lineal— aclara cuánto añade realmente un modelo más complejo, y a menudo es lo bastante buena para lanzarse por sí sola.

Martin Zinkevich, 'Rules of Machine Learning: Best Practices for ML Engineering', Google, regla #4
06

Cuando un patrón parece demasiado bueno, busca el factor de confusión

Una correlación sorprendente es más a menudo un artefacto de una tercera variable oculta que un descubrimiento genuino; busca activamente qué más podría explicarla antes de presentar un resultado.

Enraizado en la tradición de diseño experimental de Fisher; formalizado en Judea Pearl, 'The Book of Why', 2018

Herramientas del oficio

Python (pandas, scikit-learn, NumPy)

El lenguaje dominante para la manipulación de datos y el aprendizaje automático clásico, con pandas para datos tabulares y scikit-learn para algoritmos de modelado estándar.

SQL

El lenguaje de consulta para extraer datos de los almacenes de datos relacionales y en la nube —Snowflake, BigQuery, Redshift— donde realmente residen los datos de la mayoría de las empresas.

Notebook de Jupyter

El entorno interactivo estándar para el análisis exploratorio, que permite a un científico de datos clínicos ejecutar código, ver un gráfico y tomar notas en el mismo documento.

Tableau / Power BI

Herramientas de paneles de inteligencia de negocio usadas para convertir un análisis terminado en algo que una parte interesada no técnica pueda explorar y supervisar sin escribir código.

Git y plataformas en la nube (AWS, GCP, Azure)

Control de versiones para el código y, cada vez más, para los modelos, junto con la infraestructura en la nube que almacena datos y ejecuta tareas de entrenamiento a una escala que un portátil no puede manejar.

Cómo se falla en esto

Probar hasta que algo sea significativo

Ejecutar muchas comparaciones estadísticas e informar solo de la que cruza un umbral de significación produce descubrimientos falsos que no se replicarán, un modo de fallo bien documentado conocido como p-hacking.

Lanzar un modelo que filtra el objetivo

Incluir accidentalmente una característica que codifica el resultado que se está prediciendo produce resultados fuera de línea irrealmente sólidos que se derrumban una vez que el modelo se ejecuta con datos de producción genuinamente no vistos.

Construir una respuesta sofisticada a la pregunta equivocada

Un modelo de aprendizaje automático cuidadosamente ajustado que resuelve un problema que una simple consulta SQL o una fórmula de hoja de cálculo habrían respondido igual de bien desperdicia esfuerzo y puede pasar por alto la verdadera pregunta de negocio.

Profesiones similares

Vecinos más cercanos en el perfil de seis puntuaciones, no solo el mismo campo.

Seguir explorando

Seguir explorando

Más en Ciencia e investigación

⚛️

Físico

Deriva y pone a prueba las leyes matemáticas que rigen la materia, la energía, el espacio y el tiempo, desde una pizarra solitaria hasta un artículo de un acelerador de partículas con 3.000 autores.

Resistente a la IA 65
🧬

Biólogo

El científico que estudia la vida misma, desde Linneo nombrando especies a mano hasta editar genomas con CRISPR, aún contrastando cada idea con un organismo vivo.

Resistente a la IA 64
🧪

Químico

El científico que fabrica y mide la materia misma — del alambique de perfume de Tapputi en Babilonia a los laboratorios robotizados de hoy, sigue siendo quien decide qué significa el espectro.

Resistente a la IA 70
📊

Científico de datos

Encuentra patrones y construye modelos predictivos a partir de datos: un título laboral de 2008 asentado sobre tres siglos de contar, contrastar y visualizar evidencia.

Resistente a la IA 38
🔭

Astrónomo

El científico que mide el universo, desde las tablillas de arcilla babilónicas hasta los telescopios espaciales, aún decidiendo qué parpadeo en los datos es un descubrimiento.

Resistente a la IA 70
🧮

Matemático

De los escribas babilonios a los medallistas Fields y la demostración asistida por IA: la profesión que convierte preguntas difíciles en certeza permanente, teorema a teorema.

Resistente a la IA 70
🧿

Ingeniero Cuántico

Construye, mide y controla dispositivos que explotan estados cuánticos para informática, detección, comunicación e investigación de materiales.

Resistente a la IA 78