Encuentra patrones y construye modelos predictivos a partir de datos: un título laboral de 2008 asentado sobre tres siglos de contar, contrastar y visualizar evidencia.
También llamado: Científico aplicado · Científico de aprendizaje automático
Científico de datos: Encuentra patrones y construye modelos predictivos a partir de datos: un título laboral de 2008 asentado sobre tres siglos de contar, contrastar y visualizar evidencia.
Un científico de datos extrae patrones, predicciones y recomendaciones a partir de datos usando estadística, programación y conocimiento del dominio, y convierte el resultado en algo sobre lo que una empresa, un organismo público o un equipo de investigación puede actuar. El trabajo abarca escribir SQL para sacar datos de un almacén, limpiarlos y reestructurarlos, ajustar un modelo estadístico o de aprendizaje automático, y explicar qué respalda el resultado y qué no.
El título laboral es mucho más joven que el oficio que hay detrás. 'Data scientist' data de alrededor de 2008, cuando DJ Patil y Jeff Hammerbacher lo adoptaron de forma independiente al montar equipos de datos en LinkedIn y Facebook, y el estadístico William S. Cleveland propuso 'data science' como campo académico recién en 2001. La disciplina subyacente tiene siglos: pasa por el impulso de John Tukey en los años 1960–70 hacia el análisis exploratorio de datos, vuelve a la estadística de Ronald Fisher en los años 1920 y al estudio de John Graunt de 1662 sobre los registros de mortalidad de Londres.
Un artículo de Harvard Business Review de 2012 que lo llamó 'el trabajo más sexy del siglo XXI' desencadenó una década de contrataciones corporativas y cientos de nuevos programas universitarios. Ese auge ha madurado: el título generalista se ha dividido en ingeniería de analítica, ingeniería de aprendizaje automático y analítica de producto, y las herramientas de IA ya hacen una parte creciente de las consultas, limpiezas y gráficos rutinarios que el puesto original asumía que haría una persona a mano.
Dentro de la profesión
La ciencia de datos es el oficio de convertir registros imperfectos en decisiones. Lo difícil rara vez es ajustar un modelo; suele ser decidir qué puede sostener honestamente la evidencia.
Gran parte del día es trabajo de evidencia
Los data scientists consultan almacenes, reconcilian definiciones, inspeccionan distribuciones, limpian campos rotos y explican la incertidumbre. Modelar importa, pero un resultado solo gana confianza cuando se pueden examinar su linaje de datos, supuestos y alternativas. Los profesionales más fuertes saben decir a un stakeholder que un gráfico de aspecto seguro responde a la pregunta equivocada, o que una asociación observada no es prueba de causa. Esa franqueza, más que un AUC alto, es lo que evita que la organización tome decisiones caras sobre arena movediza.
El título oculta varias carreras
Un data scientist de producto puede diseñar experimentos y medir resultados de features. Un applied scientist puede desarrollar modelos predictivos. Un decision scientist puede centrarse en operaciones, finanzas o política. En organizaciones maduras, analytics engineering, data engineering y ML engineering absorben partes del antiguo rol generalista. El conocimiento de dominio cambia el trabajo tanto como el stack: un experimento en una app de compras no es un estudio de resultados clínicos ni de fraude. El mismo título puede significar SQL y dashboards en una empresa y papers de ranking en otra.
La puerta es el razonamiento demostrado
Estadística, informática, matemáticas, economía y ciencias físicas ofrecen vías. Un título ayuda, pero una entrevista o un portafolio suelen probar SQL, razonamiento estadístico, calidad de datos y comunicación de forma más directa. Un proyecto creíble no necesita un modelo espectacular: necesita una pregunta clara, datos documentados, una línea base adecuada y conclusiones ajustadas a la evidencia. Quien solo muestra un notebook brillante sin explicar limitaciones suele fallar cuando el negocio pregunta «¿podemos actuar sobre esto?».
La IA comprime el análisis rutinario
Los asistentes pueden redactar SQL, gráficos, resúmenes y modelos base. Eso cambia de verdad el trabajo de entrada. No resuelve definiciones de medición, no revela un confusor oculto, no elige un uso ético de una predicción ni asume responsabilidad por una decisión. La profesión se mueve hacia el encuadre del problema, la experimentación, el razonamiento causal y la revisión de análisis generados por máquina. En mercados hispanohablantes, quien une dominio de negocio local con rigor cuantitativo sigue siendo escaso y demandado.
Cómo se ramifica el trabajo
Cinco formas habituales del mismo título: especialidad, entorno o trayectoria.
Productos digitales
Data scientist de producto
Usa métricas y experimentos para guiar elecciones de producto, defendiéndose de la optimización engañosa a corto plazo.
Sistemas predictivos
Applied / machine-learning scientist
Construye y evalúa modelos de ranking, previsión, detección o personalización, a menudo junto a ingenieros de ML.
Operaciones y estrategia
Decision scientist
Combina datos con contexto de negocio o política pública para apoyar planificación, asignación y riesgo.
Growth e inferencia causal
Especialista en experimentación
Diseña pruebas controladas y cuasi-experimentos que distinguen una intervención de una correlación.
Ciencia e investigación pública
Data scientist de investigación
Trabaja con datos observacionales o experimentales complejos donde reproducibilidad y rigor metodológico pesan más que el shipping rápido.
Cómo se lee en cada país
El mismo oficio cambia de puerta, estatus y textura diaria — reescrito para lectores de cada idioma.
Títulos especializados y entrevistas
Tecnología, finanzas y salud usan el título de formas distintas; el reclutamiento suele probar SQL, experimentos y comunicación de forma explícita. La compensación alta se concentra en pocas ciudades y empleadores.
Plataformas, comercio y datos empresariales
Grandes plataformas de consumo, telecom y conglomerados sostienen el trabajo analítico; el contexto en coreano suele ser vital para datos de producto y clientes. Los títulos pueden mezclar analista y scientist.
Datos empresariales y adopción cuidadosa
Manufactura, finanzas y consumo amplían analytics manteniendo prácticas establecidas de gobernanza. Los equipos internacionales valoran inglés y cloud junto al conocimiento de dominio local.
Privacidad y contexto industrial
La protección de datos y la representación laboral condicionan qué se puede recoger y usar. Automoción, manufactura e investigación demandan personas que unan estadística y operaciones reales.
Finanzas en Londres e investigación
Finanzas, consultoría y producto se concentran en Londres; la investigación pública y las universidades ofrecen incentivos distintos. Los roles por contrato siguen siendo visibles en el mercado.
Finanzas regionales y plataformas
Bancos, tecnología gubernamental y sedes regionales crean roles de datos que abarcan varios mercados. Expectativas regulatorias y reglas de datos transfronterizos son restricciones frecuentes.
Del archivo
Imágenes Commons CC/PD autoalojadas para esta profesión.
Por qué la actitud importa en este oficio
Un modelo puede ser estadísticamente correcto y aun así engañar a quien toma la decisión; que un científico de datos lo diga antes de la fecha límite, no solo cuando se le pregunta, es donde la actitud pesa más que la técnica.
Comunicar el hallazgo que perjudica la hoja de ruta
Un análisis que dice que una función que todos quieren lanzar no mueve la métrica esperada, o que un canal de crecimiento muy querido en realidad solo capta demanda que ya existía, resulta incómodo y fácil de suavizar. Los científicos de datos que comunican el resultado inconveniente de todos modos son la razón por la que las decisiones de una empresa siguen la realidad; los que matizan un hallazgo hacia lo que la dirección quiere oír convierten la analítica en decoración.
Confesar los límites de una muestra pequeña
Un experimento de cinco días o una cohorte reducida pueden producir un número que parece preciso y en realidad es ruido, y casi nadie aguas abajo va a comprobar el tamaño de la muestra antes de actuar sobre él. La actitud que distingue a un analista fiable es negarse a que un número suene más seguro de lo que los datos subyacentes en realidad permiten, incluso cuando un número seguro es el que la parte interesada quiere.
Asumir la consecuencia real de un modelo
Un modelo que niega un préstamo, clasifica un currículum o marca a un paciente le hace algo a una persona que nunca ve el cuaderno del que salió. Como el autor del modelo suele ser el único en condiciones de notar un sesgo sutil o una fuga de variable antes del despliegue, tomarse esa responsabilidad en serio —en lugar de tratar el modelo como el problema de otro una vez lanzado— es donde realmente se atrapa el daño.
Posturas que resisten bajo presión
Cinco actitudes concretas que el trabajo recompensa, no eslóganes.
Grafica los datos en bruto antes de tocar un modelo
Mira distribuciones, valores atípicos y datos ausentes con sus propios ojos antes de ajustar nada, partiendo de que un modelo absorberá en silencio lo que esté roto en los datos en vez de señalarlo a nadie.
Declara la incertidumbre en la misma frase que el hallazgo
Comunica un intervalo de confianza o una salvedad junto al número destacado, no solo cuando lo cuestionan, para que una parte interesada no pueda confundir una estimación aproximada con una precisa simplemente porque la incertidumbre se dejó sin decir.
Busca la variable de confusión antes de celebrar un resultado
Trata una correlación sorprendente y conveniente como un problema que investigar, no como un resultado que presentar, porque cuanto más halaga un hallazgo el plan preferido del equipo, más escrutinio merece.
Abandona su propio análisis favorito cuando los datos no lo sostienen
Descarta una hipótesis predilecta en cuanto la evidencia deja de respaldarla, en lugar de probar un corte más de los datos con la esperanza de que finalmente sobreviva a la prueba, y lo dice con claridad en el informe.
Dice que los datos no pueden responder la pregunta planteada
Le dice a una parte interesada con claridad que los datos disponibles no sostienen una respuesta segura, en vez de producir un número igualmente porque se pidió un número y una diapositiva en blanco parecía inaceptable de presentar.
Momentos que lo revelan
Situaciones que separan el lenguaje de currículum de la práctica real.
El experimento que muestra que la función favorita no funciona
La dirección ya anunció la fecha de lanzamiento antes de que terminara la prueba A/B. Los resultados no muestran ninguna mejora real. Que el analista lo comunique con claridad, o busque una métrica secundaria que quede mejor, revela cuál es realmente el trabajo.
Un modelo rinde bien hasta que se encuentra con un subgrupo con el que no se probó
La precisión agregada se ve sólida, pero un desglose por grupo demográfico o región revela que el modelo falla de forma desproporcionada en uno de ellos. Notarlo antes del despliegue, sin que nadie lo pida, separa a los analistas que comprueban de los que reportan el promedio y siguen adelante.
Un cliente quiere un número más preciso del que los datos permiten
Se le pide a un conjunto de datos de tres semanas que justifique una proyección de crecimiento anual firme. Entregar una cifra que suena segura es fácil y bien recibido; explicar por qué los datos solo permiten un rango aproximado es más difícil y mucho menos popular.
El panel en el que todos confían está equivocado en silencio
Una métrica muy usada tiene un error sutil que da la casualidad de hacer que el rendimiento se vea bien, y nadie aguas arriba se ha quejado. Señalarlo significa admitir un error propio y decepcionar a quienes preferían el número antiguo.
Dónde la "vocación" se vuelve dañina
La «cultura basada en datos» como tapadera de respuestas predeterminadas
Las empresas que se presentan como rigurosamente basadas en datos a veces usan ese lenguaje para presionar a los analistas a encontrar apoyo para una decisión ya tomada, tratando a quien reporta un resultado inconveniente como alguien que no es «un jugador de equipo». En España y Latinoamérica, muchas startups que se anuncian como «data-driven» cubren esa demanda con becarios y analistas junior a los que se paga por debajo de mercado bajo la promesa de aprendizaje acelerado. El auge inicial del campo como profesión de moda también normalizó horas extra sin pagar disfrazadas de curiosidad: quedarse hasta medianoche por un corte más de un conjunto de datos se celebra como pasión, no se cuestiona como un problema de carga de trabajo.
El perfil
Resiste a la IA38
Sueldo74
Barrera de entrada55
Autonomía60
Demanda78
Impacto66
¿Cuán expuesto está a la IA?
High
Una parte significativa del trabajo rutinario de ciencia de datos —consultas SQL, gráficos exploratorios, ajustar un modelo estándar con AutoML, escribir código de pipeline repetitivo— ya es automatizable o asistida por IA hoy, y esa parte crece rápido. Lo que resiste a la automatización es enmarcar un problema de negocio ambiguo como una pregunta contrastable, juzgar si un resultado es real o un artefacto estadístico, y rendir cuentas cuando la decisión en el mundo real de un modelo resulta ser errónea.
¿Qué hace realmente un científico de datos día a día?
Contrariamente a la imagen de 'construir modelos de IA', la mayoría de los días se reparte entre escribir consultas SQL y código Python para sacar y limpiar datos, ejecutar pruebas estadísticas o entrenar modelos, y traducir resultados a un gráfico o un memorándum sobre el que un interlocutor no técnico pueda actuar. Las encuestas a profesionales sitúan de forma consistente la limpieza y preparación de datos en aproximadamente la mitad o más del tiempo de trabajo.
¿Se necesita un doctorado para ser científico de datos?
No. A diferencia de la medicina o el derecho, no hay licencia ni un único título obligatorio; una licenciatura o un máster en estadística, informática, matemáticas o un campo cuantitativo afín es la vía más habitual, y un portafolio sólido de proyectos reales suele importar más a los empleadores que la credencial exacta. Los doctorados son más comunes en puestos de investigación o de aprendizaje automático aplicado.
¿Es la ciencia de datos solo estadística con otro nombre?
No del todo. Se apoya mucho en la estadística —el diseño experimental de Fisher, el análisis exploratorio de Tukey— pero añade programación, ingeniería de bases de datos y aprendizaje automático que los departamentos clásicos de estadística rara vez enseñaban. William S. Cleveland propuso el término en 2001 precisamente para describir esta versión ampliada y muy computacional del campo, construida sobre la estadística en lugar de sustituirla.
¿Está la ciencia de datos en riesgo por la IA?
El extremo rutinario ya está expuesto: las herramientas AutoML pueden ajustar y afinar modelos estándar, y los asistentes de IA pueden escribir consultas SQL, primeros borradores de gráficos exploratorios y código de pipelines repetitivo más rápido que una persona. Lo que no se ha automatizado es formular la pregunta correcta, juzgar si un patrón es significativo o espurio, y asumir la responsabilidad de una decisión basada en el resultado.
¿Cuánto ganan los científicos de datos?
Varía mucho según el país y la antigüedad. La Oficina de Estadísticas Laborales de EE. UU. situó el salario anual medio de la ocupación Data Scientists en torno a 108 000 dólares en 2023, mientras que los analistas junior suelen empezar cerca de 70 000–95 000 dólares y los científicos de datos senior o principales en grandes tecnológicas pueden ganar 200 000–400 000 dólares o más en compensación total con equity.
¿Cuál es la diferencia entre científico de datos, analista de datos e ingeniero de aprendizaje automático?
Un analista de datos suele responder preguntas de negocio definidas con datos y paneles ya existentes; un científico de datos construye nuevos modelos estadísticos y análisis predictivos, a menudo a partir de datos más desordenados; un ingeniero de aprendizaje automático saca un modelo de un cuaderno y lo hace funcionar de forma fiable, a escala, en producción. Las fronteras se difuminan a menudo, y mucha gente se mueve entre los tres a lo largo de la carrera.
¿Qué herramientas y lenguajes de programación usa la ciencia de datos?
Python domina, normalmente junto a bibliotecas como pandas y scikit-learn, y SQL para consultar bases de datos. R sigue siendo común en entornos académicos y de bioestadística. Los cuadernos Jupyter son el entorno estándar para el trabajo exploratorio, y plataformas de almacén de datos en la nube como Snowflake, BigQuery o Databricks ahora guardan los datos que la mayoría de los científicos de datos consultan de verdad.
¿Por qué se llamó a 'data scientist' el 'trabajo más sexy del siglo XXI'?
Thomas Davenport y DJ Patil usaron esa frase como título de su artículo de octubre de 2012 en Harvard Business Review, argumentando que la rara combinación de habilidad estadística, capacidad de programar y juicio de negocio que el puesto exigía lo hacía a la vez escaso y muy buscado. La frase cuajó y ayudó a desencadenar una década de contrataciones corporativas y docenas de nuevos programas universitarios.
Insertar este ranking
Pega este código en tu blog o web; el ranking se mantiene actualizado.