Skip to content

📊Orígenes y evolución

Científico de datos · Encuentra patrones y construye modelos predictivos a partir de datos: un título laboral de 2008 asentado sobre tres siglos de contar, contrastar y visualizar evidencia.

Compartir esta página

La ciencia de datos es uno de los títulos laborales más jóvenes de este sitio asentado sobre uno de los oficios más antiguos: convertir un montón de registros en una afirmación sobre la que alguien puede actuar. El nombre 'data scientist' data solo de alrededor de 2008; la disciplina subyacente remonta tres siglos de estadísticos contando, contrastando y visualizando evidencia.

Dos hilos recorren toda la historia: una lenta profesionalización de la inferencia estadística, desde las tablas de mortalidad de un mercero londinense hasta los ensayos de cultivo de Fisher, y un empaquetado mucho más rápido y reciente de esa herencia en un título laboral corporativo, un departamento académico y, brevemente, el 'trabajo más sexy del siglo XXI'.

Dónde empezó

1662Londres, Inglaterra

El mercero londinense John Graunt publicó 'Natural and Political Observations ... Made upon the Bills of Mortality,' un análisis sistemático de los registros parroquiales semanales de muertes que Londres llevaba desde los años de la peste, a partir del cual estimó la población de la ciudad e identificó patrones en las causas de muerte. Fue uno de los primeros intentos conocidos de extraer conclusiones generales de un gran cuerpo de datos recopilados en lugar de anécdotas individuales, y le valió a Graunt, un tendero sin formación universitaria, la elección a la Royal Society: la raíz intelectual a la que el nombre mucho más tardío del campo acabaría uniéndose.

Línea de tiempo

1662Graunt analiza las Bills of Mortality de Londres

John Graunt publica un estudio estadístico de los registros parroquiales de muertes de Londres, estimando el tamaño de la población y los patrones de mortalidad: entre los primeros usos sistemáticos de datos recopilados para extraer conclusiones generales.

1908Gosset publica la t de Student como 'Student'

William Sealy Gosset, estadístico de la cervecería Guinness en Dublín, publica 'The Probable Error of a Mean' bajo el seudónimo 'Student' porque Guinness prohibía al personal publicar con su propio nombre, introduciendo la distribución t usada desde entonces en el análisis de muestras pequeñas.

1925Fisher publica 'Statistical Methods for Research Workers'

Ronald Fisher, analizando décadas de datos de rendimiento de cultivos en la Rothamsted Experimental Station, publica el libro que establece el análisis de la varianza y el diseño experimental moderno como práctica estadística estándar.

1933Neyman y Pearson formalizan el contraste de hipótesis

El artículo de Jerzy Neyman y Egon Pearson 'On the Problem of the Most Efficient Tests of Statistical Hypotheses' da a la estadística su marco moderno para decidir, con tasas de error cuantificadas, si un resultado es significativo.

1962Tukey sostiene que el análisis de datos es una ciencia propia

El artículo de John Tukey 'The Future of Data Analysis' sostiene que analizar datos reales merece reconocimiento como ciencia distinta con sus propios métodos, no como una rama menor de la estadística matemática.

1977'Exploratory Data Analysis' de Tukey populariza el box plot

El libro de Tukey da a los profesionales herramientas prácticas —entre ellas el diagrama de caja— para comprender a ojo la forma de un conjunto de datos antes de ajustar ningún modelo.

1996Fayyad, Piatetsky-Shapiro y Smyth definen el 'descubrimiento de conocimiento'

El artículo del trío en AI Magazine formaliza el 'Knowledge Discovery in Databases' como el proceso más amplio que rodea la minería de datos en bruto, parte de una oleada de los años 1990 que formalizó el descubrimiento de patrones en bases de datos corporativas en crecimiento.

2001Cleveland propone 'data science' como campo

El estadístico de Bell Labs William S. Cleveland publica 'Data Science: An Action Plan for Expanding the Technical Areas of the Field of Statistics,' proponiendo departamentos universitarios dedicados a la ciencia de datos.

2008Patil y Hammerbacher acuñan el título laboral

Al montar equipos de datos en LinkedIn y Facebook respectivamente, DJ Patil y Jeff Hammerbacher adoptan de forma independiente 'data scientist' como título para el trabajo de estadística más ingeniería que hacían sus equipos.

2012Harvard Business Review lo llama el 'trabajo más sexy'

El artículo de octubre de 2012 de Thomas Davenport y DJ Patil 'Data Scientist: The Sexiest Job of the 21st Century' desencadena una década de contrataciones corporativas y una oleada de nuevos programas universitarios.

Las eras

1662–1899

Contar a los vivos y a los muertos

En 1662, el mercero londinense John Graunt publicó un análisis estadístico de los registros parroquiales de muertes de la ciudad, uno de los primeros intentos conocidos de extraer conclusiones generales de datos recopilados en lugar de anécdotas individuales. El astrónomo belga Adolphe Quetelet amplió la idea en los años 1830 con su 'física social,' aplicando distribuciones estadísticas a rasgos humanos. Florence Nightingale llevó la tradición a la persuasión práctica en 1858, usando un diagrama de área polar de datos de mortalidad de la Guerra de Crimea para convencer a la Oficina de Guerra británica de que la mala higiene, no el combate, mataba a la mayoría de los soldados —y se convirtió en el proceso en la primera mujer elegida Fellow de la Royal Statistical Society.

Fotografía de Ronald Fisher, cuyos métodos estadísticos sustentan la ciencia de datos moderna
Unknown author Unknown author · Public domain · Wikimedia Commons
1900–1935

Los estadísticos formalizan la inferencia

Karl Pearson fundó la revista Biometrika en 1901 para dar un hogar a la joven disciplina de la estadística matemática. William Sealy Gosset, trabajando como estadístico de la cervecería Guinness, publicó la prueba t en 1908 bajo el seudónimo 'Student' porque Guinness prohibía a los empleados publicar con su propio nombre. El libro de Ronald Fisher de 1925 'Statistical Methods for Research Workers,' escrito mientras analizaba décadas de ensayos de cultivo en la Rothamsted Experimental Station, introdujo el análisis de la varianza y el diseño experimental riguroso. Jerzy Neyman y Egon Pearson completaron el instrumental en 1933 con un marco formal para el contraste de hipótesis: la maquinaria estadística que la ciencia de datos heredaría después casi intacta.

ENIAC, uno de los primeros ordenadores electrónicos de propósito general, presentado en 1946
The original uploader was TexasDex at English Wikipedia . · CC BY-SA 3.0 · Wikimedia Commons
1936–1969

Llegan los ordenadores y Tukey plantea el caso

La Segunda Guerra Mundial aceleró el cálculo a gran escala, desde equipos humanos de cómputo hasta los primeros ordenadores electrónicos de propósito general como el ENIAC, presentado en 1946. Los estadísticos que habían pasado décadas calculando a mano usaron cada vez más las máquinas para ejecutar análisis a una escala antes imposible. En 1962, el estadístico de Bell Labs y Princeton John Tukey publicó 'The Future of Data Analysis,' sosteniendo que analizar datos reales se enseñaba 'mal' como una rama menor de la estadística matemática y merecía reconocimiento como ciencia propia, con sus propios métodos y su propia reivindicación de la atención de las universidades.

Un diagrama de caja, una de las herramientas de análisis exploratorio de datos que popularizó John Tukey
User:Schutz · Public domain · Wikimedia Commons
1970–1999

Análisis exploratorio y el auge de la minería de datos

El libro de Tukey de 1977 'Exploratory Data Analysis' dio a los profesionales herramientas prácticas —entre ellas el diagrama de caja— para comprender la forma de un conjunto de datos antes de ajustar ningún modelo. A medida que las empresas acumularon bases de datos transaccionales crecientes en los años 1980 y 1990, surgió una disciplina paralela de 'minería de datos' para encontrar patrones en ellas; un artículo de 1996 de Usama Fayyad, Gregory Piatetsky-Shapiro y Padhraic Smyth formalizó la distinción entre la minería de datos en bruto y el proceso más amplio de 'Knowledge Discovery in Databases.' El almacén de datos corporativo, popularizado a través de los escritos del consultor Bill Inmon a lo largo de la década, dio a este trabajo un hogar permanente dentro de las grandes empresas.

Ilustración conceptual de datos a gran escala, la materia prima de la ciencia de datos del siglo XXI
Jouasse · CC BY-SA 4.0 · Wikimedia Commons
2000–present

Nombrada, titulada, hipada y especializándose

El estadístico de Bell Labs William S. Cleveland propuso 'data science' como nombre para una disciplina estadística ampliada en un artículo de 2001. El artículo MapReduce de Google de 2004 y el marco de código abierto Hadoop que siguió dieron al campo herramientas baratas para datos a escala de internet. Alrededor de 2008, DJ Patil y Jeff Hammerbacher, montando equipos de datos en LinkedIn y Facebook, adoptaron de forma independiente 'data scientist' como título laboral, y el artículo de octubre de 2012 de Thomas Davenport y Patil en Harvard Business Review que lo llamó 'el trabajo más sexy del siglo XXI' desencadenó una década de contrataciones corporativas. A finales de los años 2010 el rol había madurado lo bastante como para dividirse en títulos más especializados —ingeniero de analítica, ingeniero de aprendizaje automático, analista de producto— incluso mientras la IA generativa empezaba a automatizar gran parte de las consultas y gráficos rutinarios que la descripción original del puesto asumía que haría una persona a mano.

Lo que este oficio reemplazó

Oficios vecinos que ya no existen — absorbidos, automatizados o regulados fuera.

Computadora humana

1880s–1950s

Mucho antes de los ordenadores electrónicos, equipos de trabajadores —de forma desproporcionada mujeres, como las 'Harvard Computers' que catalogaron estrellas en el Observatorio del Harvard College desde los años 1880, y Katherine Johnson, Dorothy Vaughan y Mary Jackson de la NASA, que calcularon a mano trayectorias orbitales hasta los años 1960— realizaban el trabajo matemático que hoy hace el software. Los ordenadores electrónicos absorbieron el rol en una generación de volverse fiables y asequibles.

Operador de tarjetas perforadas / keypunch

1890s–1970s

Tras el tabulador de tarjetas perforadas de Herman Hollerith, construido para el censo de EE. UU. de 1890, los operadores de keypunch pasaron décadas transcribiendo registros en papel a tarjetas que los mainframes podían leer, una habilidad administrativa especializada enseñada en cursos de formación dedicados. Los terminales de entrada directa hicieron el rol en gran medida obsoleto en los años 1970 y 1980.

Programador de informes por lotes en mainframe

1960s–2000s

Los departamentos corporativos de 'procesamiento de datos' empleaban programadores, a menudo en COBOL, cuyo trabajo principal era escribir y ejecutar trabajos por lotes nocturnos programados que producían los informes impresos de la dirección para la mañana siguiente. Los paneles de inteligencia de negocio de autoservicio y las herramientas de consulta ad hoc permitieron a los gerentes sacar sus propios números bajo demanda, cerrando esta especialidad casi por completo hacia los años 2000.

Oficios que desaparecieron →

Cada capacidad que la ciencia de datos reivindica como nueva —encontrar patrones en grandes conjuntos de datos, inferencia rigurosa, visualización persuasiva— tiene un ancestro concreto y comprobable: las tablas de mortalidad de Graunt, los ensayos de cultivo de Fisher, los diagramas de caja de Tukey. Lo que cambió en 2001 y 2008 fue sobre todo el nombre y el empaquetado, aplicados a un oficio antiguo recién potenciado por almacenamiento y cómputo baratos.

El auge del 'trabajo más sexy' de 2012 ya ha recorrido en parte su curso: el título se ha fragmentado en ingeniero de analítica, ingeniero de aprendizaje automático y analista de producto, y la IA generativa está absorbiendo las consultas y gráficos rutinarios que la descripción laboral original de 2008 daba por sentados. La disciplina subyacente —decidir qué significa realmente un patrón en los datos— parece probable que vuelva a sobrevivir al título laboral concreto.

Profesiones similares

Vecinos más cercanos en el perfil de seis puntuaciones, no solo el mismo campo.

Seguir explorando

Seguir explorando

Más en Ciencia e investigación