Skip to content

📊Los grandes

Científico de datos · Encuentra patrones y construye modelos predictivos a partir de datos: un título laboral de 2008 asentado sobre tres siglos de contar, contrastar y visualizar evidencia.

Compartir esta página

El canon de la ciencia de datos va de un mercero londinense del siglo XVII contando a mano las muertes por peste a un científico del siglo XXI minando miles de millones de clics de enlaces anonimizados. Las ocho personas aquí abarcan más de tres siglos y tres continentes.

Lo que las conecta es menos un método compartido que un instinto compartido: mirar con dureza registros reales y desordenados, y confiar en un patrón solo después de comprobar que sobrevive al escrutinio —la misma disciplina sobre la que sigue funcionando el campo, comoquiera que se titule esta década.

El podio de todos los tiempos

Florence Nightingale
Florence Nightingale
United Kingdom
2
Ronald Fisher
Ronald Fisher
United Kingdom
1
William Sealy Gosset
William Sealy Gosset
United Kingdom / Ireland
3

“Un experimento riguroso necesita un control y una aleatorización incorporados desde el principio, no discutidos después.”

Ronald Fisher

Los ocho que llegaron a la cima

1
Fotografía de Ronald Fisher Unknown author Unknown author · Public domain

Ronald Fisher

United Kingdom · 1890–1962

Estadístico y genetista británico que construyó gran parte del marco moderno de la estadística aplicada —análisis de la varianza, diseño experimental aleatorizado y estimación de máxima verosimilitud— en gran medida mientras analizaba décadas de ensayos de rendimiento de cultivos en la Rothamsted Experimental Station en los años 1920.

La anécdota

En un té de la tarde en Rothamsted a finales de los años 1920, la colega Muriel Bristol afirmó que podía distinguir si la leche se había vertido en la taza antes o después del té. En lugar de descartarla, Fisher diseñó un experimento aleatorizado para poner a prueba la afirmación: el escenario que usó más tarde en su libro de 1935 'The Design of Experiments' para exponer la lógica de la hipótesis nula y el diseño de ensayos aleatorizados.

“Un experimento riguroso necesita un control y una aleatorización incorporados desde el principio, no discutidos después.”

'Statistical Methods for Research Workers' publicado
1925
Años en Rothamsted Experimental Station
~14 yrs
Elegido Fellow de la Royal Society
1929
2
Fotografía de Florence Nightingale Henry Hering (1814-1893) · Public domain

Florence Nightingale

United Kingdom · 1820–1910

Más conocida como fundadora de la enfermería moderna, Nightingale fue también una estadística pionera que usó la visualización de datos para convencer al gobierno británico de que la mala higiene, no las heridas de batalla, mataba a la mayoría de los soldados en la Guerra de Crimea, y se convirtió en la primera mujer elegida Fellow de la Royal Statistical Society.

La anécdota

En 1858, Nightingale publicó su diagrama 'coxcomb' o de área polar —un gráfico circular que divide el año en cuñas dimensionadas por las muertes mensuales, coloreadas por causa— para mostrar a la Oficina de Guerra que la enfermedad prevenible, no el combate, causaba la abrumadora mayoría de las muertes del ejército británico en Crimea; la visualización ayudó a impulsar reformas sanitarias militares duraderas.

“Un gráfico bien diseñado puede cambiar la política de un gobierno más rápido de lo que nunca lo harán los mismos números en una tabla.”

Elegida Fellow, Royal Statistical Society
1858 (first woman)
'Notes on Matters Affecting Health' publicado
1858
Royal Sanitary Commission establecida
1857
3
Fotografía de William Sealy Gosset User Wujaszek on pl.wikipedia · Public domain

William Sealy Gosset

United Kingdom / Ireland · 1876–1937

Trabajando como químico y estadístico de la cervecería Guinness en Dublín, Gosset desarrolló la distribución t y la prueba t para resolver un problema muy práctico —juzgar la calidad de pequeñas muestras de cebada— y publicó bajo el seudónimo 'Student' porque Guinness prohibía a los empleados publicar con su propio nombre.

La anécdota

La preocupación de Guinness de que los competidores aprendieran secretos comerciales la llevó a prohibir las publicaciones del personal; el artículo histórico de Gosset de 1908 'The Probable Error of a Mean' apareció por tanto en Biometrika bajo el seudónimo 'Student,' un nombre que sigue unido a la prueba t usada en millones de análisis de muestras pequeñas hoy, mucho después de que su verdadera identidad se conociera entre los estadísticos.

“Un método construido para resolver un problema estrecho y práctico puede sobrevivir a su propósito original por más de un siglo.”

'The Probable Error of a Mean' publicado
1908, Biometrika
Años en Guinness
~38 yrs
Seudónimo usado en publicaciones
'Student'
4
Fotografía de C. R. Rao Prateek Karandikar · CC BY-SA 4.0

C. R. Rao

India / United States · 1920–2023

Estadístico indoamericano que, a los 25 años, derivó la cota de Cramér–Rao y el teorema de Rao–Blackwell —dos de los resultados más usados en teoría de la estimación estadística— y más tarde ayudó a construir el Indian Statistical Institute de India antes de una larga carrera en universidades estadounidenses.

La anécdota

El artículo de Rao de 1945, escrito como joven investigador en el Indian Statistical Institute de Kolkata, demostró un límite inferior sobre cuán precisamente cualquier estimador insesgado puede medir una cantidad desconocida —hoy llamada la cota de Cramér–Rao— un resultado tan fundacional que aparece en casi todos los libros de texto de estadística publicados desde entonces, acreditado a un artículo que escribió antes de cumplir 26.

“Un solo resultado demostrado con precisión al principio de una carrera puede sobrevivir a décadas de las modas posteriores de un campo.”

Artículo de la cota de Cramér–Rao publicado
1945
US National Medal of Science
2002
Edad al morir
102
5

John Tukey

United States · 1915–2000

Matemático y estadístico estadounidense que co-inventó el algoritmo Fast Fourier Transform, inventó el diagrama de caja y sostuvo en su artículo de 1962 'The Future of Data Analysis' que analizar datos reales debía reconocerse como una disciplina científica propia distinta de la estadística matemática.

La anécdota

En 'The Future of Data Analysis' (1962), Tukey escribió que el análisis de datos se había enseñado 'mal' como una rama menor de las matemáticas, y pasó los siguientes quince años desarrollando técnicas prácticas —incluido el diagrama de caja y el stem-and-leaf plot, introducidos en su libro de 1977 'Exploratory Data Analysis'— diseñadas para trabajarse a mano con lápiz y papel antes de que un ordenador tocara los números.

“Mira los datos con tus propios ojos, usando herramientas simples dibujadas a mano, antes de confiar en cualquier modelo construido a partir de ellos.”

'The Future of Data Analysis' publicado
1962
'Exploratory Data Analysis' publicado
1977
Algoritmo Fast Fourier Transform
1965, with Cooley
6

William S. Cleveland

United States · b. 1943

Estadístico de Bell Labs que acuñó 'data science' como nombre para una disciplina estadística ampliada en un artículo de 2001, e inventó por separado técnicas de visualización de datos y suavizado muy usadas, incluido el método de regresión local LOESS.

La anécdota

El artículo de Cleveland de 2001 'Data Science: An Action Plan for Expanding the Technical Areas of the Field of Statistics' propuso que las universidades crearan departamentos dedicados de ciencia de datos distintos de los de estadística —una recomendación institucional concreta que tardó más de una década en cuajar, pero hacia mediados de los años 2010 cientos de universidades en todo el mundo habían hecho exactamente eso.

“Nombrar y proponer formalmente los límites de un campo por escrito puede moldear cómo se organizan las universidades en torno a él años después.”

'Data Science: An Action Plan' publicado
2001
'Visualizing Data' publicado
1993
Años en Bell Labs
~30 yrs
7

DJ Patil

United States · b. 1973

Dirigió el equipo de datos de LinkedIn donde él y su colega Jeff Hammerbacher adoptaron de forma independiente el título laboral 'data scientist' alrededor de 2008, coescribió el influyente artículo de Harvard Business Review de 2012 que lo nombraba 'el trabajo más sexy del siglo XXI,' y más tarde fue el primer Chief Data Scientist de EE. UU. bajo el presidente Obama.

La anécdota

Patil ha contado que mientras montaba el equipo de datos de LinkedIn alrededor de 2008, él y su equipo consideraron títulos como 'data analyst' y 'business analyst' antes de quedarse con 'data scientist' en parte porque capturaba mejor la mezcla de ingeniería y estadística que el rol exigía realmente, y en parte porque era simplemente un título más atractivo para reclutar.

“El título laboral correcto puede moldear cómo se recluta a toda una profesión, casi tanto como el trabajo en sí.”

Artículo 'Sexiest Job' de HBR publicado
Oct 2012, with Davenport
Mandato como US Chief Data Scientist
2015–2017
Se unió al equipo de datos de LinkedIn
2008
8

Hilary Mason

United States · b. 1978

Se convirtió en chief scientist de bit.ly en 2009, una de las primeras personas en ostentar el título laboral en público, usando los masivos datos de clics del servicio de acortamiento de enlaces para estudiar qué se propaga en línea, y más tarde fundó la startup de investigación en aprendizaje automático Fast Forward Labs.

La anécdota

En bit.ly, Mason y sus colegas minaron miles de millones de clics anonimizados de enlaces acortados para estudiar cómo se propaga realmente la información por internet en tiempo real, publicando hallazgos sobre patrones como a qué hora del día se hace más clic en los enlaces —convirtiendo una utilidad de acortamiento de enlaces en uno de los primeros programas de investigación de ciencia de datos a gran escala discutidos en público.

“Un producto de infraestructura mundano puede duplicarse como uno de los conjuntos de datos de investigación más ricos disponibles, si alguien piensa en mirar.”

Chief Scientist de bit.ly desde
2009
Fast Forward Labs fundada
2014
Fast Forward Labs adquirida por Cloudera
2017

Las barras se escalan respecto al líder de esta lista.

Laboratorio comparativo

Activa o apaga nombres: cada barra se reescala al líder de tu selección.

5 / 8

El debate

Si DJ Patil y Jeff Hammerbacher 'acuñaron' realmente el título laboral está disputado; ambos han acreditado a equipos más amplios y al uso informal previo en la industria, y la frase aparece en referencias dispersas antes de 2008.

El crédito por nombrar el campo en sí está contestado: el informático Peter Naur usó el término 'data science' como sinónimo de informática ya en 1974, décadas antes de la propuesta ampliamente citada de William S. Cleveland de 2001.

Profesiones similares

Vecinos más cercanos en el perfil de seis puntuaciones, no solo el mismo campo.

Seguir explorando

Seguir explorando

Más en Ciencia e investigación