Skip to content

📊Cultura y estatus

Científico de datos · Encuentra patrones y construye modelos predictivos a partir de datos: un título laboral de 2008 asentado sobre tres siglos de contar, contrastar y visualizar evidencia.

Compartir esta página

La cultura popular se saltó en gran medida al estadístico y fue directamente a la figura más dramática del quant o del algoritmo: la imagen pública del científico de datos debe más a los analistas de béisbol de Moneyball y a los quants que predicen crisis de The Big Short que a cualquiera haciendo lo que un científico de datos en activo hace realmente día a día.

Dentro del campo, la cultura se sostiene en benchmarks públicos competitivos, bromas estadísticas de tono seco y un formato documental —la model card— que convierte 'sé honesto sobre los límites de tu modelo' en un hábito profesional rutinario en lugar de una ocurrencia a posteriori.

Estatus social a lo largo de la historia

Cuánto estatus tuvo la profesión en cada era, en escala 0–100.

2235285578
1660s–18991900s–1930s1950s–1980s2001–20112012–present
1660s–1899

El trabajo estadístico temprano lo hacían en gran medida oficinistas, reformadores aficionados y autodidactas como Nightingale; útil y a veces influyente, pero rara vez prestigioso por sí mismo.

1900s–1930s

Pearson, Fisher y Gosset profesionalizaron la estadística en una disciplina académica con sus propias revistas y departamentos universitarios, ganando respeto académico mientras seguían casi invisibles para el público en general.

1950s–1980s

A medida que se extendía la informática de mainframe, el personal de 'procesamiento de datos' y los estadísticos se veían sobre todo como apoyo corporativo de retaguardia esencial pero poco glamoroso, rara vez presentes en la toma de decisiones ejecutivas.

2001–2011

La propuesta académica de Cleveland de 2001 atrajo poca atención pública, pero el premio de un millón de dólares de Netflix de 2006–2009 por un algoritmo de recomendación y la acuñación de 'data scientist' en 2008 en LinkedIn y Facebook empezaron a girar cabezas dentro de la industria tecnológica.

2012–present

El encuadre de 'trabajo más sexy' de Harvard Business Review de octubre de 2012 desencadenó un auge de contratación y prestigio; hacia los años 2020 el título se ha fragmentado en roles más especializados y ha perdido parte de su brillo singular, aunque el salario y la demanda siguen fuertes.

En cine, libros y arte

Film2011

Moneyball

Bennett Miller (director); basada en el libro de Michael Lewis de 2003

Dramatiza cómo Billy Beane de los Oakland Athletics y el analista Paul DePodesta usaron el análisis estadístico, apoyándose en la sabermétrica de Bill James, para montar una plantilla competitiva con uno de los presupuestos más pequeños del béisbol.

Film2015

The Big Short

Adam McKay (director); basada en el libro de Michael Lewis

Sigue a un puñado de analistas que estudiaron los datos del mercado hipotecario con suficiente detenimiento como para predecir la crisis financiera de 2008 antes de que casi nadie más creyera los números.

TV series2005–2010

Numb3rs

Nicolas Falacci y Cheryl Heuton (creadores)

Un matemático ayuda a su hermano agente del FBI a resolver crímenes usando análisis estadístico y reconocimiento de patrones, introduciendo a una audiencia televisiva estadounidense generalista las matemáticas aplicadas como trabajo de investigación.

TV series2011–present

Black Mirror

Charlie Brooker (creador)

Esta antología británica imagina de forma recurrente el perfilado de datos y la puntuación predictiva llevados a extremos inquietantes, de forma más directa en el episodio de 2016 'Nosedive,' moldeando la ansiedad pública sobre el ranking algorítmico de las personas.

Film2016

Hidden Figures

Theodore Melfi (director); basada en el libro de Margot Lee Shetterly

Cuenta la historia real de Katherine Johnson, Dorothy Vaughan y Mary Jackson, matemáticas negras cuyos cálculos a mano en la NASA sustentaron las misiones orbitales Mercury de 1962 antes de que los ordenadores electrónicos tomaran el relevo.

Documentary2020

Coded Bias

Shalini Kantayya (directora)

Sigue el descubrimiento de la investigadora del MIT Joy Buolamwini de que los sistemas de reconocimiento facial identifican mal las caras de piel más oscura con mucha más frecuencia, convirtiendo un hallazgo técnico de sesgo en los datos en un ajuste de cuentas público más amplio con la equidad algorítmica.

Proverbios y dichos

Garbage in, garbage out

Aforismo informático, de uso amplio hacia los años 1950–60Un modelo o un análisis solo es tan fiable como los datos que se le alimentan: ninguna sofisticación estadística salva unos datos de entrada malos.

All models are wrong, but some are useful

George Box, estadístico, 'Science and Statistics,' Journal of the American Statistical Association, 1976Todo modelo es una simplificación de la realidad; el objetivo es un modelo lo bastante preciso para ser útil, no una descripción perfecta del mundo.

Correlation does not imply causation

Máxima estadística clásica, formalizada a través de la estadística de principios del siglo XXQue dos variables se muevan juntas no prueba que una cause la otra: un tercer factor oculto puede explicar ambas.

It's 80% data cleaning

Máxima industrial muy repetida, eco del artículo de Steve Lohr de 2014 en The New York Times sobre el 'trabajo de conserje' de los científicos de datosLa mayor parte del tiempo de un proyecto real se va en encontrar, limpiar y reestructurar datos, no en construir el modelo en sí.

Ritos, símbolos y vestimenta

El shake-up del leaderboard de Kaggle

Las competiciones públicas de aprendizaje automático alojadas en Kaggle, lanzadas en 2010, clasifican a los participantes en un leaderboard visible a lo largo del concurso y luego revelan la clasificación final contra un conjunto de prueba oculto al cerrarlo: un momento que los competidores llaman el 'shake-up,' porque el sobreajuste al leaderboard público puede hacer caer a un equipo docenas de puestos de la noche a la mañana.

Publicar una model card

Siguiendo la práctica propuesta en un artículo de 2018 de Margaret Mitchell y colegas en Google, los equipos documentan cada vez más el uso previsto de un modelo, los datos de entrenamiento y las limitaciones conocidas en una breve 'model card' antes de que se lance —tratada como una obligación profesional más que como un extra opcional.

El recorrido por el cuaderno

Presentar hallazgos exploratorios desplazándose en vivo por las celdas y gráficos de un cuaderno Jupyter, en lugar de una presentación de diapositivas pulida, sigue siendo la forma por defecto en que un científico de datos comparte resultados tempranos con compañeros e interlocutores.

Nada de esto resuelve la tensión más antigua del campo: si 'data science' es una disciplina genuinamente nueva o trabajo estadístico e informático más antiguo con un nombre más vendible. Los propios profesionales discuten sobre ello, a menudo dentro del mismo equipo.

Lo que se ha mantenido constante desde las tablas de mortalidad de Graunt de 1662 es el movimiento básico: convertir un montón de registros en una afirmación sobre la que alguien puede actuar, y ser honesto sobre cuánto de esa afirmación respaldan realmente los datos.

Profesiones similares

Vecinos más cercanos en el perfil de seis puntuaciones, no solo el mismo campo.

Seguir explorando

Seguir explorando

Más en Ciencia e investigación