Skip to content

📊Culture & Status

Scientifique des données · Détecte des régularités et construit des modèles prédictifs à partir de données — un intitulé de poste né en 2008, fondé sur trois siècles de comptage, de tests et de visualisation des preuves.

Partager cette page

La culture populaire a surtout sauté l'étape du statisticien pour aller directement au quant ou à l'algorithme — l'image publique du scientifique des données doit plus aux analystes de baseball de Moneyball et aux quants prédisant la crise dans The Big Short qu'à quiconque faisant concrètement le métier au quotidien.

À l'intérieur du domaine, la culture repose sur des benchmarks publics compétitifs, des blagues statistiques deadpan et un format documentaire — la fiche modèle — qui transforme « être honnête sur les limites de son modèle » en habitude professionnelle routinière plutôt qu'en réflexion après coup.

Social standing through history

How much status the profession carried in each era, on a 0–100 scale.

2235285578
1660s–18991900s–1930s1950s–1980s2001–20112012–présent
1660s–1899

Les premiers travaux statistiques étaient surtout menés par des clercs, des réformateurs amateurs et des autodidactes comme Nightingale ; utiles et parfois influents, mais rarement prestigieux en eux-mêmes.

1900s–1930s

Pearson, Fisher et Gosset professionnalisent les statistiques en discipline académique avec ses propres revues et départements universitaires, gagnant le respect savant tout en restant presque invisibles pour le grand public.

1950s–1980s

Avec la diffusion de l'informatique centralisée, le personnel de « traitement des données » et les statisticiens étaient surtout vus comme un support d'entreprise essentiel mais peu glamour, rarement présents dans la prise de décision exécutive.

2001–2011

La proposition académique de Cleveland en 2001 attire peu l'attention du public, mais le prix d'un million de dollars de Netflix en 2006–2009 pour un algorithme de recommandation et la création de l'intitulé « data scientist » en 2008 chez LinkedIn et Facebook commencent à faire tourner les têtes dans l'industrie technologique.

2012–présent

Le cadrage « sexiest job » de la Harvard Business Review en octobre 2012 déclenche un boom de recrutement et de prestige ; dans les années 2020, l'intitulé s'est fragmenté en rôles plus spécialisés et a perdu une part de son éclat singulier, bien que la rémunération et la demande restent solides.

In film, books and art

Film2011

Moneyball

Bennett Miller (réalisateur) ; d'après le livre de Michael Lewis (2003)

Dramatise comment Billy Beane des Oakland Athletics et l'analyste Paul DePodesta ont utilisé l'analyse statistique, s'inspirant de la sabermétrie de Bill James, pour constituer une équipe compétitive avec l'un des plus petits budgets du baseball.

Film2015

The Big Short

Adam McKay (réalisateur) ; d'après le livre de Michael Lewis

Suit une poignée d'analystes qui ont étudié de près les données du marché hypothécaire pour prédire la crise financière de 2008 avant que presque personne ne croie aux chiffres.

Série TV2005–2010

Numb3rs

Nicolas Falacci et Cheryl Heuton (créateurs)

Un mathématicien aide son frère agent du FBI à résoudre des crimes par l'analyse statistique et la reconnaissance de motifs, introduisant un public télévisuel américain mainstream aux mathématiques appliquées comme travail d'enquête.

Série TV2011–présent

Black Mirror

Charlie Brooker (créateur)

Cette série anthologique britannique imagine à plusieurs reprises le profilage de données et le scoring prédictif poussés à des extrêmes inquiétants, notamment dans l'épisode de 2016 « Nosedive », façonnant l'anxiété publique face au classement algorithmique des personnes.

Film2016

Hidden Figures

Theodore Melfi (réalisateur) ; d'après le livre de Margot Lee Shetterly

Raconte l'histoire réelle de Katherine Johnson, Dorothy Vaughan et Mary Jackson, mathématiciennes noires dont les calculs à la main à la NASA ont soutenu les missions orbitales Mercury de 1962 avant que les ordinateurs électroniques ne prennent le relais.

Documentaire2020

Coded Bias

Shalini Kantayya (réalisatrice)

Suit la découverte par la chercheuse du MIT Joy Buolamwini que les systèmes de reconnaissance faciale identifient bien plus souvent à tort les visages à peau foncée, transformant un constat technique de biais de données en prise de conscience publique plus large sur l'équité algorithmique.

Proverbs and idioms

Garbage in, garbage out

Adage informatique, largement répandu dès les années 1950–60Un modèle ou une analyse n'est fiable que dans la mesure des données qui l'alimentent — aucune sophistication statistique ne rattrape des données d'entrée médiocres.

All models are wrong, but some are useful

George Box, statisticien, « Science and Statistics », Journal of the American Statistical Association, 1976Tout modèle simplifie la réalité ; l'objectif est un modèle assez précis pour être utile, et non une description parfaite du monde.

Correlation does not imply causation

Maxime statistique classique, formalisée au fil des statistiques du début du XXe siècleDeux variables évoluant ensemble ne prouvent pas que l'une cause l'autre — un troisième facteur caché peut expliquer les deux.

C'est 80 % de nettoyage de données

Maxime industrielle très répétée, reprise dans l'article de 2014 du New York Times de Steve Lohr sur le « travail de conciergerie » des scientifiques des donnéesLa majeure partie du temps d'un vrai projet va à la recherche, au nettoyage et au remaniement des données, et non à la construction du modèle lui-même.

Rites, symbols and dress

Le « shake-up » du classement Kaggle

Les compétitions publiques d'apprentissage automatique hébergées sur Kaggle, lancées en 2010, classent les participants sur un tableau de bord visible tout au long du concours, puis révèlent le classement final sur un jeu de test caché à la clôture — un moment que les compétiteurs appellent le « shake-up », car un surajustement au classement public peut faire chuter une équipe de dizaines de places du jour au lendemain.

Publier une fiche modèle

Suivant la pratique proposée dans un article de 2018 de Margaret Mitchell et collègues chez Google, les équipes documentent de plus en plus l'usage prévu d'un modèle, ses données d'entraînement et ses limites connues dans une courte « fiche modèle » avant mise en production — traitée comme une obligation professionnelle plutôt qu'un extra optionnel.

La présentation en notebook

Présenter des résultats exploratoires en faisant défiler en direct les cellules et graphiques d'un notebook Jupyter, plutôt qu'un diaporama poli, reste la façon par défaut dont un scientifique des données partage des résultats préliminaires avec collègues et parties prenantes.

Rien de tout cela ne tranche la plus vieille tension du domaine : la science des données est-elle une discipline réellement nouvelle ou un travail statistique et informatique plus ancien sous un nom plus vendeur ? Les praticiens eux-mêmes en débattent, souvent au sein de la même équipe.

Ce qui est resté constant depuis les tables de mortalité de Graunt en 1662, c'est le geste de base : transformer un amas de registres en affirmation sur laquelle quelqu'un peut agir, et être honnête sur la part de cette affirmation que les données supportent réellement.

Métiers proches

Voisins les plus proches sur le profil à six scores — pas seulement le même champ.

Continuer à explorer

Keep exploring

More in Science & Research