Skip to content

📊The Greats

Scientifique des données · Détecte des régularités et construit des modèles prédictifs à partir de données — un intitulé de poste né en 2008, fondé sur trois siècles de comptage, de tests et de visualisation des preuves.

Partager cette page

Le canon de la science des données va d'un commerçant londonien du XVIIe siècle comptant à la main les morts de la peste à un scientifique du XXIe siècle exploitant des milliards de clics anonymisés. Les huit personnes ici couvrent plus de trois siècles et trois continents.

Ce qui les relie, ce n'est pas tant une méthode commune qu'un instinct partagé : regarder attentivement de vrais registres désordonnés, et ne faire confiance à une régularité qu'après l'avoir soumise à l'examen — la même discipline sur laquelle le domaine repose encore, quel que soit l'intitulé du moment.

The all-time podium

Florence Nightingale
Florence Nightingale
United Kingdom
2
Ronald Fisher
Ronald Fisher
United Kingdom
1
William Sealy Gosset
William Sealy Gosset
United Kingdom / Ireland
3

“Une expérience rigoureuse a besoin d'un témoin et d'une randomisation intégrés dès le départ, et non discutés après coup.”

Ronald Fisher

The eight who reached the top

1
Photographie de Ronald Fisher Unknown author Unknown author · Public domain

Ronald Fisher

United Kingdom · 1890–1962

Statisticien et généticien britannique qui a construit une grande partie du cadre moderne des statistiques appliquées — analyse de variance, plan d'expérience randomisé et estimation par vraisemblance maximale — surtout en analysant des décennies d'essais de rendement agricole à la Rothamsted Experimental Station dans les années 1920.

The story

Lors d'un thé l'après-midi à Rothamsted à la fin des années 1920, la collègue Muriel Bristol affirma pouvoir dire si le lait avait été versé dans la tasse avant ou après le thé. Plutôt que de la rejeter, Fisher conçut une expérience randomisée pour tester réellement l'affirmation — le scénario qu'il utilisa plus tard dans son ouvrage de 1935 « The Design of Experiments » pour exposer la logique de l'hypothèse nulle et du plan d'essai randomisé.

“Une expérience rigoureuse a besoin d'un témoin et d'une randomisation intégrés dès le départ, et non discutés après coup.”

« Statistical Methods for Research Workers » publié
1925
Années à la Rothamsted Experimental Station
~14 ans
Élu Fellow de la Royal Society
1929
2
Photographie de Florence Nightingale Henry Hering (1814-1893) · Public domain

Florence Nightingale

United Kingdom · 1820–1910

Plus connue comme fondatrice des soins infirmiers modernes, Nightingale fut aussi une statisticienne pionnière qui utilisa la visualisation de données pour convaincre le gouvernement britannique que la mauvaise hygiène, et non les blessures de guerre, tuait la plupart des soldats en Crimée, et devint la première femme élue Fellow de la Royal Statistical Society.

The story

En 1858, Nightingale publia son diagramme polaire ou « coxcomb » — un graphique circulaire divisant l'année en secteurs dimensionnés par les décès mensuels, colorés par cause — pour montrer au War Office que la maladie évitable, et non le combat, causait l'écrasante majorité des morts de l'armée britannique en Crimée ; la visualisation contribua à des réformes sanitaires durables de l'armée.

“Un graphique bien conçu peut changer une politique gouvernementale plus vite que les mêmes chiffres dans un tableau.”

Élue Fellow, Royal Statistical Society
1858 (première femme)
« Notes on Matters Affecting Health » publié
1858
Royal Sanitary Commission établie
1857
3
Photographie de William Sealy Gosset User Wujaszek on pl.wikipedia · Public domain

William Sealy Gosset

United Kingdom / Ireland · 1876–1937

Chimiste et statisticien à la brasserie Guinness à Dublin, Gosset développa la loi t et le test t pour résoudre un problème très concret — juger la qualité de petits échantillons d'orge — et publia sous le pseudonyme « Student » parce que Guinness interdisait à son personnel de publier sous son propre nom.

The story

La crainte de Guinness que des concurrents découvrent des secrets commerciaux l'amena à interdire les publications du personnel ; l'article fondateur de 1908 de Gosset « The Probable Error of a Mean » parut donc dans Biometrika sous le pseudonyme « Student », un nom toujours attaché au test t utilisé dans des millions d'analyses d'échantillons de petite taille, longtemps après que son identité fut connue des statisticiens.

“Une méthode construite pour résoudre un problème étroit et concret peut survivre à son objectif d'origine de plus d'un siècle.”

« The Probable Error of a Mean » publié
1908, Biometrika
Années chez Guinness
~38 ans
Pseudonyme utilisé dans les publications
« Student »
4
Photographie de C. R. Rao Prateek Karandikar · CC BY-SA 4.0

C. R. Rao

India / United States · 1920–2023

Statisticien indo-américain qui, à 25 ans, dériva la borne de Cramér–Rao et le théorème de Rao–Blackwell — deux des résultats les plus largement utilisés en théorie de l'estimation statistique — et contribua plus tard à construire l'Indian Statistical Institute avant une longue carrière dans des universités américaines.

The story

L'article de 1945 de Rao, rédigé comme jeune chercheur à l'Indian Statistical Institute de Kolkata, prouva une limite inférieure à la précision avec laquelle tout estimateur sans biais peut mesurer une quantité inconnue — désormais appelée borne de Cramér–Rao — un résultat si fondateur qu'il figure dans presque tous les manuels de statistiques publiés depuis, crédité à un article qu'il écrivit avant ses 26 ans.

“Un seul résultat rigoureusement démontré tôt dans une carrière peut survivre à des décennies de modes ultérieures du domaine.”

Article sur la borne de Cramér–Rao publié
1945
National Medal of Science (É.-U.)
2002
Âge au décès
102
5

John Tukey

United States · 1915–2000

Mathématicien et statisticien américain co-inventeur de l'algorithme de transformée de Fourier rapide, inventeur du diagramme en boîte, et auteur de l'article de 1962 « The Future of Data Analysis » arguant que l'analyse de données réelles devrait être reconnue comme discipline scientifique distincte des statistiques mathématiques.

The story

Dans « The Future of Data Analysis » (1962), Tukey écrivit que l'analyse de données avait été « mal enseignée » comme branche mineure des mathématiques, et passa les quinze années suivantes à développer des techniques pratiques — dont le diagramme en boîte et le diagramme en tiges-et-feuilles, introduits dans son ouvrage de 1977 « Exploratory Data Analysis » — conçues pour être travaillées à la main au crayon et au papier avant qu'un ordinateur ne touche les chiffres.

“Regarder les données de ses propres yeux, avec des outils simples dessinés à la main, avant de faire confiance à un modèle construit à partir d'elles.”

« The Future of Data Analysis » publié
1962
« Exploratory Data Analysis » publié
1977
Algorithme de transformée de Fourier rapide
1965, avec Cooley
6

William S. Cleveland

United States · b. 1943

Statisticien des Bell Labs qui inventa « data science » comme nom d'une discipline statistique élargie dans un article de 2001, et inventa séparément des techniques de visualisation et de lissage largement utilisées, dont la méthode de régression locale LOESS.

The story

L'article de 2001 de Cleveland « Data Science: An Action Plan for Expanding the Technical Areas of the Field of Statistics » proposa que les universités créent des départements de science des données distincts des départements de statistiques — une recommandation institutionnelle précise qui mit plus d'une décennie à s'imposer, mais que des centaines d'universités dans le monde ont adoptée à la mi-2010.

“Nommer et proposer formellement les frontières d'un domaine par écrit peut façonner la façon dont les universités s'organisent autour de lui des années plus tard.”

« Data Science: An Action Plan » publié
2001
« Visualizing Data » publié
1993
Années aux Bell Labs
~30 ans
7

DJ Patil

United States · b. 1973

A dirigé l'équipe data de LinkedIn où lui et son collègue Jeff Hammerbacher adoptèrent indépendamment l'intitulé « data scientist » vers 2008, co-écrivit l'influent article de 2012 de la Harvard Business Review le qualifiant de « sexiest job of the 21st century », et servit ensuite comme premier Chief Data Scientist des États-Unis sous le président Obama.

The story

Patil a raconté qu'en constituant l'équipe data de LinkedIn vers 2008, lui et son équipe envisagèrent des intitulés comme « data analyst » et « business analyst » avant de choisir « data scientist » en partie parce qu'il capturait mieux le mélange d'ingénierie et de statistiques que le rôle exigeait réellement, et en partie parce que c'était simplement un intitulé plus attractif pour recruter.

“Le bon intitulé de poste peut façonner la façon dont toute une profession se recrute, presque autant que le travail lui-même.”

Article HBR « Sexiest Job » publié
oct. 2012, avec Davenport
Mandat de Chief Data Scientist (É.-U.)
2015–2017
Rejoint l'équipe data de LinkedIn
2008
8

Hilary Mason

United States · b. 1978

Devint la chief scientist de bit.ly en 2009, l'une des premières personnes à porter publiquement l'intitulé, utilisant les données massives de clics du service de raccourcissement de liens pour étudier ce qui se propage en ligne, et fonda plus tard la startup de recherche en apprentissage automatique Fast Forward Labs.

The story

Chez bit.ly, Mason et ses collègues exploitèrent des milliards de clics anonymisés sur des liens raccourcis pour étudier comment l'information se propage réellement sur Internet en temps réel, publiant des résultats sur des régularités comme l'heure de la journée où les liens sont le plus cliqués — transformant un utilitaire de raccourcissement en l'un des premiers grands programmes de recherche en science des données discutés publiquement.

“Un produit d'infrastructure banal peut aussi servir de l'un des jeux de données de recherche les plus riches disponibles, si quelqu'un pense à les regarder.”

Chief Scientist chez bit.ly depuis
2009
Fast Forward Labs fondé
2014
Fast Forward Labs acquis par Cloudera
2017

Les barres sont proportionnelles au leader de cette liste.

Labo comparatif

Toggle names on and off — every bar rescales to the leader of your selection.

5 / 8

The argument

La question de savoir si DJ Patil et Jeff Hammerbacher ont vraiment « inventé » l'intitulé de poste est disputée ; tous deux ont crédité des équipes plus larges et un usage informel antérieur dans l'industrie, et l'expression apparaît dans des références éparses avant 2008.

La paternité du nom du domaine est contestée : l'informaticien Peter Naur utilisa le terme « data science » comme synonyme d'informatique dès 1974, des décennies avant la proposition largement citée de William S. Cleveland en 2001.

Métiers proches

Voisins les plus proches sur le profil à six scores — pas seulement le même champ.

Continuer à explorer

Keep exploring

More in Science & Research