Skip to content

📊Craft & Know-How

Scientifique des données · Détecte des régularités et construit des modèles prédictifs à partir de données — un intitulé de poste né en 2008, fondé sur trois siècles de comptage, de tests et de visualisation des preuves.

Partager cette page

L'image populaire du scientifique des données construisant des modèles prédictifs ingénieux est réelle mais incomplète. Enquêtes auprès des praticiens et récits de première main décrivent un métier où trouver, nettoyer et remanier des données désordonnées absorbe plus d'heures que l'étape de modélisation que la plupart imaginent.

Le savoir-faire transmis dans le domaine repose moins sur la mémorisation d'un algorithme précis que sur un scepticisme discipliné : examiner les données avant de faire confiance à un modèle, vérifier si une régularité tient dans des sous-groupes, et savoir quand la réponse honnête à la question d'un décideur est que les données ne permettent pas d'en conclure.

What the work demands

857870726258
Statistiques et probabilités
85
Programmation (Python, SQL, R)
78
Préparation et pipelines de données
70
Modélisation en apprentissage automatique
72
Communication des résultats
62
Contexte métier ou de domaine
58

Statistiques et probabilités

Tests d'hypothèses, régression, et comprendre ce qu'une p-valeur ou un intervalle de confiance affirme réellement — le fondement inférentiel sur lequel repose tout le reste du métier.

Programmation (Python, SQL, R)

Écrire du code assez fluide pour extraire, nettoyer et transformer des données à grande échelle, et non seulement prototyper une analyse dans un notebook qui n'a jamais besoin de tourner à nouveau.

Préparation et pipelines de données

Transformer des données réelles désordonnées — valeurs manquantes, doublons, formats incohérents — en quelque chose qu'un modèle ou un graphique peut réellement utiliser.

Modélisation en apprentissage automatique

Choisir, entraîner et valider un modèle adapté au problème, et savoir quand une simple régression bat un réseau de neurones élaboré.

Communication des résultats

Traduire un résultat statistique en graphique, note ou recommandation qu'un dirigeant non technique peut exploiter, sans simplifier à l'excès ni noyer l'incertitude réelle.

Contexte métier ou de domaine

Comprendre ce qu'une métrique signifie réellement dans une entreprise ou un domaine scientifique précis, pour que l'analyse réponde à la question réellement posée.

A day in the life

Stand-up et contrôle des tableaux de bordExtraction et nettoyage de donnéesDéjeunerModélisation et analyseRéunions avec parties prenantes et revuesHors horaires (en principe) 036912151821 24h
  1. 8–9 Stand-up et contrôle des tableaux de bord

    Revue des exécutions nocturnes de pipelines et des tableaux de bord de métriques clés, et bref point d'équipe sur les priorités du jour.

  2. 9–12 Extraction et nettoyage de données

    Écriture de requêtes SQL contre un entrepôt de données, jointures et remaniement de tables, gestion des valeurs manquantes ou incohérentes — souvent le plus gros bloc d'une journée de travail.

  3. 12–13 Déjeuner

    Une vraie pause, et souvent l'occasion informelle de remonter des problèmes inter-équipes avant qu'ils n'atteignent une réunion planifiée.

  4. 13–15 Modélisation et analyse

    Construction ou affinage d'un modèle statistique, test de significativité d'une expérience, ou creusement des raisons d'un mouvement de métrique.

  5. 15–17 Réunions avec parties prenantes et revues

    Présentation de résultats à une équipe produit ou métier, revue des résultats d'un test A/B, ou défense des hypothèses d'une analyse sous questionnement.

  6. 17–8 Hors horaires (en principe)

    Temps personnel, sauf autour d'un lancement produit ou d'une revue trimestrielle, où les soirées peuvent absorber des demandes d'analyse de dernière minute.

The know-how

Craft knowledge practitioners actually pass on — not motivation.

01

Regarder les données avant de les modéliser

Tracer les distributions brutes, nuages de points et résumés simples avant d'ajuster quoi que ce soit — une habitude qui détecte des données cassées, des erreurs d'unité et des valeurs aberrantes qu'un modèle absorberait autrement silencieusement.

John Tukey, « Exploratory Data Analysis », 1977
02

Vérifier si la tendance tient dans les sous-groupes

Une tendance agrégée peut s'inverser complètement une fois les données scindées par une catégorie pertinente — un phénomène connu sous le nom de paradoxe de Simpson, du nom d'un article de 1951 du statisticien Edward H. Simpson.

Edward H. Simpson, article de 1951 ; phénomène noté plus tôt par Karl Pearson et d'autres
03

Mettre de côté un jeu de test et ne pas le regarder avant la fin

Vérifier à plusieurs reprises les performances sur les mêmes données tenues à l'écart, puis ajuster le modèle, fuit silencieusement de l'information de ces données vers le modèle — ne les toucher qu'une seule fois, c'est ce qui garde un résultat final honnête.

Pratique standard, formalisée dans Hastie, Tibshirani et Friedman, « The Elements of Statistical Learning », 2001
04

Budgéter la majeure partie du projet pour le nettoyage, pas la modélisation

Les vrais projets tournent régulièrement autour de 80 % de préparation de données et 20 % de modélisation plutôt que l'inverse — planifier un calendrier sur l'hypothèse contraire est une façon courante de prendre du retard.

Largement repris depuis Steve Lohr, « For Big-Data Scientists, "Janitor Work" Is Key Hurdle to Insight », New York Times, 2014
05

Livrer d'abord le modèle le plus simple qui pourrait raisonnablement fonctionner

Une baseline — parfois une simple règle ou un modèle linéaire — clarifie combien un modèle plus complexe ajoute réellement, et suffit souvent à être mise en production telle quelle.

Martin Zinkevich, « Rules of Machine Learning: Best Practices for ML Engineering », Google, règle n° 4
06

Quand une régularité semble trop belle, traquer la variable confondante

Une corrélation surprenante est plus souvent un artefact d'une troisième variable cachée qu'une découverte authentique — chercher activement ce qui pourrait l'expliquer avant de présenter un résultat.

Enraciné dans la tradition du plan d'expérience de Fisher ; formalisé dans Judea Pearl, « The Book of Why », 2018

Tools of the trade

Python (pandas, scikit-learn, NumPy)

Le langage dominant pour la manipulation de données et l'apprentissage automatique classique, avec pandas pour les données tabulaires et scikit-learn pour les algorithmes de modélisation standard.

SQL

Le langage de requête pour extraire des données des entrepôts relationnels et cloud — Snowflake, BigQuery, Redshift — où vivent réellement les données de la plupart des entreprises.

Jupyter Notebook

L'environnement interactif standard pour l'analyse exploratoire, permettant d'exécuter du code, voir un graphique et prendre des notes dans le même document.

Tableau / Power BI

Des outils de tableaux de bord de business intelligence pour transformer une analyse terminée en quelque chose qu'un décideur non technique peut explorer et suivre sans écrire de code.

Git et plateformes cloud (AWS, GCP, Azure)

Contrôle de version pour le code et, de plus en plus, pour les modèles, aux côtés de l'infrastructure cloud qui stocke les données et exécute les jobs d'entraînement à une échelle qu'un ordinateur portable ne peut pas gérer.

How people fail at it

Tester jusqu'à obtenir une significativité

Exécuter de nombreuses comparaisons statistiques et ne rapporter que celle qui franchit un seuil de significativité produit des fausses découvertes qui ne se reproduiront pas — un mode d'échec bien documenté connu sous le nom de p-hacking.

Livrer un modèle qui fuit la cible

Inclure accidentellement une variable qui encode le résultat prédit produit des résultats hors ligne irréalistement forts qui s'effondrent une fois le modèle exécuté sur de vraies données de production jamais vues.

Construire une réponse sophistiquée à la mauvaise question

Un modèle d'apprentissage automatique soigneusement optimisé résolvant un problème qu'une simple requête SQL ou une formule de tableur aurait traité tout aussi bien gaspille l'effort et peut manquer la vraie question métier.

Métiers proches

Voisins les plus proches sur le profil à six scores — pas seulement le même champ.

Continuer à explorer

Keep exploring

More in Science & Research