Formuler la bonne question
84Transformer un problème métier ou scientifique vague en question précise et testable exige un contexte organisationnel et de domaine qu'un outil automatisé n'a pas accès par lui-même.
Scientifique des données · Détecte des régularités et construit des modèles prédictifs à partir de données — un intitulé de poste né en 2008, fondé sur trois siècles de comptage, de tests et de visualisation des preuves.
Plus la case est foncee, plus le score de cet indicateur est eleve.
MoinsPlus
Derniere relecture Sources et creditsCrédits médiasMéthodologie
Contrairement à l'image du « constructeur de modèles d'IA », la plupart des journées se partagent entre l'écriture de requêtes SQL et de code Python pour extraire et nettoyer les données, l'exécution de tests statistiques ou l'entraînement de modèles, et la traduction des résultats en graphique ou note de synthèse qu'un décideur non technique peut exploiter. Les enquêtes auprès des praticiens placent régulièrement le nettoyage et la préparation des données à environ la moitié — voire davantage — du temps de travail total.
Non. Contrairement à la médecine ou au droit, il n'existe ni licence ni diplôme unique obligatoire ; une licence ou un master en statistiques, informatique, mathématiques ou dans un autre domaine quantitatif voisin constitue la voie la plus courante, et un solide portfolio de projets réels compte souvent davantage aux yeux des employeurs que le diplôme exact. Les doctorats sont plus fréquents dans les rôles fortement orientés recherche ou apprentissage automatique appliqué.
Pas tout à fait. Elle s'appuie fortement sur les statistiques — le plan d'expérience de Fisher, l'analyse exploratoire de Tukey — mais ajoute la programmation, l'ingénierie des bases de données et l'apprentissage automatique que les départements de statistique classiques enseignaient rarement. William S. Cleveland a proposé le terme en 2001 précisément pour décrire cette version élargie et informatisée du domaine, bâtie sur les statistiques plutôt qu'en les remplaçant.
L'extrémité routinière est déjà exposée : les outils AutoML peuvent ajuster et optimiser des modèles standards, et les assistants IA rédigent des requêtes SQL, des premiers graphiques exploratoires et du code de pipeline plus vite qu'un humain. Ce qui n'a pas été automatisé, c'est la formulation de la bonne question, le jugement sur le caractère significatif ou artificiel d'une régularité, et la responsabilité d'une décision fondée sur le résultat.
Cela varie fortement selon le pays et l'ancienneté. Le Bureau of Labor Statistics américain a fixé le salaire annuel médian de la profession « Data Scientists » à environ 108 000 $ en 2023, tandis que les analystes juniors débutent souvent entre 70 000 et 95 000 $ et que les scientifiques des données seniors ou principaux dans les grandes entreprises technologiques peuvent percevoir 200 000 à 400 000 $ ou plus en rémunération totale avec actions.
Un analyste de données répond généralement à des questions métier définies avec des données et des tableaux de bord existants ; un scientifique des données construit de nouveaux modèles statistiques et analyses prédictives, souvent à partir de données plus désordonnées ; un ingénieur en apprentissage automatique sort un modèle du notebook et le fait tourner de façon fiable, à grande échelle, en production. Les frontières se brouillent constamment, et beaucoup passent d'un rôle à l'autre au fil d'une carrière.
La science des données occupe un point inhabituel dans l'histoire de l'IA : bon nombre des outils qui transforment la profession — apprentissage automatique automatisé, traduction langage naturel vers SQL, graphiques assistés par IA — ont été largement construits par des scientifiques des données et des chercheurs en apprentissage automatique, désormais retournés contre des parties de leur propre travail quotidien.
Cette exposition est réelle et inégale. L'extrémité routinière et bien spécifiée du métier — extraire des données, exécuter un modèle standard, produire un premier graphique — est déjà comparablement rapide pour les outils d'IA. Ce qui survit repose moins sur l'écriture de code que sur la décision de quelle question vaut la peine d'être posée et de savoir si une réponse peut être digne de confiance.
Une part significative du travail routinier en science des données — requêtes SQL, graphiques exploratoires, ajustement d'un modèle standard avec AutoML, rédaction de code de pipeline passe-partout — est déjà automatisable ou assistée par IA aujourd'hui, et cette part croît rapidement. Ce qui résiste à l'automatisation, c'est formuler un problème métier ambigu en question testable, juger si un résultat est réel ou un artefact statistique, et être responsable lorsqu'une décision fondée sur un modèle s'avère erronée dans le monde réel.
Scored from the tasks, not the job title. Lower is safer.
Jobs AI cannot take →Transformer un problème métier ou scientifique vague en question précise et testable exige un contexte organisationnel et de domaine qu'un outil automatisé n'a pas accès par lui-même.
Distinguer un effet authentique du bruit, d'un artefact de fuite de données ou d'un partage train-test chanceux est exactement le jugement sceptique que les pipelines automatisés appliquent le plus mal à leur propre sortie.
Quelqu'un doit répondre d'un modèle qui refuse un prêt, signale un patient ou fixe mal le prix d'un produit — une responsabilité qui ne peut pas être transférée à l'outil qui a produit le chiffre.
Obtenir qu'un résultat contre-intuitif ou déplaisant soit réellement suivi dépend de la confiance, de la crédibilité et de la négociation avec des personnes, et non seulement d'une analyse correcte.
Choisir la bonne expérience naturelle, le bon groupe témoin ou la bonne stratégie d'inférence causale pour une nouvelle question relève davantage du jugement créatif que de la reconnaissance de motifs sur des analyses passées.
Les outils langage naturel vers SQL traitent désormais une large part des demandes d'extraction de données simples qui exigeaient autrefois l'intervention directe d'un scientifique des données.
Les outils d'analyse exploratoire automatisée peuvent générer en quelques secondes des graphiques de distribution, des résumés de corrélations et des graphiques de base à partir d'un jeu de données brut.
Les plateformes AutoML peuvent sélectionner, entraîner et optimiser des modèles conventionnels comme le gradient boosting ou la régression logistique largement sans surveillance, pour des problèmes bien définis et bien étiquetés.
Assembler un script standard de transformation ou de chargement de données est désormais souvent plus rapide à générer avec un assistant de codage IA et à relire qu'à écrire de zéro.
Une part croissante du métier consiste à spécifier ce qu'un pipeline automatisé doit tenter et à vérifier sa sortie, plutôt qu'à écrire chaque requête et modèle à la main.
L'ingénierie analytique, l'ingénierie de l'apprentissage automatique et l'analytique produit sont devenus des intitulés séparés, chacun absorbant une tranche de ce qu'un seul « data scientist » était censé couvrir il y a une décennie.
À mesure que la détection de motifs dans des données existantes devient plus facile à automatiser, la compétence plus difficile de concevoir une expérience ou une analyse causale digne de confiance gagne en valeur, et non en perd.
Les outils no-code et AutoML permettent aux non-spécialistes d'exécuter leurs propres analyses de base, poussant les scientifiques des données vers les problèmes plus difficiles et ambigus que ces outils ne peuvent pas traiter.
Construit et maintient les pipelines de transformation de données — souvent avec des outils comme dbt — qui alimentent tableaux de bord et modèles, entre ingénierie des données et analyse.
Sort un modèle d'un notebook de recherche et le fait tourner de façon fiable, surveillée et à grande échelle dans un système de production.
Possède la feuille de route d'une fonctionnalité pilotée par les données ou l'IA, traduisant les objectifs métier en ce qu'une équipe data doit réellement construire.
Audite les modèles et les données qui les sous-tendent pour biais, équité et conformité réglementaire avant qu'ils ne soient autorisés à être mis en production.
Trois lentilles reversibles: augmenter, remplacer une tranche, ou ouvrir une niche. Pedagogique, pas une prevision.
Le role reste; l IA accelere brouillons ou recherche; le jugement reste humain.
Un paquet etroit de taches peut se comprimer d abord tandis que le craft adjacent croit.
Supervision et integration peuvent apparaitre la ou la sortie IA doit etre fiable.
La demande de personnes capables de transformer des données en décision digne de confiance restera très probablement forte dans la prochaine décennie, mais la version d'entrée de gamme du métier change déjà : moins de rôles existeront purement pour écrire des requêtes routinières et des premiers graphiques à la main.
L'avantage le plus clair à long terme revient aux scientifiques des données capables de formuler une question réellement utile, repérer quand un résultat généré par IA est silencieusement faux, et assumer la responsabilité d'une recommandation devant des parties prenantes sceptiques — le même jugement dont le domaine a eu besoin depuis les essais agricoles de Fisher, appliqué désormais à un flux de travail qui rédige de plus en plus sa propre première version.
Voisins les plus proches sur le profil à six scores — pas seulement le même champ.
Le gardien des livres : héritier d'un métier si ancien qu'il a inventé l'écriture, négociant aujourd'hui avec les logiciels conçus pour l'automatiser.
AI-resistant 35 🗺️Décide ce que l'entreprise doit construire ensuite, et pourquoi — en transformant les besoins clients, les objectifs business et les contraintes techniques en un plan partagé que personne d'autre ne possède vraiment.
AI-resistant 50 💻Écrit, teste et maintient le code qui gère la vie moderne – et est l’une des premières professions à voir l’IA automatiser son propre travail quotidien.
AI-resistant 35 📣Le professionnel qui crée la demande — des murs peints de Pompéi et du mémo « brand man » de P&G en 1931 aux fils d'actualité gouvernés par les enchères de l'ère numérique.
AI-resistant 38 📦Construit les systèmes qui entraînent, déploient, surveillent et gouvernent les modèles d'apprentissage automatique en production.
AI-resistant 54 🔎Étudie la façon dont les gens utilisent les produits, transformant les comportements observés, les besoins et les frustrations en preuves sur lesquelles les équipes peuvent concevoir.
AI-resistant 69Établit et teste les lois mathématiques qui régissent la matière, l'énergie, l'espace et le temps, d'un tableau noir solitaire à un article de collisionneur signé par 3 000 auteurs.
AI-resistant 65 🧬Le scientifique qui étudie la vie elle-même, de Linnaeus nommant les espèces à la main à l'édition de génomes avec CRISPR, testant encore chaque idée sur un organisme vivant.
AI-resistant 64 🧪Le scientifique qui fabrique et mesure la matière — de l'alambic babylonien de Tapputi aux laboratoires robotisés d'aujourd'hui, celui qui décide encore ce que signifie le spectre.
AI-resistant 70 🔭Le scientifique qui mesure l'univers, des tablettes d'argile babyloniennes aux télescopes spatiaux, et qui décide encore aujourd'hui quelle fluctuation dans les données est une découverte.
AI-resistant 70 🧮Des scribes babyloniens aux lauréats Fields et à la démonstration assistée par IA : la profession qui transforme les questions difficiles en certitude permanente, théorème après théorème.
AI-resistant 70 🧿Construit, mesure et contrôle des appareils qui exploitent les états quantiques pour l'informatique, la détection, la communication et la recherche sur les matériaux.
AI-resistant 78 🧫Utilise les données cliniques, d’essais et du système de santé pour générer des preuves fiables pour des soins, des recherches et des décisions opérationnelles plus sûrs.
AI-resistant 68