Skip to content Aller a une section

📊AI & The Future

Scientifique des données · Détecte des régularités et construit des modèles prédictifs à partir de données — un intitulé de poste né en 2008, fondé sur trois siècles de comptage, de tests et de visualisation des preuves.

D’un coup d’oeil
Intensite des scores

Plus la case est foncee, plus le score de cet indicateur est eleve.

Derniere relecture Sources et creditsCrédits médiasMéthodologie

Reponses courtes

Que fait concrètement un scientifique des données au quotidien ?

Contrairement à l'image du « constructeur de modèles d'IA », la plupart des journées se partagent entre l'écriture de requêtes SQL et de code Python pour extraire et nettoyer les données, l'exécution de tests statistiques ou l'entraînement de modèles, et la traduction des résultats en graphique ou note de synthèse qu'un décideur non technique peut exploiter. Les enquêtes auprès des praticiens placent régulièrement le nettoyage et la préparation des données à environ la moitié — voire davantage — du temps de travail total.

Faut-il un doctorat pour devenir scientifique des données ?

Non. Contrairement à la médecine ou au droit, il n'existe ni licence ni diplôme unique obligatoire ; une licence ou un master en statistiques, informatique, mathématiques ou dans un autre domaine quantitatif voisin constitue la voie la plus courante, et un solide portfolio de projets réels compte souvent davantage aux yeux des employeurs que le diplôme exact. Les doctorats sont plus fréquents dans les rôles fortement orientés recherche ou apprentissage automatique appliqué.

La science des données n'est-elle que des statistiques sous un autre nom ?

Pas tout à fait. Elle s'appuie fortement sur les statistiques — le plan d'expérience de Fisher, l'analyse exploratoire de Tukey — mais ajoute la programmation, l'ingénierie des bases de données et l'apprentissage automatique que les départements de statistique classiques enseignaient rarement. William S. Cleveland a proposé le terme en 2001 précisément pour décrire cette version élargie et informatisée du domaine, bâtie sur les statistiques plutôt qu'en les remplaçant.

La science des données est-elle menacée par l'IA ?

L'extrémité routinière est déjà exposée : les outils AutoML peuvent ajuster et optimiser des modèles standards, et les assistants IA rédigent des requêtes SQL, des premiers graphiques exploratoires et du code de pipeline plus vite qu'un humain. Ce qui n'a pas été automatisé, c'est la formulation de la bonne question, le jugement sur le caractère significatif ou artificiel d'une régularité, et la responsabilité d'une décision fondée sur le résultat.

Combien gagnent les scientifiques des données ?

Cela varie fortement selon le pays et l'ancienneté. Le Bureau of Labor Statistics américain a fixé le salaire annuel médian de la profession « Data Scientists » à environ 108 000 $ en 2023, tandis que les analystes juniors débutent souvent entre 70 000 et 95 000 $ et que les scientifiques des données seniors ou principaux dans les grandes entreprises technologiques peuvent percevoir 200 000 à 400 000 $ ou plus en rémunération totale avec actions.

Quelle différence entre un scientifique des données, un analyste de données et un ingénieur en apprentissage automatique ?

Un analyste de données répond généralement à des questions métier définies avec des données et des tableaux de bord existants ; un scientifique des données construit de nouveaux modèles statistiques et analyses prédictives, souvent à partir de données plus désordonnées ; un ingénieur en apprentissage automatique sort un modèle du notebook et le fait tourner de façon fiable, à grande échelle, en production. Les frontières se brouillent constamment, et beaucoup passent d'un rôle à l'autre au fil d'une carrière.

Ouvrir le lab comparer

Partager cette page

La science des données occupe un point inhabituel dans l'histoire de l'IA : bon nombre des outils qui transforment la profession — apprentissage automatique automatisé, traduction langage naturel vers SQL, graphiques assistés par IA — ont été largement construits par des scientifiques des données et des chercheurs en apprentissage automatique, désormais retournés contre des parties de leur propre travail quotidien.

Cette exposition est réelle et inégale. L'extrémité routinière et bien spécifiée du métier — extraire des données, exécuter un modèle standard, produire un premier graphique — est déjà comparablement rapide pour les outils d'IA. Ce qui survit repose moins sur l'écriture de code que sur la décision de quelle question vaut la peine d'être posée et de savoir si une réponse peut être digne de confiance.

62 / 100
Élevé

Share of the work a machine could do

Une part significative du travail routinier en science des données — requêtes SQL, graphiques exploratoires, ajustement d'un modèle standard avec AutoML, rédaction de code de pipeline passe-partout — est déjà automatisable ou assistée par IA aujourd'hui, et cette part croît rapidement. Ce qui résiste à l'automatisation, c'est formuler un problème métier ambigu en question testable, juger si un résultat est réel ou un artefact statistique, et être responsable lorsqu'une décision fondée sur un modèle s'avère erronée dans le monde réel.

Scored from the tasks, not the job title. Lower is safer.

Jobs AI cannot take →

What machines cannot take

Formuler la bonne question

84

Transformer un problème métier ou scientifique vague en question précise et testable exige un contexte organisationnel et de domaine qu'un outil automatisé n'a pas accès par lui-même.

Juger si une régularité est réelle

80

Distinguer un effet authentique du bruit, d'un artefact de fuite de données ou d'un partage train-test chanceux est exactement le jugement sceptique que les pipelines automatisés appliquent le plus mal à leur propre sortie.

Responsabilité d'une décision concrète

88

Quelqu'un doit répondre d'un modèle qui refuse un prêt, signale un patient ou fixe mal le prix d'un produit — une responsabilité qui ne peut pas être transférée à l'outil qui a produit le chiffre.

Convaincre des parties prenantes sceptiques

68

Obtenir qu'un résultat contre-intuitif ou déplaisant soit réellement suivi dépend de la confiance, de la crédibilité et de la négociation avec des personnes, et non seulement d'une analyse correcte.

Concevoir une expérience réellement nouvelle

74

Choisir la bonne expérience naturelle, le bon groupe témoin ou la bonne stratégie d'inférence causale pour une nouvelle question relève davantage du jugement créatif que de la reconnaissance de motifs sur des analyses passées.

What they already take

Requêtes SQL et extractions de données routinières

75

Les outils langage naturel vers SQL traitent désormais une large part des demandes d'extraction de données simples qui exigeaient autrefois l'intervention directe d'un scientifique des données.

Premiers graphiques et résumés exploratoires

65

Les outils d'analyse exploratoire automatisée peuvent générer en quelques secondes des graphiques de distribution, des résumés de corrélations et des graphiques de base à partir d'un jeu de données brut.

Ajustement et optimisation de modèles standards

68

Les plateformes AutoML peuvent sélectionner, entraîner et optimiser des modèles conventionnels comme le gradient boosting ou la régression logistique largement sans surveillance, pour des problèmes bien définis et bien étiquetés.

Code de pipeline et ETL passe-partout

60

Assembler un script standard de transformation ou de chargement de données est désormais souvent plus rapide à générer avec un assistant de codage IA et à relire qu'à écrire de zéro.

How the work is changing

De la construction de modèles à leur direction et vérification

Une part croissante du métier consiste à spécifier ce qu'un pipeline automatisé doit tenter et à vérifier sa sortie, plutôt qu'à écrire chaque requête et modèle à la main.

L'intitulé généraliste se scinde en spécialités

L'ingénierie analytique, l'ingénierie de l'apprentissage automatique et l'analytique produit sont devenus des intitulés séparés, chacun absorbant une tranche de ce qu'un seul « data scientist » était censé couvrir il y a une décennie.

L'inférence causale et l'expérimentation gagnent en prestige

À mesure que la détection de motifs dans des données existantes devient plus facile à automatiser, la compétence plus difficile de concevoir une expérience ou une analyse causale digne de confiance gagne en valeur, et non en perd.

Le « citizen data scientist » diffuse l'analyse de base

Les outils no-code et AutoML permettent aux non-spécialistes d'exécuter leurs propres analyses de base, poussant les scientifiques des données vers les problèmes plus difficiles et ambigus que ces outils ne peuvent pas traiter.

New jobs branching off

Ingénieur analytique

Construit et maintient les pipelines de transformation de données — souvent avec des outils comme dbt — qui alimentent tableaux de bord et modèles, entre ingénierie des données et analyse.

Ingénieur en apprentissage automatique

Sort un modèle d'un notebook de recherche et le fait tourner de façon fiable, surveillée et à grande échelle dans un système de production.

Product manager data

Possède la feuille de route d'une fonctionnalité pilotée par les données ou l'IA, traduisant les objectifs métier en ce qu'une équipe data doit réellement construire.

Analyste IA responsable / risque modèle

Audite les modèles et les données qui les sous-tendent pour biais, équité et conformité réglementaire avant qu'ils ne soient autorisés à être mis en production.

Scenarios d exposition a l IA

Trois lentilles reversibles: augmenter, remplacer une tranche, ou ouvrir une niche. Pedagogique, pas une prevision.

Augmenter

Le role reste; l IA accelere brouillons ou recherche; le jugement reste humain.

Remplacer une tranche

Un paquet etroit de taches peut se comprimer d abord tandis que le craft adjacent croit.

Nouvelle niche

Supervision et integration peuvent apparaitre la ou la sortie IA doit etre fiable.

Outlook

La demande de personnes capables de transformer des données en décision digne de confiance restera très probablement forte dans la prochaine décennie, mais la version d'entrée de gamme du métier change déjà : moins de rôles existeront purement pour écrire des requêtes routinières et des premiers graphiques à la main.

L'avantage le plus clair à long terme revient aux scientifiques des données capables de formuler une question réellement utile, repérer quand un résultat généré par IA est silencieusement faux, et assumer la responsabilité d'une recommandation devant des parties prenantes sceptiques — le même jugement dont le domaine a eu besoin depuis les essais agricoles de Fisher, appliqué désormais à un flux de travail qui rédige de plus en plus sa propre première version.

Métiers proches

Voisins les plus proches sur le profil à six scores — pas seulement le même champ.

Continuer à explorer

Keep exploring

More in Science & Research

⚛️

Physicien

Établit et teste les lois mathématiques qui régissent la matière, l'énergie, l'espace et le temps, d'un tableau noir solitaire à un article de collisionneur signé par 3 000 auteurs.

AI-resistant 65
🧬

Biologiste

Le scientifique qui étudie la vie elle-même, de Linnaeus nommant les espèces à la main à l'édition de génomes avec CRISPR, testant encore chaque idée sur un organisme vivant.

AI-resistant 64
🧪

Chimiste

Le scientifique qui fabrique et mesure la matière — de l'alambic babylonien de Tapputi aux laboratoires robotisés d'aujourd'hui, celui qui décide encore ce que signifie le spectre.

AI-resistant 70
🔭

Astronome

Le scientifique qui mesure l'univers, des tablettes d'argile babyloniennes aux télescopes spatiaux, et qui décide encore aujourd'hui quelle fluctuation dans les données est une découverte.

AI-resistant 70
🧮

Mathématicien

Des scribes babyloniens aux lauréats Fields et à la démonstration assistée par IA : la profession qui transforme les questions difficiles en certitude permanente, théorème après théorème.

AI-resistant 70
🧿

Ingénieur quantique

Construit, mesure et contrôle des appareils qui exploitent les états quantiques pour l'informatique, la détection, la communication et la recherche sur les matériaux.

AI-resistant 78
🧫

Scientifique des données cliniques

Utilise les données cliniques, d’essais et du système de santé pour générer des preuves fiables pour des soins, des recherches et des décisions opérationnelles plus sûrs.

AI-resistant 68