Skip to content

🤖Craft & Know-How

Chercheur en IA · Conçoit et teste les algorithmes derrière l'intelligence artificielle, dans un domaine qui s'efforce désormais d'automatiser une part croissante de son propre processus de recherche.

Partager cette page

L’image d’un chercheur inventant un nouvel algorithme intelligent en un éclair est en grande partie fausse. La plupart des journées sont consacrées à mener des expériences qui échouent de manière peu informative, à lire ce qu'une centaine d'autres laboratoires ont publié ce mois-ci et à essayer de déterminer si un résultat prometteur est réel ou s'il s'agit d'un artefact d'une graine aléatoire chanceuse.

Le savoir-faire transmis au sein du domaine concerne moins l'architecture à mémoriser que la discipline expérimentale : comment isoler ce qui a réellement provoqué une amélioration, quand faire confiance à un point de référence et quand ne pas le faire, et comment éviter qu'un résultat négatif ne soit discrètement rejeté.

What the work demands

887485668462
Fondements mathématiques
88
Programmation et systèmes
74
Rigueur expérimentale
85
Synthèse de la littérature
66
Goût de recherche
84
Écriture et communication
62

Fondements mathématiques

L'algèbre linéaire, les probabilités, le calcul et l'optimisation sont le langage dans lequel presque tous les modèles et articles sont rédigés ; sans eux, les nouvelles méthodes sont illisibles plutôt que peu familières.

Programmation et systèmes

Écrire du code efficace en Python et un cadre d'apprentissage en profondeur, et comprendre suffisamment l'ingénierie des systèmes distribués pour exécuter des tâches de formation sur des dizaines ou des milliers de processeurs.

Rigueur expérimentale

Concevoir des comparaisons contrôlées, exécuter suffisamment de graines aléatoires pour faire confiance à un résultat et isoler quel changement spécifique a réellement provoqué une amélioration plutôt que de supposer l'explication évidente.

Synthèse de la littérature

Suivre le rythme d'un domaine qui publie des dizaines de milliers de nouvelles prépublications par an et déterminer lesquelles sont réellement importantes est désormais une compétence à part entière.

Goût de recherche

Choisir laquelle des nombreuses directions plausibles mérite des mois de calcul et d’attention – la compétence la plus difficile à enseigner directement, généralement absorbée en travaillant aux côtés d’un conseiller expérimenté.

Écriture et communication

Un résultat qui ne peut pas être rédigé assez clairement pour survivre à un examen par les pairs, ou expliqué à un bailleur de fonds non spécialisé, a du mal à avoir un impact, aussi réel soit-il.

A day in the life

Vérification des courses et lectureTravail en profondeur : expériences et codeDéjeunerRencontres et groupe de lectureAnalyse et rédactionHors du temps (principalement) 036912151821 24h
  1. 8–10 Vérification des courses et lecture

    Examiner les résultats des expériences du jour au lendemain, parcourir les nouvelles prépublications arXiv et les discussions en laboratoire avant le début du travail ciblé de la journée.

  2. 10–13 Travail en profondeur : expériences et code

    Le bloc le mieux protégé de la journée, consacré à l'écriture du code d'entraînement, au débogage d'un modèle ou à la conception de la prochaine expérience d'une série.

  3. 13–14 Déjeuner

    Souvent mangé avec des camarades de laboratoire, et souvent le cadre du genre d'échange d'idées informel qu'une réunion programmée produit rarement.

  4. 14–16 Rencontres et groupe de lecture

    Réunions de laboratoire, en tête-à-tête avec un conseiller ou un responsable, et groupe de lecture rotatif où quelqu'un présente un article que le groupe doit comprendre.

  5. 16–19 Analyse et rédaction

    Explorer pourquoi une expérience a fonctionné ou non, mettre à jour un document de résultats partagés et rédiger des sections d'un article avant une date limite.

  6. 19–8 Hors du temps (principalement)

    Temps personnel – sauf dans les semaines précédant l'échéance d'une conférence majeure, où les soirées et les week-ends sont régulièrement consacrés à la fin des expériences.

The know-how

Craft knowledge practitioners actually pass on — not motivation.

01

Surajustez d'abord un seul lot

Avant de faire confiance à une exécution d'entraînement sur l'ensemble de données complet, vérifiez que le modèle peut ramener sa perte à près de zéro sur une petite poignée d'exemples. S’il ne parvient même pas à mémoriser dix exemples, le bug réside dans le code et non dans les données.

Andrej Karpathy, « Une recette pour former des réseaux de neurones », 2019
02

Ajustez la ligne de base aussi fort que la nouvelle idée

Une part surprenante des « améliorations » publiées diminuent ou disparaissent une fois que la base de comparaison obtient le même budget de recherche d’hyperparamètres que la nouvelle méthode – un modèle documenté à la fois dans les GAN et les modèles de langage.

Fait écho dans Lucic et al., « Les GAN sont-ils créés égaux ? Une étude à grande échelle »(2018), et Melis et al. (2017) sur les références du LSTM
03

Ablate un changement à la fois

Lorsqu'une nouvelle méthode avec cinq modifications regroupées bat une ancienne, supprimez chaque modification indépendamment et testez à nouveau avant de créditer une seule idée - sinon l'histoire du journal et la cause réelle du gain peuvent discrètement diverger.

Discipline standard d'étude sur l'ablation, formalisée dans la méthodologie ML depuis les années 2010
04

Méfiez-vous d'une référence par rapport à laquelle vous optimisez également

Un chiffre du classement cesse de mesurer la capacité générale une fois que les chercheurs s'y adaptent directement à plusieurs reprises - une dynamique connue depuis longtemps sous le nom de loi de Goodhart et citée directement dans les critiques de la saturation des références en matière de PNL et de vision.

Loi de Goodhart, popularisée sous sa forme moderne par l'anthropologue Marilyn Strathern, 1997
05

Écrivez les affirmations avant la dernière expérience

La rédaction précoce des principales affirmations d'un article impose un objectif concret et falsifiable pour les expériences restantes, au lieu de lancer d'abord des expériences et d'assembler un récit autour de ce qui s'est passé qui a fonctionné.

Pratique commune de conseil en doctorat, largement reprise dans les conseils partagés sur « comment rédiger un article » entre les laboratoires
06

Enregistrez ce qui n'a pas fonctionné, pas seulement ce qui a fonctionné

Les configurations, les graines et les hyperparamètres ayant échoué sont généralement supprimés en cas d'échec d'une exécution, mais leur enregistrement empêche un laboratoire de réexécuter tranquillement la même impasse six mois plus tard sous un nom différent.

Discipline standard du cahier de laboratoire empruntée à la physique expérimentale et à la biologie

Tools of the trade

PyTorch/JAX

Les deux cadres dominants d’apprentissage profond ; PyTorch est leader dans la plupart des recherches universitaires et industrielles, tandis que JAX est populaire pour les travaux à grande échelle et affiliés à Google.

Cluster de calcul GPU/TPU

Des clusters partagés, programmés avec des outils comme Slurm, qui transforment une conception de modèle en un véritable réseau formé – souvent la plus grande contrainte sur les expériences possibles.

arXiv

Dans la pratique, le lieu de publication de facto du domaine : les nouveaux résultats circulent ici sous forme de prépublications, souvent des mois avant ou sans examen formel par les pairs.

Poids et biais / TensorBoard

Des tableaux de bord de suivi des expériences qui enregistrent les courbes de perte, les hyperparamètres et les résultats sur des centaines d'exécutions, sans lesquels la comparaison des expériences serait ingérable.

Cahiers Jupyter

Environnements interactifs pour une exploration rapide des données, le débogage du comportement d'un modèle sur des exemples spécifiques et le prototypage avant que le code ne passe dans un pipeline de formation complet.

How people fail at it

À la poursuite des gains du classement sans mécanisme

Obtenir une amélioration de la précision fractionnaire grâce à une recherche ou une échelle d'hyperparamètres supplémentaires, sans hypothèse sur la raison pour laquelle cela fonctionne, produit des résultats sur lesquels il est difficile pour quiconque de s'appuyer, même lorsque le nombre lui-même est réel.

Signaler uniquement la meilleure graine aléatoire

En exécutant de nombreuses graines et en ne publiant que la meilleure, au lieu d’une moyenne et d’une propagation, le bruit ordinaire ressemble à un véritable effet – un problème signalé à plusieurs reprises dans les études d’apprentissage par renforcement et de reproductibilité PNL.

Données non divulguées ou avantages de calcul

Les données de test qui ont fuité dans un corpus de pré-formation, ou un budget de calcul légèrement plus important qu'un rapport papier, peuvent rendre un résultat impossible à reproduire et, une fois découvert, nuire à la crédibilité d'un chercheur plus que ne le ferait un résultat modeste et honnête.

Métiers proches

Voisins les plus proches sur le profil à six scores — pas seulement le même champ.

Continuer à explorer

Keep exploring

More in Engineering & Technology