Chercheur en IA · Conçoit et teste les algorithmes derrière l'intelligence artificielle, dans un domaine qui s'efforce désormais d'automatiser une part croissante de son propre processus de recherche.
L’image d’un chercheur inventant un nouvel algorithme intelligent en un éclair est en grande partie fausse. La plupart des journées sont consacrées à mener des expériences qui échouent de manière peu informative, à lire ce qu'une centaine d'autres laboratoires ont publié ce mois-ci et à essayer de déterminer si un résultat prometteur est réel ou s'il s'agit d'un artefact d'une graine aléatoire chanceuse.
Le savoir-faire transmis au sein du domaine concerne moins l'architecture à mémoriser que la discipline expérimentale : comment isoler ce qui a réellement provoqué une amélioration, quand faire confiance à un point de référence et quand ne pas le faire, et comment éviter qu'un résultat négatif ne soit discrètement rejeté.
What the work demands
Fondements mathématiques
88
Programmation et systèmes
74
Rigueur expérimentale
85
Synthèse de la littérature
66
Goût de recherche
84
Écriture et communication
62
Fondements mathématiques
L'algèbre linéaire, les probabilités, le calcul et l'optimisation sont le langage dans lequel presque tous les modèles et articles sont rédigés ; sans eux, les nouvelles méthodes sont illisibles plutôt que peu familières.
Programmation et systèmes
Écrire du code efficace en Python et un cadre d'apprentissage en profondeur, et comprendre suffisamment l'ingénierie des systèmes distribués pour exécuter des tâches de formation sur des dizaines ou des milliers de processeurs.
Rigueur expérimentale
Concevoir des comparaisons contrôlées, exécuter suffisamment de graines aléatoires pour faire confiance à un résultat et isoler quel changement spécifique a réellement provoqué une amélioration plutôt que de supposer l'explication évidente.
Synthèse de la littérature
Suivre le rythme d'un domaine qui publie des dizaines de milliers de nouvelles prépublications par an et déterminer lesquelles sont réellement importantes est désormais une compétence à part entière.
Goût de recherche
Choisir laquelle des nombreuses directions plausibles mérite des mois de calcul et d’attention – la compétence la plus difficile à enseigner directement, généralement absorbée en travaillant aux côtés d’un conseiller expérimenté.
Écriture et communication
Un résultat qui ne peut pas être rédigé assez clairement pour survivre à un examen par les pairs, ou expliqué à un bailleur de fonds non spécialisé, a du mal à avoir un impact, aussi réel soit-il.
A day in the life
8–10Vérification des courses et lecture
Examiner les résultats des expériences du jour au lendemain, parcourir les nouvelles prépublications arXiv et les discussions en laboratoire avant le début du travail ciblé de la journée.
10–13Travail en profondeur : expériences et code
Le bloc le mieux protégé de la journée, consacré à l'écriture du code d'entraînement, au débogage d'un modèle ou à la conception de la prochaine expérience d'une série.
13–14Déjeuner
Souvent mangé avec des camarades de laboratoire, et souvent le cadre du genre d'échange d'idées informel qu'une réunion programmée produit rarement.
14–16Rencontres et groupe de lecture
Réunions de laboratoire, en tête-à-tête avec un conseiller ou un responsable, et groupe de lecture rotatif où quelqu'un présente un article que le groupe doit comprendre.
16–19Analyse et rédaction
Explorer pourquoi une expérience a fonctionné ou non, mettre à jour un document de résultats partagés et rédiger des sections d'un article avant une date limite.
19–8Hors du temps (principalement)
Temps personnel – sauf dans les semaines précédant l'échéance d'une conférence majeure, où les soirées et les week-ends sont régulièrement consacrés à la fin des expériences.
The know-how
Craft knowledge practitioners actually pass on — not motivation.
01
Surajustez d'abord un seul lot
Avant de faire confiance à une exécution d'entraînement sur l'ensemble de données complet, vérifiez que le modèle peut ramener sa perte à près de zéro sur une petite poignée d'exemples. S’il ne parvient même pas à mémoriser dix exemples, le bug réside dans le code et non dans les données.
02
Ajustez la ligne de base aussi fort que la nouvelle idée
Une part surprenante des « améliorations » publiées diminuent ou disparaissent une fois que la base de comparaison obtient le même budget de recherche d’hyperparamètres que la nouvelle méthode – un modèle documenté à la fois dans les GAN et les modèles de langage.
03
Ablate un changement à la fois
Lorsqu'une nouvelle méthode avec cinq modifications regroupées bat une ancienne, supprimez chaque modification indépendamment et testez à nouveau avant de créditer une seule idée - sinon l'histoire du journal et la cause réelle du gain peuvent discrètement diverger.
04
Méfiez-vous d'une référence par rapport à laquelle vous optimisez également
Un chiffre du classement cesse de mesurer la capacité générale une fois que les chercheurs s'y adaptent directement à plusieurs reprises - une dynamique connue depuis longtemps sous le nom de loi de Goodhart et citée directement dans les critiques de la saturation des références en matière de PNL et de vision.
05
Écrivez les affirmations avant la dernière expérience
La rédaction précoce des principales affirmations d'un article impose un objectif concret et falsifiable pour les expériences restantes, au lieu de lancer d'abord des expériences et d'assembler un récit autour de ce qui s'est passé qui a fonctionné.
06
Enregistrez ce qui n'a pas fonctionné, pas seulement ce qui a fonctionné
Les configurations, les graines et les hyperparamètres ayant échoué sont généralement supprimés en cas d'échec d'une exécution, mais leur enregistrement empêche un laboratoire de réexécuter tranquillement la même impasse six mois plus tard sous un nom différent.
Tools of the trade
PyTorch/JAX
Les deux cadres dominants d’apprentissage profond ; PyTorch est leader dans la plupart des recherches universitaires et industrielles, tandis que JAX est populaire pour les travaux à grande échelle et affiliés à Google.
Cluster de calcul GPU/TPU
Des clusters partagés, programmés avec des outils comme Slurm, qui transforment une conception de modèle en un véritable réseau formé – souvent la plus grande contrainte sur les expériences possibles.
arXiv
Dans la pratique, le lieu de publication de facto du domaine : les nouveaux résultats circulent ici sous forme de prépublications, souvent des mois avant ou sans examen formel par les pairs.
Poids et biais / TensorBoard
Des tableaux de bord de suivi des expériences qui enregistrent les courbes de perte, les hyperparamètres et les résultats sur des centaines d'exécutions, sans lesquels la comparaison des expériences serait ingérable.
Cahiers Jupyter
Environnements interactifs pour une exploration rapide des données, le débogage du comportement d'un modèle sur des exemples spécifiques et le prototypage avant que le code ne passe dans un pipeline de formation complet.
How people fail at it
À la poursuite des gains du classement sans mécanisme
Obtenir une amélioration de la précision fractionnaire grâce à une recherche ou une échelle d'hyperparamètres supplémentaires, sans hypothèse sur la raison pour laquelle cela fonctionne, produit des résultats sur lesquels il est difficile pour quiconque de s'appuyer, même lorsque le nombre lui-même est réel.
Signaler uniquement la meilleure graine aléatoire
En exécutant de nombreuses graines et en ne publiant que la meilleure, au lieu d’une moyenne et d’une propagation, le bruit ordinaire ressemble à un véritable effet – un problème signalé à plusieurs reprises dans les études d’apprentissage par renforcement et de reproductibilité PNL.
Données non divulguées ou avantages de calcul
Les données de test qui ont fuité dans un corpus de pré-formation, ou un budget de calcul légèrement plus important qu'un rapport papier, peuvent rendre un résultat impossible à reproduire et, une fois découvert, nuire à la crédibilité d'un chercheur plus que ne le ferait un résultat modeste et honnête.
Métiers proches
Voisins les plus proches sur le profil à six scores — pas seulement le même champ.