Skip to content

🤖Oficio y saber hacer

Investigador en IA · Diseña y prueba los algoritmos detrás de la inteligencia de máquina, en un campo que ahora corre a automatizar una parte creciente de su propio proceso de investigación.

Compartir esta página

La imagen de un investigador inventando un algoritmo ingenioso en un destello de intuición es en su mayor parte falsa. La mayoría de los días se pasan ejecutando experimentos que fallan de formas poco informativas, leyendo lo que cien otros laboratorios publicaron este mes, e intentando distinguir si un resultado prometedor es real o un artefacto de una semilla aleatoria afortunada.

El oficio que se transmite dentro del campo tiene menos que ver con qué arquitectura memorizar y más con la disciplina experimental: cómo aislar qué causó realmente una mejora, cuándo confiar en un referente y cuándo no, y cómo impedir que un resultado negativo se deseche en silencio.

Lo que exige el trabajo

887485668462
Fundamentos matemáticos
88
Programación y sistemas
74
Rigor experimental
85
Síntesis de literatura
66
Criterio de investigación
84
Escritura y comunicación
62

Fundamentos matemáticos

Álgebra lineal, probabilidad, cálculo y optimización son el lenguaje en el que está escrito casi todo modelo y artículo; sin ellos, los métodos nuevos resultan ilegibles más que simplemente desconocidos.

Programación y sistemas

Escribir código eficiente en Python y un marco de aprendizaje profundo, y entender suficiente ingeniería de sistemas distribuidos para ejecutar trabajos de entrenamiento en docenas o miles de procesadores.

Rigor experimental

Diseñar comparaciones controladas, ejecutar suficientes semillas aleatorias para confiar en un resultado, y aislar qué cambio concreto causó realmente una mejora en lugar de asumir la explicación obvia.

Síntesis de literatura

Seguir el ritmo de un campo que publica decenas de miles de nuevos preprints al año, y distinguir el puñado que realmente importa, es ahora una habilidad por derecho propio.

Criterio de investigación

Elegir cuál de muchas direcciones plausibles merece meses de cómputo y atención — la habilidad más difícil de enseñar directamente, que suele absorberse trabajando junto a un director experimentado.

Escritura y comunicación

Un resultado que no puede redactarse con claridad suficiente para sobrevivir a la revisión por pares, o explicarse a un financiador no especialista, lucha por tener impacto por real que sea.

Un día en la vida

Revisar ejecuciones y lecturaTrabajo profundo: experimentos y códigoAlmuerzoReuniones y grupo de lecturaAnálisis y escrituraFuera del horario (en su mayor parte) 036912151821 24h
  1. 8–10 Revisar ejecuciones y lectura

    Revisar los resultados de experimentos nocturnos y ojear nuevos preprints de arXiv y la discusión del chat del laboratorio antes de que empiece el trabajo concentrado del día.

  2. 10–13 Trabajo profundo: experimentos y código

    El bloque mejor protegido del día, dedicado a escribir código de entrenamiento, depurar un modelo o diseñar el siguiente experimento de una serie.

  3. 13–14 Almuerzo

    A menudo compartido con compañeros de laboratorio, y con frecuencia el escenario del intercambio informal de ideas que una reunión programada rara vez produce.

  4. 14–16 Reuniones y grupo de lectura

    Reuniones de laboratorio, encuentros individuales con un director o jefe, y un grupo de lectura rotativo en el que alguien presenta un artículo que el grupo necesita entender.

  5. 16–19 Análisis y escritura

    Profundizar por qué un experimento funcionó o no, actualizar un documento compartido de resultados y redactar secciones de un artículo antes de un plazo.

  6. 19–8 Fuera del horario (en su mayor parte)

    Tiempo personal — excepto en las semanas previas a un gran plazo de congreso, cuando las tardes y los fines de semana desaparecen de forma rutinaria para terminar experimentos.

El saber hacer

Conocimiento de oficio que se transmite de verdad — no motivación vacía.

01

Sobreajustar primero un solo lote

Antes de confiar en una ejecución de entrenamiento sobre el conjunto completo de datos, comprobar que el modelo puede llevar su pérdida cerca de cero en un puñado diminuto de ejemplos. Si ni siquiera puede memorizar diez ejemplos, el fallo está en el código, no en los datos.

Andrej Karpathy, «A Recipe for Training Neural Networks», 2019
02

Afinar la línea base tanto como la idea nueva

Una proporción sorprendente de «mejoras» publicadas se encoge o desaparece una vez que la línea base de comparación recibe el mismo presupuesto de búsqueda de hiperparámetros que el método nuevo — un patrón documentado en GANs y modelos de lenguaje por igual.

Eco en Lucic et al., «Are GANs Created Equal? A Large-Scale Study» (2018), y Melis et al. (2017) sobre líneas base LSTM
03

Abatir un cambio cada vez

Cuando un método nuevo con cinco cambios empaquetados juntos supera a uno antiguo, retirar cada cambio de forma independiente y volver a probar antes de acreditar cualquier idea concreta — de lo contrario la historia del artículo y la causa real de la ganancia pueden divergir en silencio.

Disciplina estándar de estudios de ablación, formalizada en la metodología de ML desde los años 2010
04

Desconfiar de un referente contra el que también se optimiza

Un número de tabla de clasificación deja de medir capacidad general una vez que los investigadores afinan repetidamente directamente contra él — una dinámica conocida desde hace tiempo como la ley de Goodhart, y citada directamente en críticas a la saturación de referentes en NLP y visión.

Ley de Goodhart, popularizada en su forma moderna por la antropóloga Marilyn Strathern, 1997
05

Escribir las afirmaciones antes del último experimento

Redactar pronto las afirmaciones centrales de un artículo fuerza un objetivo concreto y falsable para los experimentos restantes, en lugar de ejecutar experimentos primero y armar una narrativa en torno a lo que resultó funcionar.

Práctica común de dirección de doctorado, ampliamente repetida en guías compartidas de «cómo escribir un artículo» entre laboratorios
06

Registrar lo que no funcionó, no solo lo que sí

Las configuraciones, semillas e hiperparámetros fallidos suelen desecharse una vez que una ejecución falla, pero registrarlos evita que un laboratorio vuelva a ejecutar en silencio el mismo callejón sin salida seis meses después bajo otro nombre.

Disciplina estándar de cuaderno de laboratorio tomada de la física experimental y la biología

Herramientas del oficio

PyTorch / JAX

Los dos marcos de aprendizaje profundo dominantes; PyTorch lidera en la mayor parte de la investigación académica e industrial, mientras que JAX es popular para trabajo a gran escala y afiliado a Google.

Clúster de cómputo GPU/TPU

Clústeres compartidos, programados con herramientas como Slurm, que convierten un diseño de modelo en una red realmente entrenada — a menudo la mayor constricción individual sobre qué experimentos son posibles.

arXiv

El foro de publicación de facto del campo en la práctica: los nuevos resultados circulan aquí como preprints, a menudo meses antes o del todo sin revisión formal por pares.

Weights & Biases / TensorBoard

Paneles de seguimiento de experimentos que registran curvas de pérdida, hiperparámetros y salidas a lo largo de cientos de ejecuciones, sin los cuales comparar experimentos sería inmanejable.

Cuadernos Jupyter

Entornos interactivos para exploración rápida de datos, depurar el comportamiento de un modelo en ejemplos concretos y prototipar antes de que el código pase a un pipeline completo de entrenamiento.

Cómo se falla en esto

Perseguir ganancias de tabla sin un mecanismo

Exprimir una mejora fraccionaria de precisión mediante búsqueda extra de hiperparámetros o escala, sin una hipótesis de por qué funciona, produce resultados difíciles de construir sobre ellos aunque el número en sí sea real.

Informar solo de la mejor semilla aleatoria

Ejecutar muchas semillas y publicar solo la mejor, en lugar de una media y una dispersión, hace que el ruido ordinario parezca un efecto genuino — un problema señalado repetidamente en estudios de reproducibilidad de aprendizaje por refuerzo y NLP.

Ventajas no reveladas de datos o cómputo

Datos de prueba que se filtraron a un corpus de preentrenamiento, o un presupuesto de cómputo en silencio mayor del que reporta un artículo, pueden hacer imposible reproducir un resultado — y, una vez descubierto, dañan la credibilidad de un investigador más que lo habría hecho un resultado modesto y honesto.

Profesiones similares

Vecinos más cercanos en el perfil de seis puntuaciones, no solo el mismo campo.

Seguir explorando

Seguir explorando

Más en Ingeniería y tecnología