Investigador en IA · Diseña y prueba los algoritmos detrás de la inteligencia de máquina, en un campo que ahora corre a automatizar una parte creciente de su propio proceso de investigación.
La imagen de un investigador inventando un algoritmo ingenioso en un destello de intuición es en su mayor parte falsa. La mayoría de los días se pasan ejecutando experimentos que fallan de formas poco informativas, leyendo lo que cien otros laboratorios publicaron este mes, e intentando distinguir si un resultado prometedor es real o un artefacto de una semilla aleatoria afortunada.
El oficio que se transmite dentro del campo tiene menos que ver con qué arquitectura memorizar y más con la disciplina experimental: cómo aislar qué causó realmente una mejora, cuándo confiar en un referente y cuándo no, y cómo impedir que un resultado negativo se deseche en silencio.
Lo que exige el trabajo
Fundamentos matemáticos
88
Programación y sistemas
74
Rigor experimental
85
Síntesis de literatura
66
Criterio de investigación
84
Escritura y comunicación
62
Fundamentos matemáticos
Álgebra lineal, probabilidad, cálculo y optimización son el lenguaje en el que está escrito casi todo modelo y artículo; sin ellos, los métodos nuevos resultan ilegibles más que simplemente desconocidos.
Programación y sistemas
Escribir código eficiente en Python y un marco de aprendizaje profundo, y entender suficiente ingeniería de sistemas distribuidos para ejecutar trabajos de entrenamiento en docenas o miles de procesadores.
Rigor experimental
Diseñar comparaciones controladas, ejecutar suficientes semillas aleatorias para confiar en un resultado, y aislar qué cambio concreto causó realmente una mejora en lugar de asumir la explicación obvia.
Síntesis de literatura
Seguir el ritmo de un campo que publica decenas de miles de nuevos preprints al año, y distinguir el puñado que realmente importa, es ahora una habilidad por derecho propio.
Criterio de investigación
Elegir cuál de muchas direcciones plausibles merece meses de cómputo y atención — la habilidad más difícil de enseñar directamente, que suele absorberse trabajando junto a un director experimentado.
Escritura y comunicación
Un resultado que no puede redactarse con claridad suficiente para sobrevivir a la revisión por pares, o explicarse a un financiador no especialista, lucha por tener impacto por real que sea.
Un día en la vida
8–10Revisar ejecuciones y lectura
Revisar los resultados de experimentos nocturnos y ojear nuevos preprints de arXiv y la discusión del chat del laboratorio antes de que empiece el trabajo concentrado del día.
10–13Trabajo profundo: experimentos y código
El bloque mejor protegido del día, dedicado a escribir código de entrenamiento, depurar un modelo o diseñar el siguiente experimento de una serie.
13–14Almuerzo
A menudo compartido con compañeros de laboratorio, y con frecuencia el escenario del intercambio informal de ideas que una reunión programada rara vez produce.
14–16Reuniones y grupo de lectura
Reuniones de laboratorio, encuentros individuales con un director o jefe, y un grupo de lectura rotativo en el que alguien presenta un artículo que el grupo necesita entender.
16–19Análisis y escritura
Profundizar por qué un experimento funcionó o no, actualizar un documento compartido de resultados y redactar secciones de un artículo antes de un plazo.
19–8Fuera del horario (en su mayor parte)
Tiempo personal — excepto en las semanas previas a un gran plazo de congreso, cuando las tardes y los fines de semana desaparecen de forma rutinaria para terminar experimentos.
El saber hacer
Conocimiento de oficio que se transmite de verdad — no motivación vacía.
01
Sobreajustar primero un solo lote
Antes de confiar en una ejecución de entrenamiento sobre el conjunto completo de datos, comprobar que el modelo puede llevar su pérdida cerca de cero en un puñado diminuto de ejemplos. Si ni siquiera puede memorizar diez ejemplos, el fallo está en el código, no en los datos.
02
Afinar la línea base tanto como la idea nueva
Una proporción sorprendente de «mejoras» publicadas se encoge o desaparece una vez que la línea base de comparación recibe el mismo presupuesto de búsqueda de hiperparámetros que el método nuevo — un patrón documentado en GANs y modelos de lenguaje por igual.
03
Abatir un cambio cada vez
Cuando un método nuevo con cinco cambios empaquetados juntos supera a uno antiguo, retirar cada cambio de forma independiente y volver a probar antes de acreditar cualquier idea concreta — de lo contrario la historia del artículo y la causa real de la ganancia pueden divergir en silencio.
04
Desconfiar de un referente contra el que también se optimiza
Un número de tabla de clasificación deja de medir capacidad general una vez que los investigadores afinan repetidamente directamente contra él — una dinámica conocida desde hace tiempo como la ley de Goodhart, y citada directamente en críticas a la saturación de referentes en NLP y visión.
05
Escribir las afirmaciones antes del último experimento
Redactar pronto las afirmaciones centrales de un artículo fuerza un objetivo concreto y falsable para los experimentos restantes, en lugar de ejecutar experimentos primero y armar una narrativa en torno a lo que resultó funcionar.
06
Registrar lo que no funcionó, no solo lo que sí
Las configuraciones, semillas e hiperparámetros fallidos suelen desecharse una vez que una ejecución falla, pero registrarlos evita que un laboratorio vuelva a ejecutar en silencio el mismo callejón sin salida seis meses después bajo otro nombre.
Herramientas del oficio
PyTorch / JAX
Los dos marcos de aprendizaje profundo dominantes; PyTorch lidera en la mayor parte de la investigación académica e industrial, mientras que JAX es popular para trabajo a gran escala y afiliado a Google.
Clúster de cómputo GPU/TPU
Clústeres compartidos, programados con herramientas como Slurm, que convierten un diseño de modelo en una red realmente entrenada — a menudo la mayor constricción individual sobre qué experimentos son posibles.
arXiv
El foro de publicación de facto del campo en la práctica: los nuevos resultados circulan aquí como preprints, a menudo meses antes o del todo sin revisión formal por pares.
Weights & Biases / TensorBoard
Paneles de seguimiento de experimentos que registran curvas de pérdida, hiperparámetros y salidas a lo largo de cientos de ejecuciones, sin los cuales comparar experimentos sería inmanejable.
Cuadernos Jupyter
Entornos interactivos para exploración rápida de datos, depurar el comportamiento de un modelo en ejemplos concretos y prototipar antes de que el código pase a un pipeline completo de entrenamiento.
Cómo se falla en esto
Perseguir ganancias de tabla sin un mecanismo
Exprimir una mejora fraccionaria de precisión mediante búsqueda extra de hiperparámetros o escala, sin una hipótesis de por qué funciona, produce resultados difíciles de construir sobre ellos aunque el número en sí sea real.
Informar solo de la mejor semilla aleatoria
Ejecutar muchas semillas y publicar solo la mejor, en lugar de una media y una dispersión, hace que el ruido ordinario parezca un efecto genuino — un problema señalado repetidamente en estudios de reproducibilidad de aprendizaje por refuerzo y NLP.
Ventajas no reveladas de datos o cómputo
Datos de prueba que se filtraron a un corpus de preentrenamiento, o un presupuesto de cómputo en silencio mayor del que reporta un artículo, pueden hacer imposible reproducir un resultado — y, una vez descubierto, dañan la credibilidad de un investigador más que lo habría hecho un resultado modesto y honesto.
Profesiones similares
Vecinos más cercanos en el perfil de seis puntuaciones, no solo el mismo campo.