Pesquisador de IA · Projeta e testa os algoritmos por trás da inteligência das máquinas, em um campo que agora corre para automatizar uma parcela crescente de seu próprio processo de pesquisa.
A imagem de um pesquisador inventando um novo algoritmo inteligente num piscar de olhos é em grande parte errada. A maior parte dos dias são gastos realizando experimentos que falham de maneira pouco informativa, lendo o que uma centena de outros laboratórios publicaram este mês e tentando dizer se um resultado promissor é real ou um artefato de uma semente aleatória da sorte.
A arte transmitida dentro do campo é menos sobre qual arquitetura memorizar e mais sobre disciplina experimental: como isolar o que realmente causou uma melhoria, quando confiar em um benchmark e quando não, e como evitar que um resultado negativo seja descartado silenciosamente.
What the work demands
Fundamentos matemáticos
88
Programação e sistemas
74
Rigor experimental
85
Síntese de literatura
66
Gosto de pesquisa
84
Escrita e comunicação
62
Fundamentos matemáticos
Álgebra linear, probabilidade, cálculo e otimização são a linguagem em que quase todos os modelos e artigos são escritos; sem eles, novos métodos são ilegíveis e não apenas desconhecidos.
Programação e sistemas
Escrever código eficiente em Python e uma estrutura de aprendizagem profunda e compreender a engenharia de sistemas distribuídos o suficiente para executar trabalhos de treinamento em dezenas ou milhares de processadores.
Rigor experimental
Projetar comparações controladas, gerar sementes aleatórias suficientes para confiar em um resultado e isolar qual mudança específica realmente causou uma melhoria, em vez de assumir a explicação óbvia.
Síntese de literatura
Acompanhar um campo que publica dezenas de milhares de novos preprints por ano e saber quais deles realmente importam é agora uma habilidade por si só.
Gosto de pesquisa
Escolher qual das muitas direções plausíveis merece meses de cálculo e atenção – a habilidade mais difícil de ensinar diretamente, geralmente absorvida pelo trabalho ao lado de um consultor experiente.
Escrita e comunicação
Um resultado que não pode ser escrito com clareza suficiente para sobreviver à revisão por pares, ou explicado a um financiador não especialista, luta para ter qualquer impacto, independentemente de quão real seja.
A day in the life
8–10Verificando execuções e leitura
Revendo os resultados dos experimentos durante a noite e analisando novas pré-impressões do arXiv e discussões no bate-papo do laboratório antes do início do trabalho focado do dia.
10–13Trabalho profundo: experimentos e código
O bloco mais protegido do dia, gasto escrevendo código de treinamento, depurando um modelo ou projetando o próximo experimento de uma série.
13–14Almoço
Frequentemente comido com colegas de laboratório e frequentemente o cenário para o tipo de troca informal de ideias que uma reunião agendada raramente produz.
14–16Reuniões e grupo de leitura
Reuniões de laboratório, individuais com um orientador ou gerente e um grupo de leitura rotativo onde alguém apresenta um artigo que o grupo precisa entender.
16–19Análise e redação
Investigar por que um experimento funcionou ou não, atualizar um documento de resultados compartilhados e redigir seções de um artigo antes do prazo.
19–8Fora do horário (principalmente)
Tempo pessoal - exceto nas semanas anteriores ao prazo final de uma conferência importante, quando as noites e os fins de semana desaparecem rotineiramente para a finalização de experimentos.
The know-how
Craft knowledge practitioners actually pass on — not motivation.
01
Overfit um único lote primeiro
Antes de confiar em uma execução de treinamento no conjunto de dados completo, verifique se o modelo pode levar sua perda a quase zero em alguns poucos exemplos. Se não conseguir memorizar nem dez exemplos, o bug está no código, não nos dados.
02
Ajuste a linha de base tão intensamente quanto a nova ideia
Uma parcela surpreendente de 'melhorias' publicadas diminui ou desaparece quando a linha de base de comparação obtém o mesmo orçamento de pesquisa de hiperparâmetros que o novo método - um padrão documentado tanto em GANs quanto em modelos de linguagem.
03
Apague uma alteração de cada vez
Quando um novo método com cinco alterações agrupadas supera um antigo, remova cada alteração independentemente e teste novamente antes de creditar qualquer ideia - caso contrário, a história do artigo e a causa real do ganho podem divergir silenciosamente.
04
Desconfie de um benchmark que você também está otimizando
Um número de tabela de classificação deixa de medir a capacidade geral quando os pesquisadores repetidamente se ajustam diretamente a ele – uma dinâmica há muito conhecida como lei de Goodhart e citada diretamente nas críticas à saturação de benchmark na PNL e na visão.
05
Escreva as afirmações antes do último experimento
Esboçar antecipadamente as principais afirmações de um artigo força um alvo concreto e falsificável para os experimentos restantes, em vez de primeiro realizar experimentos e montar uma narrativa em torno de tudo o que aconteceu para funcionar.
06
Registre o que não funcionou, não apenas o que funcionou
Configurações, sementes e hiperparâmetros com falha geralmente são descartados quando uma execução falha, mas registrá-los impede que um laboratório execute silenciosamente o mesmo beco sem saída seis meses depois com um nome diferente.
Tools of the trade
PyTorch/JAX
As duas estruturas dominantes de aprendizagem profunda; PyTorch lidera a maioria das pesquisas acadêmicas e industriais, enquanto JAX é popular para trabalhos em larga escala e afiliados ao Google.
Cluster de computação GPU/TPU
Clusters compartilhados, programados com ferramentas como Slurm, que transformam um design de modelo em uma rede realmente treinada – muitas vezes a maior restrição sobre quais experimentos são possíveis.
arXiv
Na prática, o local de publicação de fato da área: novos resultados circulam aqui como pré-impressões, muitas vezes meses antes ou inteiramente sem revisão formal por pares.
Pesos e preconceitos / TensorBoard
Painéis de rastreamento de experimentos que registram curvas de perda, hiperparâmetros e resultados em centenas de execuções, sem os quais a comparação de experimentos seria impossível.
Cadernos Jupyter
Ambientes interativos para exploração rápida de dados, depuração do comportamento de um modelo em exemplos específicos e prototipagem antes que o código passe para um pipeline de treinamento completo.
How people fail at it
Perseguindo ganhos na tabela de classificação sem um mecanismo
Espremer uma melhoria de precisão fracionária por meio de pesquisa ou escala extra de hiperparâmetros, sem uma hipótese de por que funciona, produz resultados difíceis de serem construídos por qualquer outra pessoa, mesmo quando o número em si é real.
Relatando apenas a melhor semente aleatória
Gerar muitas sementes e publicar apenas a melhor, em vez de um meio e uma propagação, faz com que o ruído comum pareça um efeito genuíno - um problema sinalizado repetidamente em estudos de aprendizagem por reforço e de reprodutibilidade da PNL.
Dados não divulgados ou vantagens computacionais
Dados de teste que vazaram para um corpus de pré-treinamento, ou um orçamento de computação silenciosamente maior do que um relatório em papel, podem tornar um resultado impossível de reproduzir – e, uma vez descoberto, prejudicam a credibilidade de um pesquisador mais do que um resultado modesto e honesto teria causado.