Enquadrando a pergunta certa
84Transformar um vago problema comercial ou científico em uma questão específica e testável requer um contexto organizacional e de domínio ao qual uma ferramenta automatizada não tem acesso por si só.
Cientista de Dados · Encontra padrões e constrói modelos preditivos a partir de dados – um cargo de 2008 baseado em três séculos de contagem, teste e visualização de evidências.
Celulas mais escuras marcam uma pontuacao mais alta nesse indicador.
MenosMais
Ultima revisao Fontes e creditosCréditos de mídiaMetodologia
Ao contrário da imagem de “construção de modelos de IA”, a maioria dos dias é dividida entre escrever consultas SQL e código Python para extrair e limpar dados, executar testes estatísticos ou modelos de treinamento e traduzir os resultados em um gráfico ou memorando sobre o qual uma parte interessada não técnica possa agir. Pesquisas realizadas com profissionais colocam consistentemente a limpeza e preparação de dados em cerca de metade ou mais do tempo total de trabalho.
Não. Ao contrário da medicina ou do direito, não há licença ou diploma único exigido; um bacharelado ou mestrado em estatística, ciência da computação, matemática ou áreas quantitativas relacionadas é o caminho mais comum, e um forte portfólio de projetos reais geralmente é mais importante para os empregadores do que a credencial exata. Os PhDs são mais comuns em funções de aprendizado de máquina aplicado ou de pesquisa intensa.
Não exatamente. Baseia-se fortemente em estatística – o projeto experimental de Fisher, a análise exploratória de Tukey – mas acrescenta programação, engenharia de banco de dados e aprendizado de máquina que os departamentos de estatística clássica raramente ensinam. William S. Cleveland propôs o termo em 2001 especificamente para descrever esta versão ampliada e com muita computação do campo, baseada em estatísticas em vez de substituí-la.
O fim da rotina já está exposto: as ferramentas AutoML podem ajustar e ajustar modelos padrão, e os assistentes de IA podem escrever consultas SQL, primeiros rascunhos de gráficos exploratórios e código de pipeline clichê mais rápido do que uma pessoa. O que não foi automatizado foi formular a pergunta certa, julgar se um padrão é significativo ou espúrio e assumir a responsabilidade por uma decisão baseada no resultado.
Varia muito de acordo com o país e a antiguidade. O Bureau of Labor Statistics dos EUA estimou o salário médio anual para a ocupação de Cientistas de Dados em cerca de 108.000 dólares em 2023, enquanto os analistas juniores muitas vezes começam perto de 70.000 a 95.000 dólares e os cientistas de dados seniores ou principais em grandes empresas de tecnologia podem ganhar entre 200.000 e 400.000 dólares ou mais em remuneração total com capital próprio.
Um analista de dados normalmente responde a questões de negócios definidas com dados e painéis existentes; um cientista de dados constrói novos modelos estatísticos e análises preditivas, muitas vezes a partir de dados mais confusos; um engenheiro de aprendizado de máquina tira um modelo de um notebook e o faz funcionar de maneira confiável, em escala, na produção. Os limites se confundem constantemente e muitas pessoas alternam entre os três ao longo da carreira.
A ciência de dados situa-se num ponto incomum na história da IA: muitas das ferramentas que remodelam a profissão – aprendizagem automática de máquinas, tradução de linguagem natural para SQL, gráficos assistidos por IA – foram elas próprias, em grande parte, construídas por cientistas de dados e investigadores de aprendizagem automática, agora direccionadas para partes do seu próprio trabalho diário.
Essa exposição é real e desigual. O final do trabalho rotineiro e bem especificado – extrair dados, executar um modelo padrão, produzir um primeiro rascunho do gráfico – já é comparativamente rápido para as ferramentas de IA realizarem. O fim que sobrevive tem menos a ver com escrever código e mais com decidir que pergunta vale a pena fazer e se uma resposta é confiável.
Uma parcela significativa do trabalho rotineiro de ciência de dados – consultas SQL, gráficos exploratórios, ajuste de um modelo padrão com AutoML, gravação de código de pipeline padronizado – já é automatizável ou assistida por IA hoje, e essa parcela está crescendo rapidamente. O que resiste à automação é enquadrar um problema de negócios ambíguo como uma questão testável, julgar se um resultado é real ou um artefato estatístico e ser responsável quando a decisão de um modelo no mundo real se revelar errada.
Scored from the tasks, not the job title. Lower is safer.
Jobs AI cannot take →Transformar um vago problema comercial ou científico em uma questão específica e testável requer um contexto organizacional e de domínio ao qual uma ferramenta automatizada não tem acesso por si só.
Distinguir um efeito genuíno do ruído, de um artefato de vazamento de dados ou de uma divisão sortuda de teste de trem é exatamente o julgamento cético que os pipelines automatizados são piores em aplicar à sua própria saída.
Alguém tem que responder por um modelo que nega um empréstimo, sinaliza um paciente ou avalia mal um produto – uma responsabilidade que não pode ser transferida para a ferramenta que produziu o número.
Conseguir que uma descoberta contra-intuitiva ou indesejável seja realmente implementada depende de confiança, credibilidade e negociação com as pessoas, e não apenas de uma análise correta.
Escolher o experimento natural, o grupo de controle ou a estratégia de inferência causal correta para uma nova questão está mais próximo do julgamento criativo do que da correspondência de padrões em análises anteriores.
As ferramentas de linguagem natural para SQL agora lidam com uma grande parcela de solicitações diretas de recuperação de dados que antes exigiam o envolvimento direto de um cientista de dados.
Ferramentas automatizadas de análise exploratória podem gerar gráficos de distribuição, resumos de correlação e gráficos básicos a partir de um conjunto de dados brutos em segundos.
As plataformas AutoML podem selecionar, treinar e ajustar modelos convencionais, como aumento de gradiente ou regressão logística, em grande parte autônoma, para problemas bem definidos e rotulados.
Conectar um script padrão de transformação ou carregamento de dados agora costuma ser mais rápido de gerar com um assistente de codificação de IA e revisar do que escrever do zero.
Uma parcela crescente do trabalho consiste em especificar o que um pipeline automatizado deve tentar e verificar sua saída, em vez de escrever cada consulta e modelo manualmente.
A engenharia analítica, a engenharia de aprendizagem automática e a análise de produtos tornaram-se cada vez mais cargos separados, cada um absorvendo uma fatia do que se esperava que um único “cientista de dados” cobrisse há uma década.
À medida que a descoberta de padrões nos dados existentes se torna mais fácil de automatizar, a habilidade mais difícil de conceber uma experiência fiável ou uma análise causal está a tornar-se mais valorizada, e não menos.
As ferramentas sem código e AutoML permitem que não especialistas executem suas próprias análises básicas, empurrando cientistas de dados dedicados para problemas mais difíceis e ambíguos que essas ferramentas não conseguem resolver.
Constrói e mantém pipelines de transformação de dados – geralmente usando ferramentas como dbt – que alimentam painéis e modelos, situados entre a engenharia e a análise de dados.
Retira um modelo de um caderno de pesquisa e faz com que ele seja executado de forma confiável, monitorada e em escala em um sistema de produção.
Possui o roteiro para um recurso baseado em dados ou IA, traduzindo as metas de negócios no que uma equipe de dados deve realmente construir.
Audita modelos e os dados por trás deles em busca de parcialidade, imparcialidade e conformidade regulatória antes de serem autorizados a serem enviados.
Tres lentes reversiveis: aumentar, substituir uma fatia ou abrir um nicho. Didatico, nao previsao.
O papel permanece; a IA acelera rascunhos ou pesquisa; o julgamento fica humano.
Um pacote estreito de tarefas pode comprimir primeiro enquanto o oficio adjacente cresce.
Podem surgir supervisao e integracao onde a saida de IA precise de confianca.
É muito provável que a procura por pessoas que possam transformar os dados numa decisão fiável se mantenha forte durante a próxima década, mas a versão inicial do trabalho já está a mudar: existirão menos funções exclusivamente para escrever manualmente consultas de rotina e primeiros rascunhos de gráficos.
A vantagem mais clara a longo prazo reside nos cientistas de dados, que conseguem formular uma questão genuinamente útil, identificar quando um resultado gerado pela IA está silenciosamente errado e assumir a responsabilidade por uma recomendação perante partes interessadas céticas – o mesmo julgamento que o campo tem necessitado desde os testes de colheita de Fisher, agora aplicado a um fluxo de trabalho que cada vez mais elabora a sua própria primeira passagem.
O guardião dos livros: herdeiro de um ofício tão antigo que inventou a própria escrita, agora negociando com o software construído para automatizá-lo.
AI-resistant 35 🗺️Decide o que uma empresa deve construir a seguir e por quê – transformando as necessidades dos clientes, as metas de negócios e os limites de engenharia em um plano compartilhado que ninguém mais possui.
AI-resistant 50 💻Escreve, testa e mantém o código que comanda a vida moderna – e é uma das primeiras profissões a observar a IA automatizar seu próprio trabalho diário.
AI-resistant 35 📣O profissional que cria procura – desde as paredes pintadas de Pompeia e o memorando do homem de marca da P&G de 1931 até aos feeds conduzidos por leilões da era digital.
AI-resistant 38 📦Constrói os sistemas que treinam, implantam, monitoram e controlam modelos de aprendizado de máquina em produção.
AI-resistant 54 🔎Estuda como as pessoas usam os produtos, transformando comportamentos, necessidades e frustrações observados em evidências que as equipes podem desenvolver.
AI-resistant 69Deriva e testa as leis matemáticas que regem a matéria, a energia, o espaço e o tempo, desde um quadro-negro solitário até um artigo sobre o acelerador de partículas de 3.000 autores.
AI-resistant 65 🧬O cientista que estuda a própria vida, desde Linnaeus nomeando espécies manualmente até a edição de genomas com CRISPR, ainda testando todas as ideias contra um organismo vivo.
AI-resistant 64 🧪O cientista que fabrica e mede a própria matéria – desde o perfume babilónico de Tapputi até aos laboratórios robóticos de hoje, continua a ser aquele que decide o que significa o espectro.
AI-resistant 70 🔭O cientista que mede o universo, desde as tabuletas de argila da Babilônia até os telescópios espaciais, ainda decidindo qual oscilação nos dados é uma descoberta.
AI-resistant 70 🧮Dos escribas babilônicos aos medalhistas Fields e às provas assistidas por IA: a profissão que transforma questões difíceis em certezas permanentes, um teorema de cada vez.
AI-resistant 70 🧿Constrói, mede e controla dispositivos que exploram estados quânticos para computação, detecção, comunicação e pesquisa de materiais.
AI-resistant 78 🧫Utiliza dados clínicos, de ensaios e do sistema de saúde para gerar evidências confiáveis para cuidados, pesquisas e decisões operacionais mais seguras.
AI-resistant 68