Skip to content Pular para uma secao

📊AI & The Future

Cientista de Dados · Encontra padrões e constrói modelos preditivos a partir de dados – um cargo de 2008 baseado em três séculos de contagem, teste e visualização de evidências.

De relance
Intensidade da pontuacao

Celulas mais escuras marcam uma pontuacao mais alta nesse indicador.

Ultima revisao Fontes e creditosCréditos de mídiaMetodologia

Respostas curtas

O que um cientista de dados realmente faz no dia a dia?

Ao contrário da imagem de “construção de modelos de IA”, a maioria dos dias é dividida entre escrever consultas SQL e código Python para extrair e limpar dados, executar testes estatísticos ou modelos de treinamento e traduzir os resultados em um gráfico ou memorando sobre o qual uma parte interessada não técnica possa agir. Pesquisas realizadas com profissionais colocam consistentemente a limpeza e preparação de dados em cerca de metade ou mais do tempo total de trabalho.

Você precisa de um PhD para se tornar um cientista de dados?

Não. Ao contrário da medicina ou do direito, não há licença ou diploma único exigido; um bacharelado ou mestrado em estatística, ciência da computação, matemática ou áreas quantitativas relacionadas é o caminho mais comum, e um forte portfólio de projetos reais geralmente é mais importante para os empregadores do que a credencial exata. Os PhDs são mais comuns em funções de aprendizado de máquina aplicado ou de pesquisa intensa.

A ciência de dados é apenas estatística com um novo nome?

Não exatamente. Baseia-se fortemente em estatística – o projeto experimental de Fisher, a análise exploratória de Tukey – mas acrescenta programação, engenharia de banco de dados e aprendizado de máquina que os departamentos de estatística clássica raramente ensinam. William S. Cleveland propôs o termo em 2001 especificamente para descrever esta versão ampliada e com muita computação do campo, baseada em estatísticas em vez de substituí-la.

A ciência de dados está em risco devido à IA?

O fim da rotina já está exposto: as ferramentas AutoML podem ajustar e ajustar modelos padrão, e os assistentes de IA podem escrever consultas SQL, primeiros rascunhos de gráficos exploratórios e código de pipeline clichê mais rápido do que uma pessoa. O que não foi automatizado foi formular a pergunta certa, julgar se um padrão é significativo ou espúrio e assumir a responsabilidade por uma decisão baseada no resultado.

Quanto ganham os cientistas de dados?

Varia muito de acordo com o país e a antiguidade. O Bureau of Labor Statistics dos EUA estimou o salário médio anual para a ocupação de Cientistas de Dados em cerca de 108.000 dólares em 2023, enquanto os analistas juniores muitas vezes começam perto de 70.000 a 95.000 dólares e os cientistas de dados seniores ou principais em grandes empresas de tecnologia podem ganhar entre 200.000 e 400.000 dólares ou mais em remuneração total com capital próprio.

Qual é a diferença entre um cientista de dados, um analista de dados e um engenheiro de aprendizado de máquina?

Um analista de dados normalmente responde a questões de negócios definidas com dados e painéis existentes; um cientista de dados constrói novos modelos estatísticos e análises preditivas, muitas vezes a partir de dados mais confusos; um engenheiro de aprendizado de máquina tira um modelo de um notebook e o faz funcionar de maneira confiável, em escala, na produção. Os limites se confundem constantemente e muitas pessoas alternam entre os três ao longo da carreira.

Comece por esta secao - AI & The Future

Abrir lab comparar

Share

A ciência de dados situa-se num ponto incomum na história da IA: muitas das ferramentas que remodelam a profissão – aprendizagem automática de máquinas, tradução de linguagem natural para SQL, gráficos assistidos por IA – foram elas próprias, em grande parte, construídas por cientistas de dados e investigadores de aprendizagem automática, agora direccionadas para partes do seu próprio trabalho diário.

Essa exposição é real e desigual. O final do trabalho rotineiro e bem especificado – extrair dados, executar um modelo padrão, produzir um primeiro rascunho do gráfico – já é comparativamente rápido para as ferramentas de IA realizarem. O fim que sobrevive tem menos a ver com escrever código e mais com decidir que pergunta vale a pena fazer e se uma resposta é confiável.

62 / 100
Alto

Share of the work a machine could do

Uma parcela significativa do trabalho rotineiro de ciência de dados – consultas SQL, gráficos exploratórios, ajuste de um modelo padrão com AutoML, gravação de código de pipeline padronizado – já é automatizável ou assistida por IA hoje, e essa parcela está crescendo rapidamente. O que resiste à automação é enquadrar um problema de negócios ambíguo como uma questão testável, julgar se um resultado é real ou um artefato estatístico e ser responsável quando a decisão de um modelo no mundo real se revelar errada.

Scored from the tasks, not the job title. Lower is safer.

Jobs AI cannot take →

What machines cannot take

Enquadrando a pergunta certa

84

Transformar um vago problema comercial ou científico em uma questão específica e testável requer um contexto organizacional e de domínio ao qual uma ferramenta automatizada não tem acesso por si só.

Julgando se um padrão é real

80

Distinguir um efeito genuíno do ruído, de um artefato de vazamento de dados ou de uma divisão sortuda de teste de trem é exatamente o julgamento cético que os pipelines automatizados são piores em aplicar à sua própria saída.

Responsabilidade por uma decisão do mundo real

88

Alguém tem que responder por um modelo que nega um empréstimo, sinaliza um paciente ou avalia mal um produto – uma responsabilidade que não pode ser transferida para a ferramenta que produziu o número.

Persuadir as partes interessadas céticas

68

Conseguir que uma descoberta contra-intuitiva ou indesejável seja realmente implementada depende de confiança, credibilidade e negociação com as pessoas, e não apenas de uma análise correta.

Projetando um experimento genuinamente novo

74

Escolher o experimento natural, o grupo de controle ou a estratégia de inferência causal correta para uma nova questão está mais próximo do julgamento criativo do que da correspondência de padrões em análises anteriores.

What they already take

Consultas SQL de rotina e extração de dados

75

As ferramentas de linguagem natural para SQL agora lidam com uma grande parcela de solicitações diretas de recuperação de dados que antes exigiam o envolvimento direto de um cientista de dados.

Primeiro rascunho de gráficos exploratórios e resumos

65

Ferramentas automatizadas de análise exploratória podem gerar gráficos de distribuição, resumos de correlação e gráficos básicos a partir de um conjunto de dados brutos em segundos.

Ajustando e ajustando modelos padrão

68

As plataformas AutoML podem selecionar, treinar e ajustar modelos convencionais, como aumento de gradiente ou regressão logística, em grande parte autônoma, para problemas bem definidos e rotulados.

Pipeline padrão e código ETL

60

Conectar um script padrão de transformação ou carregamento de dados agora costuma ser mais rápido de gerar com um assistente de codificação de IA e revisar do que escrever do zero.

How the work is changing

Desde construir modelos até direcioná-los e verificá-los

Uma parcela crescente do trabalho consiste em especificar o que um pipeline automatizado deve tentar e verificar sua saída, em vez de escrever cada consulta e modelo manualmente.

O título generalista se divide em especialidades

A engenharia analítica, a engenharia de aprendizagem automática e a análise de produtos tornaram-se cada vez mais cargos separados, cada um absorvendo uma fatia do que se esperava que um único “cientista de dados” cobrisse há uma década.

Inferência causal e experimentação ganham status

À medida que a descoberta de padrões nos dados existentes se torna mais fácil de automatizar, a habilidade mais difícil de conceber uma experiência fiável ou uma análise causal está a tornar-se mais valorizada, e não menos.

O 'cientista de dados cidadão' espalha análises básicas

As ferramentas sem código e AutoML permitem que não especialistas executem suas próprias análises básicas, empurrando cientistas de dados dedicados para problemas mais difíceis e ambíguos que essas ferramentas não conseguem resolver.

New jobs branching off

Engenheiro analítico

Constrói e mantém pipelines de transformação de dados – geralmente usando ferramentas como dbt – que alimentam painéis e modelos, situados entre a engenharia e a análise de dados.

Engenheiro de aprendizado de máquina

Retira um modelo de um caderno de pesquisa e faz com que ele seja executado de forma confiável, monitorada e em escala em um sistema de produção.

Gerente de produtos de dados

Possui o roteiro para um recurso baseado em dados ou IA, traduzindo as metas de negócios no que uma equipe de dados deve realmente construir.

IA responsável/analista de risco de modelo

Audita modelos e os dados por trás deles em busca de parcialidade, imparcialidade e conformidade regulatória antes de serem autorizados a serem enviados.

Cenarios de exposicao a IA

Tres lentes reversiveis: aumentar, substituir uma fatia ou abrir um nicho. Didatico, nao previsao.

Aumentar

O papel permanece; a IA acelera rascunhos ou pesquisa; o julgamento fica humano.

Substituir uma fatia

Um pacote estreito de tarefas pode comprimir primeiro enquanto o oficio adjacente cresce.

Novo nicho

Podem surgir supervisao e integracao onde a saida de IA precise de confianca.

Outlook

É muito provável que a procura por pessoas que possam transformar os dados numa decisão fiável se mantenha forte durante a próxima década, mas a versão inicial do trabalho já está a mudar: existirão menos funções exclusivamente para escrever manualmente consultas de rotina e primeiros rascunhos de gráficos.

A vantagem mais clara a longo prazo reside nos cientistas de dados, que conseguem formular uma questão genuinamente útil, identificar quando um resultado gerado pela IA está silenciosamente errado e assumir a responsabilidade por uma recomendação perante partes interessadas céticas – o mesmo julgamento que o campo tem necessitado desde os testes de colheita de Fisher, agora aplicado a um fluxo de trabalho que cada vez mais elabora a sua própria primeira passagem.

Similar professions

Continue exploring

Keep exploring

More in Science & Research