Skip to content Pular para uma secao

📊Culture & Status

Cientista de Dados · Encontra padrões e constrói modelos preditivos a partir de dados – um cargo de 2008 baseado em três séculos de contagem, teste e visualização de evidências.

De relance
Intensidade da pontuacao

Celulas mais escuras marcam uma pontuacao mais alta nesse indicador.

Ultima revisao Fontes e creditosCréditos de mídiaMetodologia

Respostas curtas

O que um cientista de dados realmente faz no dia a dia?

Ao contrário da imagem de “construção de modelos de IA”, a maioria dos dias é dividida entre escrever consultas SQL e código Python para extrair e limpar dados, executar testes estatísticos ou modelos de treinamento e traduzir os resultados em um gráfico ou memorando sobre o qual uma parte interessada não técnica possa agir. Pesquisas realizadas com profissionais colocam consistentemente a limpeza e preparação de dados em cerca de metade ou mais do tempo total de trabalho.

Você precisa de um PhD para se tornar um cientista de dados?

Não. Ao contrário da medicina ou do direito, não há licença ou diploma único exigido; um bacharelado ou mestrado em estatística, ciência da computação, matemática ou áreas quantitativas relacionadas é o caminho mais comum, e um forte portfólio de projetos reais geralmente é mais importante para os empregadores do que a credencial exata. Os PhDs são mais comuns em funções de aprendizado de máquina aplicado ou de pesquisa intensa.

A ciência de dados é apenas estatística com um novo nome?

Não exatamente. Baseia-se fortemente em estatística – o projeto experimental de Fisher, a análise exploratória de Tukey – mas acrescenta programação, engenharia de banco de dados e aprendizado de máquina que os departamentos de estatística clássica raramente ensinam. William S. Cleveland propôs o termo em 2001 especificamente para descrever esta versão ampliada e com muita computação do campo, baseada em estatísticas em vez de substituí-la.

A ciência de dados está em risco devido à IA?

O fim da rotina já está exposto: as ferramentas AutoML podem ajustar e ajustar modelos padrão, e os assistentes de IA podem escrever consultas SQL, primeiros rascunhos de gráficos exploratórios e código de pipeline clichê mais rápido do que uma pessoa. O que não foi automatizado foi formular a pergunta certa, julgar se um padrão é significativo ou espúrio e assumir a responsabilidade por uma decisão baseada no resultado.

Quanto ganham os cientistas de dados?

Varia muito de acordo com o país e a antiguidade. O Bureau of Labor Statistics dos EUA estimou o salário médio anual para a ocupação de Cientistas de Dados em cerca de 108.000 dólares em 2023, enquanto os analistas juniores muitas vezes começam perto de 70.000 a 95.000 dólares e os cientistas de dados seniores ou principais em grandes empresas de tecnologia podem ganhar entre 200.000 e 400.000 dólares ou mais em remuneração total com capital próprio.

Qual é a diferença entre um cientista de dados, um analista de dados e um engenheiro de aprendizado de máquina?

Um analista de dados normalmente responde a questões de negócios definidas com dados e painéis existentes; um cientista de dados constrói novos modelos estatísticos e análises preditivas, muitas vezes a partir de dados mais confusos; um engenheiro de aprendizado de máquina tira um modelo de um notebook e o faz funcionar de maneira confiável, em escala, na produção. Os limites se confundem constantemente e muitas pessoas alternam entre os três ao longo da carreira.

Comece por esta secao - Culture & Status

Abrir lab comparar

Share

A cultura popular passou direto pelo estatístico e foi para a figura mais dramática do quant ou do algoritmo - a imagem pública do cientista de dados deve mais aos analistas de beisebol de Moneyball e aos quants de previsão de crises do The Big Short do que a qualquer pessoa que faça o que um cientista de dados ativo realmente faz no dia a dia.

Dentro do campo, a cultura baseia-se em benchmarks públicos competitivos, piadas internas estatísticas e um formato de documento – o cartão modelo – que transforma “seja honesto sobre os limites do seu modelo” num hábito profissional de rotina, em vez de uma reflexão tardia.

Social standing through history

How much status the profession carried in each era, on a 0–100 scale.

2235285578
1660-18991900-1930Décadas de 1950 a 19802001–20112012 – presente
1660-1899

Os primeiros trabalhos estatísticos foram realizados em grande parte por funcionários, reformadores amadores e pessoas de fora autodidatas como Nightingale; útil e ocasionalmente influente, mas raramente prestigiado por si só.

1900-1930

Pearson, Fisher e Gosset profissionalizaram a estatística numa disciplina académica com as suas próprias revistas e departamentos universitários, ganhando respeito académico e permanecendo quase invisíveis para o público em geral.

Décadas de 1950 a 1980

À medida que a computação mainframe se difundia, o pessoal de “processamento de dados” e os estatísticos eram vistos principalmente como suporte de back-end corporativo essencial, mas pouco glamoroso, raramente presente na tomada de decisões executivas.

2001–2011

A proposta acadêmica de Cleveland em 2001 atraiu pouca atenção pública, mas o prêmio de algoritmo de recomendação de um milhão de dólares da Netflix em 2006-2009 e a criação do termo “cientista de dados” em 2008 no LinkedIn e no Facebook começaram a chamar a atenção na indústria de tecnologia.

2012 – presente

O enquadramento do “emprego mais sexy” da Harvard Business Review de outubro de 2012 desencadeou um boom de contratações e prestígio; na década de 2020, o título fragmentou-se em funções mais especializadas e perdeu algum do seu brilho singular, embora a remuneração e a procura continuem fortes.

In film, books and art

Filme2011

Bola de dinheiro

Bennett Miller (diretor); baseado no livro de Michael Lewis de 2003

Dramatiza como Billy Beane, do Oakland Athletics, e o analista Paul DePodesta usaram a análise estatística, com base na sabermetria de Bill James, para construir um elenco competitivo com um dos menores orçamentos do beisebol.

Filme2015

A Grande Curta

Adam McKay (diretor); baseado no livro de Michael Lewis

Segue um punhado de analistas que estudaram os dados do mercado hipotecário de perto o suficiente para prever a crise financeira de 2008 antes que quase todo mundo acreditasse nos números.

série de TV2005–2010

Número3rs

Nicolas Falacci e Cheryl Heuton (criadores)

Um matemático ajuda seu irmão, agente do FBI, a resolver crimes usando análise estatística e reconhecimento de padrões, apresentando ao grande público da TV americana a matemática aplicada como trabalho investigativo.

série de TV2011 – presente

Espelho Negro

Charlie Brooker (criador)

Esta série de antologia britânica imagina repetidamente o perfil de dados e a pontuação preditiva levados a extremos perturbadores, mais diretamente no episódio 'Nosedive' de 2016, moldando a ansiedade do público sobre a classificação algorítmica de pessoas.

Filme2016

Figuras ocultas

Theodore Melfi (diretor); baseado no livro de Margot Lee Shetterly

Conta a história real de Katherine Johnson, Dorothy Vaughan e Mary Jackson, matemáticas negras cujos cálculos manuais na NASA sustentaram as missões orbitais de Mercúrio em 1962, antes que os computadores eletrônicos assumissem o trabalho.

Documentário2020

Viés codificado

Shalini Kantayya (diretora)

Segue a descoberta da pesquisadora do MIT, Joy Buolamwini, de que os sistemas de reconhecimento facial identificam erroneamente rostos de pele mais escura com muito mais frequência, transformando uma descoberta técnica de viés de dados em um reconhecimento público mais amplo da justiça algorítmica.

Proverbs and idioms

Entra lixo, sai lixo

Aforismo de computação, amplamente utilizado nas décadas de 1950-60Um modelo ou análise é tão confiável quanto os dados inseridos nele – nenhuma sofisticação estatística resgata dados de entrada incorretos.

Todos os modelos estão errados, mas alguns são úteis

George Box, estatístico, 'Science and Statistics', Journal of the American Statistical Association, 1976Todo modelo é uma simplificação da realidade; o objetivo é um modelo suficientemente preciso para ser útil, e não uma descrição perfeita do mundo.

Correlação não implica causalidade

Máxima estatística clássica, formalizada através das estatísticas do início do século XXDuas variáveis ​​movendo-se juntas não prova que uma causa a outra – um terceiro fator oculto pode explicar ambas.

É 80% de limpeza de dados

Máxima amplamente repetida da indústria, ecoada no artigo de Steve Lohr de 2014 no New York Times sobre o “trabalho de zelador” dos cientistas de dadosA maior parte do tempo de um projeto real é gasto em encontrar, limpar e remodelar dados, e não na construção do modelo em si.

Rites, symbols and dress

A mudança na tabela de classificação do Kaggle

As competições públicas de aprendizado de máquina hospedadas no Kaggle, lançadas em 2010, classificam os participantes em uma tabela de classificação visível ao longo de uma competição e, em seguida, revelam a classificação final em relação a um conjunto de testes oculto quando ela é encerrada – um momento que os concorrentes chamam de “sacudir”, já que o excesso de adaptação à tabela de classificação pública pode derrubar uma equipe dezenas de posições durante a noite.

Publicando um cartão modelo

Seguindo a prática proposta num artigo de 2018 de Margaret Mitchell e colegas do Google, as equipas documentam cada vez mais a utilização pretendida de um modelo, os dados de formação e as limitações conhecidas num pequeno “cartão de modelo” antes de ser enviado – tratado mais como uma obrigação profissional do que como um extra opcional.

O passo a passo do notebook

Apresentar descobertas exploratórias percorrendo ao vivo as células e gráficos de um notebook Jupyter, em vez de uma apresentação de slides sofisticada, continua sendo a forma padrão de um cientista de dados compartilhar os primeiros resultados com colegas de equipe e partes interessadas.

Nada disto resolve a tensão mais antiga do campo: se a “ciência de dados” é uma disciplina genuinamente nova ou se o trabalho estatístico e de computação mais antigo tem um nome mais comercializável. Os próprios profissionais discutem sobre isso, muitas vezes dentro da mesma equipe.

O que se manteve constante desde as tábuas de mortalidade de Graunt de 1662 foi o movimento básico: transformar uma pilha de registos numa afirmação sobre a qual alguém possa agir e ser honesto sobre quanto dessa afirmação os dados realmente suportam.

Similar professions

Continue exploring

Keep exploring

More in Science & Research