Encontra padrões e constrói modelos preditivos a partir de dados – um cargo de 2008 baseado em três séculos de contagem, teste e visualização de evidências.
Also called: Cientista Aplicado · Cientista de aprendizado de máquina
Um cientista de dados extrai padrões, previsões e recomendações de dados usando estatísticas, programação e conhecimento de domínio e, em seguida, transforma o resultado em algo em que uma empresa, agência governamental ou equipe de pesquisa possa agir. O trabalho abrange escrever SQL para extrair dados de um warehouse, limpá-los e remodelá-los, ajustar um modelo estatístico ou de aprendizado de máquina e explicar o que o resultado suporta ou não.
O cargo é muito mais recente do que a profissão por trás dele. 'Cientista de dados' data de cerca de 2008, quando DJ Patil e Jeff Hammerbacher decidiram independentemente sobre isso enquanto construíam equipes de dados no LinkedIn e Facebook, e o estatístico William S. Cleveland propôs 'ciência de dados' como um campo acadêmico apenas em 2001. A disciplina subjacente é séculos mais antiga, remontando ao impulso de John Tukey nas décadas de 1960-70 para análise exploratória de dados até as estatísticas de Ronald Fisher da década de 1920 e John Graunt de 1662 estudo dos registros de mortalidade de Londres.
Um artigo de 2012 da Harvard Business Review que o chamou de “o trabalho mais sexy do século 21” desencadeou um boom de contratações corporativas que durou uma década e centenas de novos programas universitários. Desde então, esse boom amadureceu: o título generalista dividiu-se em engenharia analítica, engenharia de aprendizagem automática e análise de produtos, e as ferramentas de IA agora lidam com uma parcela crescente da rotina de consulta, limpeza e mapeamento do trabalho original que se supunha que uma pessoa faria manualmente.
Inside the profession
A ciência de dados é a arte de transformar registros imperfeitos em decisões, onde a parte difícil raramente é ajustar um modelo e geralmente decidir o que os dados podem suportar honestamente.
A maior parte do dia é trabalho de evidências
Cientistas de dados ativos consultam armazéns, reconciliam definições, inspecionam distribuições, limpam campos quebrados e explicam incertezas. A modelagem é importante, mas um resultado só ganha confiança quando sua linhagem de dados, suposições e alternativas podem ser examinadas. Os profissionais mais fortes podem dizer a uma parte interessada que um gráfico de aparência confiante responde à pergunta errada ou que uma associação observada não é evidência de uma causa.
O título esconde várias carreiras
Um cientista de dados de produtos pode projetar experimentos e medir os resultados dos recursos. Um cientista aplicado pode desenvolver modelos preditivos. Um cientista de decisão pode se concentrar em operações, finanças ou políticas. Em organizações maduras, a engenharia analítica, a engenharia de dados e a engenharia de ML absorvem partes do antigo trabalho generalista. O conhecimento do domínio muda o trabalho tanto quanto a pilha técnica: um experimento em um aplicativo de compras não é um estudo dos resultados dos pacientes ou de fraude.
O portão é demonstrado raciocínio
Estatística, ciência da computação, matemática, economia e ciências físicas fornecem rotas. Um diploma ajuda, mas uma entrevista ou portfólio geralmente testa SQL, raciocínio estatístico, qualidade de dados e comunicação de forma mais direta. Um projeto credível não precisa de um modelo chamativo; necessita de uma pergunta clara, de dados documentados, de uma linha de base apropriada e de conclusões que correspondam às evidências.
IA comprime análises de rotina
Os assistentes podem elaborar SQL, gráficos, resumos e modelos básicos. Isso realmente muda o trabalho inicial. Não estabelece definições de medição, não expõe um fator de confusão oculto, não escolhe um uso ético para uma previsão ou aceita a responsabilidade por uma decisão. A profissão está avançando em direção ao enquadramento de problemas, à experimentação, ao raciocínio causal e à revisão de análises geradas por máquinas.
How the work branches
Produtos digitais
Cientista de dados de produtos
Usa métricas e experimentos para orientar as escolhas de produtos, ao mesmo tempo que se defende contra otimizações enganosas de curto prazo.
Sistemas preditivos
Cientista aplicado/de aprendizado de máquina
Cria e avalia modelos para classificação, previsão, detecção ou personalização, muitas vezes junto com engenheiros de ML.
Operações e estratégia
Cientista de decisão
Combina dados com o contexto empresarial ou de políticas públicas para apoiar decisões de planejamento, alocação e risco.
Crescimento e inferência causal
Especialista em experimentação
Projeta testes controlados e quase-experimentos que distinguem uma intervenção de correlação.
Ciência e pesquisa pública
Cientista de dados de pesquisa
Trabalha com dados observacionais ou experimentais complexos onde a reprodutibilidade e o rigor metodológico superam o envio rápido do produto.
How it reads by country
Estados Unidos — títulos e entrevistas especializadas
Os setores de tecnologia, finanças e saúde usam o título de forma diferente, e o recrutamento muitas vezes testa explicitamente o SQL, os experimentos e a comunicação. A alta remuneração está concentrada em algumas cidades e empregadores.
Coreia do Sul — plataformas, comércio e dados empresariais
Grandes plataformas de consumo, telecomunicações e conglomerados apoiam o trabalho analítico, sendo o contexto da língua coreana muitas vezes vital para dados de produtos e clientes. Os títulos dos cargos podem confundir as funções de analista e cientista.
Japão — dados empresariais e adoção cuidadosa
As empresas industriais, financeiras e de consumo estão a expandir a análise, ao mesmo tempo que mantêm práticas estabelecidas de governação de dados. As equipes internacionais podem valorizar o inglês e a experiência na nuvem juntamente com o conhecimento do domínio local.
Alemanha — privacidade e contexto industrial
A proteção de dados e a representação dos trabalhadores determinam quais dados podem ser coletados e usados. Os empregadores do setor automotivo, de manufatura e de pesquisa criam demanda por pessoas que possam unir estatísticas e operações reais.
Reino Unido — Londres finanças e pesquisa
As empresas financeiras, de consultoria e de produtos concentram-se fortemente em Londres, enquanto a investigação pública e as universidades oferecem diferentes incentivos de carreira. As funções contratuais permanecem visíveis no mercado.
Singapura — finanças e plataformas regionais
Bancos, tecnologia governamental e sedes regionais criam funções de dados que abrangem vários mercados. As expectativas regulamentares e as regras de dados transfronteiriças são restrições frequentes.
The profile
Resists AI38
Pay74
Barrier to entry55
Autonomy60
Demand78
Impact66
How exposed is it to AI?
Alto
Uma parcela significativa do trabalho rotineiro de ciência de dados – consultas SQL, gráficos exploratórios, ajuste de um modelo padrão com AutoML, gravação de código de pipeline padronizado – já é automatizável ou assistida por IA hoje, e essa parcela está crescendo rapidamente. O que resiste à automação é enquadrar um problema de negócios ambíguo como uma questão testável, julgar se um resultado é real ou um artefato estatístico e ser responsável quando a decisão de um modelo no mundo real se revelar errada.
O que um cientista de dados realmente faz no dia a dia?
Ao contrário da imagem de “construção de modelos de IA”, a maioria dos dias é dividida entre escrever consultas SQL e código Python para extrair e limpar dados, executar testes estatísticos ou modelos de treinamento e traduzir os resultados em um gráfico ou memorando sobre o qual uma parte interessada não técnica possa agir. Pesquisas realizadas com profissionais colocam consistentemente a limpeza e preparação de dados em cerca de metade ou mais do tempo total de trabalho.
Você precisa de um PhD para se tornar um cientista de dados?
Não. Ao contrário da medicina ou do direito, não há licença ou diploma único exigido; um bacharelado ou mestrado em estatística, ciência da computação, matemática ou áreas quantitativas relacionadas é o caminho mais comum, e um forte portfólio de projetos reais geralmente é mais importante para os empregadores do que a credencial exata. Os PhDs são mais comuns em funções de aprendizado de máquina aplicado ou de pesquisa intensa.
A ciência de dados é apenas estatística com um novo nome?
Não exatamente. Baseia-se fortemente em estatística – o projeto experimental de Fisher, a análise exploratória de Tukey – mas acrescenta programação, engenharia de banco de dados e aprendizado de máquina que os departamentos de estatística clássica raramente ensinam. William S. Cleveland propôs o termo em 2001 especificamente para descrever esta versão ampliada e com muita computação do campo, baseada em estatísticas em vez de substituí-la.
A ciência de dados está em risco devido à IA?
O fim da rotina já está exposto: as ferramentas AutoML podem ajustar e ajustar modelos padrão, e os assistentes de IA podem escrever consultas SQL, primeiros rascunhos de gráficos exploratórios e código de pipeline clichê mais rápido do que uma pessoa. O que não foi automatizado foi formular a pergunta certa, julgar se um padrão é significativo ou espúrio e assumir a responsabilidade por uma decisão baseada no resultado.
Quanto ganham os cientistas de dados?
Varia muito de acordo com o país e a antiguidade. O Bureau of Labor Statistics dos EUA estimou o salário médio anual para a ocupação de Cientistas de Dados em cerca de 108.000 dólares em 2023, enquanto os analistas juniores muitas vezes começam perto de 70.000 a 95.000 dólares e os cientistas de dados seniores ou principais em grandes empresas de tecnologia podem ganhar entre 200.000 e 400.000 dólares ou mais em remuneração total com capital próprio.
Qual é a diferença entre um cientista de dados, um analista de dados e um engenheiro de aprendizado de máquina?
Um analista de dados normalmente responde a questões de negócios definidas com dados e painéis existentes; um cientista de dados constrói novos modelos estatísticos e análises preditivas, muitas vezes a partir de dados mais confusos; um engenheiro de aprendizado de máquina tira um modelo de um notebook e o faz funcionar de maneira confiável, em escala, na produção. Os limites se confundem constantemente e muitas pessoas alternam entre os três ao longo da carreira.
Quais ferramentas e linguagens de programação a ciência de dados usa?
Python domina, geralmente combinado com bibliotecas como pandas e scikit-learn, junto com SQL para consultar bancos de dados. R permanece comum em ambientes acadêmicos e com uso intenso de bioestatística. Os notebooks Jupyter são o ambiente padrão para trabalho exploratório, e plataformas de data warehouse em nuvem, como Snowflake, BigQuery ou Databricks, agora armazenam os dados que a maioria dos cientistas de dados realmente consulta.
Por que 'cientista de dados' foi chamado de 'trabalho mais sexy do século 21'?
Thomas Davenport e DJ Patil usaram essa frase como título de seu artigo da Harvard Business Review de outubro de 2012, argumentando que a rara combinação de habilidade estatística, capacidade de codificação e julgamento de negócios que a função exigia a tornava escassa e muito procurada. A frase pegou, ajudando a desencadear um boom de contratações corporativas que durou uma década e dezenas de novos programas de graduação universitária.
Incorporar este ranking
Cole este código no seu blog ou site — o ranking permanece atualizado.