🔬 과학·연구

📊데이터 과학자

데이터에서 패턴을 찾고 예측 모델을 만드는 직업 — 2008년에 붙여진 이름이지만, 그 밑바탕에는 3세기에 걸친 증거 수집·검증·시각화의 역사가 있다.

다른 이름: 응용 과학자 · 머신러닝 과학자

Abstract visualization of interconnected data points and charts
Courtesy NASA/JPL-Caltech. · Public domain

핵심 정보

2008년, 링크드인/페이스북직업명 등장
HBR, 2012년 10월'가장 섹시한 직업' 기사
2001년, 클리블랜드학문 분야로 명명
약 $108k/년연봉 중위값(미국, 2023)
약 20%여성 비율(미국, 추정)
Python, SQL, R핵심 도구

데이터 과학자는 통계학, 프로그래밍, 도메인 지식을 활용해 데이터에서 패턴과 예측, 권고안을 이끌어낸 뒤, 기업이나 정부 기관, 연구팀이 실제로 행동으로 옮길 수 있는 결과로 바꾸는 사람이다. 업무는 데이터 웨어하우스에서 데이터를 뽑아내는 SQL 작성부터 데이터 정제와 재구성, 통계·머신러닝 모델 적합, 그리고 그 결과가 무엇을 뒷받침하고 무엇을 뒷받침하지 않는지 설명하는 일까지 이어진다.

이 직업명은 그 뒤에 있는 기술보다 훨씬 젊다. '데이터 과학자'라는 이름은 2008년 무렵 DJ 파틸과 제프 하머바커가 각각 링크드인과 페이스북에서 데이터팀을 꾸리며 독립적으로 정착시킨 표현이며, 통계학자 윌리엄 S. 클리블랜드가 '데이터 사이언스'를 학문 분야로 제안한 것은 2001년에 불과하다. 그러나 근본이 되는 학문 자체는 훨씬 오래되어, 존 튜키가 1960~70년대에 밀어붙인 탐색적 데이터 분석을 거쳐 로널드 피셔의 1920년대 통계학, 그리고 1662년 존 그란트의 런던 사망 기록 연구까지 거슬러 올라간다.

2012년 하버드 비즈니스 리뷰가 이를 '21세기 가장 섹시한 직업'이라 부른 기사는 10년에 걸친 기업 채용 붐과 수백 개의 새로운 대학 프로그램을 촉발했다. 그 붐은 이제 성숙기에 접어들어, 이 포괄적 직업명은 애널리틱스 엔지니어링, 머신러닝 엔지니어링, 프로덕트 애널리틱스로 분화되었고, AI 도구들은 원래 이 직업이 사람의 손으로 하리라 가정했던 정형화된 질의·정제·차트 작업의 점점 더 많은 부분을 처리하고 있다.

직업 프로필

387455607866
  • AI 내성38
  • 보수74
  • 진입장벽55
  • 자율성60
  • 수요78
  • 영향력66

AI에 얼마나 노출되어 있나?

62 / 100

높음

SQL 질의, 탐색적 차트 작성, AutoML을 이용한 표준 모델 적합, 상용구 파이프라인 코드 작성 등 정형화된 데이터 사이언스 업무의 상당 부분은 이미 자동화되었거나 AI의 도움을 받고 있으며, 그 비중은 빠르게 커지고 있다. 자동화에 저항하는 것은 모호한 비즈니스 문제를 검증 가능한 질문으로 다듬는 일, 결과가 진짜인지 통계적 우연인지 판단하는 일, 그리고 모델의 실제 결정이 잘못되었을 때 책임을 지는 일이다.

AI와 미래 →

이 직업을 보는 일곱 가지 관점

자주 묻는 질문

데이터 과학자는 실제로 하루에 무슨 일을 하나요?
'AI 모델을 만든다'는 이미지와 달리, 대부분의 하루는 데이터를 뽑고 정제하는 SQL·Python 코드 작성, 통계 검정이나 모델 학습, 그리고 그 결과를 비전문가 이해관계자가 행동으로 옮길 수 있는 차트나 메모로 옮기는 작업으로 나뉜다. 실무자 설문조사는 일관되게 데이터 정제와 준비가 전체 근무 시간의 절반 이상을 차지한다고 보고한다.
데이터 과학자가 되려면 박사 학위가 필요한가요?
아니다. 의학이나 법학과 달리 자격증이나 필수 학위가 정해져 있지 않으며, 통계학·컴퓨터공학·수학 등 정량적 분야의 학사나 석사가 가장 흔한 경로다. 실제 프로젝트로 구성된 탄탄한 포트폴리오가 정확한 학위보다 더 중요하게 평가되는 경우가 많다. 박사 학위는 연구 중심이나 응용 머신러닝 비중이 큰 직무에서 더 흔하다.
데이터 사이언스는 그냥 이름만 바뀐 통계학인가요?
정확히는 아니다. 피셔의 실험 설계, 튜키의 탐색적 분석 등 통계학에 크게 의존하지만, 고전 통계학과에서는 거의 가르치지 않던 프로그래밍, 데이터베이스 엔지니어링, 머신러닝을 더한다. 윌리엄 S. 클리블랜드는 2001년에 이 확장된 컴퓨팅 중심 통계학을 가리키기 위해 이 용어를 제안했으며, 이는 통계학을 대체하는 것이 아니라 그 위에 세운 개념이다.
데이터 사이언스는 AI로 대체될 위험이 있나요?
정형화된 업무는 이미 상당히 노출되어 있다. AutoML 도구는 표준 모델을 학습하고 튜닝할 수 있고, AI 어시스턴트는 사람보다 빠르게 SQL 쿼리를 작성하고 탐색적 차트 초안을 그리며 상용구 파이프라인 코드를 짤 수 있다. 아직 자동화되지 않은 것은 올바른 질문을 설정하는 능력, 패턴이 의미 있는지 우연인지 판단하는 능력, 그리고 그 결과로 내려진 결정에 책임을 지는 일이다.
데이터 과학자는 얼마나 버나요?
국가와 경력에 따라 크게 다르다. 미국 노동통계국은 2023년 데이터 과학자 직군의 연봉 중위값을 약 $108,000로 집계했으며, 주니어 애널리스트는 흔히 $70,000~$95,000에서 시작하고 대형 기술 기업의 시니어·프린시펄 데이터 과학자는 지분을 포함한 총보상이 $200,000~$400,000 이상에 이르기도 한다.
데이터 과학자, 데이터 애널리스트, 머신러닝 엔지니어는 어떻게 다른가요?
데이터 애널리스트는 대개 기존 데이터와 대시보드로 정해진 비즈니스 질문에 답한다. 데이터 과학자는 더 지저분한 데이터로부터 새로운 통계 모델과 예측 분석을 만든다. 머신러닝 엔지니어는 노트북 속 모델을 꺼내 대규모로 안정적으로 운영하게 만든다. 세 역할의 경계는 끊임없이 흐려지며, 많은 사람이 커리어 동안 셋 사이를 오간다.
데이터 사이언스는 어떤 도구와 프로그래밍 언어를 쓰나요?
Python이 지배적이며 pandas, scikit-learn 같은 라이브러리와 함께 데이터베이스 질의용 SQL이 짝을 이룬다. R은 학계와 생물통계 분야에서 여전히 흔히 쓰인다. Jupyter 노트북이 탐색 작업의 표준 환경이며, Snowflake, BigQuery, Databricks 같은 클라우드 데이터 웨어하우스 플랫폼이 오늘날 대부분의 데이터 과학자가 실제로 조회하는 데이터를 담고 있다.
'데이터 과학자'는 왜 '21세기 가장 섹시한 직업'이라 불렸나요?
토머스 대븐포트와 DJ 파틸은 2012년 10월 하버드 비즈니스 리뷰 기사 제목으로 이 표현을 썼다. 이들은 통계적 역량과 코딩 능력, 비즈니스 판단력이라는 드문 조합이 이 역할을 희소하면서도 매우 수요 높은 존재로 만든다고 주장했다. 이 표현은 널리 퍼져 10년에 걸친 기업 채용 붐과 수십 개의 새로운 대학 학위 프로그램을 촉발하는 데 일조했다.

과학·연구 분야의 다른 직업