본문으로 건너뛰기 섹션으로 건너뛰기

📊기원과 변천사

데이터 과학자 · 데이터에서 패턴을 찾고 예측 모델을 만드는 직업 — 2008년에 붙여진 이름이지만, 그 밑바탕에는 3세기에 걸친 증거 수집·검증·시각화의 역사가 있다.

한눈에
연표

시간 순 이정표입니다. 주간 활동 격자가 아닙니다.

1662 그란트, 런던 사망표를 분석하다1908 고셋, '스튜던트'라는 이름으로 t검정을 발표하다1925 피셔가 '연구자를 위한 통계적 방법'을 출간하다1933 네이만과 피어슨이 가설검정을 정식화하다1962 튜키, 데이터 분석이 독자적 과학이라 주장하다1977 튜키의 '탐색적 데이터 분석'이 상자그림을 대중화하다1996 파야드, 피아테츠키샤피로, 스미스가 '지식 발견'을 정의하다2001 클리블랜드가 '데이터 사이언스'를 학문 분야로 제안하다2008 파틸과 하머바커가 직업명을 만들다2012 하버드 비즈니스 리뷰가 '가장 섹시한 직업'이라 부르다
  1. 그란트, 런던 사망표를 분석하다
  2. 고셋, '스튜던트'라는 이름으로 t검정을 발표하다
  3. 피셔가 '연구자를 위한 통계적 방법'을 출간하다
  4. 네이만과 피어슨이 가설검정을 정식화하다
  5. 튜키, 데이터 분석이 독자적 과학이라 주장하다
  6. 튜키의 '탐색적 데이터 분석'이 상자그림을 대중화하다
  7. 파야드, 피아테츠키샤피로, 스미스가 '지식 발견'을 정의하다
  8. 클리블랜드가 '데이터 사이언스'를 학문 분야로 제안하다
  9. 파틸과 하머바커가 직업명을 만들다
  10. 하버드 비즈니스 리뷰가 '가장 섹시한 직업'이라 부르다
지표 밀도

진한 칸일수록 이 직업에서 해당 지표가 높습니다.

최근 검토 출처·크레딧미디어 크레딧방법론

짧은 답

데이터 과학자는 실제로 하루에 무슨 일을 하나요?

'AI 모델을 만든다'는 이미지와 달리, 대부분의 하루는 데이터를 뽑고 정제하는 SQL·Python 코드 작성, 통계 검정이나 모델 학습, 그리고 그 결과를 비전문가 이해관계자가 행동으로 옮길 수 있는 차트나 메모로 옮기는 작업으로 나뉜다. 실무자 설문조사는 일관되게 데이터 정제와 준비가 전체 근무 시간의 절반 이상을 차지한다고 보고한다.

데이터 과학자가 되려면 박사 학위가 필요한가요?

아니다. 의학이나 법학과 달리 자격증이나 필수 학위가 정해져 있지 않으며, 통계학·컴퓨터공학·수학 등 정량적 분야의 학사나 석사가 가장 흔한 경로다. 실제 프로젝트로 구성된 탄탄한 포트폴리오가 정확한 학위보다 더 중요하게 평가되는 경우가 많다. 박사 학위는 연구 중심이나 응용 머신러닝 비중이 큰 직무에서 더 흔하다.

데이터 사이언스는 그냥 이름만 바뀐 통계학인가요?

정확히는 아니다. 피셔의 실험 설계, 튜키의 탐색적 분석 등 통계학에 크게 의존하지만, 고전 통계학과에서는 거의 가르치지 않던 프로그래밍, 데이터베이스 엔지니어링, 머신러닝을 더한다. 윌리엄 S. 클리블랜드는 2001년에 이 확장된 컴퓨팅 중심 통계학을 가리키기 위해 이 용어를 제안했으며, 이는 통계학을 대체하는 것이 아니라 그 위에 세운 개념이다.

데이터 사이언스는 AI로 대체될 위험이 있나요?

정형화된 업무는 이미 상당히 노출되어 있다. AutoML 도구는 표준 모델을 학습하고 튜닝할 수 있고, AI 어시스턴트는 사람보다 빠르게 SQL 쿼리를 작성하고 탐색적 차트 초안을 그리며 상용구 파이프라인 코드를 짤 수 있다. 아직 자동화되지 않은 것은 올바른 질문을 설정하는 능력, 패턴이 의미 있는지 우연인지 판단하는 능력, 그리고 그 결과로 내려진 결정에 책임을 지는 일이다.

데이터 과학자는 얼마나 버나요?

국가와 경력에 따라 크게 다르다. 미국 노동통계국은 2023년 데이터 과학자 직군의 연봉 중위값을 약 $108,000로 집계했으며, 주니어 애널리스트는 흔히 $70,000~$95,000에서 시작하고 대형 기술 기업의 시니어·프린시펄 데이터 과학자는 지분을 포함한 총보상이 $200,000~$400,000 이상에 이르기도 한다.

데이터 과학자, 데이터 애널리스트, 머신러닝 엔지니어는 어떻게 다른가요?

데이터 애널리스트는 대개 기존 데이터와 대시보드로 정해진 비즈니스 질문에 답한다. 데이터 과학자는 더 지저분한 데이터로부터 새로운 통계 모델과 예측 분석을 만든다. 머신러닝 엔지니어는 노트북 속 모델을 꺼내 대규모로 안정적으로 운영하게 만든다. 세 역할의 경계는 끊임없이 흐려지며, 많은 사람이 커리어 동안 셋 사이를 오간다.

이 섹션부터 시작 - 기원과 변천사

비교 랩 열기

이 페이지 공유

데이터 사이언스는 이 사이트에서 가장 젊은 직업명 중 하나이면서, 가장 오래된 기술 위에 놓여 있다. 즉 한 뭉치의 기록을 누군가 행동으로 옮길 수 있는 주장으로 바꾸는 일이다. '데이터 과학자'라는 이름은 2008년 무렵에야 등장했지만, 근본 학문은 3세기에 걸쳐 증거를 세고, 검증하고, 시각화해 온 통계학자들의 역사를 통해 이어져 내려온다.

이 이야기 전체를 관통하는 두 갈래가 있다. 하나는 런던 상인의 사망표에서 피셔의 작물 실험까지 이어지는 통계적 추론의 느린 전문화 과정이고, 다른 하나는 그 유산을 기업 직업명과 학과, 그리고 잠시나마 '21세기 가장 섹시한 직업'으로 포장한 훨씬 빠르고 최근의 과정이다.

시작된 곳

1662년영국 런던

런던의 잡화상 존 그란트는 '사망표에 관한 자연적·정치적 관찰'을 출간했다. 이는 페스트 시기 이후 런던 교구가 기록해 온 주간 사망 기록을 체계적으로 분석한 것으로, 이를 바탕으로 도시 인구를 추정하고 사인의 패턴을 밝혀냈다. 개별 일화가 아니라 방대한 수집 데이터로부터 일반적 결론을 이끌어낸 가장 초기의 시도 중 하나였으며, 대학 교육을 받지 않은 상인이었던 그란트는 이 업적으로 왕립학회 회원으로 선출되었다 — 훗날 훨씬 나중에 붙여질 이 분야의 이름이 결국 뿌리를 두게 될 지적 기원이다.

연표

1662그란트, 런던 사망표를 분석하다

존 그란트가 런던 교구의 사망 기록을 통계적으로 연구해 발표하며, 인구 규모와 사망 패턴을 추정한다 — 수집된 데이터로 일반적 결론을 이끌어낸 가장 초기의 체계적 사례 중 하나다.

1908고셋, '스튜던트'라는 이름으로 t검정을 발표하다

더블린의 기네스 양조장 통계학자였던 윌리엄 실리 고셋은 기네스가 직원의 실명 출판을 금지했기 때문에 '스튜던트'라는 필명으로 '평균의 확률오차'를 발표한다. 이는 소표본 분석에 지금까지 쓰이는 t분포를 도입한 논문이다.

1925피셔가 '연구자를 위한 통계적 방법'을 출간하다

로덤스테드 실험연구소에서 수십 년치 작물 수확량 데이터를 분석하던 로널드 피셔가 분산분석과 현대적 실험 설계를 표준 통계 관행으로 확립한 책을 출간한다.

1933네이만과 피어슨이 가설검정을 정식화하다

예르지 네이만과 이건 피어슨의 논문 '통계적 가설의 가장 효율적인 검정 문제'는 정량화된 오류율로 결과의 유의성을 판단하는 현대적 통계 체계를 제시한다.

1962튜키, 데이터 분석이 독자적 과학이라 주장하다

존 튜키의 논문 '데이터 분석의 미래'는 실제 데이터를 분석하는 일이 수리통계학의 부차적 분야가 아니라 그 자체의 방법론을 가진 독자적 과학으로 인정받아야 한다고 주장한다.

1977튜키의 '탐색적 데이터 분석'이 상자그림을 대중화하다

튜키의 책은 모델을 적합하기 전에 데이터의 형태를 눈으로 파악할 수 있는 실용적 도구 — 그중 상자그림 — 를 실무자들에게 제공한다.

1996파야드, 피아테츠키샤피로, 스미스가 '지식 발견'을 정의하다

세 사람이 AI 매거진에 발표한 논문은 원시 데이터마이닝을 둘러싼 더 넓은 과정으로서 '데이터베이스 내 지식 발견'을 정식화하며, 커져가는 기업 데이터베이스에서 패턴 발견을 체계화하려던 1990년대 흐름의 일부다.

2001클리블랜드가 '데이터 사이언스'를 학문 분야로 제안하다

벨연구소 통계학자 윌리엄 S. 클리블랜드가 '데이터 사이언스: 통계학 분야의 기술 영역 확장을 위한 실행 계획'을 발표하며 전용 대학 데이터 사이언스 학과 설립을 제안한다.

2008파틸과 하머바커가 직업명을 만들다

각각 링크드인과 페이스북에서 데이터팀을 꾸리던 DJ 파틸과 제프 하머바커가 자신들의 팀이 하던 통계와 엔지니어링이 결합된 업무를 가리켜 독립적으로 '데이터 과학자'라는 직업명을 정착시킨다.

2012하버드 비즈니스 리뷰가 '가장 섹시한 직업'이라 부르다

토머스 대븐포트와 DJ 파틸의 2012년 10월 기사 '데이터 과학자: 21세기 가장 섹시한 직업'이 10년에 걸친 기업 채용 붐과 새로운 대학 학위 프로그램의 물결을 촉발한다.

시대별 흐름

1662~1899년

산 자와 죽은 자를 세다

1662년, 런던의 잡화상 존 그란트는 도시 교구의 사망 기록을 통계적으로 분석해 발표했다. 개별 일화가 아니라 수집된 데이터에서 일반적 결론을 이끌어낸 가장 초기의 시도 중 하나였다. 벨기에 천문학자 아돌프 케틀레는 1830년대에 '사회물리학'으로 이 개념을 확장해 통계 분포를 인간 특성에 적용했다. 플로렌스 나이팅게일은 1858년 크림전쟁 사망 데이터의 극좌표 다이어그램을 이용해 영국 전쟁부에 전투가 아니라 열악한 위생이 대부분의 병사를 죽이고 있음을 설득하며 이 전통을 실용적 설득으로 이어갔고, 그 과정에서 왕립통계학회 최초의 여성 회원이 되었다.

현대 데이터 사이언스의 기반이 된 통계적 방법을 만든 로널드 피셔의 사진
Unknown author Unknown author · Public domain · Wikimedia Commons
1900~1935년

통계학자들이 추론을 정식화하다

칼 피어슨은 1901년 신생 수리통계학 분야에 자리를 마련하기 위해 학술지 '바이오메트리카'를 창간했다. 기네스 양조장 통계학자였던 윌리엄 실리 고셋은 회사가 직원의 실명 출판을 금지했기 때문에 1908년 '스튜던트'라는 필명으로 t검정을 발표했다. 로덤스테드 실험연구소에서 수십 년치 작물 실험 데이터를 분석하며 쓴 로널드 피셔의 1925년 저서 '연구자를 위한 통계적 방법'은 분산분석과 엄밀한 실험 설계를 도입했다. 예르지 네이만과 이건 피어슨은 1933년 가설검정을 위한 정식 체계로 이 도구상자를 완성했다 — 데이터 사이언스가 훗날 거의 그대로 물려받게 될 통계적 장비다.

1946년 공개된 최초의 전자식 범용 컴퓨터 중 하나인 에니악
The original uploader was TexasDex at English Wikipedia . · CC BY-SA 3.0 · Wikimedia Commons
1936~1969년

컴퓨터가 등장하고, 튜키가 주장을 펼치다

제2차 세계대전은 대규모 계산을 가속시켰다. 인간 계산 팀에서 시작해 1946년 공개된 최초의 전자식 범용 컴퓨터 에니악(ENIAC)에 이르기까지. 수십 년간 손 계산에 매달리던 통계학자들은 점점 기계를 이용해 이전에는 불가능했던 규모의 분석을 수행하게 되었다. 1962년 벨연구소 및 프린스턴의 통계학자 존 튜키는 '데이터 분석의 미래'를 발표해, 실제 데이터를 분석하는 일이 수리통계학의 부차적 분야로 '잘못 가르쳐지고' 있으며, 그 자체의 방법론과 대학의 관심을 받을 자격이 있는 독자적 과학으로 인정받아야 한다고 주장했다.

존 튜키가 대중화한 탐색적 데이터 분석 도구 중 하나인 상자그림
User:Schutz · Public domain · Wikimedia Commons
1970~1999년

탐색적 분석과 데이터마이닝 붐

튜키의 1977년 저서 '탐색적 데이터 분석'은 모델을 적합하기 전에 데이터셋의 형태를 파악할 수 있는 실용적 도구 — 그중 상자그림 — 를 실무자들에게 제공했다. 1980~90년대에 걸쳐 기업들이 점점 더 많은 거래 데이터베이스를 쌓아가면서, 그 안에서 패턴을 찾는 '데이터마이닝'이라는 병행 학문이 등장했다. 1996년 우사마 파야드, 그레고리 피아테츠키샤피로, 파드라익 스미스의 논문은 원시 데이터마이닝과 더 넓은 개념인 '데이터베이스 내 지식 발견' 과정을 구분해 정식화했다. 컨설턴트 빌 인먼의 글을 통해 그 시대에 널리 퍼진 기업 데이터 웨어하우징은 이 작업이 대기업 내부에 영구적으로 자리 잡을 터전을 마련해 주었다.

21세기 데이터 사이언스의 원재료인 대규모 데이터를 표현한 개념도
Jouasse · CC BY-SA 4.0 · Wikimedia Commons
2000년~현재

이름이 붙고, 직함이 되고, 주목받다가, 세분화되다

벨연구소 통계학자 윌리엄 S. 클리블랜드는 2001년 논문에서 확장된 통계학 분야를 가리키는 이름으로 '데이터 사이언스'를 제안했다. 구글의 2004년 맵리듀스 논문과 그 뒤를 이은 오픈소스 하둡 프레임워크는 이 분야에 인터넷 규모의 데이터를 다룰 저렴한 도구를 안겨주었다. 2008년 무렵, 링크드인과 페이스북에서 데이터팀을 꾸리던 DJ 파틸과 제프 하머바커가 독립적으로 '데이터 과학자'라는 직업명을 정착시켰고, 토머스 대븐포트와 파틸의 2012년 10월 하버드 비즈니스 리뷰 기사가 이를 '21세기 가장 섹시한 직업'이라 부르며 10년에 걸친 기업 채용 붐을 촉발했다. 2010년대 후반에 이르러 이 역할은 애널리틱스 엔지니어, 머신러닝 엔지니어, 프로덕트 애널리스트 같은 더 전문화된 직함으로 분화될 만큼 성숙했고, 그 사이 생성형 AI는 원래 이 직업 설명이 사람의 손으로 할 것이라 가정했던 정형화된 질의와 차트 작업의 상당 부분을 자동화하기 시작했다.

이 직업이 대체한 직업들

더 이상 존재하지 않는 인접 직업들 — 흡수되거나, 자동화되거나, 규제로 사라졌다.

인간 계산원

1880년대~1950년대

전자식 컴퓨터가 등장하기 훨씬 전, 1880년대부터 하버드 천문대에서 별을 목록화한 '하버드 계산원들'이나 1960년대까지 궤도 계산을 손으로 수행한 NASA의 캐서린 존슨, 도로시 본, 메리 잭슨처럼 주로 여성으로 구성된 노동자 팀들이 지금은 소프트웨어가 대신하는 수학적 노동을 담당했다. 전자식 컴퓨터가 신뢰할 만하고 저렴해지자 한 세대 만에 이 역할을 흡수해버렸다.

펀치카드/키펀치 조작원

1890년대~1970년대

1890년 미국 인구조사를 위해 만들어진 허먼 홀러리스의 천공카드 집계기 이후, 키펀치 조작원들은 수십 년 동안 종이 기록을 메인프레임 컴퓨터가 읽을 수 있는 카드로 옮겨 적었고, 이는 전용 교육 과정에서 가르치는 전문 사무 기술이었다. 직접 입력 컴퓨터 단말기의 등장으로 이 역할은 1970~80년대에 거의 사라졌다.

메인프레임 배치 리포트 프로그래머

1960년대~2000년대

과거 기업의 '데이터 처리' 부서는 주로 코볼로 야간 배치 작업을 짜고 실행해 다음 날 아침까지 경영진용 인쇄 보고서를 만들어내는 프로그래머를 고용했다. 셀프서비스 비즈니스 인텔리전스 대시보드와 임시 조회 도구가 등장하며 관리자가 원할 때 직접 수치를 뽑아낼 수 있게 되었고, 이 전문 직종은 2000년대에 이르러 거의 자취를 감췄다.

사라진 직업들 →

데이터 사이언스가 새롭다고 내세우는 능력 — 대규모 데이터에서의 패턴 발견, 엄밀한 추론, 설득력 있는 시각화 — 은 모두 구체적으로 확인 가능한 선조를 갖는다. 그란트의 사망표, 피셔의 작물 실험, 튜키의 상자그림이 그것이다. 2001년과 2008년에 바뀐 것은 대부분 이름과 포장이었고, 저렴한 저장장치와 컴퓨팅 자원이 새롭게 힘을 실어준 오래된 기술에 붙여졌을 뿐이다.

그 뒤를 이은 2012년 '가장 섹시한 직업' 붐은 이미 어느 정도 흐름을 다했다. 직업명은 애널리틱스 엔지니어, 머신러닝 엔지니어, 프로덕트 애널리스트로 갈라졌고, 생성형 AI는 2008년 최초 직업 설명이 당연시했던 정형화된 질의와 차트 작업을 흡수하고 있다. 데이터 속 패턴이 실제로 무엇을 의미하는지 판단하는 근본 기술은 이번에도 특정 직업명보다 더 오래 살아남을 것으로 보인다.

비슷한 직업

같은 분야만이 아니라 여섯 점수 프로필이 가까운 직업입니다.

계속 탐색하기

계속 탐색하기

과학·연구 분야의 다른 직업

⚛️

물리학자

물질과 에너지, 공간과 시간을 지배하는 수학 법칙을 이끌어내고 검증한다. 혼자 칠판 앞에 선 연구자에서 3,000명이 공동 저자로 이름을 올리는 입자가속기 논문까지 그 모습은 다양하다.

AI 내성 65
🧬

생물학자

생명 그 자체를 연구하는 과학자. 린네가 손으로 종을 명명하던 시절부터 크리스퍼로 유전체를 편집하는 오늘날까지, 모든 아이디어를 살아있는 생물체에 비추어 검증한다.

AI 내성 64
🧪

화학자

물질 그 자체를 만들고 측정하는 과학자 — 바빌로니아 타푸티의 증류기에서 오늘날 로봇 실험실에 이르기까지, 스펙트럼이 의미하는 바를 결정하는 것은 여전히 사람이다.

AI 내성 70
🔭

천문학자

바빌로니아의 점토판에서 우주 망원경까지, 우주를 측정하는 과학자 — 데이터 속 어떤 깜빡임이 발견인지는 지금도 가려내는 중이다.

AI 내성 70
🧮

수학자

바빌로니아 서기관에서 필즈상 수상자와 AI 보조 증명까지: 어려운 질문을 영구적 확실성으로 바꾸는 직업, 정리 하나하나마다.

AI 내성 70
🧿

양자 엔지니어

컴퓨팅, 감지, 통신 및 재료 연구를 위해 양자 상태를 활용하는 장치를 구축, 측정 및 제어합니다.

AI 내성 78
🧫

임상 데이터 과학자

임상, 시험 및 건강 시스템 데이터를 사용하여 보다 안전한 치료, 연구 및 운영 결정을 위한 신뢰할 수 있는 증거를 생성합니다.

AI 내성 68