본문으로 건너뛰기 섹션으로 건너뛰기

📊전설의 인물들

데이터 과학자 · 데이터에서 패턴을 찾고 예측 모델을 만드는 직업 — 2008년에 붙여진 이름이지만, 그 밑바탕에는 3세기에 걸친 증거 수집·검증·시각화의 역사가 있다.

한눈에
지표 밀도

진한 칸일수록 이 직업에서 해당 지표가 높습니다.

최근 검토 출처·크레딧미디어 크레딧방법론

짧은 답

데이터 과학자는 실제로 하루에 무슨 일을 하나요?

'AI 모델을 만든다'는 이미지와 달리, 대부분의 하루는 데이터를 뽑고 정제하는 SQL·Python 코드 작성, 통계 검정이나 모델 학습, 그리고 그 결과를 비전문가 이해관계자가 행동으로 옮길 수 있는 차트나 메모로 옮기는 작업으로 나뉜다. 실무자 설문조사는 일관되게 데이터 정제와 준비가 전체 근무 시간의 절반 이상을 차지한다고 보고한다.

데이터 과학자가 되려면 박사 학위가 필요한가요?

아니다. 의학이나 법학과 달리 자격증이나 필수 학위가 정해져 있지 않으며, 통계학·컴퓨터공학·수학 등 정량적 분야의 학사나 석사가 가장 흔한 경로다. 실제 프로젝트로 구성된 탄탄한 포트폴리오가 정확한 학위보다 더 중요하게 평가되는 경우가 많다. 박사 학위는 연구 중심이나 응용 머신러닝 비중이 큰 직무에서 더 흔하다.

데이터 사이언스는 그냥 이름만 바뀐 통계학인가요?

정확히는 아니다. 피셔의 실험 설계, 튜키의 탐색적 분석 등 통계학에 크게 의존하지만, 고전 통계학과에서는 거의 가르치지 않던 프로그래밍, 데이터베이스 엔지니어링, 머신러닝을 더한다. 윌리엄 S. 클리블랜드는 2001년에 이 확장된 컴퓨팅 중심 통계학을 가리키기 위해 이 용어를 제안했으며, 이는 통계학을 대체하는 것이 아니라 그 위에 세운 개념이다.

데이터 사이언스는 AI로 대체될 위험이 있나요?

정형화된 업무는 이미 상당히 노출되어 있다. AutoML 도구는 표준 모델을 학습하고 튜닝할 수 있고, AI 어시스턴트는 사람보다 빠르게 SQL 쿼리를 작성하고 탐색적 차트 초안을 그리며 상용구 파이프라인 코드를 짤 수 있다. 아직 자동화되지 않은 것은 올바른 질문을 설정하는 능력, 패턴이 의미 있는지 우연인지 판단하는 능력, 그리고 그 결과로 내려진 결정에 책임을 지는 일이다.

데이터 과학자는 얼마나 버나요?

국가와 경력에 따라 크게 다르다. 미국 노동통계국은 2023년 데이터 과학자 직군의 연봉 중위값을 약 $108,000로 집계했으며, 주니어 애널리스트는 흔히 $70,000~$95,000에서 시작하고 대형 기술 기업의 시니어·프린시펄 데이터 과학자는 지분을 포함한 총보상이 $200,000~$400,000 이상에 이르기도 한다.

데이터 과학자, 데이터 애널리스트, 머신러닝 엔지니어는 어떻게 다른가요?

데이터 애널리스트는 대개 기존 데이터와 대시보드로 정해진 비즈니스 질문에 답한다. 데이터 과학자는 더 지저분한 데이터로부터 새로운 통계 모델과 예측 분석을 만든다. 머신러닝 엔지니어는 노트북 속 모델을 꺼내 대규모로 안정적으로 운영하게 만든다. 세 역할의 경계는 끊임없이 흐려지며, 많은 사람이 커리어 동안 셋 사이를 오간다.

이 섹션부터 시작 - 전설의 인물들

비교 랩 열기

이 페이지 공유

데이터 사이언스의 계보는 손으로 페스트 사망자 수를 세던 17세기 런던 상인에서부터 수십억 건의 익명화된 링크 클릭을 채굴하는 21세기 과학자까지 이어진다. 여기 소개하는 여덟 명은 3세기, 3대륙에 걸쳐 있다.

이들을 연결하는 것은 공유된 방법론이라기보다 공유된 본능이다. 실제의 지저분한 기록을 세심히 들여다보고, 패턴이 검증을 견뎌낸 뒤에야 그것을 신뢰하는 것 — 이 분야가 어느 시대에 어떤 이름으로 불리든 여전히 지탱하고 있는 바로 그 원칙이다.

역대 최고의 시상대

플로렌스 나이팅게일
플로렌스 나이팅게일
영국
2
로널드 피셔
로널드 피셔
영국
1
윌리엄 실리 고셋
윌리엄 실리 고셋
영국 / 아일랜드
3

“엄밀한 실험은 나중에 논쟁할 것이 아니라 처음부터 통제와 무작위화를 갖춰야 한다.”

로널드 피셔

정점에 오른 8인

1
로널드 피셔의 사진 Unknown author Unknown author · Public domain

로널드 피셔

영국 · 1890~1962

영국의 통계학자이자 유전학자로, 1920년대 로덤스테드 실험연구소에서 수십 년치 작물 수확량 실험을 분석하며 분산분석, 무작위 실험 설계, 최대우도추정 등 현대 응용통계학의 뼈대 대부분을 세웠다.

일화

1920년대 후반 로덤스테드의 어느 오후 티타임에서, 동료 뮤리엘 브리스톨은 우유를 찻잔에 먼저 부었는지 나중에 부었는지 맛으로 알 수 있다고 주장했다. 피셔는 이를 무시하는 대신 실제로 이 주장을 검증할 무작위 실험을 설계했다 — 그는 이 사례를 1935년 저서 '실험의 설계'에서 귀무가설과 무작위 시험 설계의 논리를 설명하는 데 다시 사용했다.

“엄밀한 실험은 나중에 논쟁할 것이 아니라 처음부터 통제와 무작위화를 갖춰야 한다.”

'연구자를 위한 통계적 방법' 출간
1925년
로덤스테드 실험연구소 재직 기간
약 14년
왕립학회 회원 선출
1929년
2
플로렌스 나이팅게일의 사진 Henry Hering (1814-1893) · Public domain

플로렌스 나이팅게일

영국 · 1820~1910

현대 간호학의 창시자로 더 잘 알려져 있지만, 나이팅게일은 데이터 시각화를 활용해 크림전쟁에서 전투 부상이 아니라 열악한 위생이 대부분의 병사를 죽이고 있음을 영국 정부에 설득한 선구적 통계학자이기도 했으며, 왕립통계학회 최초의 여성 회원이 되었다.

일화

1858년 나이팅게일은 한 해를 월별 사망자 수 크기의 부채꼴로 나누고 사인별로 색을 입힌 원형 다이어그램, 이른바 '콕스콤' 또는 극좌표 다이어그램을 발표해, 크림전쟁에서 영국군 사망의 압도적 다수가 전투가 아니라 예방 가능한 질병 때문이었음을 전쟁부에 보여주었다. 이 시각화는 지속적인 군 위생 개혁을 이끌어냈다.

“잘 설계된 차트는 같은 숫자를 표로만 보여주는 것보다 훨씬 빠르게 정부 정책을 바꿀 수 있다.”

왕립통계학회 회원 선출
1858년(최초의 여성)
'건강에 영향을 미치는 사항에 관한 노트' 출간
1858년
왕립위생위원회 설립
1857년
3
윌리엄 실리 고셋의 사진 User Wujaszek on pl.wikipedia · Public domain

윌리엄 실리 고셋

영국 / 아일랜드 · 1876~1937

더블린의 기네스 양조장에서 화학자 겸 통계학자로 일하며, 소량의 보리 샘플 품질을 판단하는 매우 실용적인 문제를 풀기 위해 t분포와 t검정을 개발했고, 기네스가 직원의 실명 출판을 금지했기 때문에 '스튜던트'라는 필명으로 발표했다.

일화

경쟁사가 영업 비밀을 알게 될 것을 우려한 기네스는 직원의 출판을 금지했고, 이에 고셋의 획기적인 1908년 논문 '평균의 확률오차'는 바이오메트리카에 '스튜던트'라는 필명으로 실렸다. 그의 실명이 통계학자들 사이에 알려진 지 오래인 지금도 이 이름은 오늘날 수백만 건의 소표본 분석에 쓰이는 t검정에 붙어 있다.

“하나의 좁고 실용적인 문제를 풀기 위해 만들어진 방법이 한 세기 넘게 그 원래 목적을 뛰어넘어 살아남을 수 있다.”

'평균의 확률오차' 발표
1908년, 바이오메트리카
기네스 재직 기간
약 38년
출판에 사용한 필명
'스튜던트'
4
C. R. 라오의 사진 Prateek Karandikar · CC BY-SA 4.0

C. R. 라오

인도 / 미국 · 1920~2023

인도계 미국인 통계학자로, 25세에 크라메르-라오 하한과 라오-블랙웰 정리 — 통계적 추정 이론에서 가장 널리 쓰이는 결과 두 가지 — 를 도출했고, 이후 인도통계연구소 설립에 힘을 보태며 미국 대학에서 오랜 경력을 쌓았다.

일화

콜카타 인도통계연구소의 젊은 연구원이던 라오가 1945년 발표한 논문은 어떤 비편향 추정량도 알려지지 않은 양을 얼마나 정밀하게 측정할 수 있는지에 대한 하한선을 증명했다 — 지금은 크라메르-라오 하한이라 불리며, 26세가 되기도 전에 쓴 이 결과는 매우 근본적이어서 이후 출간된 거의 모든 통계학 교재에 등장한다.

“경력 초기에 정밀하게 증명된 결과 하나가 이후 수십 년간의 유행보다 더 오래 살아남을 수 있다.”

크라메르-라오 하한 논문 발표
1945년
미국 국가과학훈장 수상
2002년
사망 당시 나이
102세
5

존 튜키

미국 · 1915~2000

고속 푸리에 변환 알고리즘을 공동 발명하고 상자그림을 창안한 미국의 수학자 겸 통계학자로, 1962년 논문 '데이터 분석의 미래'에서 실제 데이터 분석이 수리통계학과 구별되는 독자적 과학으로 인정받아야 한다고 주장했다.

일화

'데이터 분석의 미래'(1962년)에서 튜키는 데이터 분석이 수학의 부차적 분야로 '잘못 가르쳐지고' 있다고 썼고, 이후 15년 동안 상자그림과 줄기잎그림을 비롯한 실용적 기법 — 1977년 저서 '탐색적 데이터 분석'에서 소개됨 — 을 개발했다. 컴퓨터가 숫자에 손대기 전에 연필과 종이로 손수 다룰 수 있도록 설계된 도구들이었다.

“어떤 모델을 신뢰하기 전에, 단순하고 손으로 그릴 수 있는 도구로 데이터를 직접 눈으로 살펴보라.”

'데이터 분석의 미래' 발표
1962년
'탐색적 데이터 분석' 출간
1977년
고속 푸리에 변환 알고리즘
1965년, 쿨리와 공동
6

윌리엄 S. 클리블랜드

미국 · 1943년 출생

2001년 논문에서 확장된 통계학 분야를 가리키는 이름으로 '데이터 사이언스'를 만든 벨연구소 통계학자로, LOESS 국소회귀법을 비롯해 널리 쓰이는 데이터 시각화·평활화 기법도 별도로 발명했다.

일화

클리블랜드의 2001년 논문 '데이터 사이언스: 통계학 분야의 기술 영역 확장을 위한 실행 계획'은 대학이 통계학과와는 별도로 전용 데이터 사이언스 학과를 만들 것을 제안하는 구체적인 제도적 권고안이었다. 이 제안이 자리 잡기까지 10년 넘게 걸렸지만, 2010년대 중반에는 전 세계 수백 개 대학이 실제로 그렇게 했다.

“한 분야의 경계를 글로 명명하고 공식적으로 제안하는 일은 몇 년 뒤 대학들이 그 분야를 조직하는 방식을 좌우할 수 있다.”

'데이터 사이언스: 실행 계획' 발표
2001년
'데이터 시각화' 출간
1993년
벨연구소 재직 기간
약 30년
7

DJ 파틸

미국 · 1973년 출생

링크드인의 데이터팀을 이끌며 동료 제프 하머바커와 함께 2008년 무렵 독립적으로 '데이터 과학자'라는 직업명을 정착시켰고, 이를 '21세기 가장 섹시한 직업'이라 부른 2012년 하버드 비즈니스 리뷰의 영향력 있는 기사를 공동 집필했으며, 이후 오바마 대통령 시절 미국 최초의 최고데이터과학자로 재직했다.

일화

파틸은 2008년 무렵 링크드인의 데이터팀을 꾸리며 '데이터 애널리스트'나 '비즈니스 애널리스트' 같은 직함도 고려했지만, 이 역할이 실제로 요구하는 엔지니어링과 통계학의 조합을 더 잘 포착한다는 이유와 채용에 더 매력적인 직함이라는 이유로 '데이터 과학자'를 택했다고 회고한다.

“올바른 직업명은 그 일 자체만큼이나 한 직군 전체가 어떻게 채용되는지를 좌우할 수 있다.”

'가장 섹시한 직업' HBR 기사 발표
2012년 10월, 대븐포트와 공동
미국 최고데이터과학자 재임
2015~2017년
링크드인 데이터팀 합류
2008년
8

힐러리 메이슨

미국 · 1978년 출생

2009년 bit.ly의 수석 과학자가 되어 이 직함을 공개적으로 갖게 된 가장 이른 인물 중 한 명으로, 이 링크 단축 서비스의 방대한 클릭스트림 데이터를 이용해 온라인에서 무엇이 퍼지는지 연구했고, 이후 머신러닝 연구 스타트업 패스트 포워드 랩스를 설립했다.

일화

bit.ly에서 메이슨과 동료들은 수십억 건의 익명화된 단축 링크 클릭을 채굴해 정보가 실시간으로 인터넷을 통해 실제로 어떻게 퍼지는지 연구했고, 어느 시간대에 링크가 가장 많이 클릭되는지 같은 패턴을 발표하며 링크 단축 유틸리티를 대규모 데이터 사이언스 연구 프로그램 중 최초로 공개 논의되는 사례 중 하나로 바꿔놓았다.

“평범한 인프라 제품도 누군가 알아본다면 가장 풍부한 연구 데이터셋 중 하나가 될 수 있다.”

bit.ly 수석 과학자 재직 시작
2009년
패스트 포워드 랩스 설립
2014년
패스트 포워드 랩스, 클라우데라에 인수
2017년

그래프는 이 목록 1위 기준 상대값입니다.

비교 실험실

이름을 켜고 끄면 — 모든 막대가 선택된 그룹의 1위를 기준으로 다시 계산된다.

5 / 8

논쟁

DJ 파틸과 제프 하머바커가 정말로 이 직업명을 '만들었는지'는 논쟁의 대상이다. 두 사람 모두 더 넓은 팀의 공로와 업계 내 비공식적 선행 사용을 인정했으며, 이 표현은 2008년 이전 산발적인 기록에도 등장한다.

이 분야 자체의 이름을 붙인 공로도 논쟁적이다. 컴퓨터과학자 피터 나우어는 윌리엄 S. 클리블랜드의 널리 인용되는 2001년 제안보다 수십 년 앞선 1974년에 이미 '데이터 사이언스'라는 용어를 컴퓨터과학의 동의어로 사용했다.

비슷한 직업

같은 분야만이 아니라 여섯 점수 프로필이 가까운 직업입니다.

계속 탐색하기

계속 탐색하기

과학·연구 분야의 다른 직업

⚛️

물리학자

물질과 에너지, 공간과 시간을 지배하는 수학 법칙을 이끌어내고 검증한다. 혼자 칠판 앞에 선 연구자에서 3,000명이 공동 저자로 이름을 올리는 입자가속기 논문까지 그 모습은 다양하다.

AI 내성 65
🧬

생물학자

생명 그 자체를 연구하는 과학자. 린네가 손으로 종을 명명하던 시절부터 크리스퍼로 유전체를 편집하는 오늘날까지, 모든 아이디어를 살아있는 생물체에 비추어 검증한다.

AI 내성 64
🧪

화학자

물질 그 자체를 만들고 측정하는 과학자 — 바빌로니아 타푸티의 증류기에서 오늘날 로봇 실험실에 이르기까지, 스펙트럼이 의미하는 바를 결정하는 것은 여전히 사람이다.

AI 내성 70
🔭

천문학자

바빌로니아의 점토판에서 우주 망원경까지, 우주를 측정하는 과학자 — 데이터 속 어떤 깜빡임이 발견인지는 지금도 가려내는 중이다.

AI 내성 70
🧮

수학자

바빌로니아 서기관에서 필즈상 수상자와 AI 보조 증명까지: 어려운 질문을 영구적 확실성으로 바꾸는 직업, 정리 하나하나마다.

AI 내성 70
🧿

양자 엔지니어

컴퓨팅, 감지, 통신 및 재료 연구를 위해 양자 상태를 활용하는 장치를 구축, 측정 및 제어합니다.

AI 내성 78
🧫

임상 데이터 과학자

임상, 시험 및 건강 시스템 데이터를 사용하여 보다 안전한 치료, 연구 및 운영 결정을 위한 신뢰할 수 있는 증거를 생성합니다.

AI 내성 68