본문으로 건너뛰기

🧫기원과 변천사

임상 데이터 과학자 · 임상, 시험 및 건강 시스템 데이터를 사용하여 보다 안전한 치료, 연구 및 운영 결정을 위한 신뢰할 수 있는 증거를 생성합니다.

이 페이지 공유

Data science is one of the youngest job titles on this site sitting on top of one of the oldest crafts: turning a pile of records into a claim someone can act on. The name 'clinical data scientist' dates only to around 2008; the underlying discipline runs back through three centuries of statisticians counting, testing and visualizing evidence.

Two threads run through the whole story: a slow professionalization of statistical inference, from a London tradesman's mortality tables to Fisher's crop trials, and a much faster, more recent packaging of that inheritance into a corporate job title, an academic department and, briefly, the 'sexiest job of the 21st century.'

시작된 곳

1662년런던, 영국

런던의 잡화업자인 John Graunt는 런던이 흑사병이 발생한 이후 보관해 온 주간 교구 사망 기록을 체계적으로 분석한 '자연적 및 정치적 관찰... 사망의 법안에 따라 작성됨'을 출판했으며, 이를 통해 그는 도시의 인구를 추정하고 사망 원인의 패턴을 식별했습니다. 이는 개별 일화가 아닌 수집된 대규모 데이터에서 일반적인 결론을 도출하려는 가장 초기의 알려진 시도 중 하나였으며, 대학 교육을 받지 않은 가게 주인인 Graunt가 결국 이 분야의 훨씬 나중에 이름이 붙게 될 지적 뿌리인 왕립 학회에 선출되었습니다.

연표

1662년Graunt는 런던의 사망률을 분석합니다.

John Graunt는 런던의 교구 사망 기록에 대한 통계 연구를 발표하여 인구 규모와 사망률 패턴을 추정합니다. 이는 일반적인 결론을 도출하기 위해 수집된 데이터를 체계적으로 사용한 최초의 사례 중 하나입니다.

1908년Gosset은 t-test를 'Student'로 게시합니다.

더블린에 있는 기네스 양조장의 통계학자인 윌리엄 씰리 고셋(William Sealy Gosset)은 '평균의 확률 오류(The Probable Error of a Mean)'를 'Student'라는 가명으로 출판했습니다. 기네스는 직원이 자신의 이름으로 출판하는 것을 금지하고 그 이후로 소표본 분석에 사용되는 t-분포를 도입했기 때문입니다.

1925년Fisher, '연구 인력을 위한 통계 방법' 출판

Rothamsted Experimental Station에서 수십 년간의 작물 수확량 데이터를 분석하는 Ronald Fisher는 표준 통계 관행으로 분산 분석과 현대 실험 설계를 확립하는 책을 출판합니다.

1933년Neyman과 Pearson, 가설 검정 공식화

Jerzy Neyman과 Egon Pearson의 논문 '통계적 가설의 가장 효율적인 테스트 문제'는 통계에 정량화된 오류율을 사용하여 결과가 중요한지 여부를 결정하는 현대적인 프레임워크를 제공합니다.

1962년Tukey는 데이터 분석이 그 자체의 과학이라고 주장합니다.

John Tukey의 논문 'The Future of Data Analysis'는 실제 데이터를 분석하는 것이 수학 통계의 작은 분야가 아닌 고유한 방법을 갖춘 별개의 과학으로 인정받을 가치가 있다고 주장합니다.

1977년Tukey의 '탐색적 데이터 분석'으로 상자 그림이 대중화되었습니다.

Tukey의 책은 실무자들에게 모델을 맞추기 전에 데이터 세트의 모양을 눈으로 이해할 수 있는 실습 도구(그 중 상자 그림)를 제공합니다.

1996년Fayyad, Piatetsky-Shapiro 및 Smyth는 '지식 발견'을 정의합니다.

AI 매거진에 실린 세 사람의 논문은 성장하는 기업 데이터베이스에서 패턴 발견을 공식화하는 1990년대 물결의 일부인 원시 데이터 마이닝을 둘러싼 더 광범위한 프로세스로 '데이터베이스의 지식 발견'을 공식화합니다.

2001년클리블랜드, '임상 데이터 사이언스'를 분야로 제안

Bell Labs의 통계학자인 William S. Cleveland는 '임상 데이터 과학: 통계 분야의 기술 영역 확장을 위한 실행 계획'을 발표하고 대학의 데이터 과학 전담 학과를 제안했습니다.

2008년Patil과 Hammerbacher가 직위를 정했습니다.

LinkedIn과 Facebook에서 각각 데이터 팀을 구축하고 있는 DJ Patil과 Jeff Hammerbacher는 팀에서 수행하는 통계 및 엔지니어링 작업의 직위로 '임상 데이터 과학자'를 독립적으로 결정했습니다.

2012년하버드 비즈니스 리뷰(Harvard Business Review)는 이를 '가장 섹시한 직업'으로 꼽았습니다.

Thomas Davenport와 DJ Patil의 2012년 10월 기사 '임상 데이터 과학자: 21세기의 가장 섹시한 직업'은 10년 동안 지속된 기업 채용 붐과 새로운 대학 학위 프로그램의 물결을 촉발시켰습니다.

시대별 흐름

1662년~1899년

산 자와 죽은 자의 수를 세는 것

1662년 런던의 잡화업자인 존 그랜트(John Graunt)는 도시의 교구 사망 기록에 대한 통계 분석을 발표했는데, 이는 개별 일화가 아닌 수집된 데이터로부터 일반적인 결론을 도출하려는 최초의 알려진 시도 중 하나입니다. 벨기에 천문학자 Adolphe Quetelet는 1830년대에 인간 특성에 통계적 분포를 적용하는 '사회 물리학'으로 아이디어를 확장했습니다. 플로렌스 나이팅게일(Florence Nightingale)은 1858년에 크림 전쟁 사망률 데이터의 극지방 다이어그램을 사용하여 대부분의 군인이 전투가 아닌 열악한 위생으로 인해 사망하고 있다는 사실을 영국 육군성에 설득하여 이 전통을 실제적인 설득으로 옮겼습니다. 이 과정에서 왕립 통계 학회 회원으로 선출된 최초의 여성이 되었습니다.

1900년~1935년

통계학자는 추론을 공식화합니다.

Karl Pearson은 1901년에 젊은 수학 통계학 분야에 본거지를 제공하기 위해 Biometrika 저널을 창간했습니다. 기네스 양조장의 통계학자인 William Sealy Gosset은 기네스가 직원들이 자신의 이름으로 출판하는 것을 금지했기 때문에 1908년 'Student'라는 가명으로 t-테스트를 ​​출판했습니다. Rothamsted Experimental Station에서 수십 년간의 작물 실험을 분석하면서 집필된 Ronald Fisher의 1925년 저서 'Statistical Methods for Research Workers'에는 분산 분석과 엄격한 실험 설계가 소개되었습니다. Jerzy Neyman과 Egon Pearson은 1933년에 가설 테스트를 위한 공식적인 프레임워크를 갖춘 툴킷을 완성했습니다. 통계 기계 임상 데이터 과학은 나중에 거의 그대로 계승될 것입니다.

1936년~1969년

컴퓨터가 도착하고 Tukey가 소송을 제기합니다.

제2차 세계대전으로 인해 인간 컴퓨팅 팀부터 1946년에 공개된 ENIAC과 같은 최초의 전자 범용 컴퓨터에 이르기까지 대규모 계산이 가속화되었습니다. 수십 년 동안 수작업 계산에 종사했던 통계학자들은 이전에는 불가능했던 규모로 분석을 실행하기 위해 점점 더 기계를 사용했습니다. 1962년 벨 연구소와 프린스턴 통계학자 존 투키(John Tukey)는 '데이터 분석의 미래(The Future of Data Analysis)'를 출판하여 실제 데이터를 분석하는 것은 수학적 통계의 작은 분야로서 '잘못 가르쳐지고 있으며' 고유한 방법과 대학의 관심을 받는 고유한 과학으로 인정받을 가치가 있다고 주장했습니다.

1970년~1999년

탐색적 분석과 데이터 마이닝 붐

Tukey의 1977년 저서 '탐색적 데이터 분석(Exploratory Data Analysis)'은 실무자들에게 모델을 적용하기 전에 데이터 세트의 모양을 이해할 수 있는 실습 도구(그 중 상자 그림)를 제공했습니다. 1980년대와 1990년대에 걸쳐 기업이 점점 늘어나는 트랜잭션 데이터베이스를 축적함에 따라, 그 안에서 패턴을 찾기 위해 '데이터 마이닝'이라는 병행 분야가 등장했습니다. Usama Fayyad, Gregory Piatetsky-Shapiro 및 Padhraic Smyth의 1996년 논문은 원시 데이터 마이닝과 '데이터베이스의 지식 발견'이라는 보다 광범위한 프로세스 간의 구별을 공식화했습니다. 지난 10년 동안 컨설턴트 Bill Inmon의 저술을 통해 대중화된 기업 데이터 웨어하우징은 대기업 내부에서 이 작업을 영구적인 기반으로 삼았습니다.

2000년~현재

명명, 제목 지정, 과장 및 전문화

Bell Labs의 통계학자인 William S. Cleveland는 2001년 논문에서 확대된 통계 분야의 이름으로 '임상 데이터 과학'을 제안했습니다. Google의 2004년 MapReduce 논문과 그에 따른 오픈 소스 Hadoop 프레임워크는 현장에 인터넷 규모 데이터를 위한 저렴한 도구를 제공했습니다. 2008년경 LinkedIn과 Facebook에서 데이터 팀을 구성하는 DJ Patil과 Jeff Hammerbacher는 독립적으로 '임상 데이터 과학자'를 직위로 정했고 Thomas Davenport와 Patil의 2012년 10월 Harvard Business Review 기사에서는 이를 '21세기의 가장 섹시한 직업'이라고 부르며 10년 동안 기업 채용 붐을 일으켰습니다. 2010년대 후반에 이르러 그 역할은 분석 엔지니어, 머신러닝 엔지니어, 제품 분석가 등 보다 전문화된 직위로 분할될 만큼 성숙해졌습니다. 심지어 생성 AI는 사람이 직접 수행한다고 가정한 일상적인 쿼리 및 원래 직무 설명 차트 작성의 상당 부분을 자동화하기 시작했습니다.

이 직업이 대체한 직업들

더 이상 존재하지 않는 인접 직업들 — 흡수되거나, 자동화되거나, 규제로 사라졌다.

인간 컴퓨터

1880년대~1950년대

전자 컴퓨터가 등장하기 오래 전에, 1880년대부터 하버드 대학 천문대에서 별 목록을 작성한 '하버드 컴퓨터', 1960년대까지 궤도 궤적을 직접 계산한 NASA의 캐서린 존슨, 도로시 본, 메리 잭슨과 같은 여성 근로자 팀이 현재 소프트웨어로 수행되는 수학적 작업을 수행했습니다. 전자 컴퓨터는 신뢰성과 가격이 저렴해지는 세대에서 그 역할을 흡수했습니다.

펀치 카드/키펀치 연산자

1890년대~1970년대

1890년 미국 인구 조사를 위해 제작된 Herman Hollerith의 천공 카드 도표에 이어, 키펀치 운영자는 메인프레임 컴퓨터가 읽을 수 있는 카드에 종이 기록을 복사하는 데 수십 년을 보냈습니다. 이는 전용 교육 과정에서 가르치는 전문적인 사무 기술입니다. 직접 입력 컴퓨터 터미널은 1970년대와 1980년대에 그 역할을 거의 쓸모없게 만들었습니다.

메인프레임 배치 보고서 프로그래머

1960년대~2000년대

기업의 '데이터 처리' 부서는 한때 프로그래머를 고용했으며 종종 COBOL에서 일했습니다. 그의 주요 업무는 다음날 아침까지 경영진의 인쇄 보고서를 생성하는 예정된 야간 배치 작업을 작성하고 실행하는 것이었습니다. 셀프 서비스 비즈니스 인텔리전스 대시보드와 임시 쿼리 도구를 통해 관리자는 필요에 따라 자신의 수치를 가져올 수 있으며 2000년대에는 이 전문 분야가 거의 완전히 폐쇄됩니다.

사라진 직업들 →

Every capability clinical data science claims as new — pattern-finding in large datasets, rigorous inference, persuasive visualization — has a specific, checkable ancestor: Graunt's mortality tables, Fisher's crop trials, Tukey's box plots. What changed in 2001 and 2008 was mostly the name and the packaging, applied to an old craft newly powered by cheap storage and computing.

The 2012 'sexiest job' boom that followed has already partly run its course: the title has splintered into analytics engineer, machine learning engineer and product analyst, and generative AI is absorbing the routine querying and charting the original 2008 job description took for granted. The underlying discipline — deciding what a pattern in the data actually means — looks likely to outlast the specific job title once again.

비슷한 직업

같은 분야만이 아니라 여섯 점수 프로필이 가까운 직업입니다.

계속 탐색하기

계속 탐색하기

과학·연구 분야의 다른 직업

⚛️

물리학자

물질과 에너지, 공간과 시간을 지배하는 수학 법칙을 이끌어내고 검증한다. 혼자 칠판 앞에 선 연구자에서 3,000명이 공동 저자로 이름을 올리는 입자가속기 논문까지 그 모습은 다양하다.

AI 내성 65
🧬

생물학자

생명 그 자체를 연구하는 과학자. 린네가 손으로 종을 명명하던 시절부터 크리스퍼로 유전체를 편집하는 오늘날까지, 모든 아이디어를 살아있는 생물체에 비추어 검증한다.

AI 내성 64
🧪

화학자

물질 그 자체를 만들고 측정하는 과학자 — 바빌로니아 타푸티의 증류기에서 오늘날 로봇 실험실에 이르기까지, 스펙트럼이 의미하는 바를 결정하는 것은 여전히 사람이다.

AI 내성 70
📊

데이터 과학자

데이터에서 패턴을 찾고 예측 모델을 만드는 직업 — 2008년에 붙여진 이름이지만, 그 밑바탕에는 3세기에 걸친 증거 수집·검증·시각화의 역사가 있다.

AI 내성 38
🔭

천문학자

바빌로니아의 점토판에서 우주 망원경까지, 우주를 측정하는 과학자 — 데이터 속 어떤 깜빡임이 발견인지는 지금도 가려내는 중이다.

AI 내성 70
🧮

수학자

바빌로니아 서기관에서 필즈상 수상자와 AI 보조 증명까지: 어려운 질문을 영구적 확실성으로 바꾸는 직업, 정리 하나하나마다.

AI 내성 70
🧿

양자 엔지니어

컴퓨팅, 감지, 통신 및 재료 연구를 위해 양자 상태를 활용하는 장치를 구축, 측정 및 제어합니다.

AI 내성 78