본문으로 건너뛰기 섹션으로 건너뛰기

🧫문화와 위상

임상 데이터 과학자 · 임상, 시험 및 건강 시스템 데이터를 사용하여 보다 안전한 치료, 연구 및 운영 결정을 위한 신뢰할 수 있는 증거를 생성합니다.

한눈에
지표 밀도

진한 칸일수록 이 직업에서 해당 지표가 높습니다.

최근 검토 출처·크레딧미디어 크레딧방법론

짧은 답

임상 데이터 과학자는 실제로 매일 무엇을 합니까?

'AI 모델 구축' 이미지와는 달리, 대부분의 날은 SQL 쿼리와 Python 코드를 작성하여 데이터를 가져오고 정리하고, 통계 테스트 또는 모델 교육을 실행하고, 결과를 비기술적 이해관계자가 조치를 취할 수 있는 차트나 메모로 변환하는 작업으로 나뉩니다. 실무자 설문조사에 따르면 지속적으로 데이터 정리 및 준비 작업이 전체 작업 시간의 대략 절반 이상에 소요됩니다.

임상 데이터 과학자가 되려면 박사 학위가 필요합니까?

아니요. 의학이나 법률과는 달리 자격증이나 단일 필수 학위가 없습니다. 통계, 컴퓨터 과학, 수학 또는 관련 양적 분야의 학사 또는 석사 학위가 가장 일반적인 경로이며 실제 프로젝트의 강력한 포트폴리오는 종종 정확한 자격보다 고용주에게 더 ​​중요합니다. 박사 학위는 연구 중심적이거나 응용 기계 학습 역할에 더 일반적입니다.

임상 데이터 과학은 단지 새로운 이름의 통계일 뿐인가?

그렇지 않습니다. Fisher의 실험 설계, Tukey의 탐색 분석 등 통계에 크게 의존하지만 기존 통계학과에서 거의 가르치지 않는 프로그래밍, 데이터베이스 엔지니어링 및 기계 학습을 추가합니다. William S. Cleveland는 2001년에 이 용어를 대체하기보다는 통계를 기반으로 하는 확장되고 컴퓨팅 집약적인 분야 버전을 설명하기 위해 특별히 제안했습니다.

임상 데이터 과학이 AI로 인해 위험에 처해 있나요?

일상적인 끝은 이미 노출되어 있습니다. AutoML 도구는 표준 모델을 맞추고 조정할 수 있으며 AI 보조자는 사람보다 빠르게 SQL 쿼리, 초안 탐색 차트 및 상용구 파이프라인 코드를 작성할 수 있습니다. 자동화되지 않은 것은 올바른 질문을 구성하고, 패턴이 의미있는지 가짜인지 판단하고, 결과에 따라 결정을 내리는 것입니다.

임상 데이터 과학자의 수입은 얼마입니까?

국가나 연공서열에 따라 매우 다양합니다. 미국 노동통계국(US Bureau of Labor Statistics)은 2023년 임상 데이터 과학자 직업의 평균 연봉을 약 108,000달러로 추정한 반면, 하급 분석가는 종종 70,000~95,000달러에 가깝게 시작하고 주요 기술 회사의 선임 또는 수석 임상 데이터 과학자는 총 자본 보상으로 200,000~400,000달러 이상을 벌 수 있습니다.

임상 데이터 과학자, 데이터 분석가, 기계 학습 엔지니어의 차이점은 무엇입니까?

데이터 분석가는 일반적으로 기존 데이터와 대시보드를 사용하여 정의된 비즈니스 질문에 답합니다. 임상 데이터 과학자는 종종 더 복잡한 데이터로부터 새로운 통계 모델과 예측 분석을 구축합니다. 기계 학습 엔지니어는 노트북에서 모델을 꺼내 프로덕션 환경에서 대규모로 안정적으로 실행합니다. 경계는 끊임없이 흐려지고 많은 사람들은 경력 전반에 걸쳐 세 가지 모두 사이를 이동합니다.

비교 랩 열기

이 페이지 공유

대중문화는 대부분 통계학자를 건너뛰고 퀀트나 알고리즘이라는 더 극적인 모습으로 나아갔습니다. 임상 데이터 과학자의 공개 이미지는 현직 임상 데이터 과학자가 실제로 매일 하는 일을 하는 사람보다는 머니볼(Moneyball)의 야구 분석가와 빅쇼트(The Big Short)의 위기 예측 퀀트에 더 많은 영향을 받았습니다.

현장 내에서 문화는 경쟁적인 공개 벤치마크, 무표정한 통계적 농담, '모델의 한계에 대해 솔직하게 말하는 것'을 사후 고려가 아닌 일상적인 직업 습관으로 바꾸는 문서 형식(모델 카드)을 기반으로 진행됩니다.

역사 속 사회적 위상

시대별로 이 직업이 지녔던 위상을 0–100 척도로 나타냈다.

2235285578
1660년대~1899년1900년대~1930년대1950년대~1980년대2001년~2011년2012년~현재
1660년대~1899년

초기 통계 작업은 주로 사무원, 아마추어 개혁가 및 나이팅게일과 같은 독학 외부인에 의해 수행되었습니다. 유용하고 때로는 영향력이 있지만 그 자체로 권위 있는 경우는 거의 없습니다.

1900년대~1930년대

Pearson, Fisher 및 Gosset은 통계를 자체 저널과 대학 학과를 통해 학문 분야로 전문화하여 학문적 존경을 얻으면서도 일반 대중에게는 거의 보이지 않았습니다.

1950년대~1980년대

메인프레임 컴퓨팅이 확산됨에 따라 '데이터 처리' 직원과 통계학자는 주로 필수적이지만 매력적이지 않은 기업 백엔드 지원으로 간주되었으며 경영진의 의사결정에는 거의 참여하지 않았습니다.

2001년~2011년

클리블랜드의 2001년 학술 제안은 대중의 관심을 거의 끌지 못했지만, 넷플릭스의 2006~2009년 백만 달러 추천 알고리즘 상과 2008년 링크드인과 페이스북의 '임상 데이터 과학자' 신조어가 기술 산업 내부에서 주목을 받기 시작했습니다.

2012년~현재

Harvard Business Review의 2012년 10월 '가장 섹시한 직업' 프레이밍은 채용 및 명성 붐을 촉발했습니다. 2020년대에 이르러 이 타이틀은 보다 전문적인 역할로 세분화되었으며, 급여와 수요는 여전히 강세를 유지하고 있지만 그 독특한 빛을 일부 잃었습니다.

영화·책·예술 속 모습

영화2011년

머니볼

베넷 밀러(감독); 마이클 루이스(Michael Lewis)의 2003년 책을 기반으로 함

Oakland Athletics의 Billy Beane과 분석가 Paul DePodesta가 통계 분석을 사용하여 Bill James의 세이버메트릭스를 활용하여 야구에서 가장 적은 예산으로 경쟁력 있는 명단을 구축한 방법을 극화합니다.

영화2015년

빅쇼트

아담 맥케이(감독); 마이클 루이스의 책을 바탕으로

다른 사람들이 그 수치를 믿기도 전에 2008년 금융 위기를 예측할 수 있을 만큼 모기지 시장 데이터를 면밀히 연구한 소수의 분석가를 따릅니다.

TV 시리즈2005년~2010년

Numb3rs

니콜라스 팔라치(Nicolas Falacci)와 셰릴 휴튼(Cheryl Heuton)(창작자)

한 수학자는 FBI 요원인 동생이 통계 분석과 패턴 인식을 사용하여 범죄를 해결하도록 돕고 미국 주류 TV 시청자에게 수사 작업으로 응용 수학을 소개합니다.

TV 시리즈2011년~현재

블랙미러

찰리 브루커 (창작자)

이 영국 선집 시리즈는 사람들의 알고리즘 순위에 대한 대중의 불안을 형성하는 2016년 에피소드 'Nosedive'에서 가장 직접적으로 데이터 프로파일링과 예측 점수가 불안한 극단으로 가는 것을 반복적으로 상상합니다.

영화2016년

숨겨진 인물

테오도르 멜피(감독); 마고 리 셰털리(Margot Lee Shetterly)의 책을 바탕으로

전자 컴퓨터가 작업을 이어받기 전인 1962년 수성 궤도 임무를 NASA에서 수작업으로 계산한 흑인 여성 수학자 캐서린 존슨, 도로시 본, 메리 잭슨의 실제 이야기를 들려줍니다.

다큐멘터리2020

코딩된 바이어스

샬리니 칸타야 (감독)

MIT 연구원 Joy Buolamwini는 안면 인식 시스템이 피부색이 어두운 얼굴을 훨씬 더 자주 잘못 식별하여 기술적인 데이터 편향 결과를 알고리즘 공정성을 갖춘 더 폭넓은 대중의 평가로 전환한다는 사실을 발견했습니다.

속담과 관용구

쓰레기는 들어가고, 쓰레기는 나온다

1950년대~60년대에 널리 사용된 컴퓨팅 격언모델이나 분석의 신뢰성은 입력된 데이터만큼만 신뢰할 수 있습니다. 아무리 통계적으로 정교하다고 해도 잘못된 입력 데이터를 구제할 수는 없습니다.

모든 모델이 잘못되었지만 일부는 유용합니다.

George Box, 통계학자, '과학과 통계', 미국 통계 협회 저널, 1976모든 모델은 현실을 단순화한 것입니다. 목표는 세상에 대한 완벽한 설명이 아니라 유용할 만큼 정확한 모델을 만드는 것입니다.

상관관계는 인과관계를 의미하지 않습니다.

20세기 초 통계를 통해 공식화된 고전적인 통계적 격언두 변수가 함께 움직인다고 해서 하나가 다른 변수의 원인이라는 것을 증명할 수는 없습니다. 숨겨진 세 번째 요인이 두 가지를 모두 설명할 수 있습니다.

80% 데이터 정리입니다

널리 반복되는 업계 격언은 임상 데이터 과학자의 '관리인 작업'에 대한 Steve Lohr의 2014년 New York Times 기사에 반영되어 있습니다.실제 프로젝트 시간의 대부분은 모델 자체를 구축하는 것이 아니라 데이터를 찾고, 정리하고, 재구성하는 데 사용됩니다.

의례, 상징, 복장

Kaggle 리더보드 개편

2010년에 시작된 Kaggle에서 주최하는 공개 머신러닝 대회는 대회 내내 눈에 보이는 리더보드에 참가자의 순위를 매긴 다음, 대회가 종료되면 숨겨진 테스트 세트에 대한 최종 순위를 공개합니다. 공개 리더보드에 과적합하면 하룻밤 사이에 팀이 수십 단계 하락할 수 있기 때문에 경쟁자들이 '개편'이라고 부르는 순간입니다.

모델 카드 게시

Google의 Margaret Mitchell과 동료들이 2018년 논문에서 제안한 관행에 따라 팀에서는 배송 전에 모델의 의도된 용도, 훈련 데이터 및 알려진 제한 사항을 짧은 '모델 카드'에 문서화하는 일이 점점 더 늘어나고 있습니다. 이는 선택적인 추가 항목이 아닌 전문적인 의무로 처리됩니다.

노트북 연습

세련된 슬라이드 데크 대신 Jupyter 노트북의 셀과 차트를 실시간으로 스크롤하여 탐색적 결과를 제시하는 것은 임상 데이터 과학자가 팀 동료 및 이해관계자와 초기 결과를 공유하는 기본 방법으로 남아 있습니다.

이 중 어느 것도 해당 분야의 가장 오래된 긴장, 즉 '임상 데이터 과학'이 진정으로 새로운 학문인지 아니면 더 시장성이 있는 이름을 지닌 오래된 통계 및 컴퓨팅 작업인지 여부를 해결하지 못합니다. 실무자들은 종종 같은 팀 내에서 이에 대해 논쟁을 벌입니다.

Graunt의 1662년 사망률 표 이후 변함없이 유지된 것은 기본적인 움직임입니다. 기록 더미를 누군가가 조치를 취할 수 있는 주장으로 바꾸고 데이터가 실제로 뒷받침하는 주장의 양이 얼마나 되는지 솔직하게 밝히는 것입니다.

비슷한 직업

같은 분야만이 아니라 여섯 점수 프로필이 가까운 직업입니다.

계속 탐색하기

계속 탐색하기

과학·연구 분야의 다른 직업

⚛️

물리학자

물질과 에너지, 공간과 시간을 지배하는 수학 법칙을 이끌어내고 검증한다. 혼자 칠판 앞에 선 연구자에서 3,000명이 공동 저자로 이름을 올리는 입자가속기 논문까지 그 모습은 다양하다.

AI 내성 65
🧬

생물학자

생명 그 자체를 연구하는 과학자. 린네가 손으로 종을 명명하던 시절부터 크리스퍼로 유전체를 편집하는 오늘날까지, 모든 아이디어를 살아있는 생물체에 비추어 검증한다.

AI 내성 64
🧪

화학자

물질 그 자체를 만들고 측정하는 과학자 — 바빌로니아 타푸티의 증류기에서 오늘날 로봇 실험실에 이르기까지, 스펙트럼이 의미하는 바를 결정하는 것은 여전히 사람이다.

AI 내성 70
📊

데이터 과학자

데이터에서 패턴을 찾고 예측 모델을 만드는 직업 — 2008년에 붙여진 이름이지만, 그 밑바탕에는 3세기에 걸친 증거 수집·검증·시각화의 역사가 있다.

AI 내성 38
🔭

천문학자

바빌로니아의 점토판에서 우주 망원경까지, 우주를 측정하는 과학자 — 데이터 속 어떤 깜빡임이 발견인지는 지금도 가려내는 중이다.

AI 내성 70
🧮

수학자

바빌로니아 서기관에서 필즈상 수상자와 AI 보조 증명까지: 어려운 질문을 영구적 확실성으로 바꾸는 직업, 정리 하나하나마다.

AI 내성 70
🧿

양자 엔지니어

컴퓨팅, 감지, 통신 및 재료 연구를 위해 양자 상태를 활용하는 장치를 구축, 측정 및 제어합니다.

AI 내성 78