본문으로 건너뛰기

🧫실무와 노하우

임상 데이터 과학자 · 임상, 시험 및 건강 시스템 데이터를 사용하여 보다 안전한 치료, 연구 및 운영 결정을 위한 신뢰할 수 있는 증거를 생성합니다.

이 페이지 공유

The popular image of a clinical data scientist building clever predictive models is real but incomplete. Practitioner surveys and firsthand accounts consistently describe a job where finding, cleaning and reshaping messy data eats up more hours than the modeling step most people picture.

The craft passed down inside the field is less about memorizing a specific algorithm and more about disciplined skepticism: looking at the data before trusting any model of it, checking whether a pattern holds inside subgroups, and knowing when the honest answer to a stakeholder's question is that the data cannot support one.

이 일이 요구하는 역량

857870726258
통계와 확률
85
프로그래밍(Python, SQL, R)
78
데이터 랭글링 및 파이프라인
70
머신러닝 모델링
72
결과 전달
62
비즈니스 또는 도메인 컨텍스트
58

통계와 확률

가설 테스트, 회귀, p-값 또는 신뢰 구간이 실제로 무엇을 주장하는지 이해하는 것 등은 업무의 다른 모든 것의 기반이 되는 추론 기반입니다.

프로그래밍(Python, SQL, R)

다시 실행할 필요가 없는 노트북에서 분석 프로토타입을 만드는 것뿐만 아니라 대규모로 데이터를 가져오고, 정리하고, 변환할 수 있을 만큼 유창한 코드를 작성합니다.

데이터 랭글링 및 파이프라인

지저분하고 일관성이 없는 실제 데이터(누락된 값, 중복된 레코드, 일치하지 않는 형식)를 모델이나 차트에서 실제로 사용할 수 있는 것으로 전환합니다.

머신러닝 모델링

문제에 적합한 모델을 선택, 학습 및 검증하고 간단한 회귀 분석이 정교한 신경망을 능가하는 경우를 파악합니다.

결과 전달

실제 불확실성을 과도하게 단순화하거나 묻어두지 않고 통계 결과를 기술 지식이 없는 경영진이 조치를 취할 수 있는 차트, 메모 또는 권장 사항으로 변환합니다.

비즈니스 또는 도메인 컨텍스트

특정 비즈니스 또는 과학 분야에서 측정항목이 실제로 무엇을 의미하는지 이해하여 분석을 통해 실제로 제기된 질문에 대한 답을 얻을 수 있습니다.

하루의 풍경

기립 및 대시보드 점검데이터 가져오기 및 정리점심모델링 및 분석이해관계자 회의 및 검토무휴(주로) 036912151821 24h
  1. 8–9 기립 및 대시보드 점검

    야간 파이프라인 실행 및 주요 지표 대시보드를 검토하고 그날의 우선순위에 대해 팀과 짧은 동기화를 수행합니다.

  2. 9–12 데이터 가져오기 및 정리

    데이터 웨어하우스에 대한 SQL 쿼리 작성, 테이블 조인 및 재구성, 누락되거나 일관되지 않은 값 처리(일반적으로 하루 중 가장 큰 단일 블록).

  3. 12–13 점심

    진정한 휴식 시간이자 예정된 회의에 도달하기 전에 팀 간 문제가 제기되는 비공식적 환경인 경우가 많습니다.

  4. 13–15 모델링 및 분석

    통계 모델을 구축하거나 개선하고, 실험의 유의성 테스트를 실행하고, 측정항목이 이동한 이유를 자세히 알아보세요.

  5. 15–17 이해관계자 회의 및 검토

    제품 또는 비즈니스 팀에 결과를 제시하고, A/B 테스트 결과를 검토하고, 질문이 있을 때 분석의 가정을 방어합니다.

  6. 17–8 무휴(주로)

    제품 출시 또는 분기별 비즈니스 검토를 제외한 개인 시간은 저녁 시간에 마지막 분석 요청을 처리할 수 있습니다.

노하우

현장에서 실제로 전수되는 기술 지식 — 동기부여 문구가 아니다.

01

모델링하기 전에 데이터를 살펴보세요.

무엇이든 맞추기 전에 원시 분포, 산점도 및 간단한 요약을 플로팅합니다. 이는 모델이 조용히 흡수하고 숨길 깨진 데이터, 단위 오류 및 이상값을 잡아내는 습관입니다.

존 투키(John Tukey), '탐색적 데이터 분석', 1977
02

하위 그룹 내에서도 추세가 유지되는지 확인

데이터가 관련 범주로 분할되면 집계 추세가 완전히 반전될 수 있습니다. 이 패턴은 통계학자인 Edward H. Simpson이 1951년 논문에서 이름을 딴 심슨의 역설로 알려져 있습니다.

Edward H. Simpson, 1951년 논문; Karl Pearson과 다른 사람들이 앞서 언급한 현상
03

테스트 세트를 들고 끝까지 보지 마세요.

동일한 보유 데이터에 대해 반복적으로 성능을 확인한 다음 모델을 조정하면 해당 데이터의 정보가 조용히 모델로 유출됩니다. 단 한 번만 터치하면 최종 결과가 정직하게 유지됩니다.

Hastie, Tibshirani 및 Friedman, 'The Elements of Statistical Learning,' 2001에서 공식화된 표준 관행
04

모델링이 아닌 청소를 위해 대부분의 프로젝트 예산을 책정하십시오.

실제 프로젝트는 그 반대보다 일관되게 데이터 준비 80%, 모델링 20%에 가깝게 실행됩니다. 반대 가정을 중심으로 일정을 계획하는 것은 프로젝트가 지연되는 일반적인 방법입니다.

Steve Lohr, '대규모 임상 데이터 과학자의 경우 "관리인 작업"은 통찰력의 핵심 장애물입니다', New York Times, 2014
05

그럴듯하게 작동할 수 있는 가장 간단한 모델을 먼저 출시하세요.

기준선(때로는 규칙이나 선형 모델일 수도 있음)은 더 복잡한 모델이 실제로 얼마나 추가되는지를 명확히 하며, 자체적으로 출시하기에 충분한 경우가 많습니다.

Martin Zinkevich, '기계 학습 규칙: ML 엔지니어링 모범 사례', Google, 규칙 #4
06

패턴이 너무 좋아 보이면 혼란스러운 부분을 찾아보세요.

놀라운 상관관계는 진정한 발견이라기보다는 숨겨진 세 번째 변수의 인공물인 경우가 더 많습니다. 결과를 제시하기 전에 이를 설명할 수 있는 다른 것을 적극적으로 검색하십시오.

Fisher의 실험적 디자인 전통에 뿌리를 두고 있습니다. Judea Pearl에서 정식화, 'The Book of Why', 2018

일의 도구들

Python(팬더, scikit-learn, NumPy)

테이블 형식 데이터용 pandas와 표준 모델링 알고리즘용 scikit-learn을 포함하여 데이터 조작 및 고전적인 기계 학습을 위한 주요 언어입니다.

SQL

대부분의 기업 데이터가 실제로 존재하는 관계형 및 클라우드 데이터 웨어하우스(Snowflake, BigQuery, Redshift)에서 데이터를 가져오기 위한 쿼리 언어입니다.

주피터 노트북

임상 데이터 과학자가 코드를 실행하고, 차트를 보고, 동일한 문서에 메모를 작성할 수 있는 탐색적 분석을 위한 표준 대화형 환경입니다.

태블로/파워 BI

완성된 분석을 비기술적 이해관계자가 코드를 작성하지 않고도 탐색하고 모니터링할 수 있는 것으로 바꾸는 데 사용되는 비즈니스 인텔리전스 대시보드 도구입니다.

Git 및 클라우드 플랫폼(AWS, GCP, Azure)

노트북이 처리할 수 없는 규모로 데이터를 저장하고 교육 작업을 실행하는 클라우드 인프라와 함께 코드 및 모델에 대한 버전 제어가 점차 늘어나고 있습니다.

실패하는 이유

중요한 것이 나올 때까지 테스트

많은 통계적 비교를 실행하고 유의성 임계값을 초과하는 것만 보고하면 복제되지 않는 잘못된 발견이 생성됩니다. 이는 p-해킹으로 알려진 잘 문서화된 실패 모드입니다.

타겟을 유출하는 모델 배송

예측되는 결과를 인코딩하는 기능을 실수로 포함하면 모델이 실제로 보이지 않는 프로덕션 데이터에서 실행되면 붕괴되는 비현실적으로 강력한 오프라인 결과가 생성됩니다.

잘못된 질문에 대한 정교한 답변 구축

간단한 SQL 쿼리나 스프레드시트 수식으로 문제를 해결하는 신중하게 조정된 머신 러닝 모델은 노력을 낭비하고 실제 비즈니스 질문을 놓칠 수 있습니다.

비슷한 직업

같은 분야만이 아니라 여섯 점수 프로필이 가까운 직업입니다.

계속 탐색하기

계속 탐색하기

과학·연구 분야의 다른 직업

⚛️

물리학자

물질과 에너지, 공간과 시간을 지배하는 수학 법칙을 이끌어내고 검증한다. 혼자 칠판 앞에 선 연구자에서 3,000명이 공동 저자로 이름을 올리는 입자가속기 논문까지 그 모습은 다양하다.

AI 내성 65
🧬

생물학자

생명 그 자체를 연구하는 과학자. 린네가 손으로 종을 명명하던 시절부터 크리스퍼로 유전체를 편집하는 오늘날까지, 모든 아이디어를 살아있는 생물체에 비추어 검증한다.

AI 내성 64
🧪

화학자

물질 그 자체를 만들고 측정하는 과학자 — 바빌로니아 타푸티의 증류기에서 오늘날 로봇 실험실에 이르기까지, 스펙트럼이 의미하는 바를 결정하는 것은 여전히 사람이다.

AI 내성 70
📊

데이터 과학자

데이터에서 패턴을 찾고 예측 모델을 만드는 직업 — 2008년에 붙여진 이름이지만, 그 밑바탕에는 3세기에 걸친 증거 수집·검증·시각화의 역사가 있다.

AI 내성 38
🔭

천문학자

바빌로니아의 점토판에서 우주 망원경까지, 우주를 측정하는 과학자 — 데이터 속 어떤 깜빡임이 발견인지는 지금도 가려내는 중이다.

AI 내성 70
🧮

수학자

바빌로니아 서기관에서 필즈상 수상자와 AI 보조 증명까지: 어려운 질문을 영구적 확실성으로 바꾸는 직업, 정리 하나하나마다.

AI 내성 70
🧿

양자 엔지니어

컴퓨팅, 감지, 통신 및 재료 연구를 위해 양자 상태를 활용하는 장치를 구축, 측정 및 제어합니다.

AI 내성 78