올바른 질문 설정하기
84모호한 비즈니스나 과학 문제를 구체적이고 검증 가능한 질문으로 바꾸는 데는 자동화 도구가 스스로 접근할 수 없는 조직적·도메인적 맥락이 필요하다.
진한 칸일수록 이 직업에서 해당 지표가 높습니다.
낮음높음
'AI 모델을 만든다'는 이미지와 달리, 대부분의 하루는 데이터를 뽑고 정제하는 SQL·Python 코드 작성, 통계 검정이나 모델 학습, 그리고 그 결과를 비전문가 이해관계자가 행동으로 옮길 수 있는 차트나 메모로 옮기는 작업으로 나뉜다. 실무자 설문조사는 일관되게 데이터 정제와 준비가 전체 근무 시간의 절반 이상을 차지한다고 보고한다.
아니다. 의학이나 법학과 달리 자격증이나 필수 학위가 정해져 있지 않으며, 통계학·컴퓨터공학·수학 등 정량적 분야의 학사나 석사가 가장 흔한 경로다. 실제 프로젝트로 구성된 탄탄한 포트폴리오가 정확한 학위보다 더 중요하게 평가되는 경우가 많다. 박사 학위는 연구 중심이나 응용 머신러닝 비중이 큰 직무에서 더 흔하다.
정확히는 아니다. 피셔의 실험 설계, 튜키의 탐색적 분석 등 통계학에 크게 의존하지만, 고전 통계학과에서는 거의 가르치지 않던 프로그래밍, 데이터베이스 엔지니어링, 머신러닝을 더한다. 윌리엄 S. 클리블랜드는 2001년에 이 확장된 컴퓨팅 중심 통계학을 가리키기 위해 이 용어를 제안했으며, 이는 통계학을 대체하는 것이 아니라 그 위에 세운 개념이다.
정형화된 업무는 이미 상당히 노출되어 있다. AutoML 도구는 표준 모델을 학습하고 튜닝할 수 있고, AI 어시스턴트는 사람보다 빠르게 SQL 쿼리를 작성하고 탐색적 차트 초안을 그리며 상용구 파이프라인 코드를 짤 수 있다. 아직 자동화되지 않은 것은 올바른 질문을 설정하는 능력, 패턴이 의미 있는지 우연인지 판단하는 능력, 그리고 그 결과로 내려진 결정에 책임을 지는 일이다.
국가와 경력에 따라 크게 다르다. 미국 노동통계국은 2023년 데이터 과학자 직군의 연봉 중위값을 약 $108,000로 집계했으며, 주니어 애널리스트는 흔히 $70,000~$95,000에서 시작하고 대형 기술 기업의 시니어·프린시펄 데이터 과학자는 지분을 포함한 총보상이 $200,000~$400,000 이상에 이르기도 한다.
데이터 애널리스트는 대개 기존 데이터와 대시보드로 정해진 비즈니스 질문에 답한다. 데이터 과학자는 더 지저분한 데이터로부터 새로운 통계 모델과 예측 분석을 만든다. 머신러닝 엔지니어는 노트북 속 모델을 꺼내 대규모로 안정적으로 운영하게 만든다. 세 역할의 경계는 끊임없이 흐려지며, 많은 사람이 커리어 동안 셋 사이를 오간다.
데이터 사이언스는 AI 이야기에서 독특한 위치에 있다. 이 직군을 재편하고 있는 도구들 — 자동화된 머신러닝, 자연어-SQL 변환, AI 보조 차트 작성 — 대부분이 다름 아닌 데이터 과학자와 머신러닝 연구자들이 만들었고, 이제 그것이 자기 자신의 업무 일부를 겨누고 있다.
그 노출은 실질적이면서도 고르지 않다. 데이터를 뽑고 표준 모델을 돌리고 초안 차트를 만드는 정형화되고 명확한 업무는 이미 AI 도구가 비교적 빠르게 해낸다. 살아남는 부분은 코드 작성보다는, 어떤 질문이 물을 가치가 있는지 결정하고 그 답을 신뢰할 수 있는지 판단하는 일이다.
SQL 질의, 탐색적 차트 작성, AutoML을 이용한 표준 모델 적합, 상용구 파이프라인 코드 작성 등 정형화된 데이터 사이언스 업무의 상당 부분은 이미 자동화되었거나 AI의 도움을 받고 있으며, 그 비중은 빠르게 커지고 있다. 자동화에 저항하는 것은 모호한 비즈니스 문제를 검증 가능한 질문으로 다듬는 일, 결과가 진짜인지 통계적 우연인지 판단하는 일, 그리고 모델의 실제 결정이 잘못되었을 때 책임을 지는 일이다.
직함이 아니라 업무 단위로 산정했다. 낮을수록 안전하다.
AI가 대체하지 못하는 직업 →모호한 비즈니스나 과학 문제를 구체적이고 검증 가능한 질문으로 바꾸는 데는 자동화 도구가 스스로 접근할 수 없는 조직적·도메인적 맥락이 필요하다.
진짜 효과와 잡음, 데이터 누출 아티팩트, 운 좋은 학습-테스트 분할을 구별하는 일은 자동화 파이프라인이 자기 출력물에 대해 가장 서투른 회의적 판단 영역이다.
대출을 거부하거나 환자를 표시하거나 상품 가격을 잘못 매기는 모델에 대해서는 누군가가 답해야 한다 — 이 책임은 그 수치를 만들어낸 도구로 넘길 수 없다.
반직관적이거나 달갑지 않은 발견이 실제로 실행되게 만드는 것은 옳은 분석만이 아니라 사람들과의 신뢰, 신용, 협상에 달려 있다.
새로운 질문에 맞는 자연 실험, 대조군, 인과추론 전략을 선택하는 일은 과거 분석에 대한 패턴 매칭보다는 창의적 판단에 더 가깝다.
자연어-SQL 변환 도구는 한때 데이터 과학자의 직접 개입이 필요했던 단순한 데이터 조회 요청의 상당 부분을 이제 처리한다.
자동화된 탐색적 분석 도구는 원 데이터셋으로부터 몇 초 만에 분포 그래프, 상관관계 요약, 기본 차트를 생성할 수 있다.
AutoML 플랫폼은 정의가 명확하고 라벨이 잘 된 문제에 대해 그래디언트 부스팅이나 로지스틱 회귀 같은 표준 모델을 거의 사람 손 없이 선택·학습·튜닝할 수 있다.
표준적인 데이터 변환·적재 스크립트를 짜는 일은 이제 처음부터 작성하기보다 AI 코딩 어시스턴트로 생성하고 검토하는 편이 더 빠른 경우가 많다.
업무의 점점 더 큰 부분이 모든 쿼리와 모델을 직접 짜는 것이 아니라, 자동화된 파이프라인이 무엇을 시도해야 할지 지정하고 그 출력을 검증하는 일이 되고 있다.
애널리틱스 엔지니어링, 머신러닝 엔지니어링, 프로덕트 애널리틱스가 점점 별도의 직함으로 자리 잡으며, 각각 10년 전 단일한 '데이터 과학자'가 담당하리라 기대되던 업무의 일부를 흡수하고 있다.
기존 데이터에서 패턴을 찾는 일이 자동화하기 쉬워질수록, 신뢰할 만한 실험이나 인과분석을 설계하는 더 어려운 기술은 오히려 덜 중요해지는 것이 아니라 더 중요해지고 있다.
노코드와 AutoML 도구는 비전문가도 자기만의 기초 분석을 실행할 수 있게 하며, 전담 데이터 과학자들을 그런 도구가 다룰 수 없는 더 어렵고 모호한 문제 쪽으로 밀어내고 있다.
흔히 dbt 같은 도구를 이용해 대시보드와 모델에 데이터를 공급하는 데이터 변환 파이프라인을 구축하고 유지하며, 데이터 엔지니어링과 분석 사이에 위치한다.
연구 노트북 속 모델을 꺼내 프로덕션 시스템에서 안정적으로 모니터링되며 대규모로 돌아가게 만든다.
데이터 또는 AI 기반 기능의 로드맵을 책임지며, 비즈니스 목표를 데이터팀이 실제로 만들어야 할 것으로 옮긴다.
모델과 그 뒤의 데이터가 출시되기 전 편향, 공정성, 규제 준수를 감사한다.
세 가지 가역 렌즈: 업무 보조, 일부 대체, 새 틈새. 교육용이며 예측이 아닙니다.
역할은 유지하고 AI가 초안·분류·조사를 빠르게 하며 판단과 책임은 사람이 집니다.
좁은 작업 묶음(템플릿·초안·반복 채점)이 먼저 줄어들고 인접 숙련은 커질 수 있습니다.
규제 환경에서 AI 출력을 신뢰해야 하는 감독·통합·도메인 QA 역할이 생길 수 있습니다.
데이터를 신뢰할 만한 결정으로 바꿀 수 있는 사람에 대한 수요는 앞으로 10년간 강하게 유지될 가능성이 매우 높지만, 이 직업의 신입 단계는 이미 변하고 있다. 순전히 정형화된 질의와 초안 차트를 손으로 작성하기 위해서만 존재하는 자리는 점점 줄어들 것이다.
가장 뚜렷한 장기적 우위는 진정으로 유용한 질문을 설정하고, AI가 생성한 결과가 조용히 틀렸을 때를 알아채며, 회의적인 이해관계자 앞에서 권고안에 책임을 질 수 있는 데이터 과학자들에게 있다 — 피셔의 작물 실험 이래 이 분야가 필요로 해온 것과 같은 판단력이, 이제 스스로 첫 초안을 점점 더 많이 그려내는 워크플로에 적용되고 있을 뿐이다.
같은 분야만이 아니라 여섯 점수 프로필이 가까운 직업입니다.
장부의 수호자: 문자 자체를 만들어낸 오래된 기술의 계승자이자, 이제는 자신을 자동화하려는 소프트웨어와 협상 중이다.
AI 내성 35 🗺️회사가 다음에 무엇을 만들지, 왜 만들어야 하는지를 결정하는 사람. 고객의 필요, 사업 목표, 엔지니어링의 한계를 하나의 공유된 계획으로 엮어내지만, 그 계획을 온전히 소유하는 사람은 따로 없다.
AI 내성 50 💻현대 사회를 움직이는 코드를 작성하고 테스트하고 유지보수하는 직업이며, AI가 자기 일상 업무를 자동화하는 모습을 가장 먼저 지켜보는 직업 중 하나다.
AI 내성 35 📣수요를 만들어내는 전문가. 폼페이의 벽화 광고와 P&G의 1931년 브랜드맨 메모에서 경매 기반의 디지털 피드 시대까지.
AI 내성 38 📦프로덕션 환경에서 기계 학습 모델을 교육, 배포, 모니터링 및 관리하는 시스템을 구축합니다.
AI 내성 54 🔎사람들이 제품을 어떻게 사용하는지 연구해, 관찰된 행동과 필요와 불만을 팀이 디자인의 근거로 삼을 수 있는 증거로 바꾸는 일.
AI 내성 69물질과 에너지, 공간과 시간을 지배하는 수학 법칙을 이끌어내고 검증한다. 혼자 칠판 앞에 선 연구자에서 3,000명이 공동 저자로 이름을 올리는 입자가속기 논문까지 그 모습은 다양하다.
AI 내성 65 🧬생명 그 자체를 연구하는 과학자. 린네가 손으로 종을 명명하던 시절부터 크리스퍼로 유전체를 편집하는 오늘날까지, 모든 아이디어를 살아있는 생물체에 비추어 검증한다.
AI 내성 64 🧪물질 그 자체를 만들고 측정하는 과학자 — 바빌로니아 타푸티의 증류기에서 오늘날 로봇 실험실에 이르기까지, 스펙트럼이 의미하는 바를 결정하는 것은 여전히 사람이다.
AI 내성 70 🔭바빌로니아의 점토판에서 우주 망원경까지, 우주를 측정하는 과학자 — 데이터 속 어떤 깜빡임이 발견인지는 지금도 가려내는 중이다.
AI 내성 70 🧮바빌로니아 서기관에서 필즈상 수상자와 AI 보조 증명까지: 어려운 질문을 영구적 확실성으로 바꾸는 직업, 정리 하나하나마다.
AI 내성 70 🧿컴퓨팅, 감지, 통신 및 재료 연구를 위해 양자 상태를 활용하는 장치를 구축, 측정 및 제어합니다.
AI 내성 78 🧫임상, 시험 및 건강 시스템 데이터를 사용하여 보다 안전한 치료, 연구 및 운영 결정을 위한 신뢰할 수 있는 증거를 생성합니다.
AI 내성 68