과거 기업의 '데이터 처리' 부서는 주로 코볼로 야간 배치 작업을 짜고 실행해 다음 날 아침까지 경영진용 인쇄 보고서를 만들어내는 프로그래머를 고용했다. 셀프서비스 비즈니스 인텔리전스 대시보드와 임시 조회 도구가 등장하며 관리자가 원할 때 직접 수치를 뽑아낼 수 있게 되었고, 이 전문 직종은 2000년대에 이르러 거의 자취를 감췄다.
메인프레임 배치 리포트 프로그래머은(는) 더 이상 존재하지 않는다. 무엇이 이 일을 없앴고, 그 자리를 어느 직업이 가져갔는지 정리했다.
통계학자들이 추론을 정식화하다
칼 피어슨은 1901년 신생 수리통계학 분야에 자리를 마련하기 위해 학술지 '바이오메트리카'를 창간했다. 기네스 양조장 통계학자였던 윌리엄 실리 고셋은 회사가 직원의 실명 출판을 금지했기 때문에 1908년 '스튜던트'라는 필명으로 t검정을 발표했다. 로덤스테드 실험연구소에서 수십 년치 작물 실험 데이터를 분석하며 쓴 로널드 피셔의 1925년 저서 '연구자를 위한 통계적 방법'은 분산분석과 엄밀한 실험 설계를 도입했다. 예르지 네이만과 이건 피어슨은 1933년 가설검정을 위한 정식 체계로 이 도구상자를 완성했다 — 데이터 사이언스가 훗날 거의 그대로 물려받게 될 통계적 장비다.
같은 시기에 벌어진 일
로덤스테드 실험연구소에서 수십 년치 작물 수확량 데이터를 분석하던 로널드 피셔가 분산분석과 현대적 실험 설계를 표준 통계 관행으로 확립한 책을 출간한다.
예르지 네이만과 이건 피어슨의 논문 '통계적 가설의 가장 효율적인 검정 문제'는 정량화된 오류율로 결과의 유의성을 판단하는 현대적 통계 체계를 제시한다.
존 튜키의 논문 '데이터 분석의 미래'는 실제 데이터를 분석하는 일이 수리통계학의 부차적 분야가 아니라 그 자체의 방법론을 가진 독자적 과학으로 인정받아야 한다고 주장한다.
튜키의 책은 모델을 적합하기 전에 데이터의 형태를 눈으로 파악할 수 있는 실용적 도구 — 그중 상자그림 — 를 실무자들에게 제공한다.
그 일은 지금 어디에 있나
데이터에서 패턴을 찾고 예측 모델을 만드는 직업 — 2008년에 붙여진 이름이지만, 그 밑바탕에는 3세기에 걸친 증거 수집·검증·시각화의 역사가 있다.
📊 데이터 과학자 →기업의 '데이터 처리' 부서는 한때 프로그래머를 고용했으며 종종 COBOL에서 일했습니다. 그의 주요 업무는 다음날 아침까지 경영진의 인쇄 보고서를 생성하는 예정된 야간 배치 작업을 작성하고 실행하는 것이었습니다. 셀프 서비스 비즈니스 인텔리전스 대시보드와 임시 쿼리 도구를 통해 관리자는 필요에 따라 자신의 수치를 가져올 수 있으며 2000년대에는 이 전문 분야가 거의 완전히 폐쇄됩니다.
통계학자는 추론을 공식화합니다.
Karl Pearson은 1901년에 젊은 수학 통계학 분야에 본거지를 제공하기 위해 Biometrika 저널을 창간했습니다. 기네스 양조장의 통계학자인 William Sealy Gosset은 기네스가 직원들이 자신의 이름으로 출판하는 것을 금지했기 때문에 1908년 'Student'라는 가명으로 t-테스트를 출판했습니다. Rothamsted Experimental Station에서 수십 년간의 작물 실험을 분석하면서 집필된 Ronald Fisher의 1925년 저서 'Statistical Methods for Research Workers'에는 분산 분석과 엄격한 실험 설계가 소개되었습니다. Jerzy Neyman과 Egon Pearson은 1933년에 가설 테스트를 위한 공식적인 프레임워크를 갖춘 툴킷을 완성했습니다. 통계 기계 임상 데이터 과학은 나중에 거의 그대로 계승될 것입니다.
같은 시기에 벌어진 일
Rothamsted Experimental Station에서 수십 년간의 작물 수확량 데이터를 분석하는 Ronald Fisher는 표준 통계 관행으로 분산 분석과 현대 실험 설계를 확립하는 책을 출판합니다.
Jerzy Neyman과 Egon Pearson의 논문 '통계적 가설의 가장 효율적인 테스트 문제'는 통계에 정량화된 오류율을 사용하여 결과가 중요한지 여부를 결정하는 현대적인 프레임워크를 제공합니다.
John Tukey의 논문 'The Future of Data Analysis'는 실제 데이터를 분석하는 것이 수학 통계의 작은 분야가 아닌 고유한 방법을 갖춘 별개의 과학으로 인정받을 가치가 있다고 주장합니다.
Tukey의 책은 실무자들에게 모델을 맞추기 전에 데이터 세트의 모양을 눈으로 이해할 수 있는 실습 도구(그 중 상자 그림)를 제공합니다.
그 일은 지금 어디에 있나
임상, 시험 및 건강 시스템 데이터를 사용하여 보다 안전한 치료, 연구 및 운영 결정을 위한 신뢰할 수 있는 증거를 생성합니다.
🧫 임상 데이터 과학자 →