Skip to content 跳到章节

🧫起源与演变

临床数据科学家 · 使用临床、试验和卫生系统数据生成可靠的证据,以实现更安全的护理、研究和运营决策。

一眼看清
年表

按时间排列的节点,不是每周活动格。

第1662章 格朗特分析伦敦的死亡率1908年 Gosset 将 t 检验发布为“学生”1925年 费舍尔出版了“研究人员的统计方法”1933年 内曼和皮尔逊将假设检验形式化1962年 图基认为数据分析是它自己的科学1977年 图基的“探索性数据分析”普及了箱线图1996年 法耶兹、皮亚特斯基-夏皮罗和史密斯定义“知识发现”2001年 克利夫兰提出“临床数据科学”作为一个领域2008年 帕蒂尔和哈默巴赫创造了这个职位名称2012年 哈佛商业评论称其为“最性感的工作”
  1. 格朗特分析伦敦的死亡率
  2. Gosset 将 t 检验发布为“学生”
  3. 费舍尔出版了“研究人员的统计方法”
  4. 内曼和皮尔逊将假设检验形式化
  5. 图基认为数据分析是它自己的科学
  6. 图基的“探索性数据分析”普及了箱线图
  7. 法耶兹、皮亚特斯基-夏皮罗和史密斯定义“知识发现”
  8. 克利夫兰提出“临床数据科学”作为一个领域
  9. 帕蒂尔和哈默巴赫创造了这个职位名称
  10. 哈佛商业评论称其为“最性感的工作”
指标浓度

格子越深,表示该主题在这项指标上越高。

最近审阅 来源与署名媒体署名方法说明

简短问答

临床数据科学家每天实际上做什么?

与“构建 AI 模型”的形象相反,大多数时间都是编写 SQL 查询和 Python 代码来提取和清理数据、运行统计测试或训练模型,以及将结果转换为非技术利益相关者可以采取行动的图表或备忘录。从业者调查一致认为数据清理和准备时间大约占总工作时间的一半或更多。

您需要博士学位才能成为临床数据科学家吗?

不需要。与医学或法律不同,没有执照或单一所需的学位;统计学、计算机科学、数学或相关定量领域的学士或硕士学位是最常见的途径,对雇主来说,强大的实际项目组合通常比确切的证书更重要。博士更常见于研究型或应用型机器学习职位。

临床数据科学只是换了个名字的统计学吗?

不完全是。它大量借鉴了统计学——费舍尔的实验设计、图基的探索性分析——但增加了经典统计学系很少教授的编程、数据库工程和机器学习。威廉·S·克利夫兰 (William S. Cleveland) 在 2001 年提出了这个术语,专门用来描述这个领域的扩展、计算密集型版本,它建立在统计数据的基础上,而不是取代它。

临床数据科学是否面临人工智能的风险?

常规结果已经暴露:AutoML 工具可以拟合和调整标准模型,AI 助手可以比人更快地编写 SQL 查询、初稿探索性图表和样板管道代码。没有自动化的是提出正确的问题,判断模式是否有意义或虚假,以及对基于结果的决策负责。

临床数据科学家能赚多少钱?

它因国家和资历的不同而有很大差异。美国劳工统计局预计,到 2023 年,临床数据科学家职业的年薪中位数约为 108,000 美元,而初级分析师的起薪通常接近 70,000 至 95,000 美元,大型科技公司的高级或首席临床数据科学家的股权总薪酬可达 200,000 至 400,000 美元或更多。

临床数据科学家、数据分析师和机器学习工程师之间有什么区别?

数据分析师通常使用现有数据和仪表板回答定义的业务问题;临床数据科学家通常根据更混乱的数据建立新的统计模型和预测分析;机器学习工程师从笔记本中取出模型,并使其在生产中大规模可靠地运行。界限不断模糊,许多人在职业生涯中在这三者之间摇摆不定。

打开对比实验室

分享本页

数据科学是该网站上最年轻的职位之一,它位于最古老的工艺之一之上:将一堆记录转变为人们可以采取行动的主张。 “临床数据科学家”这个名称只能追溯到 2008 年左右;其基本原理可以追溯到三个世纪以来统计学家对证据进行计数、测试和可视化的过程。

整个故事有两条主线贯穿:统计推断的缓慢专业化,从伦敦商人的死亡率表到费舍尔的作物试验,以及更快、更新的将这种遗产包装成公司职位、学术部门,以及简单地说“21世纪最性感的工作”。

起源之地

第1662章英国伦敦

伦敦服饰商约翰·格朗特(John Graunt)发表了《自然和政治观察……根据死亡法案进行的观察》,系统分析了伦敦自鼠疫以来每周保存的教区死亡记录,据此他估计了该市的人口并确定了死亡原因的模式。这是已知最早的尝试之一,即从大量收集的数据而不是个人轶事中得出一般性结论,它为没有接受过大学培训的店主格朗特赢得了英国皇家学会的选举权——这也是该领域后来的名称最终所依附的知识根源。

时间线

第1662章格朗特分析伦敦的死亡率

约翰·格朗特(John Graunt)发表了一份关于伦敦教区死亡记录的统计研究,估计了人口规模和死亡率模式——这是最早系统地利用收集的数据得出一般性结论的研究。

1908年Gosset 将 t 检验发布为“学生”

都柏林吉尼斯啤酒厂的统计学家威廉·西利·戈塞特 (William Sealy Gosset) 以笔名“学生”出版了《平均值的可能误差》,因为吉尼斯啤酒禁止员工以自己的名义发表文章,从此引入了小样本分析中使用的 t 分布。

1925年费舍尔出版了“研究人员的统计方法”

罗纳德·费舍尔(Ronald Fisher)分析了洛桑实验站数十年的农作物产量数据,出版了这本书,该书将方差分析和现代实验设计确立为标准统计实践。

1933年内曼和皮尔逊将假设检验形式化

Jerzy Neyman 和 Egon Pearson 的论文“关于统计假设最有效检验的问题”为统计学提供了现代框架,用于通过量化的错误率来决定结果是否显着。

1962年图基认为数据分析是它自己的科学

约翰·图基 (John Tukey) 的论文《数据分析的未来》认为,分析真实数据应该被视为一门具有自己方法的独特科学,而不是数理统计的一个次要分支。

1977年图基的“探索性数据分析”普及了箱线图

图基的书为从业者提供了实用工具(其中的箱线图),用于在将任何模型拟合到数据集之前通过眼睛了解数据集的形状。

1996年法耶兹、皮亚特斯基-夏皮罗和史密斯定义“知识发现”

三人在 AI 杂志上发表的论文将“数据库中的知识发现”正式化为围绕原始数据挖掘的更广泛的过程,这是 20 世纪 90 年代不断增长的企业数据库中正式化模式发现浪潮的一部分。

2001年克利夫兰提出“临床数据科学”作为一个领域

贝尔实验室统计学家 William S. Cleveland 发表了《临床数据科学:扩大统计领域技术领域的行动计划》,提议设立专门的大学数据科学系。

2008年帕蒂尔和哈默巴赫创造了这个职位名称

DJ Patil 和 Jeff Hammerbacher 分别在 LinkedIn 和 Facebook 建立数据团队,他们独立地将“临床数据科学家”作为他们团队正在进行的统计加工程工作的职位名称。

2012年哈佛商业评论称其为“最性感的工作”

Thomas Davenport 和 DJ Patil 2012 年 10 月发表的文章“临床数据科学家:21 世纪最性感的工作”引发了长达十年的企业招聘热潮和一波新的大学学位课程浪潮。

时代脉络

1662–1899

数着生者和死者

1662 年,伦敦服饰商约翰·格朗特 (John Graunt) 发表了对该市教区死亡记录的统计分析,这是已知的最早尝试从收集的数据而不是个人轶事中得出一般结论的尝试之一。比利时天文学家 Adolphe Quetelet 在 1830 年代通过他的“社会物理学”扩展了这一想法,将统计分布应用于人类特征。 1858 年,弗洛伦斯·南丁格尔 (Florence Nightingale) 将这一传统付诸实践,使用克里米亚战争死亡率数据的极地图让英国陆军部相信,造成大多数士兵死亡的是恶劣的卫生条件,而不是战斗,她成为在此过程中第一位当选英国皇家统计学会会员的女性。

1900–1935

统计学家将推论形式化

Karl Pearson 于 1901 年创办了《Biometrika》杂志,为年轻的数理统计学科提供了一个家。吉尼斯啤酒厂的统计学家威廉·西利·戈塞特 (William Sealy Gosset) 于 1908 年以笔名“学生”发表了 t 检验,因为吉尼斯啤酒公司禁止员工以自己的名义发表文章。 Ronald Fisher 1925 年出版的《研究人员统计方法》一书是在分析洛桑实验站数十年的作物试验时撰写的,介绍了方差分析和严格的实验设计。 Jerzy Neyman 和 Egon Pearson 于 1933 年完成了该工具包,为假设检验提供了正式的框架——统计机器、临床数据科学后来几乎原封不动地继承下来。

1936年–1969年

计算机到来,图基提出了一个案例

第二次世界大战加速了大规模计算,从人类计算团队到 1946 年推出的 ENIAC 等第一台电子通用计算机。花费了数十年时间进行手工计算的统计学家越来越多地使用机器来以以前不可能的规模进行分析。 1962 年,贝尔实验室和普林斯顿大学统计学家约翰·图基 (John Tukey) 发表了《数据分析的未来》,认为分析真实数据作为数理统计的一个小分支,受到了“错误的教育”,而作为一门独立的科学,应该得到认可,有自己的方法,也需要大学的关注。

1970–1999

探索性分析和数据挖掘热潮

Tukey 1977 年出版的《探索性数据分析》一书为从业者提供了实用工具(其中的箱线图),用于在将任何模型拟合到数据集之前了解数据集的形状。随着 20 世纪 80 年代和 90 年代企业积累了不断增长的事务数据库,“数据挖掘”的并行学科出现了,以发现其中的模式; Usama Fayyad、Gregory Piatetsky-Shapiro 和 Padhraic Smyth 于 1996 年发表的一篇论文正式区分了原始数据挖掘和更广泛的“数据库中的知识发现”过程之间的区别。企业数据仓库通过顾问 Bill Inmon 的著作在过去十年中得到普及,使这项工作在大公司中拥有了永久的家。

2000年至今

命名、标题、炒作和专业化

贝尔实验室统计学家 William S. Cleveland 在 2001 年的一篇论文中提出“临床数据科学”作为扩展的统计学学科的名称。 Google 2004 年的 MapReduce 论文和随后的开源 Hadoop 框架为该领域提供了用于互联网规模数据的廉价工具。 2008 年左右,在 LinkedIn 和 Facebook 建立数据团队的 DJ Patil 和 Jeff Hammerbacher 独立选定了“临床数据科学家”作为职位名称,Thomas Davenport 和 Patil 2012 年 10 月在《哈佛商业评论》上发表的文章称其为“21 世纪最性感的工作”,引发了长达十年的企业招聘热潮。到 2010 年代末,这个角色已经足够成熟,可以分为更专业的职位——分析工程师、机器学习工程师、产品分析师——即使生成式人工智能开始自动化大部分例行查询和绘制原始职位描述的图表,这些工作假设是由人手工完成的。

被它取代的行当

已不存在的邻近职业——被吸收、自动化或法规抹去。

人机

1880 年代–1950 年代

早在电子计算机出现之前,工作团队——其中女性比例过高,例如从 1880 年代起在哈佛学院天文台对恒星进行编目的“哈佛计算机”,以及 20 世纪 60 年代手动计算轨道轨迹的 NASA 凯瑟琳·约翰逊、多萝西·沃恩和玛丽·杰克逊——就完成了现在由软件完成的数学工作。电子计算机在一代人的时间里扮演着变得可靠和负担得起的角色。

打孔卡/按键操作员

1890 年代–1970 年代

继 Herman Hollerith 为 1890 年美国人口普查而制造的打孔卡制表机之后,按键操作员花费了数十年的时间将纸质记录转录到大型计算机可以读取的卡片上,这是专门培训课程中教授的一项专门的文书技能。到了 20 世纪 70 年代和 80 年代,直接输入计算机终端使这一角色基本过时。

大型机批量报告编程器

1960 年代–2000 年代

公司的“数据处理”部门曾经雇用程序员,通常在 COBOL 中工作,他们的主要工作是编写和运行预定的夜间批处理作业,这些作业在第二天早上生成管理层的打印报告。自助式商业智能仪表板和临时查询工具让管理人员可以根据需要提取自己的数据,到 2000 年代几乎完全关闭了这一专业。

消失的行当 →

临床数据科学声称的每一项新功能——大型数据集中的模式查找、严格的推理、有说服力的可视化——都有一个特定的、可检查的祖先:格朗特死亡率表、费舍尔作物试验、图基箱线图。 2001 年和 2008 年发生的变化主要是名称和包装,适用于一种由廉价存储和计算新驱动的旧工艺。

随后出现的 2012 年“最性感工作”热潮已经部分结束:这个头衔已经分裂为分析工程师、机器学习工程师和产品分析师,而生成式人工智能正在吸收 2008 年最初的职位描述中理所当然的例行查询和图表。基本原则——决定数据中的模式实际上意味着什么——看起来可能再次比特定的职位更长久。

相近职业

不限同一领域,六项评分最接近的职业。

继续探索

继续探索

科学·研究领域的其他职业