Skip to content

🧫传奇人物

临床数据科学家 · 使用临床、试验和卫生系统数据生成可靠的证据,以实现更安全的护理、研究和运营决策。

分享本页

数据科学的经典包括从 17 世纪伦敦商人手工计算鼠疫死亡人数到 21 世纪科学家挖掘数十亿匿名链接点击次数。这里的八个人跨越了三个多世纪、三大洲。

连接它们的与其说是一种共同的方法,不如说是一种共同的本能:仔细观察真实的、混乱的记录,只有在检查它是否经受住审查后才相信一种模式——这个领域仍然遵循同样的规则,但它恰好在这十年被命名为。

历史领奖台

🥈
弗洛伦斯·南丁格尔
英国
2
🥇
罗纳德·费舍尔
英国
1
🥉
威廉·西利·戈塞特
英国/爱尔兰
3

“严格的实验需要从一开始就内置控制和随机化,而不是事后争论。”

罗纳德·费舍尔

登顶的八人

1

罗纳德·费舍尔

英国 · 1890–1962

英国统计学家和遗传学家,在分析 20 世纪 20 年代洛桑实验站数十年的作物产量试验时,建立了许多现代应用统计学框架——方差分析、随机实验设计和最大似然估计。

轶事

在 1920 年代末的一次 Rothamsted 下午茶会上,同事 Muriel Bristol 声称她可以分辨出牛奶是在喝茶之前还是之后倒入杯子中的。费舍尔并没有驳回她,而是设计了一个随机实验来实际检验这一说法——他后来在 1935 年出版的《实验设计》一书中使用了这个场景,以阐述原假设和随机试验设计的逻辑。

“严格的实验需要从一开始就内置控制和随机化,而不是事后争论。”

《研究人员统计方法》出版
1925年
在洛桑实验站的岁月
〜14岁
当选英国皇家学会院士
1929年
2

弗洛伦斯·南丁格尔

英国 · 1820–1910

南丁格尔被誉为现代护理学的创始人,也是一位统计学家的先驱,她利用数据可视化让英国政府相信,在克里米亚战争中杀死大多数士兵的是糟糕的卫生条件,而不是战伤,并成为第一位当选英国皇家统计学会会员的女性。

轶事

1858 年,南丁格尔发表了她的“鸡冠花”或极地区域图,这是一张圆形图表,将一年按每月死亡人数划分为楔形,按原因着色,向陆军部表明,克里米亚绝大多数英军死亡是由可预防的疾病而非战斗造成的;这种可视化有助于推动持久的军队卫生改革。

“精心设计的图表可以比表格中的相同数字更快地改变政府政策。”

当选英国皇家统计学会会士
1858(第一位女性)
《影响健康事项注意事项》出版
1858年
皇家卫生委员会成立
1857年
3

威廉·西利·戈塞特

英国/爱尔兰 · 1876–1937

作为都柏林吉尼斯啤酒厂的化学家和统计学家,戈塞特开发了 t 分布和 t 检验来解决一个非常实际的问题——判断小大麦样品的质量——并以笔名“学生”发表,因为吉尼斯禁止员工以自己的名义发表文章。

轶事

吉尼斯公司担心竞争对手了解商业秘密,因此禁止员工发表出版物;因此,戈塞特 1908 年具有里程碑意义的论文《均值的可能误差》以笔名“学生”出现在 Biometrika 上,在他的真实身份为统计学家所知很久之后,这个名字至今仍与数百万小样本分析中使用的 t 检验相联系。

“为解决一个狭隘的实际问题而建立的方法可能比其最初的目的寿命长一个多世纪。”

《平均值的可能误差》出版
1908,生物识别
吉尼斯纪录年数
〜38岁
出版物中使用的笔名
“学生”
4

C·R·拉奥

印度/美国 · 1920–2023

印度裔美国统计学家,25 岁时推导出了克拉梅尔-拉奥界和拉奥-布莱克韦尔定理(统计估计理论中使用最广泛的两个结果),后来帮助建立了印度的印度统计研究所,之后在美国大学长期从事职业生涯。

轶事

Rao 于 1945 年发表的论文是加尔各答印度统计研究所的一名年轻研究员撰写的,证明了任何无偏估计量测量未知量的精确度的下限(现在称为 Cramér-Rao 界),这一结果非常基础,几乎出现在此后出版的所有统计教科书中,归功于他在 26 岁之前写的一篇论文。

“职业生涯早期的一个单一的、经过精确验证的结果可以比该领域后来的时尚持续数十年。”

Cramér-Rao 装订论文出版
1945年
美国国家科学奖章
2002年
死亡年龄
102
5

约翰·图基

美国 · 1915年–2000年

美国数学家和统计学家,共同发明了快速傅里叶变换算法,发明了箱线图,并在 1962 年的论文《数据分析的未来》中指出,分析真实数据应该被视为独立于数理统计的科学学科。

轶事

在《数据分析的未来》(1962 年)中,图基写道,数据分析作为数学的一个小分支,一直被“教得不好”,并在接下来的 15 年里开发了实践技术,包括他 1977 年出版的《探索性数据分析》一书中介绍的箱线图和茎叶图,这些技术旨在在计算机接触数字之前用铅笔和纸手工完成。

“在相信根据数据构建的任何模型之前,请使用简单的手绘工具亲眼查看数据。”

《数据分析的未来》出版
1962年
发布“探索性数据分析”
1977年
快速傅里叶变换算法
1965 年,与库利
6

威廉·克利夫兰

美国 · b. 1943年

贝尔实验室统计学家,在 2001 年的一篇论文中创造了“临床数据科学”作为扩大的统计学科的名称,并单独发明了广泛使用的数据可视化和平滑技术,包括 LOESS 局部回归方法。

轶事

克利夫兰 2001 年的论文《临床数据科学:扩大统计领域技术领域的行动计划》提出,大学应设立有别于统计系的专门数据科学系——这项具体的机构建议花了十多年时间才流行起来,但到 2010 年代中期,全球数百所大学已经这样做了。

“在印刷品中命名并正式提出一个领域的边界可以决定几年后大学围绕该领域的组织方式。”

《临床数据科学:行动计划》出版
2001年
《可视化数据》出版
1993年
在贝尔实验室工作的岁月
〜30岁
7

DJ 帕蒂尔

美国 · b. 1973年

领导 LinkedIn 的数据团队,他和同事 Jeff Hammerbacher 于 2008 年左右独立确定了“临床数据科学家”的职位名称,并在 2012 年共同撰写了颇具影响力的《哈佛商业评论》文章,将其称为“21 世纪最性感的工作”,后来成为奥巴马总统领导下的第一位美国首席临床数据科学家。

轶事

Patil 回忆道,在 2008 年左右建立 LinkedIn 的数据团队时,他和他的团队在选择“临床数据科学家”之前考虑了“数据分析师”和“业务分析师”等头衔,部分原因是它更好地体现了该职位实际所需的工程和统计学的结合,部分原因是它只是一个更有吸引力的招聘头衔。

“正确的职位名称可以影响整个职业的招聘方式,几乎与工作本身一样重要。”

《哈佛商业评论》发表“最性感的工作”文章
2012 年 10 月,与达文波特合作
美国首席临床数据科学家任期
2015–2017
LinkedIn数据团队加入
2008年
8

希拉里·梅森

美国 · b. 1978年

2009 年成为 bit.ly 的首席科学家,是最早公开担任该职位的人之一,利用链接缩短服务的海量点击流数据来研究网上传播的内容,后来创立了机器学习研究初创公司 Fast Forward Labs。

轶事

在 bit.ly,Mason 和同事挖掘了数十亿次匿名缩短链接点击,以研究信息实际上如何在互联网上实时传播,并发布了有关一天中哪个时间链接点击最多的模式的研究结果,将链接缩短实用程序转变为第一个大规模、公开讨论的临床数据科学研究项目。

“如果有人想看的话,一个普通的基础设施产品可以兼作最丰富的研究数据集之一。”

bit.ly 首席科学家自
2009年
Fast Forward 实验室成立
2014年
Fast Forward Labs 被 Cloudera 收购
2017年

柱状图以本榜单第一名为基准。

对比实验室

开关名字——每根柱都会按你所选组合的第一名重新缩放。

5 / 8

争议

DJ Patil 和 Jeff Hammerbacher 是否真正“创造”了这个职位名称尚存争议。两者都归功于更广泛的团队和非正式的先前行业使用,并且该短语在 2008 年之前出现在零散的参考文献中。

该领域的命名本身就存在争议:计算机科学家 Peter Naur 早在 1974 年就使用“临床数据科学”一词作为计算机科学的同义词,比 William S. Cleveland 2001 年广泛引用的提案早了几十年。

相近职业

不限同一领域,六项评分最接近的职业。

继续探索

继续探索

科学·研究领域的其他职业