📊The Greats

数据科学家 · 从数据中寻找规律、构建预测模型——一个2008年才出现的职位名称,建立在三个世纪计数、检验与可视化证据的传统之上。

数据科学的谱系,从17世纪一位手工统计瘟疫死亡人数的伦敦店主,一路延伸到21世纪一位挖掘数十亿次匿名链接点击数据的科学家。这里的八个人跨越了三个多世纪、三个大陆。

把他们联系在一起的与其说是共同的方法,不如说是共同的直觉:仔细审视真实而杂乱的记录,只有在一个规律经受住检验之后才去信任它——这正是这个领域至今仍在依循的纪律,无论这十年它被冠以什么名字。

The all-time podium

弗洛伦斯·南丁格尔
弗洛伦斯·南丁格尔
英国
2
罗纳德·费舍尔
罗纳德·费舍尔
英国
1
威廉·西利·戈塞特
威廉·西利·戈塞特
英国/爱尔兰
3

The eight who reached the top

1
罗纳德·费舍尔的照片 Unknown author Unknown author · Public domain

罗纳德·费舍尔

英国 · 1890–1962

英国统计学家兼遗传学家,构建了现代应用统计学的大部分框架——方差分析、随机实验设计与最大似然估计——这些工作大多是在1920年代于罗森斯特实验站分析数十年作物产量试验数据时完成的。

The story

1920年代末的一次罗森斯特下午茶会上,同事穆里尔·布里斯托尔声称自己能分辨出牛奶是在倒茶之前还是之后加入杯中的。费舍尔没有一笑置之,而是设计了一个随机化实验来真正检验这个说法——他后来在1935年出版的《实验设计》一书中,用这个场景阐述了零假设与随机化试验设计的逻辑。

“一个严谨的实验需要从一开始就内置对照与随机化,而不是事后再去争论。”

《研究工作者的统计方法》出版
1925年
在罗森斯特实验站工作的年数
约14年
当选皇家学会会士
1929年
2
弗洛伦斯·南丁格尔的照片 Henry Hering (1814-1893) · Public domain

弗洛伦斯·南丁格尔

英国 · 1820–1910

更为人熟知的身份是现代护理学的奠基人,南丁格尔同时也是一位统计学先驱,她用数据可视化说服英国政府相信,杀死克里米亚战争中大多数士兵的是恶劣的卫生条件,而非战伤,并因此成为第一位当选英国皇家统计学会会士的女性。

The story

1858年,南丁格尔发表了她的“鸡冠花图”,即极区图——一种把一年划分成若干扇形、扇形大小对应每月死亡人数、并按死因着色的圆形图表——用以向陆军部展示,克里米亚战场上英国陆军绝大多数的死亡是由可预防的疾病、而非战斗造成的;这幅可视化图助推了持久的陆军卫生改革。

“一张设计精良的图表,改变政府政策的速度,可能比同样的数字放在表格里快得多。”

当选英国皇家统计学会会士
1858年(首位女性)
《影响健康事项的札记》出版
1858年
皇家卫生委员会成立
1857年
3
威廉·西利·戈塞特的照片 User Wujaszek on pl.wikipedia · Public domain

威廉·西利·戈塞特

英国/爱尔兰 · 1876–1937

作为都柏林健力士啤酒厂的化学家兼统计学家,戈塞特为解决一个非常实际的问题——评判小批量大麦样本的质量——开发出t分布与t检验,并以笔名“Student”发表,因为健力士禁止员工以真名发表文章。

The story

健力士担心竞争对手窃取商业机密,因而禁止员工发表文章;戈塞特1908年具有里程碑意义的论文《均值的概然误差》因此以笔名“Student”发表在《生物统计学》上——这个名字至今仍附着在如今数百万项小样本分析所使用的t检验上,远远晚于统计学界得知他真实身份之后。

“一种为解决某个狭窄实际问题而设计的方法,其寿命可以远远超过一个多世纪。”

《均值的概然误差》发表
1908年,《生物统计学》
在健力士工作的年数
约38年
发表时使用的笔名
“Student”
4
C. R. 拉奥的照片 Prateek Karandikar · CC BY-SA 4.0

C. R. 拉奥

印度/美国 · 1920–2023

印度裔美国统计学家,25岁时推导出克拉美-拉奥下界与拉奥-布莱克韦尔定理——统计估计理论中应用最广泛的两个成果之一,后来协助建立了印度统计学院,并在美国多所大学度过了漫长的学术生涯。

The story

拉奥1945年的论文写于他还是加尔各答印度统计学院一名年轻研究者时期,证明了任何无偏估计量在测量未知量时精度所能达到的下限——如今被称为克拉美-拉奥下界——这一结果如此具有奠基性,以致此后出版的几乎每一本统计学教科书都会提及它,而完成这项工作时,拉奥还不到26岁。

“职业生涯早期一个精确证明的成果,可以比这个领域后来数十年的种种潮流更长久。”

克拉美-拉奥下界论文发表
1945年
获美国国家科学奖章
2002年
享年
102岁
5

约翰·图基

美国 · 1915–2000

美国数学家兼统计学家,共同发明了快速傅里叶变换算法,发明了箱形图,并在1962年的论文《数据分析的未来》中主张,分析真实数据应被承认为一门独立于数理统计学的科学学科。

The story

在《数据分析的未来》(1962年)一文中,图基写道,数据分析一直被当作数学的一个次要分支来“教得很差”,此后十五年间,他不断开发动手可用的技术——包括他1977年著作《探索性数据分析》中引入的箱形图与茎叶图——设计初衷是让人能在计算机接触这些数字之前,先用铅笔和纸手工操作。

“在信任由数据构建出的任何模型之前,先用你自己的眼睛、借助简单的手绘工具去看这些数据。”

《数据分析的未来》发表
1962年
《探索性数据分析》出版
1977年
快速傅里叶变换算法
1965年,与库利合作
6

威廉·S·克利夫兰

美国 · 1943年生

贝尔实验室统计学家,在2001年的一篇论文中为一门扩大版的统计学科提出了“data science”这个名字,同时还独立发明了包括LOESS局部回归方法在内、被广泛使用的数据可视化与平滑技术。

The story

克利夫兰2001年的论文《数据科学:拓展统计学领域技术范畴的行动计划》提议大学设立独立于统计学系的专门数据科学院系——这个具体的机构建议花了十多年才被采纳,但到2010年代中期,全球已有数百所大学真的这样做了。

“在文字中为一个领域命名并正式提出其边界,可能在多年之后塑造大学围绕它组织起来的方式。”

《数据科学:行动计划》发表
2001年
《可视化数据》出版
1993年
在贝尔实验室工作的年数
约30年
7

DJ·帕蒂尔

美国 · 1973年生

曾带领LinkedIn的数据团队,与同事杰夫·哈默巴克在2008年前后各自独立敲定了“data scientist”这一职位名称,与人合著了2012年颇具影响力的《哈佛商业评论》文章,将其称为“21世纪最性感的工作”,后来还担任美国历史上首位首席数据科学家,任职于奥巴马政府。

The story

帕蒂尔曾回忆,在2008年前后组建LinkedIn数据团队时,他和团队曾考虑过“数据分析师”“业务分析师”等头衔,最终选定“data scientist”,一方面是因为它更好地体现了这个岗位实际所需的工程与统计的混合能力,另一方面也单纯是因为这个头衔在招聘时更具吸引力。

“一个合适的职位名称,几乎能像工作本身一样,塑造整个行业招聘的方式。”

“最性感的工作”HBR文章发表
2012年10月,与达文波特合著
美国首席数据科学家任期
2015–2017年
加入LinkedIn数据团队
2008年
8

希拉里·梅森

美国 · 1978年生

2009年成为bit.ly的首席科学家,是最早公开担任这一职位名称的人之一,利用这家短链接服务庞大的点击流数据研究信息在网上如何传播,后来创立了机器学习研究初创公司Fast Forward Labs。

The story

在bit.ly,梅森与同事挖掘了数十亿次匿名化的短链接点击数据,实时研究信息在互联网上究竟是如何传播的,发表了诸如一天中哪个时段链接点击量最高之类的发现——把一款平平无奇的基础设施产品,变成了最早得到大规模公开讨论的数据科学研究项目之一。

“只要有人想到去挖掘,一款平淡无奇的基础设施产品,也可能兼具最丰富的研究数据集的价值。”

担任bit.ly首席科学家始于
2009年
创立Fast Forward Labs
2014年
Fast Forward Labs被Cloudera收购
2017年

柱状图以本榜单第一名为基准。

对比实验室

Toggle names on and off — every bar rescales to the leader of your selection.

5 / 8

The argument

DJ·帕蒂尔与杰夫·哈默巴克是否真的“创造”了这个职位名称,存在争议;两人都曾将功劳归给更广泛的团队和先前非正式的行业用法,而且这个说法在2008年之前就已零星出现在一些文献中。

为这个学科本身命名的功劳也存在争议:计算机科学家彼得·诺尔早在1974年就已把“data science”一词当作计算机科学的同义词使用,比威廉·S·克利夫兰2001年那篇被广泛引用的提议要早了几十年。

Keep exploring

More in Science & Research