Skip to content 跳到章节

🧫文化与地位

临床数据科学家 · 使用临床、试验和卫生系统数据生成可靠的证据,以实现更安全的护理、研究和运营决策。

一眼看清
指标浓度

格子越深,表示该主题在这项指标上越高。

最近审阅 来源与署名媒体署名方法说明

简短问答

临床数据科学家每天实际上做什么?

与“构建 AI 模型”的形象相反,大多数时间都是编写 SQL 查询和 Python 代码来提取和清理数据、运行统计测试或训练模型,以及将结果转换为非技术利益相关者可以采取行动的图表或备忘录。从业者调查一致认为数据清理和准备时间大约占总工作时间的一半或更多。

您需要博士学位才能成为临床数据科学家吗?

不需要。与医学或法律不同,没有执照或单一所需的学位;统计学、计算机科学、数学或相关定量领域的学士或硕士学位是最常见的途径,对雇主来说,强大的实际项目组合通常比确切的证书更重要。博士更常见于研究型或应用型机器学习职位。

临床数据科学只是换了个名字的统计学吗?

不完全是。它大量借鉴了统计学——费舍尔的实验设计、图基的探索性分析——但增加了经典统计学系很少教授的编程、数据库工程和机器学习。威廉·S·克利夫兰 (William S. Cleveland) 在 2001 年提出了这个术语,专门用来描述这个领域的扩展、计算密集型版本,它建立在统计数据的基础上,而不是取代它。

临床数据科学是否面临人工智能的风险?

常规结果已经暴露:AutoML 工具可以拟合和调整标准模型,AI 助手可以比人更快地编写 SQL 查询、初稿探索性图表和样板管道代码。没有自动化的是提出正确的问题,判断模式是否有意义或虚假,以及对基于结果的决策负责。

临床数据科学家能赚多少钱?

它因国家和资历的不同而有很大差异。美国劳工统计局预计,到 2023 年,临床数据科学家职业的年薪中位数约为 108,000 美元,而初级分析师的起薪通常接近 70,000 至 95,000 美元,大型科技公司的高级或首席临床数据科学家的股权总薪酬可达 200,000 至 400,000 美元或更多。

临床数据科学家、数据分析师和机器学习工程师之间有什么区别?

数据分析师通常使用现有数据和仪表板回答定义的业务问题;临床数据科学家通常根据更混乱的数据建立新的统计模型和预测分析;机器学习工程师从笔记本中取出模型,并使其在生产中大规模可靠地运行。界限不断模糊,许多人在职业生涯中在这三者之间摇摆不定。

打开对比实验室

分享本页

流行文化大多直接跳过统计学家,转向更引人注目的量化或算法人物——临床数据科学家的公众形象更多地归功于《点球成金》的棒球分析师和《大空头》的危机预测量化,而不是任何从事临床数据科学家日常工作的人。

在该领域内,这种文化运行在竞争性的公共基准、面无表情的统计笑话和文档格式(模型卡)上,它将“诚实地面对模型的局限性”变成了一种常规的职业习惯,而不是事后的想法。

历史上的社会地位

各时代该职业的地位,以0–100表示。

2235285578
1660 年代–1899 年1900 年代–1930 年代20世纪50年代–1980年代2001年–2011年2012年至今
1660 年代–1899 年

早期的统计工作主要是由职员、业余改革者和像南丁格尔这样自学成才的局外人完成的。有用且偶尔有影响力,但其本身却很少享有盛誉。

1900 年代–1930 年代

皮尔逊、费舍尔和戈塞特将统计学专业化为一门学科,拥有自己的期刊和大学院系,赢得了学术界的尊重,同时几乎不为广大公众所知。

20世纪50年代–1980年代

随着大型机计算的普及,“数据处理”人员和统计人员主要被视为必不可少但乏味的企业后端支持,很少出现在执行决策中。

2001年–2011年

克利夫兰 2001 年的学术提案几乎没有引起公众关注,但 Netflix 2006 年至 2009 年的百万美元推荐算法奖以及 2008 年 LinkedIn 和 Facebook 创造的“临床数据科学家”开始在科技行业引起关注。

2012年至今

《哈佛商业评论》2012 年 10 月的“最性感工作”框架引发了招聘和声望的热潮;到了 2020 年代,尽管薪酬和需求仍然强劲,但该职位已分解为更专业的角色,并失去了一些独特的光芒。

电影、书籍与艺术中的形象

电影2011年

点球成金

贝内特·米勒(导演);根据迈克尔·刘易斯 2003 年出版的书

戏剧化地讲述了奥克兰运动家队的比利·比恩和分析师保罗·德波德斯塔如何利用统计分析,利用比尔·詹姆斯的军刀计量学,在棒球预算最少的球队之一建立一支有竞争力的阵容。

电影2015年

大空头

亚当·麦凯(导演);基于迈克尔·刘易斯的书

几位分析师对抵押贷款市场数据进行了足够仔细的研究,他们在几乎所有人都相信这些数据之前就预测了 2008 年金融危机。

电视剧2005年–2010年

数字 3rs

尼古拉斯·法拉奇和谢丽尔·休顿(创作者)

一位数学家帮助他的联邦调查局特工兄弟利用统计分析和模式识别解决犯罪问题,向美国主流电视观众介绍应用数学作为调查工作。

电视剧2011年至今

黑镜

查理·布鲁克(创始人)

这部英国选集系列反复想象数据分析和预测评分走向令人不安的极端,最直接的是 2016 年的剧集“急剧下降”,造成了公众对算法排名的焦虑。

电影2016年

隐藏人物

西奥多·梅尔菲(导演);根据玛格特·李·谢特利的书改编

讲述了黑人女性数学家凯瑟琳·约翰逊 (Katherine Johnson)、多萝西·沃恩 (Dorothy Vaughan) 和玛丽·杰克逊 (Mary Jackson) 的真实故事,她们在 NASA 的手工计算支撑了 1962 年的水星轨道任务,之后电子计算机接管了这项工作。

纪录片2020年

编码偏差

沙利尼·坎塔亚 (导演)

麻省理工学院研究员 Joy Buolamwini 发现,面部识别系统更频繁地错误识别肤色较深的面孔,将技术数据偏见的发现转变为更广泛的公众对算法公平性的反思。

谚语与习语

垃圾进,垃圾出

20 世纪 50 年代至 60 年代广泛使用的计算格言模型或分析的可信度取决于输入的数据——无论多么复杂的统计都无法挽救错误的输入数据。

所有模型都是错误的,但有些模型是有用的

George Box,统计学家,“科学与统计”,美国统计协会杂志,1976 年每个模型都是现实的简化;目标是建立一个足够精确、有用的模型,而不是对世界的完美描述。

相关性并不意味着因果关系

经典统计格言,通过 20 世纪初的统计数据形式化两个变量一起移动并不能证明一个变量导致另一个变量——隐藏的第三个因素可能可以解释两者。

80% 的数据清理

广泛重复的行业格言,与 Steve Lohr 2014 年《纽约时报》关于临床数据科学家“看门人工作”的文章相呼应实际项目的大部分时间都花在查找、清理和重塑数据上,而不是构建模型本身。

仪式、象征与着装

Kaggle 排行榜发生重大变化

Kaggle 上举办的公共机器学习竞赛于 2010 年推出,在整个竞赛过程中,在一个可见的排行榜上对参赛者进行排名,然后在比赛结束时公布与隐藏测试集的最终排名——竞争对手将这一时刻称为“换血”,因为对公共排行榜的过度拟合可能会导致团队在一夜之间下降几十个名次。

发布模型卡

遵循 Google 的 Margaret Mitchell 及其同事在 2018 年发表的论文中提出的做法,团队越来越多地在发布之前在简短的“模型卡”中记录模型的预期用途、训练数据和已知限制——将其视为一种专业义务,而不是一种可选的额外内容。

笔记本演练

通过实时滚动 Jupyter 笔记本的单元格和图表(而不是精美的幻灯片)来呈现探索性发现,仍然是临床数据科学家与队友和利益相关者分享早期结果的默认方式。

所有这些都没有解决该领域最古老的紧张局势:“临床数据科学”是一门真正的新学科还是更古老的统计和计算工作,其名称更适合市场。从业者自己经常在同一团队内对此进行争论。

自 Graunt 发布 1662 个死亡率表以来,一直保持不变的是基本举措:将一堆记录转化为人们可以采取行动的主张,并诚实地了解数据实际支持该主张的程度。

相近职业

不限同一领域,六项评分最接近的职业。

继续探索

继续探索

科学·研究领域的其他职业