Skip to content 跳到章节

🧫AI与未来

临床数据科学家 · 使用临床、试验和卫生系统数据生成可靠的证据,以实现更安全的护理、研究和运营决策。

一眼看清
指标浓度

格子越深,表示该主题在这项指标上越高。

最近审阅 来源与署名媒体署名方法说明

简短问答

临床数据科学家每天实际上做什么?

与“构建 AI 模型”的形象相反,大多数时间都是编写 SQL 查询和 Python 代码来提取和清理数据、运行统计测试或训练模型,以及将结果转换为非技术利益相关者可以采取行动的图表或备忘录。从业者调查一致认为数据清理和准备时间大约占总工作时间的一半或更多。

您需要博士学位才能成为临床数据科学家吗?

不需要。与医学或法律不同,没有执照或单一所需的学位;统计学、计算机科学、数学或相关定量领域的学士或硕士学位是最常见的途径,对雇主来说,强大的实际项目组合通常比确切的证书更重要。博士更常见于研究型或应用型机器学习职位。

临床数据科学只是换了个名字的统计学吗?

不完全是。它大量借鉴了统计学——费舍尔的实验设计、图基的探索性分析——但增加了经典统计学系很少教授的编程、数据库工程和机器学习。威廉·S·克利夫兰 (William S. Cleveland) 在 2001 年提出了这个术语,专门用来描述这个领域的扩展、计算密集型版本,它建立在统计数据的基础上,而不是取代它。

临床数据科学是否面临人工智能的风险?

常规结果已经暴露:AutoML 工具可以拟合和调整标准模型,AI 助手可以比人更快地编写 SQL 查询、初稿探索性图表和样板管道代码。没有自动化的是提出正确的问题,判断模式是否有意义或虚假,以及对基于结果的决策负责。

临床数据科学家能赚多少钱?

它因国家和资历的不同而有很大差异。美国劳工统计局预计,到 2023 年,临床数据科学家职业的年薪中位数约为 108,000 美元,而初级分析师的起薪通常接近 70,000 至 95,000 美元,大型科技公司的高级或首席临床数据科学家的股权总薪酬可达 200,000 至 400,000 美元或更多。

临床数据科学家、数据分析师和机器学习工程师之间有什么区别?

数据分析师通常使用现有数据和仪表板回答定义的业务问题;临床数据科学家通常根据更混乱的数据建立新的统计模型和预测分析;机器学习工程师从笔记本中取出模型,并使其在生产中大规模可靠地运行。界限不断模糊,许多人在职业生涯中在这三者之间摇摆不定。

打开对比实验室

分享本页

数据科学在人工智能的故事中处于一个不寻常的时刻:许多重塑这个行业的工具——自动化机器学习、自然语言到 SQL 翻译、人工智能辅助制图——本身主要是由临床数据科学家和机器学习研究人员构建的,现在又瞄准了他们自己的部分日常工作。

这种曝光是真实且不均匀的。对于人工智能工具来说,例行的、明确的工作结束——提取数据、运行标准模型、生成初稿图表——已经相当快了。幸存下来的最终目标不再是编写代码,而是决定什么问题值得提出以及答案是否可信。

32 / 100
中等

机器可替代的工作占比

日常数据科学工作中的很大一部分——SQL 查询、探索性图表、使用 AutoML 拟合标准模型、编写样板管道代码——如今已经可以自动化或由人工智能辅助,而且这一份额正在快速增长。抵制自动化的是将模棱两可的业务问题构建为可测试的问题,判断结果是真实的还是统计产物,并在模型的现实世界决策被证明是错误时承担责任。

按任务计分,而非头衔。越低越安全。

AI难以取代的职业 →

机器夺不走的

提出正确的问题

84

将模糊的业务或科学问题转化为具体的、可测试的问题需要组织和领域上下文,而自动化工具本身无法访问。

判断一个模式是否真实

80

将真实效果与噪声、数据泄漏伪影或幸运的训练测试分割区分开来,正是自动化管道最不擅长应用于其自身输出的怀疑判断。

对现实世界的决策负责

88

必须有人对拒绝贷款、标记患者或错误定价产品的模型负责——这种责任不能转移到生成数字的工具身上。

说服持怀疑态度的利益相关者

68

反直觉或不受欢迎的发现能否真正发挥作用取决于信任、可信度以及与人们的谈判,而不仅仅是正确的分析。

设计一个真正的新实验

74

为新问题选择正确的自然实验、对照组或因果推理策略更接近于创造性判断,而不是对过去分析的模式匹配。

它们已经在夺的

常规 SQL 查询和数据拉取

75

自然语言到 SQL 工具现在可以处理大量直接的数据检索请求,这些请求曾经需要临床数据科学家的直接参与。

初稿探索性图表和摘要

65

自动探索性分析工具可以在几秒钟内从原始数据集生成分布图、相关性摘要和基本图表。

安装和调整标准模型

68

AutoML 平台可以在无人值守的情况下选择、训练和调整传统模型,例如梯度提升或逻辑回归,以解决定义明确、标记明确的问题。

样板管道和 ETL 代码

60

现在,使用人工智能编码助手生成和审查标准数据转换或加载脚本通常比从头开始编写更快。

工作如何变化

从构建模型到指导和检查模型

越来越多的工作是指定自动化管道应该尝试什么并验证其输出,而不是手动编写每个查询和模型。

通才头衔分为专业

分析工程、机器学习工程和产品分析已日益成为独立的职位,每个职位都吸收了十年前单个“临床数据科学家”的职责范围。

因果推理和实验增益状态

随着现有数据中的模式查找变得更容易自动化,设计值得信赖的实验或因果分析的更难技能变得更加有价值,而不是更少。

“公民临床数据科学家”传播基础分析

无代码和 AutoML 工具让非专家可以运行自己的基本分析,从而推动专业的临床数据科学家解决这些工具无法处理的更困难、更模糊的问题。

分岔出的新职业

分析工程师

构建和维护数据转换管道(通常使用 dbt 等工具),为仪表板和模型提供数据,位于数据工程和分析之间。

机器学习工程师

从研究笔记本中取出模型,并使其在生产系统中可靠、受监控并大规模运行。

数据产品经理

拥有数据或人工智能驱动功能的路线图,将业务目标转化为数据团队实际应该构建的内容。

负责任的人工智能/模型风险分析师

在允许发布之前,审核模型及其背后的数据是否存在偏见、公平性和监管合规性。

AI 暴露情景

三个可逆透镜:增强、替代切片、新缝隙。教学标记,非预测。

增强

保留岗位;AI 加速草稿、分诊或调研,判断与责任仍在人。

替代切片

狭窄任务堆可能先压缩,相邻手艺反而增长。

新缝隙

在需信任 AI 输出的受监管场景,可能出现监督、集成与领域质检角色。

展望

未来十年,对能够将数据转化为值得信赖的决策的人才的需求很可能会保持强劲,但该工作的入门级版本已经发生了变化:纯粹手工编写例行查询和初稿图表的角色将会减少。

最明显的长期优势在于临床数据科学家,他们可以提出真正有用的问题,发现人工智能生成的结果何时悄悄错误,并在持怀疑态度的利益相关者面前负责提出建议——自费舍尔的作物试验以来,该领域一直需要同样的判断,现在应用于越来越多地起草自己的第一遍的工作流程。

相近职业

不限同一领域,六项评分最接近的职业。

继续探索

继续探索

科学·研究领域的其他职业