Skip to content 跳到章节

🧫实务与诀窍

临床数据科学家 · 使用临床、试验和卫生系统数据生成可靠的证据,以实现更安全的护理、研究和运营决策。

一眼看清
指标浓度

格子越深,表示该主题在这项指标上越高。

最近审阅 来源与署名媒体署名方法说明

简短问答

临床数据科学家每天实际上做什么?

与“构建 AI 模型”的形象相反,大多数时间都是编写 SQL 查询和 Python 代码来提取和清理数据、运行统计测试或训练模型,以及将结果转换为非技术利益相关者可以采取行动的图表或备忘录。从业者调查一致认为数据清理和准备时间大约占总工作时间的一半或更多。

您需要博士学位才能成为临床数据科学家吗?

不需要。与医学或法律不同,没有执照或单一所需的学位;统计学、计算机科学、数学或相关定量领域的学士或硕士学位是最常见的途径,对雇主来说,强大的实际项目组合通常比确切的证书更重要。博士更常见于研究型或应用型机器学习职位。

临床数据科学只是换了个名字的统计学吗?

不完全是。它大量借鉴了统计学——费舍尔的实验设计、图基的探索性分析——但增加了经典统计学系很少教授的编程、数据库工程和机器学习。威廉·S·克利夫兰 (William S. Cleveland) 在 2001 年提出了这个术语,专门用来描述这个领域的扩展、计算密集型版本,它建立在统计数据的基础上,而不是取代它。

临床数据科学是否面临人工智能的风险?

常规结果已经暴露:AutoML 工具可以拟合和调整标准模型,AI 助手可以比人更快地编写 SQL 查询、初稿探索性图表和样板管道代码。没有自动化的是提出正确的问题,判断模式是否有意义或虚假,以及对基于结果的决策负责。

临床数据科学家能赚多少钱?

它因国家和资历的不同而有很大差异。美国劳工统计局预计,到 2023 年,临床数据科学家职业的年薪中位数约为 108,000 美元,而初级分析师的起薪通常接近 70,000 至 95,000 美元,大型科技公司的高级或首席临床数据科学家的股权总薪酬可达 200,000 至 400,000 美元或更多。

临床数据科学家、数据分析师和机器学习工程师之间有什么区别?

数据分析师通常使用现有数据和仪表板回答定义的业务问题;临床数据科学家通常根据更混乱的数据建立新的统计模型和预测分析;机器学习工程师从笔记本中取出模型,并使其在生产中大规模可靠地运行。界限不断模糊,许多人在职业生涯中在这三者之间摇摆不定。

打开对比实验室

分享本页

人们普遍认为临床数据科学家构建巧妙的预测模型是真实的,但并不完整。从业者调查和第一手资料一致描述了一项工作,即查找、清理和重塑混乱的数据比大多数人想象的建模步骤花费更多的时间。

该领域内传承的技巧不再是记住特定的算法,而是更多地关于纪律性的怀疑态度:在信任任何模型之前查看数据,检查某个模式是否在子组中成立,以及知道何时对利益相关者的问题的诚实答案是数据不能支持某个模式。

工作要求什么

857870726258
统计与概率
85
编程(Python、SQL、R)
78
数据整理和管道
70
机器学习建模
72
交流调查结果
62
业务或领域上下文
58

统计与概率

假设检验、回归以及理解 p 值或置信区间的实际含义——工作中其他一切的推理基础。

编程(Python、SQL、R)

编写足够流畅的代码来大规模提取、清理和转换数据,而不仅仅是在笔记本中构建分析原型,而无需再次运行。

数据整理和管道

将混乱、不一致的真实数据(缺失值、重复记录、不匹配的格式)转变为模型或图表实际可以使用的数据。

机器学习建模

选择、训练和验证适合问题的模型,并了解简单的回归何时击败复杂的神经网络。

交流调查结果

将统计结果转化为非技术主管可以采取行动的图表、备忘录或建议,而不会过度简化或掩盖真正的不确定性。

业务或领域上下文

了解指标在特定业务或科学领域的实际含义,以便分析回答实际提出的问题。

一天的样子

站立和仪表板检查数据拉取和清理午餐建模与分析利益相关者会议和审查下班(大部分时间) 036912151821 24h
  1. 8–9 站立和仪表板检查

    检查隔夜管道运行和关键指标仪表板,并与团队就当天的优先事项进行简短同步。

  2. 9–12 数据拉取和清理

    针对数据仓库编写 SQL 查询、连接和重塑表以及处理缺失或不一致的值 — 通常是工作日中最大的单个块。

  3. 12–13 午餐

    真正的休息,通常是在非正式的场合,跨团队的问题在到达预定会议之前提出。

  4. 13–15 建模与分析

    构建或完善统计模型,运行实验的显着性测试,或深入研究指标变化的原因。

  5. 15–17 利益相关者会议和审查

    向产品或业务团队展示调查结果,审查 A/B 测试的结果,或在受到质疑时捍卫分析的假设。

  6. 17–8 下班(大部分时间)

    个人时间,除了产品发布或季度业务回顾之外,晚上可以吸收最后一刻的分析请求。

门道

从业者真正口耳相传的技艺——不是鸡汤。

01

在建模之前查看数据

在拟合任何东西之前绘制原始分布、散点图和简单的摘要——这种习惯可以捕获损坏的数据、单位错误和异常值,否则模型会悄悄吸收和隐藏。

约翰·图基,《探索性数据分析》,1977 年
02

检查趋势是否在子组内持续存在

一旦数据按相关类别划分,总体趋势可能会完全逆转——这种模式被称为“辛普森悖论”,以统计学家爱德华·H·辛普森 1951 年发表的一篇论文命名。

爱德华·辛普森 (Edward H. Simpson),1951 年论文;卡尔·皮尔逊(Karl Pearson)等人早期注意到的现象
03

拿出一个测试集,直到最后才看它

根据相同的保留数据反复检查性能,然后调整模型,悄悄地将信息从该数据泄漏到模型中——仅接触一次就可以保持最终结果的真实性。

标准实践,在 Hastie、Tibshirani 和 Friedman 的“统计学习的要素”中正式化,2001 年
04

大部分项目预算用于清洁,而不是建模

实际项目始终运行接近 80% 的数据准备和 20% 的建模,而不是相反 - 围绕相反的假设规划时间表是项目延迟的常见方式。

自从史蒂夫·洛尔 (Steve Lohr) 发表《对于大临床数据科学家来说,“清洁工作”是洞察力的关键障碍》(《纽约时报》,2014 年)以来得到了广泛的反响
05

首先交付可能可行的最简单模型

基线(有时只是一条规则或线性模型)阐明了更复杂的模型实际上增加了多少,并且通常足以单独发布。

Martin Zinkevich,“机器学习规则:机器学习工程的最佳实践”,Google,规则 #4
06

当某个模式看起来太好时,寻找令人困惑的地方

令人惊讶的相关性往往是隐藏的第三个变量的产物,而不是真正的发现——在给出结果之前积极寻找其他可以解释它的东西。

植根于费舍尔的实验设计传统;在 Judea Pearl 中正式化,《为什么之书》,2018 年

行当的工具

Python(pandas、scikit-learn、NumPy)

用于数据操作和经典机器学习的主导语言,其中 pandas 用于表格数据,scikit-learn 用于标准建模算法。

SQL

用于从关系数据仓库和云数据仓库(Snowflake、BigQuery、Redshift)中提取数据的查询语言,大多数公司的数据实际上都存放在这些数据仓库中。

Jupyter笔记本

用于探索性分析的标准交互式环境,让临床数据科学家可以在同一文档中运行代码、查看图表并做笔记。

表格/Power BI

商业智能仪表板工具用于将完成的分析转变为非技术利益相关者无需编写代码即可探索和监控的内容。

Git 和云平台(AWS、GCP、Azure)

代码的版本控制,越来越多的模型的版本控制,以及存储数据和以笔记本电脑无法处理的规模运行训练作业的云基础设施。

人如何在此失败

测试直到某件事变得重要

运行许多统计比较并仅报告超过显着性阈值的比较会产生无法复制的错误发现 - 一种被称为 p-hacking 的有据可查的故障模式。

发布泄漏目标的模型

意外地包含对预测结果进行编码的功能会产生不切实际的强大离线结果,一旦模型在真正看不见的生产数据上运行,这些结果就会崩溃。

为错误的问题建立复杂的答案

一个经过精心调整的机器学习模型解决了一个简单的 SQL 查询或电子表格公式就能回答的问题,同样会浪费精力,并且可能会错过实际的业务问题。

相近职业

不限同一领域,六项评分最接近的职业。

继续探索

继续探索

科学·研究领域的其他职业