Skip to content

🧫实务与诀窍

临床数据科学家 · 使用临床、试验和卫生系统数据生成可靠的证据,以实现更安全的护理、研究和运营决策。

分享本页

人们普遍认为临床数据科学家构建巧妙的预测模型是真实的,但并不完整。从业者调查和第一手资料一致描述了一项工作,即查找、清理和重塑混乱的数据比大多数人想象的建模步骤花费更多的时间。

该领域内传承的技巧不再是记住特定的算法,而是更多地关于纪律性的怀疑态度:在信任任何模型之前查看数据,检查某个模式是否在子组中成立,以及知道何时对利益相关者的问题的诚实答案是数据不能支持某个模式。

工作要求什么

857870726258
统计与概率
85
编程(Python、SQL、R)
78
数据整理和管道
70
机器学习建模
72
交流调查结果
62
业务或领域上下文
58

统计与概率

假设检验、回归以及理解 p 值或置信区间的实际含义——工作中其他一切的推理基础。

编程(Python、SQL、R)

编写足够流畅的代码来大规模提取、清理和转换数据,而不仅仅是在笔记本中构建分析原型,而无需再次运行。

数据整理和管道

将混乱、不一致的真实数据(缺失值、重复记录、不匹配的格式)转变为模型或图表实际可以使用的数据。

机器学习建模

选择、训练和验证适合问题的模型,并了解简单的回归何时击败复杂的神经网络。

交流调查结果

将统计结果转化为非技术主管可以采取行动的图表、备忘录或建议,而不会过度简化或掩盖真正的不确定性。

业务或领域上下文

了解指标在特定业务或科学领域的实际含义,以便分析回答实际提出的问题。

一天的样子

站立和仪表板检查数据拉取和清理午餐建模与分析利益相关者会议和审查下班(大部分时间) 036912151821 24h
  1. 8–9 站立和仪表板检查

    检查隔夜管道运行和关键指标仪表板,并与团队就当天的优先事项进行简短同步。

  2. 9–12 数据拉取和清理

    针对数据仓库编写 SQL 查询、连接和重塑表以及处理缺失或不一致的值 — 通常是工作日中最大的单个块。

  3. 12–13 午餐

    真正的休息,通常是在非正式的场合,跨团队的问题在到达预定会议之前提出。

  4. 13–15 建模与分析

    构建或完善统计模型,运行实验的显着性测试,或深入研究指标变化的原因。

  5. 15–17 利益相关者会议和审查

    向产品或业务团队展示调查结果,审查 A/B 测试的结果,或在受到质疑时捍卫分析的假设。

  6. 17–8 下班(大部分时间)

    个人时间,除了产品发布或季度业务回顾之外,晚上可以吸收最后一刻的分析请求。

门道

从业者真正口耳相传的技艺——不是鸡汤。

01

在建模之前查看数据

在拟合任何东西之前绘制原始分布、散点图和简单的摘要——这种习惯可以捕获损坏的数据、单位错误和异常值,否则模型会悄悄吸收和隐藏。

约翰·图基,《探索性数据分析》,1977 年
02

检查趋势是否在子组内持续存在

一旦数据按相关类别划分,总体趋势可能会完全逆转——这种模式被称为“辛普森悖论”,以统计学家爱德华·H·辛普森 1951 年发表的一篇论文命名。

爱德华·辛普森 (Edward H. Simpson),1951 年论文;卡尔·皮尔逊(Karl Pearson)等人早期注意到的现象
03

拿出一个测试集,直到最后才看它

根据相同的保留数据反复检查性能,然后调整模型,悄悄地将信息从该数据泄漏到模型中——仅接触一次就可以保持最终结果的真实性。

标准实践,在 Hastie、Tibshirani 和 Friedman 的“统计学习的要素”中正式化,2001 年
04

大部分项目预算用于清洁,而不是建模

实际项目始终运行接近 80% 的数据准备和 20% 的建模,而不是相反 - 围绕相反的假设规划时间表是项目延迟的常见方式。

自从史蒂夫·洛尔 (Steve Lohr) 发表《对于大临床数据科学家来说,“清洁工作”是洞察力的关键障碍》(《纽约时报》,2014 年)以来得到了广泛的反响
05

首先交付可能可行的最简单模型

基线(有时只是一条规则或线性模型)阐明了更复杂的模型实际上增加了多少,并且通常足以单独发布。

Martin Zinkevich,“机器学习规则:机器学习工程的最佳实践”,Google,规则 #4
06

当某个模式看起来太好时,寻找令人困惑的地方

令人惊讶的相关性往往是隐藏的第三个变量的产物,而不是真正的发现——在给出结果之前积极寻找其他可以解释它的东西。

植根于费舍尔的实验设计传统;在 Judea Pearl 中正式化,《为什么之书》,2018 年

行当的工具

Python(pandas、scikit-learn、NumPy)

用于数据操作和经典机器学习的主导语言,其中 pandas 用于表格数据,scikit-learn 用于标准建模算法。

SQL

用于从关系数据仓库和云数据仓库(Snowflake、BigQuery、Redshift)中提取数据的查询语言,大多数公司的数据实际上都存放在这些数据仓库中。

Jupyter笔记本

用于探索性分析的标准交互式环境,让临床数据科学家可以在同一文档中运行代码、查看图表并做笔记。

表格/Power BI

商业智能仪表板工具用于将完成的分析转变为非技术利益相关者无需编写代码即可探索和监控的内容。

Git 和云平台(AWS、GCP、Azure)

代码的版本控制,越来越多的模型的版本控制,以及存储数据和以笔记本电脑无法处理的规模运行训练作业的云基础设施。

人如何在此失败

测试直到某件事变得重要

运行许多统计比较并仅报告超过显着性阈值的比较会产生无法复制的错误发现 - 一种被称为 p-hacking 的有据可查的故障模式。

发布泄漏目标的模型

意外地包含对预测结果进行编码的功能会产生不切实际的强大离线结果,一旦模型在真正看不见的生产数据上运行,这些结果就会崩溃。

为错误的问题建立复杂的答案

一个经过精心调整的机器学习模型解决了一个简单的 SQL 查询或电子表格公式就能回答的问题,同样会浪费精力,并且可能会错过实际的业务问题。

相近职业

不限同一领域,六项评分最接近的职业。

继续探索

继续探索

科学·研究领域的其他职业