Skip to content 跳到章节
🔬 科学·研究

📊数据科学家

从数据中寻找规律、构建预测模型——一个2008年才出现的职位名称,建立在三个世纪计数、检验与可视化证据的传统之上。

又称: 应用科学家 · 机器学习科学家

约29分钟 常见问题

审阅 2026-08·媒体署名

相互关联的数据点与图表的抽象可视化
Courtesy NASA/JPL-Caltech. · Public domain
分享本页
一眼看清
指标浓度

格子越深,表示该主题在这项指标上越高。

分数画像

每根柱是该主题的0-100图鉴分,不是时间轴。

387455607866
薪酬与AI

把这份职业的薪酬与抗自动化放在同一条0-100尺上。

两项分数始终可见。拖动滑块可强调左侧(薪酬)或右侧(抗AI)。

薪酬

抗AI

两轴

一个点:该职业在两条命名轴上的位置。

薪酬抗AI数据科学家 74/38*数据科学家
入行路径

进入这一角色前通常需要的教育与训练年数。

年表

按时间排列的节点,不是每周活动格。

1662年 格朗特分析伦敦死亡率统计表1908年 戈塞特以“学生”之名发表t检验1925年 费舍尔出版《研究工作者的统计方法》1933年 内曼与皮尔逊将假设检验形式化1962年 图基主张数据分析自成一门科学1977年 图基《探索性数据分析》普及箱形图1996年 法亚德、皮亚泰茨基-夏皮罗与斯迈思定义“知识发现”2001年 克利夫兰提出把“data science”作为一个学科2008年 帕蒂尔与哈默巴克创造出这个职位名称2012年 《哈佛商业评论》称其为“最性感的工作”
  1. 格朗特分析伦敦死亡率统计表
  2. 戈塞特以“学生”之名发表t检验
  3. 费舍尔出版《研究工作者的统计方法》
  4. 内曼与皮尔逊将假设检验形式化
  5. 图基主张数据分析自成一门科学
  6. 图基《探索性数据分析》普及箱形图
  7. 法亚德、皮亚泰茨基-夏皮罗与斯迈思定义“知识发现”
  8. 克利夫兰提出把“data science”作为一个学科
  9. 帕蒂尔与哈默巴克创造出这个职位名称
  10. 《哈佛商业评论》称其为“最性感的工作”
浏览
比较
约18分钟

把这份职业地图分享给正在考虑升学、转训或首份工作的人。

最近审阅 来源与署名媒体署名方法说明

打开对比实验室

一句话看懂

数据科学家:从数据中寻找规律、构建预测模型——一个2008年才出现的职位名称,建立在三个世纪计数、检验与可视化证据的传统之上。

典型薪酬
$120k–$180k (美国)
入行年限
6
AI抗性
38/100
需求
78/100

速览

2008年,LinkedIn/FB职位名称创造于
哈佛商业评论,2012年10月“最性感的工作”一文
2001年,克利夫兰学科被正式命名
约10.8万美元/年薪酬中位数(美国,2023)
约20%该领域女性占比(美国估计)
Python、SQL、R核心工具

数据科学家利用统计学、编程与领域知识,从数据中提炼出规律、预测与建议,再把结果变成企业、政府机构或研究团队能够采取行动的依据。这份工作涵盖写SQL从数据仓库中取数、清洗与重塑数据、拟合统计或机器学习模型,以及解释这个结果究竟支持什么、不支持什么。

这个职位名称比其背后的技艺年轻得多。“data scientist”一词大约始于2008年,当时DJ·帕蒂尔与杰夫·哈默巴克在分别为LinkedIn与Facebook组建数据团队时各自独立敲定了这个称呼,而统计学家威廉·S·克利夫兰直到2001年才提出把“data science”作为一个学术领域。其背后的学科要古老得多,可以经由约翰·图基1960至70年代对探索性数据分析的推动,一路追溯到罗纳德·费舍尔1920年代的统计学,再到约翰·格朗特1662年对伦敦死亡记录的研究。

2012年《哈佛商业评论》一篇文章称其为“21世纪最性感的工作”,引发了长达十年的企业招聘热潮和数百个新设的大学项目。这股热潮如今已趋于成熟:这个泛化的职位名称已分裂为分析工程、机器学习工程和产品分析,而AI工具如今承担了越来越多原本这份工作默认由人工完成的常规查询、清洗与制图任务。

深入这份职业

数据科学是把不完美的记录变成决策的手艺:难处很少是拟合模型,而通常是判断数据诚实上能支撑什么。

一天大多是证据工作

查询数仓、统一口径、检查分布、清理坏字段并解释不确定性。建模重要,但结果只有在血缘、假设与备选方案可被审查时才赢得信任。最强的从业者能告诉干系人:看起来自信的图答错了问题,或相关不是因果。在大陆互联网与产业数据场景中,口径政治与埋点质量常比算法选择更致命。对在中国大陆从业的数据科学家而言,还要把监管口径、客户预期、交付节奏与团队协作方式一并纳入判断,而不能只复制海外岗位描述里的光鲜部分。香港与台湾的市场习惯、资质路径、舆论环境与合规细节也可能不同,跨区域发展前应单独核对,不要假设“华语地区都一样”。真正拉开差距的,往往是能否在压力下把复杂权衡讲清楚,并留下可复查的依据,而不是只会完成表面上的标准动作。

头衔藏着多种生涯

产品数据科学家做实验与功能度量;应用科学家做预测模型;决策科学家服务运营、财务或政策。成熟组织里,分析工程、数据工程与机器学习工程吸收了旧式通才的一部分。领域知识改变工作程度不亚于技术栈:购物车实验不是患者结局研究,也不是反欺诈。对在中国大陆从业的数据科学家而言,还要把监管口径、客户预期、交付节奏与团队协作方式一并纳入判断,而不能只复制海外岗位描述里的光鲜部分。香港与台湾的市场习惯、资质路径、舆论环境与合规细节也可能不同,跨区域发展前应单独核对,不要假设“华语地区都一样”。真正拉开差距的,往往是能否在压力下把复杂权衡讲清楚,并留下可复查的依据,而不是只会完成表面上的标准动作。

门槛是可展示的推理

统计、计算机、数学、经济与理工科都可进入。学位有帮助,面试与作品集更直接测试SQL、统计推理、数据质量与沟通。可信项目不需要炫模型,需要清晰问题、有文档的数据、合适基线与匹配证据的结论。只会调包画仪表盘,很难通过严肃评审。对在中国大陆从业的数据科学家而言,还要把监管口径、客户预期、交付节奏与团队协作方式一并纳入判断,而不能只复制海外岗位描述里的光鲜部分。香港与台湾的市场习惯、资质路径、舆论环境与合规细节也可能不同,跨区域发展前应单独核对,不要假设“华语地区都一样”。真正拉开差距的,往往是能否在压力下把复杂权衡讲清楚,并留下可复查的依据,而不是只会完成表面上的标准动作。

AI压缩例行分析

助手能起草SQL、图表、摘要与基线模型,确实改变初级工作。它不能敲定度量定义、暴露隐藏混杂、选择预测的伦理用途或接受决策问责。职业正转向问题框定、实验、因果推理与审查机器生成的分析。对在中国大陆从业的数据科学家而言,还要把监管口径、客户预期、交付节奏与团队协作方式一并纳入判断,而不能只复制海外岗位描述里的光鲜部分。香港与台湾的市场习惯、资质路径、舆论环境与合规细节也可能不同,跨区域发展前应单独核对,不要假设“华语地区都一样”。真正拉开差距的,往往是能否在压力下把复杂权衡讲清楚,并留下可复查的依据,而不是只会完成表面上的标准动作。工具与流程会持续升级,但面对例外情况时仍需有人负责解释、止损与担责;这正是该职业难以被完全替代的核心。

工作如何分岔

同一头衔下常见的五条路径——专长、场景与生涯形态。

数字产品

产品数据科学家

用指标与实验引导产品选择,并抵御误导性的短期优化。

预测系统

应用/机器学习科学家

为排序、预测、检测或个性化构建并评估模型,常与ML工程师协作。

运营与战略

决策科学家

把数据与商业或公共政策语境结合,支持规划、配置与风险决策。

增长与因果推断

实验专员

设计受控试验与准实验,把干预效果从相关中区分出来。

科学与公共研究

科研数据科学家

处理复杂观察或实验数据,可复现与方法严谨优先于快速上线。

各国读法不同

同样的行当,门槛、地位与日常不同。按各语言读者真正搜索的语境重写。

美国 — 市场结构与职业门槛

在美国,数据科学家的机会、薪酬与准入规则因州、行业和雇主类型差异很大。大型机构提供结构化训练,初创与自由职业路径则更灵活也更不稳定。对希望连接中美业务的人,英语沟通与合规意识通常和专业技能同等重要。

韩国 — 大企业节奏与本地语境

韩国的数据科学家岗位常见于大企业、成长型公司与专业服务网络,工作节奏与层级协作并存。韩语沟通和本地行业习惯往往影响实际表现。与中国大陆或东南亚团队协作时,还需预留文化和合规差异。

日本 — 流程、细节与长期关系

日本市场里,数据科学家常强调流程完整、质量细节与长期信任。正式资格、年功或组织内轮岗可能影响晋升速度。外企与本土机构对英语能力和交付速度的期待并不相同,选雇主几乎等于选工作方式。

德国 — 规范、培训与技术深度

德国的数据科学家受到职业教育、行业标准与劳动制度共同塑造,文档与长期责任通常被看得很重。工程与制造传统深厚,专精路线清晰;对习惯快速迭代的人,适应正式流程是进入门槛的一部分。

英国 — 资格路径与伦敦集聚

英国的数据科学家机会常向伦敦及专业服务网络集中,资格认证、雇主品牌与合同制岗位都会影响进入路径。生活成本与项目稳定性需要一起衡量;脱欧后的监管细节对跨境业务仍有持续影响。

新加坡 — 区域枢纽与华语市场连接

新加坡常把数据科学家连接到东南亚客户、跨国总部与华语商业网络。英语是协作语言,但面向中国大陆、香港、台湾市场时,监管、数据与文化语境不能当作同一件事。区域覆盖意味着跨时区沟通与多元合规成为日常。

档案图集

为本职业自托管的 Commons CC/PD 图片。

Photograph of Ronald Fisher, whose statistical methods underlie modern data science
ENIAC, one of the first electronic general-purpose computers, unveiled in 1946
A box plot, one of the exploratory data analysis tools John Tukey popularized
Conceptual illustration of large-scale data, the raw material of 21st-century data science
Photograph of Ronald Fisher
Photograph of Florence Nightingale

为什么态度在这份工作里很重要

一个模型在统计上完全说得通,却依然可能误导做决策的人;而一名数据科学家愿不愿意在截止日期到来之前,主动把这一点讲出来,而不是等别人追问才承认,才是真正让技术能力产生价值的那份态度。

把伤害到产品路线图的那个发现如实报出来

一份分析结果显示,全公司都盼着上线的功能其实根本没有推动大家期待的那个指标,或者一条被视为增长神话的渠道,实际上只是把原本就存在的需求重新收割了一遍,这样的结论既不受欢迎,又非常容易被悄悄软化处理。愿意把这种令人扫兴的真实结果原样报出来的数据科学家,才是让一家公司的决策真正贴合现实的原因;而那些为了让结果听起来更顺耳,就悄悄把发现往管理层想听的方向偏一偏的人,只是把数据分析变成了一种精心包装、用来事后自我证明的装饰品而已,早就背离了它本该发挥的作用。

坦白承认一个样本量太小根本撑不起结论的事实

一场只跑了五天的实验,或者一个人数少得可怜的用户群体,完全可以产出一个看起来相当精确、实际上只是噪音的数字,而下游几乎没有任何人会在真正拿这个数字去做决策之前,回头查一下样本量到底够不够。真正能让人放心信任的分析师,那份真正的态度差别,就在于拒绝让一个数字听起来比它背后的数据真正能支撑的确定性更高,哪怕一个语气笃定、听起来毫不含糊的数字,恰恰正是某位相关方内心真正期待听到、也更容易拿去汇报的那个答案。

真正承担起一个模型在现实世界里造成的后果

一个用来决定贷款批不批、简历排不排得上前面,或者标记出某位病人是否需要重点关注的模型,会真真切切地影响到一个从来都不会打开这份代码笔记本去看一眼的人。因为通常只有写出这个模型的人,才最有机会在它真正上线之前,注意到某个隐藏得很深的偏差或者一个正在悄悄泄露信息的特征,把这份责任真正当回事、而不是当成模型一旦上线就与自己无关的别人的问题,才是这份潜在的伤害,真正能够在造成实际后果之前被拦下来的地方,也是这份工作真正的分量所在。

压力之下仍立得住的态度

不是口号,而是这份工作真正看重的五种具体姿态。

在真正动手建模之前,先亲眼把原始数据画出来看一遍

在开始拟合任何一个模型之前,先亲自用自己的眼睛去仔仔细细地看一遍数据的分布、异常值和缺失值到底是什么样子,而不是想当然地认定一个模型自己就会把数据里那些原本就存在的问题悄悄吸收消化掉、自动修复好,却完全不会主动向任何人报警提醒,让问题一路悄无声息地流进最终呈现给相关方的那个结论里,等到很久以后才被人偶然发现、追悔莫及。

把不确定性和结论写在同一句话里,而不是被追问了才说

在报告一个核心结论的同一句话里,就主动把置信区间或者相应的前提条件一并交代清楚,而不是只有等到这个结论真正被人质疑的时候才被动地补上,这样才能让听取汇报的相关方,不会仅仅因为这份原本就该被主动说清楚的不确定性,最终没有被主动提起,就误把一个原本相当粗略的估计,当成一个精确无比、可以直接拿去做出重大决策的定论,进而承担本不该承担的风险。

在庆祝一个结果之前,先主动去找这个结果背后可能存在的干扰因素

把一个意外冒出来、又恰好显得特别令人满意的相关关系,当成一个真正需要停下手头的工作、认真核查清楚来龙去脉的疑点,而不是急着把它当成一个可以立刻拿出去展示的漂亮成果,因为一个发现越是恰好迎合了整个团队心里早就已经默默预设好的那个计划、那份期待,就越应该被拿出来仔细审视一番、多问几个为什么,而不是顺水推舟地直接采纳。

在数据不再支持自己的假设时,主动放弃这份自己钟爱的分析

一旦手头的证据已经不再支持这个自己一开始满心期待、很喜欢的假设,就果断彻底地放弃它,而不是继续再多跑几遍不同角度的数据切法,心存侥幸地一遍遍指望能够最终跑出一个终于经得起检验、拿得出手的漂亮结果,并且在最后的报告里,坦率、直接地把这段放弃这个假设的完整过程原原本本地写清楚,不带任何掩饰或者美化,即便这意味着要承认当初的判断有误。

明确说清楚手头的数据回答不了这个问题

坦率而明确地告诉相关方,现有的这些数据无论再怎么反复处理,都根本没有办法支撑起一个真正靠得住的答案,而不是仅仅因为对方已经明确提出了这个要求、又觉得最后交出一份空空如也、什么结论都没有的报告实在说不过去、显得太没有面子、太不专业,就硬着头皮编造出一个看似有充分依据、实则经不起推敲的数字来敷衍过去、蒙混过关。

分辨真假的时刻

把简历用语和实际执行区分开来的具体情境。

管理层已经提前对外公布了上线日期,而这个原本被寄予厚望的功能,经过完整的A/B测试之后,结果显示对核心指标几乎没有任何真正的提升

这名分析师是不是原原本本、不加任何美化和修饰地把这个令人失望的核心结果如实汇报给管理层,还是转而在一大堆数据里刻意挑出一个看起来相对好看一些的次要指标,去悄悄掩盖这个核心结果其实并不理想的真相,好让当初那个已经提前公开对外宣布过的上线时间和相应决定,事后回过头去看依然显得合情合理、无可指摘、经得起反复追问?

一个模型在整体的汇总数据上表现得相当不错,但按照人群或者地区细分之后,却发现它在其中某一个特定群体上的表现明显要差得多

这名分析师是不是在这个模型真正被拿去正式部署、真正开始影响到成千上万真实用户之前,主动地、完全不等任何人开口追问,就抢先一步把这个隐藏得很深的问题揪出来、当面清楚地指出,还是仅仅满足于呈现一个看起来相当体面、经得起汇报、能让在场所有人都满意的整体平均值,然后就这样若无其事地把这件事翻篇过去,转身投入到下一项完全不相干的新工作里去了?

客户手头只掌握着一份刚刚积累三个星期的数据,却要求依据它,给出一个足够肯定、可以直接写进年度报告里的全年增长预测

这名分析师是不是坦率而耐心地向客户当面把话讲清楚,眼下手头这份数据,其实只能支撑起一个相当粗略、留有余地的区间估计,还是顺着对方心里真正期待听到的那个答案,交出一个语气听起来格外自信笃定、实际上根本撑不住这份自信的具体数字,任由对方误以为这就是一个板上钉钉、毫无争议、完全可以直接拿去做重大决策的真相?

团队里所有人都长期信赖的一份仪表盘,里面其实藏着一个不容易被发现的小漏洞,而这个漏洞碰巧让整体的业绩数字看起来比真实情况更好看,也一直没有人对此提出过任何质疑

这名分析师是不是主动地、毫不犹豫地把这个隐藏的漏洞指出来,坦然承认自己或者整个团队之前工作中存在的疏忽,还是因为不想让那些一直很喜欢、也长期依赖这份好看数字的同事们因此感到失望,就选择睁一只眼闭一只眼,任由这个明明已经被自己发现的错误,继续悄悄地、心照不宣地留在系统里,没有一个人愿意主动站出来,把这个心知肚明的问题彻底修正过来?

"使命感"变成伤害的地方

"数据驱动的文化"被用来给早已预设好的答案披上一层客观的外衣

一些自我标榜为极度重视数据驱动决策的公司,有时候会反过来利用这套说辞,去逼迫分析师想方设法找出证据来支持一个早就已经拍板定下的决定,把敢于报告出令人扫兴结果的人,私下贴上一个"不懂团队合作"的标签。这个行业早年被包装成一份光鲜亮丽的热门职业,也顺带把无偿的深夜加班,正常化成了一种对数据充满好奇心的表现,熬到半夜只为了多跑一遍数据切法会被大加赞扬,而不会被追问这背后其实是一个本该被正视的工作量问题。国内不少互联网公司同样存在用"数据说话"和"拿结果说话"这类说法,去正当化分析和算法岗位长期存在的高强度无偿加班现象。

职业画像

387455607866
  • 抗AI38
  • 薪酬74
  • 入行门槛55
  • 自主性60
  • 需求78
  • 影响力66

对AI有多暴露?

62 / 100

较高

数据科学中相当一部分常规工作——SQL查询、探索性制图、用AutoML拟合标准模型、编写样板管道代码——如今已经可以自动化或借助AI完成,且这一比例还在快速增长。抗拒自动化的,是把一个模糊的业务问题构建成一个可检验的问题、判断一个结果究竟是真实的还是统计假象,以及当一个模型在现实世界中的决策出错时承担责任。

AI与未来 →

理解这一职业的七个角度

常见问题

数据科学家日常到底在做什么?
与“搭建AI模型”的刻板印象不同,多数工作日的时间分布在编写SQL查询和Python代码以提取并清洗数据、运行统计检验或训练模型,以及把结果转化成非技术利益相关者能够采取行动的图表或备忘录上。从业者调查一致表明,数据清洗与准备大约占用了总工作时间的一半甚至更多。
成为数据科学家一定要读博士吗?
不需要。与医学或法律不同,这个领域没有执业资格证,也没有唯一必需的学位;统计学、计算机科学、数学或相关量化领域的学士或硕士学位是最常见的路径,而一份扎实的真实项目作品集,往往比具体学历更受雇主看重。博士学位在研究密集型或应用机器学习岗位中更为常见。
数据科学只是换了个新名字的统计学吗?
并不完全是。它大量借鉴统计学——费舍尔的实验设计、图基的探索性分析——但又加入了传统统计学系很少教授的编程、数据库工程与机器学习。威廉·S·克利夫兰在2001年提出这个术语,正是为了描述这个建立在统计学之上、而非取代统计学的、计算密集型的扩大版学科。
数据科学会被AI取代吗?
常规部分已经暴露在风险之中:AutoML工具能够拟合并调优标准模型,AI助手编写SQL查询、初稿探索性图表和样板管道代码的速度都比人快。尚未被自动化的,是构思出正确的问题、判断一个规律究竟有意义还是伪相关,以及为建立在结果之上的决策承担责任。
数据科学家收入如何?
各国及资历差异很大。美国劳工统计局公布,2023年数据科学家这一职业的年薪中位数约为10.8万美元,初级分析师起薪往往接近7万至9.5万美元,而大型科技公司的资深或首席数据科学家算上股权的总薪酬可达20万至40万美元甚至更高。
数据科学家、数据分析师与机器学习工程师有什么区别?
数据分析师通常用现有数据和仪表盘回答已界定的业务问题;数据科学家构建新的统计模型和预测分析,处理的数据往往更杂乱;机器学习工程师则把模型从笔记本中取出,让它在生产环境中大规模、可靠地运行。三者的界限一直在模糊,很多人在职业生涯中会在这三者之间不断转换。
数据科学使用哪些工具和编程语言?
Python占主导地位,通常搭配pandas和scikit-learn等库,再加上用于查询数据库的SQL。R在学术界和生物统计密集的场景中仍然常见。Jupyter notebook是探索性工作的标准环境,而Snowflake、BigQuery或Databricks等云数据仓库平台,如今存放着多数数据科学家实际查询的数据。
为什么“数据科学家”被称为“21世纪最性感的工作”?
托马斯·达文波特与DJ·帕蒂尔在2012年10月发表于《哈佛商业评论》的文章中用这句话作为标题,认为这个岗位所需的统计能力、编码能力与商业判断力的罕见组合,使其既稀缺又备受追捧。这句话就此流传开来,助推了一场长达十年的企业招聘热潮和数十个新设的大学学位项目。

嵌入此榜单

将这段代码粘贴到您的博客或网站,榜单会保持最新。

对比…

相近职业

不限同一领域,六项评分最接近的职业。

继续探索

科学·研究领域的其他职业