Skip to content 跳到章节

📊AI与未来

数据科学家 · 从数据中寻找规律、构建预测模型——一个2008年才出现的职位名称,建立在三个世纪计数、检验与可视化证据的传统之上。

一眼看清
指标浓度

格子越深,表示该主题在这项指标上越高。

最近审阅 来源与署名媒体署名方法说明

简短问答

数据科学家日常到底在做什么?

与“搭建AI模型”的刻板印象不同,多数工作日的时间分布在编写SQL查询和Python代码以提取并清洗数据、运行统计检验或训练模型,以及把结果转化成非技术利益相关者能够采取行动的图表或备忘录上。从业者调查一致表明,数据清洗与准备大约占用了总工作时间的一半甚至更多。

成为数据科学家一定要读博士吗?

不需要。与医学或法律不同,这个领域没有执业资格证,也没有唯一必需的学位;统计学、计算机科学、数学或相关量化领域的学士或硕士学位是最常见的路径,而一份扎实的真实项目作品集,往往比具体学历更受雇主看重。博士学位在研究密集型或应用机器学习岗位中更为常见。

数据科学只是换了个新名字的统计学吗?

并不完全是。它大量借鉴统计学——费舍尔的实验设计、图基的探索性分析——但又加入了传统统计学系很少教授的编程、数据库工程与机器学习。威廉·S·克利夫兰在2001年提出这个术语,正是为了描述这个建立在统计学之上、而非取代统计学的、计算密集型的扩大版学科。

数据科学会被AI取代吗?

常规部分已经暴露在风险之中:AutoML工具能够拟合并调优标准模型,AI助手编写SQL查询、初稿探索性图表和样板管道代码的速度都比人快。尚未被自动化的,是构思出正确的问题、判断一个规律究竟有意义还是伪相关,以及为建立在结果之上的决策承担责任。

数据科学家收入如何?

各国及资历差异很大。美国劳工统计局公布,2023年数据科学家这一职业的年薪中位数约为10.8万美元,初级分析师起薪往往接近7万至9.5万美元,而大型科技公司的资深或首席数据科学家算上股权的总薪酬可达20万至40万美元甚至更高。

数据科学家、数据分析师与机器学习工程师有什么区别?

数据分析师通常用现有数据和仪表盘回答已界定的业务问题;数据科学家构建新的统计模型和预测分析,处理的数据往往更杂乱;机器学习工程师则把模型从笔记本中取出,让它在生产环境中大规模、可靠地运行。三者的界限一直在模糊,很多人在职业生涯中会在这三者之间不断转换。

从这一节开始 - AI与未来

打开对比实验室

分享本页

数据科学在AI这个故事里处于一个不寻常的位置:许多正在重塑这个行业的工具——自动机器学习、自然语言转SQL、AI辅助制图——很大程度上正是由数据科学家和机器学习研究者自己打造出来的,如今又被用来对准他们自己日常工作的一部分。

这种暴露是真实且不均衡的。这份工作中常规、界定清晰的部分——取数、运行一个标准模型、生成一份初稿图表——AI工具做起来速度已相当可观。真正抗拒自动化的部分,与其说是写代码,不如说是判断什么问题值得去问,以及一个答案是否值得信任。

62 / 100
较高

机器可替代的工作占比

数据科学中相当一部分常规工作——SQL查询、探索性制图、用AutoML拟合标准模型、编写样板管道代码——如今已经可以自动化或借助AI完成,且这一比例还在快速增长。抗拒自动化的,是把一个模糊的业务问题构建成一个可检验的问题、判断一个结果究竟是真实的还是统计假象,以及当一个模型在现实世界中的决策出错时承担责任。

按任务计分,而非头衔。越低越安全。

AI难以取代的职业 →

机器夺不走的

构思正确的问题

84

把一个模糊的业务或科学问题转化为一个具体、可检验的问题,需要自动化工具自己无法获取的组织与领域背景。

判断一个规律是否真实

80

分辨一个真实的效应与噪声、数据泄漏假象或幸运的训练-测试划分,正是自动化流程最不擅长应用到自身输出上的那种怀疑性判断。

为真实世界的决策担责

88

总要有人为一个拒绝了贷款、标记了病人或给产品定错价格的模型负责——这份责任无法转移给产出那个数字的工具。

说服持怀疑态度的利益相关者

68

让一个反直觉或不受欢迎的发现真正被采纳并付诸行动,靠的是与人的信任、信誉和协商,而不仅仅是一份正确的分析。

设计一个真正新颖的实验

74

为一个新问题选择合适的自然实验、对照组或因果推断策略,更接近创造性判断,而非对过往分析进行模式匹配。

它们已经在夺的

常规SQL查询与取数

75

自然语言转SQL工具如今已能处理大量此前需要数据科学家亲自介入的简单取数请求。

初稿探索性图表与摘要

65

自动化探索性分析工具能在数秒内从一份原始数据集生成分布图、相关性摘要与基础图表。

拟合与调优标准模型

68

对于定义明确、标注良好的问题,AutoML平台能在几乎无人干预的情况下选择、训练并调优梯度提升、逻辑回归等常规模型。

样板管道与ETL代码

60

如今用AI编程助手生成一段标准的数据转换或加载脚本再审阅,往往比从零开始编写更快。

工作如何变化

从搭建模型到指挥并核查模型

这份工作中越来越大的一部分,是设定一个自动化流程该去尝试什么、并核实其输出,而不是亲手编写每一条查询和每一个模型。

通才头衔分裂成各专精岗位

分析工程、机器学习工程与产品分析越来越多地成为独立的职位名称,各自吸纳了十年前单一“数据科学家”头衔所被期待涵盖的一部分工作。

因果推断与实验设计地位上升

随着在已有数据中发现规律变得更容易自动化,设计一个可信实验或因果分析这项更难的技能,其价值不降反升。

“公民数据科学家”让基础分析普及开来

无代码与AutoML工具让非专业人士也能自行完成基础分析,把专职数据科学家推向那些这类工具无法处理的更难、更模糊的问题。

分岔出的新职业

分析工程师

构建并维护数据转换管道——常使用dbt等工具——为仪表盘与模型提供数据,处于数据工程与数据分析之间。

机器学习工程师

把模型从研究用的笔记本中取出来,让它在生产系统中被监控、可靠且大规模地运行。

数据产品经理

负责一个数据或AI驱动功能的路线图,把业务目标转化为数据团队实际应该构建的东西。

负责任AI/模型风险分析师

在模型及其背后的数据被允许上线之前,审计其偏见、公平性与合规性。

AI 暴露情景

三个可逆透镜:增强、替代切片、新缝隙。教学标记,非预测。

增强

保留岗位;AI 加速草稿、分诊或调研,判断与责任仍在人。

替代切片

狭窄任务堆可能先压缩,相邻手艺反而增长。

新缝隙

在需信任 AI 输出的受监管场景,可能出现监督、集成与领域质检角色。

展望

未来十年,对能把数据变成可信决策的人才的需求极有可能保持强劲,但这份工作的入门版本已经在变化:纯粹靠手工编写常规查询和初稿图表的岗位会越来越少。

长期来看,优势最明显地属于那些能构思出真正有用的问题、能察觉AI生成的结果何时悄悄出错、并能在持怀疑态度的利益相关者面前为一项建议承担责任的数据科学家——这正是自费舍尔的作物试验以来这个领域一直需要的判断力,如今被用在一个越来越多由自身草拟初稿的工作流程之上。

相近职业

不限同一领域,六项评分最接近的职业。

继续探索

继续探索

科学·研究领域的其他职业