Skip to content 跳到章节

📊文化与地位

数据科学家 · 从数据中寻找规律、构建预测模型——一个2008年才出现的职位名称,建立在三个世纪计数、检验与可视化证据的传统之上。

一眼看清
指标浓度

格子越深,表示该主题在这项指标上越高。

最近审阅 来源与署名媒体署名方法说明

简短问答

数据科学家日常到底在做什么?

与“搭建AI模型”的刻板印象不同,多数工作日的时间分布在编写SQL查询和Python代码以提取并清洗数据、运行统计检验或训练模型,以及把结果转化成非技术利益相关者能够采取行动的图表或备忘录上。从业者调查一致表明,数据清洗与准备大约占用了总工作时间的一半甚至更多。

成为数据科学家一定要读博士吗?

不需要。与医学或法律不同,这个领域没有执业资格证,也没有唯一必需的学位;统计学、计算机科学、数学或相关量化领域的学士或硕士学位是最常见的路径,而一份扎实的真实项目作品集,往往比具体学历更受雇主看重。博士学位在研究密集型或应用机器学习岗位中更为常见。

数据科学只是换了个新名字的统计学吗?

并不完全是。它大量借鉴统计学——费舍尔的实验设计、图基的探索性分析——但又加入了传统统计学系很少教授的编程、数据库工程与机器学习。威廉·S·克利夫兰在2001年提出这个术语,正是为了描述这个建立在统计学之上、而非取代统计学的、计算密集型的扩大版学科。

数据科学会被AI取代吗?

常规部分已经暴露在风险之中:AutoML工具能够拟合并调优标准模型,AI助手编写SQL查询、初稿探索性图表和样板管道代码的速度都比人快。尚未被自动化的,是构思出正确的问题、判断一个规律究竟有意义还是伪相关,以及为建立在结果之上的决策承担责任。

数据科学家收入如何?

各国及资历差异很大。美国劳工统计局公布,2023年数据科学家这一职业的年薪中位数约为10.8万美元,初级分析师起薪往往接近7万至9.5万美元,而大型科技公司的资深或首席数据科学家算上股权的总薪酬可达20万至40万美元甚至更高。

数据科学家、数据分析师与机器学习工程师有什么区别?

数据分析师通常用现有数据和仪表盘回答已界定的业务问题;数据科学家构建新的统计模型和预测分析,处理的数据往往更杂乱;机器学习工程师则把模型从笔记本中取出,让它在生产环境中大规模、可靠地运行。三者的界限一直在模糊,很多人在职业生涯中会在这三者之间不断转换。

从这一节开始 - 文化与地位

打开对比实验室

分享本页

流行文化大体上跳过了统计学家,径直奔向了更具戏剧性的量化分析师或算法形象——数据科学家的公众形象,更多来自《点球成金》里的棒球分析师和《大空头》里预见危机的量化分析师,而不是来自任何真正在做在职数据科学家日常工作的人。

在这个领域内部,其文化建立在公开的竞技性基准测试、不动声色的统计学圈内笑话,以及一种文档格式——模型卡(model card)——之上,它把“如实说明模型的局限性”变成了一项常规的职业习惯,而不是事后补充。

历史上的社会地位

各时代该职业的地位,以0–100表示。

2235285578
1660年代–1899年1900年代–1930年代1950年代–1980年代2001–2011年2012年至今
1660年代–1899年

早期的统计工作大多由文员、业余改革者以及像南丁格尔这样的自学成才者完成;这些工作有用,偶尔也具影响力,但本身很少享有声望。

1900年代–1930年代

皮尔逊、费舍尔与戈塞特把统计学专业化为一门拥有自己期刊与大学院系的学术学科,赢得了学界的尊重,但对更广泛的公众来说几乎仍不可见。

1950年代–1980年代

随着大型机计算的普及,“数据处理”人员与统计学家主要被视为不可或缺却毫不光鲜的企业后台支持,鲜少出现在高管决策场合。

2001–2011年

克利夫兰2001年的学术提议几乎没有引起公众注意,但Netflix在2006至2009年间举办的百万美元推荐算法竞赛,以及2008年LinkedIn与Facebook创造出“data scientist”这一称呼,开始在科技行业内部引起关注。

2012年至今

《哈佛商业评论》2012年10月“最性感的工作”这一说法,引发了一波招聘与声望热潮;到2020年代,这个职位名称已分裂为更专精的角色,昔日那种独一无二的光环有所减退,但薪酬与需求依然强劲。

电影、书籍与艺术中的形象

电影2011

《点球成金》

贝内特·米勒(导演);改编自迈克尔·刘易斯2003年同名著作

戏剧化再现了奥克兰运动家队的比利·比恩与分析师保罗·德波德斯塔如何借助比尔·詹姆斯的赛伯计量学,用统计分析在棒球界最小的预算之一上打造出一支具备竞争力的阵容。

电影2015

《大空头》

亚当·麦凯(导演);改编自迈克尔·刘易斯的著作

追踪了几位分析师如何仔细研究抵押贷款市场数据,在几乎所有人都还不相信这些数字之前,就预见到了2008年的金融危机。

电视剧2005–2010

《数字追凶》

尼古拉斯·法拉奇 & 谢里尔·休顿(创作者)

一位数学家用统计分析与模式识别,帮助身为FBI探员的哥哥破案,让美国主流电视观众第一次接触到把应用数学当作侦查工作的概念。

电视剧2011年至今

《黑镜》

查理·布鲁克(创作者)

这部英国选集剧反复设想数据画像与预测性评分被推向令人不安的极端,尤以2016年那集《急转直下》最为直接,塑造了公众对算法给人打分排名的焦虑。

电影2016

《隐藏人物》

西奥多·梅尔菲(导演);改编自玛戈特·李·谢特利的著作

讲述了凯瑟琳·约翰逊、多萝西·沃恩与玛丽·杰克逊——三位黑人女数学家——的真实故事,在电子计算机接手这项工作之前,她们的手工计算支撑起了1962年“水星计划”的轨道任务。

纪录片2020

《编码偏见》

沙利尼·坎塔亚(导演)

追踪了麻省理工学院研究者乔伊·布奥兰维尼的发现——人脸识别系统对肤色较深的面孔误识率远高于其他人群——把一项技术性的数据偏见发现变成了公众对算法公平性的一场广泛反思。

谚语与习语

Garbage in, garbage out(垃圾进,垃圾出)

计算机行业格言,1950至60年代已广泛使用一个模型或分析的可信度,取决于输入其中的数据——再高明的统计技巧也挽救不了糟糕的输入数据。

All models are wrong, but some are useful(所有模型都是错的,但有些有用)

统计学家乔治·博克斯,《科学与统计学》,《美国统计学会杂志》,1976年每一个模型都是对现实的简化;目标是找到一个精确到足以有用的模型,而不是对世界的完美描述。

Correlation does not imply causation(相关不等于因果)

经典统计学格言,经二十世纪初统计学正式化两个变量一起变动,并不能证明其中一个导致了另一个——可能存在一个隐藏的第三因素同时解释了两者。

It's 80% data cleaning(80%的时间都在清洗数据)

业内广为流传的说法,见于史蒂夫·洛尔2014年《纽约时报》关于数据科学家“打杂工作”的文章一个真实项目的大部分时间都花在寻找、清洗与重塑数据上,而不是搭建模型本身。

仪式、象征与着装

Kaggle排行榜洗牌

2010年上线的Kaggle公开机器学习竞赛,在比赛全程用一个可见的排行榜为参赛者排名,比赛结束时再根据隐藏的测试集揭晓最终名次——参赛者称这一刻为“洗牌”,因为过度拟合公开排行榜可能让一支团队一夜之间掉下数十名。

发布模型卡

遵循谷歌玛格丽特·米切尔及其同事在2018年一篇论文中提出的做法,团队越来越多地在模型发布前用一份简短的“模型卡”记录其预期用途、训练数据与已知局限——这被视为一项职业义务,而非可有可无的附加项。

笔记本演示

通过实时滚动展示Jupyter notebook中的单元格与图表来呈现探索性发现,而不是使用精美的幻灯片,仍是数据科学家与队友及利益相关者分享早期成果的默认方式。

这一切都没有解决这个领域最古老的争议:“数据科学”究竟是一门真正的新学科,还是套着更好卖名字的旧统计与计算工作。从业者自己也在争论这个问题,往往就发生在同一个团队内部。

自格朗特1662年的死亡率统计表以来,始终不变的是这个基本动作:把一堆记录变成有人可以据以行动的结论,并如实说明这个结论究竟在多大程度上得到了数据的支持。

相近职业

不限同一领域,六项评分最接近的职业。

继续探索

继续探索

科学·研究领域的其他职业