《点球成金》
贝内特·米勒(导演);改编自迈克尔·刘易斯2003年同名著作戏剧化再现了奥克兰运动家队的比利·比恩与分析师保罗·德波德斯塔如何借助比尔·詹姆斯的赛伯计量学,用统计分析在棒球界最小的预算之一上打造出一支具备竞争力的阵容。
格子越深,表示该主题在这项指标上越高。
低高
与“搭建AI模型”的刻板印象不同,多数工作日的时间分布在编写SQL查询和Python代码以提取并清洗数据、运行统计检验或训练模型,以及把结果转化成非技术利益相关者能够采取行动的图表或备忘录上。从业者调查一致表明,数据清洗与准备大约占用了总工作时间的一半甚至更多。
不需要。与医学或法律不同,这个领域没有执业资格证,也没有唯一必需的学位;统计学、计算机科学、数学或相关量化领域的学士或硕士学位是最常见的路径,而一份扎实的真实项目作品集,往往比具体学历更受雇主看重。博士学位在研究密集型或应用机器学习岗位中更为常见。
并不完全是。它大量借鉴统计学——费舍尔的实验设计、图基的探索性分析——但又加入了传统统计学系很少教授的编程、数据库工程与机器学习。威廉·S·克利夫兰在2001年提出这个术语,正是为了描述这个建立在统计学之上、而非取代统计学的、计算密集型的扩大版学科。
常规部分已经暴露在风险之中:AutoML工具能够拟合并调优标准模型,AI助手编写SQL查询、初稿探索性图表和样板管道代码的速度都比人快。尚未被自动化的,是构思出正确的问题、判断一个规律究竟有意义还是伪相关,以及为建立在结果之上的决策承担责任。
各国及资历差异很大。美国劳工统计局公布,2023年数据科学家这一职业的年薪中位数约为10.8万美元,初级分析师起薪往往接近7万至9.5万美元,而大型科技公司的资深或首席数据科学家算上股权的总薪酬可达20万至40万美元甚至更高。
数据分析师通常用现有数据和仪表盘回答已界定的业务问题;数据科学家构建新的统计模型和预测分析,处理的数据往往更杂乱;机器学习工程师则把模型从笔记本中取出,让它在生产环境中大规模、可靠地运行。三者的界限一直在模糊,很多人在职业生涯中会在这三者之间不断转换。
流行文化大体上跳过了统计学家,径直奔向了更具戏剧性的量化分析师或算法形象——数据科学家的公众形象,更多来自《点球成金》里的棒球分析师和《大空头》里预见危机的量化分析师,而不是来自任何真正在做在职数据科学家日常工作的人。
在这个领域内部,其文化建立在公开的竞技性基准测试、不动声色的统计学圈内笑话,以及一种文档格式——模型卡(model card)——之上,它把“如实说明模型的局限性”变成了一项常规的职业习惯,而不是事后补充。
各时代该职业的地位,以0–100表示。
早期的统计工作大多由文员、业余改革者以及像南丁格尔这样的自学成才者完成;这些工作有用,偶尔也具影响力,但本身很少享有声望。
皮尔逊、费舍尔与戈塞特把统计学专业化为一门拥有自己期刊与大学院系的学术学科,赢得了学界的尊重,但对更广泛的公众来说几乎仍不可见。
随着大型机计算的普及,“数据处理”人员与统计学家主要被视为不可或缺却毫不光鲜的企业后台支持,鲜少出现在高管决策场合。
克利夫兰2001年的学术提议几乎没有引起公众注意,但Netflix在2006至2009年间举办的百万美元推荐算法竞赛,以及2008年LinkedIn与Facebook创造出“data scientist”这一称呼,开始在科技行业内部引起关注。
《哈佛商业评论》2012年10月“最性感的工作”这一说法,引发了一波招聘与声望热潮;到2020年代,这个职位名称已分裂为更专精的角色,昔日那种独一无二的光环有所减退,但薪酬与需求依然强劲。
戏剧化再现了奥克兰运动家队的比利·比恩与分析师保罗·德波德斯塔如何借助比尔·詹姆斯的赛伯计量学,用统计分析在棒球界最小的预算之一上打造出一支具备竞争力的阵容。
追踪了几位分析师如何仔细研究抵押贷款市场数据,在几乎所有人都还不相信这些数字之前,就预见到了2008年的金融危机。
一位数学家用统计分析与模式识别,帮助身为FBI探员的哥哥破案,让美国主流电视观众第一次接触到把应用数学当作侦查工作的概念。
这部英国选集剧反复设想数据画像与预测性评分被推向令人不安的极端,尤以2016年那集《急转直下》最为直接,塑造了公众对算法给人打分排名的焦虑。
讲述了凯瑟琳·约翰逊、多萝西·沃恩与玛丽·杰克逊——三位黑人女数学家——的真实故事,在电子计算机接手这项工作之前,她们的手工计算支撑起了1962年“水星计划”的轨道任务。
追踪了麻省理工学院研究者乔伊·布奥兰维尼的发现——人脸识别系统对肤色较深的面孔误识率远高于其他人群——把一项技术性的数据偏见发现变成了公众对算法公平性的一场广泛反思。
2010年上线的Kaggle公开机器学习竞赛,在比赛全程用一个可见的排行榜为参赛者排名,比赛结束时再根据隐藏的测试集揭晓最终名次——参赛者称这一刻为“洗牌”,因为过度拟合公开排行榜可能让一支团队一夜之间掉下数十名。
遵循谷歌玛格丽特·米切尔及其同事在2018年一篇论文中提出的做法,团队越来越多地在模型发布前用一份简短的“模型卡”记录其预期用途、训练数据与已知局限——这被视为一项职业义务,而非可有可无的附加项。
通过实时滚动展示Jupyter notebook中的单元格与图表来呈现探索性发现,而不是使用精美的幻灯片,仍是数据科学家与队友及利益相关者分享早期成果的默认方式。
这一切都没有解决这个领域最古老的争议:“数据科学”究竟是一门真正的新学科,还是套着更好卖名字的旧统计与计算工作。从业者自己也在争论这个问题,往往就发生在同一个团队内部。
自格朗特1662年的死亡率统计表以来,始终不变的是这个基本动作:把一堆记录变成有人可以据以行动的结论,并如实说明这个结论究竟在多大程度上得到了数据的支持。
不限同一领域,六项评分最接近的职业。
账簿的守护者:这门手艺古老到几乎发明了文字本身,如今却在与为自动化它而造的软件谈判。
抗AI 35 🗺️决定公司接下来该做什么、为什么要做——把顾客需求、商业目标和工程限制,整合成一份没有其他人能完全独自拥有的共同计划。
抗AI 50 💻写作,测试和维护了管理现代生活的代码——也是最早观看AI将自己的日常工作自动化的职业之一.
抗AI 35 📣创造需求的专业人士——从庞贝古城墙上的广告、宝洁1931年那份品牌经理备忘录,到数字时代由竞价驱动的信息流。
抗AI 38 📦构建用于训练、部署、监控和治理生产环境中机器学习模型的系统。
抗AI 54 🔎研究人们如何使用产品,将观察到的行为、需求和挫折转化为团队可以设计的证据。
抗AI 69衍生并测试关于物质,能量,空间和时间的数学定律,从一个孤独的粉笔板到3000个作者的粒子对流器纸.
抗AI 65 🧬研究生命本身的科学家,从Linnaeus手工命名物种,到用CRISPR编辑基因组,仍然在针对一个活生物体测试每一种想法.
抗AI 64 🧪亲手制造并测量物质本身的科学家——从塔普提在巴比伦蒸馏香水的年代到今天的机器人实验室,仍是那个判断谱图意味着什么的人。
抗AI 70 🔭丈量宇宙的科学家,从巴比伦泥板到空间望远镜,始终要判断数据中的哪一次闪烁是一项发现。
抗AI 70 🧮从巴比伦文士到菲尔兹奖得主,再到AI辅助证明:这门职业把难题一个定理接一个定理地变成永恒的确定性。
抗AI 70 🧿构建、测量和控制利用量子态进行计算、传感、通信和材料研究的设备。
抗AI 78 🧫使用临床、试验和卫生系统数据生成可靠的证据,以实现更安全的护理、研究和运营决策。
抗AI 68