点球成金
贝内特·米勒(导演);根据迈克尔·刘易斯 2003 年出版的书戏剧化地讲述了奥克兰运动家队的比利·比恩和分析师保罗·德波德斯塔如何利用统计分析,利用比尔·詹姆斯的军刀计量学,在棒球预算最少的球队之一建立一支有竞争力的阵容。
格子越深,表示该主题在这项指标上越高。
低高
与“构建 AI 模型”的形象相反,大多数时间都是编写 SQL 查询和 Python 代码来提取和清理数据、运行统计测试或训练模型,以及将结果转换为非技术利益相关者可以采取行动的图表或备忘录。从业者调查一致认为数据清理和准备时间大约占总工作时间的一半或更多。
不需要。与医学或法律不同,没有执照或单一所需的学位;统计学、计算机科学、数学或相关定量领域的学士或硕士学位是最常见的途径,对雇主来说,强大的实际项目组合通常比确切的证书更重要。博士更常见于研究型或应用型机器学习职位。
不完全是。它大量借鉴了统计学——费舍尔的实验设计、图基的探索性分析——但增加了经典统计学系很少教授的编程、数据库工程和机器学习。威廉·S·克利夫兰 (William S. Cleveland) 在 2001 年提出了这个术语,专门用来描述这个领域的扩展、计算密集型版本,它建立在统计数据的基础上,而不是取代它。
常规结果已经暴露:AutoML 工具可以拟合和调整标准模型,AI 助手可以比人更快地编写 SQL 查询、初稿探索性图表和样板管道代码。没有自动化的是提出正确的问题,判断模式是否有意义或虚假,以及对基于结果的决策负责。
它因国家和资历的不同而有很大差异。美国劳工统计局预计,到 2023 年,临床数据科学家职业的年薪中位数约为 108,000 美元,而初级分析师的起薪通常接近 70,000 至 95,000 美元,大型科技公司的高级或首席临床数据科学家的股权总薪酬可达 200,000 至 400,000 美元或更多。
数据分析师通常使用现有数据和仪表板回答定义的业务问题;临床数据科学家通常根据更混乱的数据建立新的统计模型和预测分析;机器学习工程师从笔记本中取出模型,并使其在生产中大规模可靠地运行。界限不断模糊,许多人在职业生涯中在这三者之间摇摆不定。
流行文化大多直接跳过统计学家,转向更引人注目的量化或算法人物——临床数据科学家的公众形象更多地归功于《点球成金》的棒球分析师和《大空头》的危机预测量化,而不是任何从事临床数据科学家日常工作的人。
在该领域内,这种文化运行在竞争性的公共基准、面无表情的统计笑话和文档格式(模型卡)上,它将“诚实地面对模型的局限性”变成了一种常规的职业习惯,而不是事后的想法。
各时代该职业的地位,以0–100表示。
早期的统计工作主要是由职员、业余改革者和像南丁格尔这样自学成才的局外人完成的。有用且偶尔有影响力,但其本身却很少享有盛誉。
皮尔逊、费舍尔和戈塞特将统计学专业化为一门学科,拥有自己的期刊和大学院系,赢得了学术界的尊重,同时几乎不为广大公众所知。
随着大型机计算的普及,“数据处理”人员和统计人员主要被视为必不可少但乏味的企业后端支持,很少出现在执行决策中。
克利夫兰 2001 年的学术提案几乎没有引起公众关注,但 Netflix 2006 年至 2009 年的百万美元推荐算法奖以及 2008 年 LinkedIn 和 Facebook 创造的“临床数据科学家”开始在科技行业引起关注。
《哈佛商业评论》2012 年 10 月的“最性感工作”框架引发了招聘和声望的热潮;到了 2020 年代,尽管薪酬和需求仍然强劲,但该职位已分解为更专业的角色,并失去了一些独特的光芒。
戏剧化地讲述了奥克兰运动家队的比利·比恩和分析师保罗·德波德斯塔如何利用统计分析,利用比尔·詹姆斯的军刀计量学,在棒球预算最少的球队之一建立一支有竞争力的阵容。
几位分析师对抵押贷款市场数据进行了足够仔细的研究,他们在几乎所有人都相信这些数据之前就预测了 2008 年金融危机。
一位数学家帮助他的联邦调查局特工兄弟利用统计分析和模式识别解决犯罪问题,向美国主流电视观众介绍应用数学作为调查工作。
这部英国选集系列反复想象数据分析和预测评分走向令人不安的极端,最直接的是 2016 年的剧集“急剧下降”,造成了公众对算法排名的焦虑。
讲述了黑人女性数学家凯瑟琳·约翰逊 (Katherine Johnson)、多萝西·沃恩 (Dorothy Vaughan) 和玛丽·杰克逊 (Mary Jackson) 的真实故事,她们在 NASA 的手工计算支撑了 1962 年的水星轨道任务,之后电子计算机接管了这项工作。
麻省理工学院研究员 Joy Buolamwini 发现,面部识别系统更频繁地错误识别肤色较深的面孔,将技术数据偏见的发现转变为更广泛的公众对算法公平性的反思。
Kaggle 上举办的公共机器学习竞赛于 2010 年推出,在整个竞赛过程中,在一个可见的排行榜上对参赛者进行排名,然后在比赛结束时公布与隐藏测试集的最终排名——竞争对手将这一时刻称为“换血”,因为对公共排行榜的过度拟合可能会导致团队在一夜之间下降几十个名次。
遵循 Google 的 Margaret Mitchell 及其同事在 2018 年发表的论文中提出的做法,团队越来越多地在发布之前在简短的“模型卡”中记录模型的预期用途、训练数据和已知限制——将其视为一种专业义务,而不是一种可选的额外内容。
通过实时滚动 Jupyter 笔记本的单元格和图表(而不是精美的幻灯片)来呈现探索性发现,仍然是临床数据科学家与队友和利益相关者分享早期结果的默认方式。
所有这些都没有解决该领域最古老的紧张局势:“临床数据科学”是一门真正的新学科还是更古老的统计和计算工作,其名称更适合市场。从业者自己经常在同一团队内对此进行争论。
自 Graunt 发布 1662 个死亡率表以来,一直保持不变的是基本举措:将一堆记录转化为人们可以采取行动的主张,并诚实地了解数据实际支持该主张的程度。
不限同一领域,六项评分最接近的职业。
通过发现、防范和响应数字攻击,保护系统、数据与人员的安全。
抗AI 63 🌬️设计、建造和改进风能、太阳能、存储和电网系统,将可再生资源转化为可靠的电力。
抗AI 72 🦾设计那些能感知,决定和采取行动的机器 在物理世界里,困难的问题永远不是智能,而是世界本身.
抗AI 65 🌿领导战略、衡量和报告,帮助组织减少环境和社会危害,同时履行业务义务。
抗AI 66 🔌每台计算机,手机和武器内部的设计和编织晶体管,使用精确到只有地球上少数工厂能运行的机器.
抗AI 60 📦构建用于训练、部署、监控和治理生产环境中机器学习模型的系统。
抗AI 54衍生并测试关于物质,能量,空间和时间的数学定律,从一个孤独的粉笔板到3000个作者的粒子对流器纸.
抗AI 65 🧬研究生命本身的科学家,从Linnaeus手工命名物种,到用CRISPR编辑基因组,仍然在针对一个活生物体测试每一种想法.
抗AI 64 🧪亲手制造并测量物质本身的科学家——从塔普提在巴比伦蒸馏香水的年代到今天的机器人实验室,仍是那个判断谱图意味着什么的人。
抗AI 70 📊从数据中寻找规律、构建预测模型——一个2008年才出现的职位名称,建立在三个世纪计数、检验与可视化证据的传统之上。
抗AI 38 🔭丈量宇宙的科学家,从巴比伦泥板到空间望远镜,始终要判断数据中的哪一次闪烁是一项发现。
抗AI 70 🧮从巴比伦文士到菲尔兹奖得主,再到AI辅助证明:这门职业把难题一个定理接一个定理地变成永恒的确定性。
抗AI 70 🧿构建、测量和控制利用量子态进行计算、传感、通信和材料研究的设备。
抗AI 78