构思正确的问题
84把一个模糊的业务或科学问题转化为一个具体、可检验的问题,需要自动化工具自己无法获取的组织与领域背景。
格子越深,表示该主题在这项指标上越高。
低高
与“搭建AI模型”的刻板印象不同,多数工作日的时间分布在编写SQL查询和Python代码以提取并清洗数据、运行统计检验或训练模型,以及把结果转化成非技术利益相关者能够采取行动的图表或备忘录上。从业者调查一致表明,数据清洗与准备大约占用了总工作时间的一半甚至更多。
不需要。与医学或法律不同,这个领域没有执业资格证,也没有唯一必需的学位;统计学、计算机科学、数学或相关量化领域的学士或硕士学位是最常见的路径,而一份扎实的真实项目作品集,往往比具体学历更受雇主看重。博士学位在研究密集型或应用机器学习岗位中更为常见。
并不完全是。它大量借鉴统计学——费舍尔的实验设计、图基的探索性分析——但又加入了传统统计学系很少教授的编程、数据库工程与机器学习。威廉·S·克利夫兰在2001年提出这个术语,正是为了描述这个建立在统计学之上、而非取代统计学的、计算密集型的扩大版学科。
常规部分已经暴露在风险之中:AutoML工具能够拟合并调优标准模型,AI助手编写SQL查询、初稿探索性图表和样板管道代码的速度都比人快。尚未被自动化的,是构思出正确的问题、判断一个规律究竟有意义还是伪相关,以及为建立在结果之上的决策承担责任。
各国及资历差异很大。美国劳工统计局公布,2023年数据科学家这一职业的年薪中位数约为10.8万美元,初级分析师起薪往往接近7万至9.5万美元,而大型科技公司的资深或首席数据科学家算上股权的总薪酬可达20万至40万美元甚至更高。
数据分析师通常用现有数据和仪表盘回答已界定的业务问题;数据科学家构建新的统计模型和预测分析,处理的数据往往更杂乱;机器学习工程师则把模型从笔记本中取出,让它在生产环境中大规模、可靠地运行。三者的界限一直在模糊,很多人在职业生涯中会在这三者之间不断转换。
数据科学在AI这个故事里处于一个不寻常的位置:许多正在重塑这个行业的工具——自动机器学习、自然语言转SQL、AI辅助制图——很大程度上正是由数据科学家和机器学习研究者自己打造出来的,如今又被用来对准他们自己日常工作的一部分。
这种暴露是真实且不均衡的。这份工作中常规、界定清晰的部分——取数、运行一个标准模型、生成一份初稿图表——AI工具做起来速度已相当可观。真正抗拒自动化的部分,与其说是写代码,不如说是判断什么问题值得去问,以及一个答案是否值得信任。
数据科学中相当一部分常规工作——SQL查询、探索性制图、用AutoML拟合标准模型、编写样板管道代码——如今已经可以自动化或借助AI完成,且这一比例还在快速增长。抗拒自动化的,是把一个模糊的业务问题构建成一个可检验的问题、判断一个结果究竟是真实的还是统计假象,以及当一个模型在现实世界中的决策出错时承担责任。
按任务计分,而非头衔。越低越安全。
AI难以取代的职业 →把一个模糊的业务或科学问题转化为一个具体、可检验的问题,需要自动化工具自己无法获取的组织与领域背景。
分辨一个真实的效应与噪声、数据泄漏假象或幸运的训练-测试划分,正是自动化流程最不擅长应用到自身输出上的那种怀疑性判断。
总要有人为一个拒绝了贷款、标记了病人或给产品定错价格的模型负责——这份责任无法转移给产出那个数字的工具。
让一个反直觉或不受欢迎的发现真正被采纳并付诸行动,靠的是与人的信任、信誉和协商,而不仅仅是一份正确的分析。
为一个新问题选择合适的自然实验、对照组或因果推断策略,更接近创造性判断,而非对过往分析进行模式匹配。
自然语言转SQL工具如今已能处理大量此前需要数据科学家亲自介入的简单取数请求。
自动化探索性分析工具能在数秒内从一份原始数据集生成分布图、相关性摘要与基础图表。
对于定义明确、标注良好的问题,AutoML平台能在几乎无人干预的情况下选择、训练并调优梯度提升、逻辑回归等常规模型。
如今用AI编程助手生成一段标准的数据转换或加载脚本再审阅,往往比从零开始编写更快。
这份工作中越来越大的一部分,是设定一个自动化流程该去尝试什么、并核实其输出,而不是亲手编写每一条查询和每一个模型。
分析工程、机器学习工程与产品分析越来越多地成为独立的职位名称,各自吸纳了十年前单一“数据科学家”头衔所被期待涵盖的一部分工作。
随着在已有数据中发现规律变得更容易自动化,设计一个可信实验或因果分析这项更难的技能,其价值不降反升。
无代码与AutoML工具让非专业人士也能自行完成基础分析,把专职数据科学家推向那些这类工具无法处理的更难、更模糊的问题。
构建并维护数据转换管道——常使用dbt等工具——为仪表盘与模型提供数据,处于数据工程与数据分析之间。
把模型从研究用的笔记本中取出来,让它在生产系统中被监控、可靠且大规模地运行。
负责一个数据或AI驱动功能的路线图,把业务目标转化为数据团队实际应该构建的东西。
在模型及其背后的数据被允许上线之前,审计其偏见、公平性与合规性。
三个可逆透镜:增强、替代切片、新缝隙。教学标记,非预测。
保留岗位;AI 加速草稿、分诊或调研,判断与责任仍在人。
狭窄任务堆可能先压缩,相邻手艺反而增长。
在需信任 AI 输出的受监管场景,可能出现监督、集成与领域质检角色。
未来十年,对能把数据变成可信决策的人才的需求极有可能保持强劲,但这份工作的入门版本已经在变化:纯粹靠手工编写常规查询和初稿图表的岗位会越来越少。
长期来看,优势最明显地属于那些能构思出真正有用的问题、能察觉AI生成的结果何时悄悄出错、并能在持怀疑态度的利益相关者面前为一项建议承担责任的数据科学家——这正是自费舍尔的作物试验以来这个领域一直需要的判断力,如今被用在一个越来越多由自身草拟初稿的工作流程之上。
不限同一领域,六项评分最接近的职业。
账簿的守护者:这门手艺古老到几乎发明了文字本身,如今却在与为自动化它而造的软件谈判。
抗AI 35 🗺️决定公司接下来该做什么、为什么要做——把顾客需求、商业目标和工程限制,整合成一份没有其他人能完全独自拥有的共同计划。
抗AI 50 💻写作,测试和维护了管理现代生活的代码——也是最早观看AI将自己的日常工作自动化的职业之一.
抗AI 35 📣创造需求的专业人士——从庞贝古城墙上的广告、宝洁1931年那份品牌经理备忘录,到数字时代由竞价驱动的信息流。
抗AI 38 📦构建用于训练、部署、监控和治理生产环境中机器学习模型的系统。
抗AI 54 🔎研究人们如何使用产品,将观察到的行为、需求和挫折转化为团队可以设计的证据。
抗AI 69衍生并测试关于物质,能量,空间和时间的数学定律,从一个孤独的粉笔板到3000个作者的粒子对流器纸.
抗AI 65 🧬研究生命本身的科学家,从Linnaeus手工命名物种,到用CRISPR编辑基因组,仍然在针对一个活生物体测试每一种想法.
抗AI 64 🧪亲手制造并测量物质本身的科学家——从塔普提在巴比伦蒸馏香水的年代到今天的机器人实验室,仍是那个判断谱图意味着什么的人。
抗AI 70 🔭丈量宇宙的科学家,从巴比伦泥板到空间望远镜,始终要判断数据中的哪一次闪烁是一项发现。
抗AI 70 🧮从巴比伦文士到菲尔兹奖得主,再到AI辅助证明:这门职业把难题一个定理接一个定理地变成永恒的确定性。
抗AI 70 🧿构建、测量和控制利用量子态进行计算、传感、通信和材料研究的设备。
抗AI 78 🧫使用临床、试验和卫生系统数据生成可靠的证据,以实现更安全的护理、研究和运营决策。
抗AI 68