构思正确的问题
84把一个模糊的业务或科学问题转化为一个具体、可检验的问题,需要自动化工具自己无法获取的组织与领域背景。
数据科学家 · 从数据中寻找规律、构建预测模型——一个2008年才出现的职位名称,建立在三个世纪计数、检验与可视化证据的传统之上。
数据科学在AI这个故事里处于一个不寻常的位置:许多正在重塑这个行业的工具——自动机器学习、自然语言转SQL、AI辅助制图——很大程度上正是由数据科学家和机器学习研究者自己打造出来的,如今又被用来对准他们自己日常工作的一部分。
这种暴露是真实且不均衡的。这份工作中常规、界定清晰的部分——取数、运行一个标准模型、生成一份初稿图表——AI工具做起来速度已相当可观。真正抗拒自动化的部分,与其说是写代码,不如说是判断什么问题值得去问,以及一个答案是否值得信任。
数据科学中相当一部分常规工作——SQL查询、探索性制图、用AutoML拟合标准模型、编写样板管道代码——如今已经可以自动化或借助AI完成,且这一比例还在快速增长。抗拒自动化的,是把一个模糊的业务问题构建成一个可检验的问题、判断一个结果究竟是真实的还是统计假象,以及当一个模型在现实世界中的决策出错时承担责任。
Scored from the tasks, not the job title. Lower is safer.
Jobs AI cannot take →把一个模糊的业务或科学问题转化为一个具体、可检验的问题,需要自动化工具自己无法获取的组织与领域背景。
分辨一个真实的效应与噪声、数据泄漏假象或幸运的训练-测试划分,正是自动化流程最不擅长应用到自身输出上的那种怀疑性判断。
总要有人为一个拒绝了贷款、标记了病人或给产品定错价格的模型负责——这份责任无法转移给产出那个数字的工具。
让一个反直觉或不受欢迎的发现真正被采纳并付诸行动,靠的是与人的信任、信誉和协商,而不仅仅是一份正确的分析。
为一个新问题选择合适的自然实验、对照组或因果推断策略,更接近创造性判断,而非对过往分析进行模式匹配。
自然语言转SQL工具如今已能处理大量此前需要数据科学家亲自介入的简单取数请求。
自动化探索性分析工具能在数秒内从一份原始数据集生成分布图、相关性摘要与基础图表。
对于定义明确、标注良好的问题,AutoML平台能在几乎无人干预的情况下选择、训练并调优梯度提升、逻辑回归等常规模型。
如今用AI编程助手生成一段标准的数据转换或加载脚本再审阅,往往比从零开始编写更快。
这份工作中越来越大的一部分,是设定一个自动化流程该去尝试什么、并核实其输出,而不是亲手编写每一条查询和每一个模型。
分析工程、机器学习工程与产品分析越来越多地成为独立的职位名称,各自吸纳了十年前单一“数据科学家”头衔所被期待涵盖的一部分工作。
随着在已有数据中发现规律变得更容易自动化,设计一个可信实验或因果分析这项更难的技能,其价值不降反升。
无代码与AutoML工具让非专业人士也能自行完成基础分析,把专职数据科学家推向那些这类工具无法处理的更难、更模糊的问题。
构建并维护数据转换管道——常使用dbt等工具——为仪表盘与模型提供数据,处于数据工程与数据分析之间。
把模型从研究用的笔记本中取出来,让它在生产系统中被监控、可靠且大规模地运行。
负责一个数据或AI驱动功能的路线图,把业务目标转化为数据团队实际应该构建的东西。
在模型及其背后的数据被允许上线之前,审计其偏见、公平性与合规性。
未来十年,对能把数据变成可信决策的人才的需求极有可能保持强劲,但这份工作的入门版本已经在变化:纯粹靠手工编写常规查询和初稿图表的岗位会越来越少。
长期来看,优势最明显地属于那些能构思出真正有用的问题、能察觉AI生成的结果何时悄悄出错、并能在持怀疑态度的利益相关者面前为一项建议承担责任的数据科学家——这正是自费舍尔的作物试验以来这个领域一直需要的判断力,如今被用在一个越来越多由自身草拟初稿的工作流程之上。