建模之前先看数据
在拟合任何模型之前,先绘制原始分布、散点图和简单的汇总统计——这个习惯能抓住数据错误、单位错误和异常值,否则模型会悄悄把它们吸收并掩盖起来。
格子越深,表示该主题在这项指标上越高。
低高
与“搭建AI模型”的刻板印象不同,多数工作日的时间分布在编写SQL查询和Python代码以提取并清洗数据、运行统计检验或训练模型,以及把结果转化成非技术利益相关者能够采取行动的图表或备忘录上。从业者调查一致表明,数据清洗与准备大约占用了总工作时间的一半甚至更多。
不需要。与医学或法律不同,这个领域没有执业资格证,也没有唯一必需的学位;统计学、计算机科学、数学或相关量化领域的学士或硕士学位是最常见的路径,而一份扎实的真实项目作品集,往往比具体学历更受雇主看重。博士学位在研究密集型或应用机器学习岗位中更为常见。
并不完全是。它大量借鉴统计学——费舍尔的实验设计、图基的探索性分析——但又加入了传统统计学系很少教授的编程、数据库工程与机器学习。威廉·S·克利夫兰在2001年提出这个术语,正是为了描述这个建立在统计学之上、而非取代统计学的、计算密集型的扩大版学科。
常规部分已经暴露在风险之中:AutoML工具能够拟合并调优标准模型,AI助手编写SQL查询、初稿探索性图表和样板管道代码的速度都比人快。尚未被自动化的,是构思出正确的问题、判断一个规律究竟有意义还是伪相关,以及为建立在结果之上的决策承担责任。
各国及资历差异很大。美国劳工统计局公布,2023年数据科学家这一职业的年薪中位数约为10.8万美元,初级分析师起薪往往接近7万至9.5万美元,而大型科技公司的资深或首席数据科学家算上股权的总薪酬可达20万至40万美元甚至更高。
数据分析师通常用现有数据和仪表盘回答已界定的业务问题;数据科学家构建新的统计模型和预测分析,处理的数据往往更杂乱;机器学习工程师则把模型从笔记本中取出,让它在生产环境中大规模、可靠地运行。三者的界限一直在模糊,很多人在职业生涯中会在这三者之间不断转换。
数据科学家搭建精巧预测模型的流行形象是真实的,但并不完整。从业者调查与第一手记述一致表明,这份工作中寻找、清洗与重塑杂乱数据所耗费的时间,远超多数人所想象的建模环节。
这个领域内部代代相传的手艺,与其说是背诵某个具体算法,不如说是一种有纪律的怀疑精神:在信任任何模型之前先看一眼数据本身,检查一个规律是否在各个子群体内依然成立,并清楚什么时候对利益相关者最诚实的回答是——数据支撑不了那个结论。
假设检验、回归分析,以及理解一个p值或置信区间究竟能说明什么——这份工作中其他一切都建立在这个推断基础之上。
写出足以在规模化场景下提取、清洗与转换数据的代码,而不只是在一个再也不用运行的笔记本里做个原型分析。
把杂乱、不一致的真实世界数据——缺失值、重复记录、不匹配的格式——变成模型或图表真正能用的东西。
为具体问题选择、训练并验证合适的模型,并清楚什么时候一个简单的回归就胜过一个精巧的神经网络。
把一个统计结果转化成图表、备忘录或建议,让非技术出身的高管能够据此行动,既不过度简化,也不掩盖真实的不确定性。
理解一个指标在具体业务或科学领域中真正的含义,从而让分析真正回答了原本被问到的问题。
审阅夜间管道运行情况与关键指标仪表盘,与团队简短同步当天的优先事项。
针对数据仓库编写SQL查询,连接并重塑表格,处理缺失或不一致的值——通常是一个工作日中最大的单一时段。
真正的休息时间,也常常是跨团队问题在被搬上正式会议之前,先在非正式场合被提出来的时候。
搭建或改进一个统计模型,运行一项实验的显著性检验,或深入探究某个指标为何发生变化。
向产品或业务团队展示发现,评审一项A/B测试的结果,或在质询下为一项分析的假设进行辩护。
属于个人的时间,除非临近产品发布或季度业务评审,此时晚上可能会突然收到临时分析请求。
从业者真正口耳相传的技艺——不是鸡汤。
在拟合任何模型之前,先绘制原始分布、散点图和简单的汇总统计——这个习惯能抓住数据错误、单位错误和异常值,否则模型会悄悄把它们吸收并掩盖起来。
一旦按某个相关类别拆分数据,整体趋势可能会完全反转——这种现象被称为辛普森悖论,得名于统计学家爱德华·H·辛普森1951年的一篇论文。
反复用同一份留出数据检验表现,再据此调整模型,会悄悄地把那份数据的信息泄漏进模型里——只碰一次,才能让最终结果保持诚实。
真实项目里,数据准备与建模的比例通常更接近80%比20%,而不是反过来——按相反的假设规划时间表,是项目延期的常见原因。
一个基线模型——有时甚至只是一条规则或一个线性模型——能够说明更复杂的模型究竟多带来了多少价值,而且它本身往往就足够好,可以直接上线。
一个出人意料的相关性,更常是某个隐藏的第三变量造成的假象,而非真正的发现——在展示结果之前,主动寻找还有什么能解释它。
数据处理与经典机器学习中占主导地位的语言,pandas用于处理表格数据,scikit-learn用于标准建模算法。
用于从关系型和云数据仓库——Snowflake、BigQuery、Redshift——中提取数据的查询语言,多数公司的数据实际就存放在那里。
探索性分析的标准交互环境,让数据科学家能在同一份文档中运行代码、查看图表并做笔记。
商业智能仪表盘工具,用于把一份完成的分析变成非技术利益相关者无需写代码就能探索与监控的东西。
代码、以及日益增多的模型的版本控制,再加上存放数据、运行超出笔记本电脑处理能力的训练任务的云基础设施。
进行大量统计比较、只报告其中越过显著性阈值的那一个,会产生无法复现的假发现——这是一种有据可查的失败模式,称为p值操纵。
无意中纳入了一个编码了预测结果本身的特征,会在离线阶段产生不切实际的优异结果,一旦模型运行在真正未见过的生产数据上就会崩溃。
用精心调优的机器学习模型去解决一个简单的SQL查询或电子表格公式本就能同样好地回答的问题,既浪费精力,也可能错过真正的业务问题。
不限同一领域,六项评分最接近的职业。
账簿的守护者:这门手艺古老到几乎发明了文字本身,如今却在与为自动化它而造的软件谈判。
抗AI 35 🗺️决定公司接下来该做什么、为什么要做——把顾客需求、商业目标和工程限制,整合成一份没有其他人能完全独自拥有的共同计划。
抗AI 50 💻写作,测试和维护了管理现代生活的代码——也是最早观看AI将自己的日常工作自动化的职业之一.
抗AI 35 📣创造需求的专业人士——从庞贝古城墙上的广告、宝洁1931年那份品牌经理备忘录,到数字时代由竞价驱动的信息流。
抗AI 38 📦构建用于训练、部署、监控和治理生产环境中机器学习模型的系统。
抗AI 54 🔎研究人们如何使用产品,将观察到的行为、需求和挫折转化为团队可以设计的证据。
抗AI 69衍生并测试关于物质,能量,空间和时间的数学定律,从一个孤独的粉笔板到3000个作者的粒子对流器纸.
抗AI 65 🧬研究生命本身的科学家,从Linnaeus手工命名物种,到用CRISPR编辑基因组,仍然在针对一个活生物体测试每一种想法.
抗AI 64 🧪亲手制造并测量物质本身的科学家——从塔普提在巴比伦蒸馏香水的年代到今天的机器人实验室,仍是那个判断谱图意味着什么的人。
抗AI 70 🔭丈量宇宙的科学家,从巴比伦泥板到空间望远镜,始终要判断数据中的哪一次闪烁是一项发现。
抗AI 70 🧮从巴比伦文士到菲尔兹奖得主,再到AI辅助证明:这门职业把难题一个定理接一个定理地变成永恒的确定性。
抗AI 70 🧿构建、测量和控制利用量子态进行计算、传感、通信和材料研究的设备。
抗AI 78 🧫使用临床、试验和卫生系统数据生成可靠的证据,以实现更安全的护理、研究和运营决策。
抗AI 68