在建模之前查看数据
在拟合任何东西之前绘制原始分布、散点图和简单的摘要——这种习惯可以捕获损坏的数据、单位错误和异常值,否则模型会悄悄吸收和隐藏。
格子越深,表示该主题在这项指标上越高。
低高
与“构建 AI 模型”的形象相反,大多数时间都是编写 SQL 查询和 Python 代码来提取和清理数据、运行统计测试或训练模型,以及将结果转换为非技术利益相关者可以采取行动的图表或备忘录。从业者调查一致认为数据清理和准备时间大约占总工作时间的一半或更多。
不需要。与医学或法律不同,没有执照或单一所需的学位;统计学、计算机科学、数学或相关定量领域的学士或硕士学位是最常见的途径,对雇主来说,强大的实际项目组合通常比确切的证书更重要。博士更常见于研究型或应用型机器学习职位。
不完全是。它大量借鉴了统计学——费舍尔的实验设计、图基的探索性分析——但增加了经典统计学系很少教授的编程、数据库工程和机器学习。威廉·S·克利夫兰 (William S. Cleveland) 在 2001 年提出了这个术语,专门用来描述这个领域的扩展、计算密集型版本,它建立在统计数据的基础上,而不是取代它。
常规结果已经暴露:AutoML 工具可以拟合和调整标准模型,AI 助手可以比人更快地编写 SQL 查询、初稿探索性图表和样板管道代码。没有自动化的是提出正确的问题,判断模式是否有意义或虚假,以及对基于结果的决策负责。
它因国家和资历的不同而有很大差异。美国劳工统计局预计,到 2023 年,临床数据科学家职业的年薪中位数约为 108,000 美元,而初级分析师的起薪通常接近 70,000 至 95,000 美元,大型科技公司的高级或首席临床数据科学家的股权总薪酬可达 200,000 至 400,000 美元或更多。
数据分析师通常使用现有数据和仪表板回答定义的业务问题;临床数据科学家通常根据更混乱的数据建立新的统计模型和预测分析;机器学习工程师从笔记本中取出模型,并使其在生产中大规模可靠地运行。界限不断模糊,许多人在职业生涯中在这三者之间摇摆不定。
人们普遍认为临床数据科学家构建巧妙的预测模型是真实的,但并不完整。从业者调查和第一手资料一致描述了一项工作,即查找、清理和重塑混乱的数据比大多数人想象的建模步骤花费更多的时间。
该领域内传承的技巧不再是记住特定的算法,而是更多地关于纪律性的怀疑态度:在信任任何模型之前查看数据,检查某个模式是否在子组中成立,以及知道何时对利益相关者的问题的诚实答案是数据不能支持某个模式。
假设检验、回归以及理解 p 值或置信区间的实际含义——工作中其他一切的推理基础。
编写足够流畅的代码来大规模提取、清理和转换数据,而不仅仅是在笔记本中构建分析原型,而无需再次运行。
将混乱、不一致的真实数据(缺失值、重复记录、不匹配的格式)转变为模型或图表实际可以使用的数据。
选择、训练和验证适合问题的模型,并了解简单的回归何时击败复杂的神经网络。
将统计结果转化为非技术主管可以采取行动的图表、备忘录或建议,而不会过度简化或掩盖真正的不确定性。
了解指标在特定业务或科学领域的实际含义,以便分析回答实际提出的问题。
检查隔夜管道运行和关键指标仪表板,并与团队就当天的优先事项进行简短同步。
针对数据仓库编写 SQL 查询、连接和重塑表以及处理缺失或不一致的值 — 通常是工作日中最大的单个块。
真正的休息,通常是在非正式的场合,跨团队的问题在到达预定会议之前提出。
构建或完善统计模型,运行实验的显着性测试,或深入研究指标变化的原因。
向产品或业务团队展示调查结果,审查 A/B 测试的结果,或在受到质疑时捍卫分析的假设。
个人时间,除了产品发布或季度业务回顾之外,晚上可以吸收最后一刻的分析请求。
从业者真正口耳相传的技艺——不是鸡汤。
在拟合任何东西之前绘制原始分布、散点图和简单的摘要——这种习惯可以捕获损坏的数据、单位错误和异常值,否则模型会悄悄吸收和隐藏。
一旦数据按相关类别划分,总体趋势可能会完全逆转——这种模式被称为“辛普森悖论”,以统计学家爱德华·H·辛普森 1951 年发表的一篇论文命名。
根据相同的保留数据反复检查性能,然后调整模型,悄悄地将信息从该数据泄漏到模型中——仅接触一次就可以保持最终结果的真实性。
实际项目始终运行接近 80% 的数据准备和 20% 的建模,而不是相反 - 围绕相反的假设规划时间表是项目延迟的常见方式。
基线(有时只是一条规则或线性模型)阐明了更复杂的模型实际上增加了多少,并且通常足以单独发布。
令人惊讶的相关性往往是隐藏的第三个变量的产物,而不是真正的发现——在给出结果之前积极寻找其他可以解释它的东西。
用于数据操作和经典机器学习的主导语言,其中 pandas 用于表格数据,scikit-learn 用于标准建模算法。
用于从关系数据仓库和云数据仓库(Snowflake、BigQuery、Redshift)中提取数据的查询语言,大多数公司的数据实际上都存放在这些数据仓库中。
用于探索性分析的标准交互式环境,让临床数据科学家可以在同一文档中运行代码、查看图表并做笔记。
商业智能仪表板工具用于将完成的分析转变为非技术利益相关者无需编写代码即可探索和监控的内容。
代码的版本控制,越来越多的模型的版本控制,以及存储数据和以笔记本电脑无法处理的规模运行训练作业的云基础设施。
运行许多统计比较并仅报告超过显着性阈值的比较会产生无法复制的错误发现 - 一种被称为 p-hacking 的有据可查的故障模式。
意外地包含对预测结果进行编码的功能会产生不切实际的强大离线结果,一旦模型在真正看不见的生产数据上运行,这些结果就会崩溃。
一个经过精心调整的机器学习模型解决了一个简单的 SQL 查询或电子表格公式就能回答的问题,同样会浪费精力,并且可能会错过实际的业务问题。
不限同一领域,六项评分最接近的职业。
通过发现、防范和响应数字攻击,保护系统、数据与人员的安全。
抗AI 63 🌬️设计、建造和改进风能、太阳能、存储和电网系统,将可再生资源转化为可靠的电力。
抗AI 72 🦾设计那些能感知,决定和采取行动的机器 在物理世界里,困难的问题永远不是智能,而是世界本身.
抗AI 65 🌿领导战略、衡量和报告,帮助组织减少环境和社会危害,同时履行业务义务。
抗AI 66 🔌每台计算机,手机和武器内部的设计和编织晶体管,使用精确到只有地球上少数工厂能运行的机器.
抗AI 60 📦构建用于训练、部署、监控和治理生产环境中机器学习模型的系统。
抗AI 54衍生并测试关于物质,能量,空间和时间的数学定律,从一个孤独的粉笔板到3000个作者的粒子对流器纸.
抗AI 65 🧬研究生命本身的科学家,从Linnaeus手工命名物种,到用CRISPR编辑基因组,仍然在针对一个活生物体测试每一种想法.
抗AI 64 🧪亲手制造并测量物质本身的科学家——从塔普提在巴比伦蒸馏香水的年代到今天的机器人实验室,仍是那个判断谱图意味着什么的人。
抗AI 70 📊从数据中寻找规律、构建预测模型——一个2008年才出现的职位名称,建立在三个世纪计数、检验与可视化证据的传统之上。
抗AI 38 🔭丈量宇宙的科学家,从巴比伦泥板到空间望远镜,始终要判断数据中的哪一次闪烁是一项发现。
抗AI 70 🧮从巴比伦文士到菲尔兹奖得主,再到AI辅助证明:这门职业把难题一个定理接一个定理地变成永恒的确定性。
抗AI 70 🧿构建、测量和控制利用量子态进行计算、传感、通信和材料研究的设备。
抗AI 78