统计学
这个领域的直系祖先提供了假设检验、回归分析、实验设计等推断工具箱——这些大体上是数据科学从费舍尔、内曼及其后继者那里继承来的遗产。
格子越深,表示该主题在这项指标上越高。
低高
与“搭建AI模型”的刻板印象不同,多数工作日的时间分布在编写SQL查询和Python代码以提取并清洗数据、运行统计检验或训练模型,以及把结果转化成非技术利益相关者能够采取行动的图表或备忘录上。从业者调查一致表明,数据清洗与准备大约占用了总工作时间的一半甚至更多。
不需要。与医学或法律不同,这个领域没有执业资格证,也没有唯一必需的学位;统计学、计算机科学、数学或相关量化领域的学士或硕士学位是最常见的路径,而一份扎实的真实项目作品集,往往比具体学历更受雇主看重。博士学位在研究密集型或应用机器学习岗位中更为常见。
并不完全是。它大量借鉴统计学——费舍尔的实验设计、图基的探索性分析——但又加入了传统统计学系很少教授的编程、数据库工程与机器学习。威廉·S·克利夫兰在2001年提出这个术语,正是为了描述这个建立在统计学之上、而非取代统计学的、计算密集型的扩大版学科。
常规部分已经暴露在风险之中:AutoML工具能够拟合并调优标准模型,AI助手编写SQL查询、初稿探索性图表和样板管道代码的速度都比人快。尚未被自动化的,是构思出正确的问题、判断一个规律究竟有意义还是伪相关,以及为建立在结果之上的决策承担责任。
各国及资历差异很大。美国劳工统计局公布,2023年数据科学家这一职业的年薪中位数约为10.8万美元,初级分析师起薪往往接近7万至9.5万美元,而大型科技公司的资深或首席数据科学家算上股权的总薪酬可达20万至40万美元甚至更高。
数据分析师通常用现有数据和仪表盘回答已界定的业务问题;数据科学家构建新的统计模型和预测分析,处理的数据往往更杂乱;机器学习工程师则把模型从笔记本中取出,让它在生产环境中大规模、可靠地运行。三者的界限一直在模糊,很多人在职业生涯中会在这三者之间不断转换。
数据科学没有执业资格证,也没有任何专业机构来裁定谁有资格使用这个头衔——这既是这个领域最大的机会,也是它最大的质量问题,因为“data scientist”这个头衔,从高级统计研究到常规电子表格报表的工作都在用。
尽管如此,实践中还是形成了一条相当一致的路径:一个量化方向的本科学位,越来越多地再加一个硕士学位,一份真实项目的作品集,以及一场围绕SQL、统计学与带回家做的案例分析构建起来的技术面试——这场面试实际上就是这个领域真正的、非正式的把关考试。
攻读统计学、计算机科学、数学、经济学或相关量化领域的学位,最好能有课程或项目把所学应用到真实数据上。
门槛大学录取,并修完以微积分与概率论为基础的课程。
实习、Kaggle竞赛、研究助理工作,或是一个带有公开GitHub仓库的自主项目——这些才是雇主在成绩单之外真正寻找的证据。
门槛拿到一份实习,或独立完成一个值得展示的项目。
攻读数据科学、统计学或相关领域的专门硕士学位,如今在大型雇主中已足够普遍,即便没有明文要求,也起到了软性门槛的作用。
门槛研究生录取,通常要求本科量化课程成绩优异。
早期岗位更偏重数据清洗、仪表盘搭建与范围明确的分析,而非开放式建模,借此打下后续工作所依赖的SQL能力与业务语境理解。
门槛一场围绕SQL、统计学与带回家做的案例分析构建的技术面试。
随着这个头衔的通才版本在规模化场景下越来越难以维持,多数数据科学家会转向某一条赛道——机器学习建模、因果推断与实验设计,或分析工程。
门槛一份可衡量业务影响的、已上线的分析或模型的过往记录。
为一个团队或产品领域设定分析议程,指导初级同事,评判标准是一系列工作所影响的决策,而不是任何单一模型。
门槛内部晋升委员会评审,权衡的是实际展现出的影响力,而不仅仅是技术产出。
美国的数据科学或统计学硕士项目,学费总额通常在3万至8万美元之间,具体取决于学校,不过佐治亚理工在线分析硕士等部分公立及在线项目的费用要低得多。训练营替代方案通常为期三到六个月,费用在1万至2万美元。在美国以外,许多欧洲硕士项目对本国或欧盟学生几乎免收学费,但生活成本,以及非欧盟学生更高的国际生学费,仍需考虑在内。
提供了假设检验、回归分析、实验设计等推断工具箱——这些大体上是数据科学从费舍尔、内曼及其后继者那里继承来的遗产。
数据库、算法,以及足以写出生产级代码、而不只是一次性分析脚本的软件工程能力,正日益成为区分优秀候选人与平庸候选人的关键。
线性代数、概率论与优化,正是机器学习方法真正的书写语言,其用处远不止于用默认参数拟合模型。
计量经济学在因果推断与观测数据分析方面的训练可以直接迁移过来,许多在职数据科学家,尤其是金融与科技行业的从业者,都持有经济学学位。
物理学出身的人往往具备很强的数值直觉,也习惯应对杂乱的真实世界测量误差,转入数据科学领域比学位名称所暗示的要容易得多。
其统计学系与硅谷招聘有着深厚联系,也是一些使用最广泛的统计学习入门教材和在线课程的诞生地。
其信息学院的信息与数据科学硕士项目,以及颇具影响力的本科课程《数据科学基础》,共同帮助定义了一套专门的数据科学课程体系。
其强大的统计学、机器学习与数据工程项目,为瑞士密集分布的制药、金融与科技雇主输送人才。
拥有深厚的统计学与机器学习研究实力,毕业生经常被伦敦以金融与科技驱动的数据团队招募。
该地区领先的数据科学与分析项目,为东南亚快速增长的银行业与科技行业输送人才。
印度选拔最严格的工程院校之一,其毕业生既进入本土科技企业,也进入跨国公司设在印度的大型数据团队。
顶尖的计算机科学与统计学项目,为中国各大科技公司输送数据与机器学习人才。
德国领先的项目,融合数据工程、统计学与机器学习,与该国汽车与工业领域的数据科学招聘紧密相连。
并非法律要求,但已是这个领域最接近默认标配的资历——在大型雇主的招聘启事中,越来越多地被列为优先或必需条件。
一项与厂商无关的分析认证,需要通过考试并具备经过核实的工作经验,自2013年起由运筹学与管理科学学会颁发。
一项云厂商认证(DP-100考试),证明具备在微软Azure平台上构建并部署机器学习模型的能力,常见于使用Azure的招聘启事中。
一项通过Coursera提供、广受欢迎的入门级资历,常被转行者用来证明自己具备基础的SQL、电子表格与可视化技能,而无需完整学位。
为期数月的高强度课程教授Python、SQL与应用统计,用一套快节奏、以项目为核心的课程外加作品集来替代完整学位——这条路径在小公司与初创企业中比在大型研究密集型雇主中更受认可。
一小部分自学成才的从业者,通过Kaggle竞赛排名或广泛使用的开源数据工具建立起公开的履历,偶尔能获得那些看重实际能力而非正式学历的公司的面试机会。
不限同一领域,六项评分最接近的职业。
账簿的守护者:这门手艺古老到几乎发明了文字本身,如今却在与为自动化它而造的软件谈判。
抗AI 35 🗺️决定公司接下来该做什么、为什么要做——把顾客需求、商业目标和工程限制,整合成一份没有其他人能完全独自拥有的共同计划。
抗AI 50 💻写作,测试和维护了管理现代生活的代码——也是最早观看AI将自己的日常工作自动化的职业之一.
抗AI 35 📣创造需求的专业人士——从庞贝古城墙上的广告、宝洁1931年那份品牌经理备忘录,到数字时代由竞价驱动的信息流。
抗AI 38 📦构建用于训练、部署、监控和治理生产环境中机器学习模型的系统。
抗AI 54 🔎研究人们如何使用产品,将观察到的行为、需求和挫折转化为团队可以设计的证据。
抗AI 69衍生并测试关于物质,能量,空间和时间的数学定律,从一个孤独的粉笔板到3000个作者的粒子对流器纸.
抗AI 65 🧬研究生命本身的科学家,从Linnaeus手工命名物种,到用CRISPR编辑基因组,仍然在针对一个活生物体测试每一种想法.
抗AI 64 🧪亲手制造并测量物质本身的科学家——从塔普提在巴比伦蒸馏香水的年代到今天的机器人实验室,仍是那个判断谱图意味着什么的人。
抗AI 70 🔭丈量宇宙的科学家,从巴比伦泥板到空间望远镜,始终要判断数据中的哪一次闪烁是一项发现。
抗AI 70 🧮从巴比伦文士到菲尔兹奖得主,再到AI辅助证明:这门职业把难题一个定理接一个定理地变成永恒的确定性。
抗AI 70 🧿构建、测量和控制利用量子态进行计算、传感、通信和材料研究的设备。
抗AI 78 🧫使用临床、试验和卫生系统数据生成可靠的证据,以实现更安全的护理、研究和运营决策。
抗AI 68