李飞飞
李飞飞主导了ImageNet项目,其大规模标注数据集和基准测试改变了计算机视觉研究,并揭示了数据基础设施对机器学习的重要性。
ImageNet始于2006年,是一个按照WordNet分类体系组织数百万张标注图片的项目。它在2012年的竞赛成为一个转折点,一个深度神经网络大幅提升了成绩,加速了后来由MLOps团队处理的计算、数据与部署挑战。
“数据基础设施能在一种新算法出现之前,就先改变模型能做到什么。”
格子越深,表示该主题在这项指标上越高。
低高
机器学习运维工程师把机器学习实验转化为可重复、可监控的服务。他们构建数据和训练流水线,打包模型,将其部署到云端或边缘环境,追踪版本,监控性能,并制定回滚流程。在较小的团队中,他们也可能编写应用代码;在较大的团队中,他们运营一个供多个数据科学团队共用的平台。
数据科学家通常专注于问题界定、数据分析和模型开发。MLOps专注于让模型在长期使用中保持可复现、可部署和可观测。这种区分并非绝对:优秀的团队会在评估和数据质量上展开协作,而MLOps工程师也需要具备足够的机器学习知识,以理解一个模型在部署后可能如何失效。
不需要。计算机科学、工程或数据相关学位很常见,但实际的软件、云计算和数据平台经验,往往比高级研究学位更重要。开发新颖模型的岗位可能更看重研究生学历;而运营机器学习平台的岗位通常同样重视生产工程、基础设施和严谨的实验能力。
Python很常见,因为大多数机器学习生态系统都以它为基础。SQL对数据工作至关重要,而Docker、YAML和基础设施即代码的配置是日常工具。一些平台团队也会使用Go、Java、Scala或TypeScript。关键能力不是对某一种语言的忠诚,而是让流水线具备可测试性、可版本化和可观测性。
模型漂移是指一个已部署的模型因为外部世界、用户行为、输入或结果发生变化而变得不再那么有用。一个基于去年模式训练的反欺诈模型,可能会漏掉一种新型骗局。监控输入分布、预测质量和业务结果,有助于团队在一次未被察觉的性能下滑演变成有害决策之前,先发现漂移。
MLOps借鉴了DevOps的理念——自动化、版本控制、持续交付和共同责任——但增加了数据和模型方面的考量。即使应用代码没有变化,一个模型也可能因为训练数据发生变化而改变。团队必须对数据集进行版本管理,评估模型行为,管理实验,并像监控服务器健康状况一样监控预测质量。
MLOps没有单一的创始人,因为它是多个学科的交汇点。它的思想源头包括机器学习研究者、数据系统构建者、软件可靠性倡导者,以及那些坚持模型表现必须在真实世界中接受检验的人。
以下人物帮助创造了MLOps工程师所使用的理念和基础设施。他们的贡献从算法延伸到运营实践,他们的故事表明,部署一个模型是一项工程与社会决策,而不仅仅是一次训练运行。
“数据基础设施能在一种新算法出现之前,就先改变模型能做到什么。”
李飞飞主导了ImageNet项目,其大规模标注数据集和基准测试改变了计算机视觉研究,并揭示了数据基础设施对机器学习的重要性。
ImageNet始于2006年,是一个按照WordNet分类体系组织数百万张标注图片的项目。它在2012年的竞赛成为一个转折点,一个深度神经网络大幅提升了成绩,加速了后来由MLOps团队处理的计算、数据与部署挑战。
“数据基础设施能在一种新算法出现之前,就先改变模型能做到什么。”
迪恩与人合著了谷歌多篇基础性系统论文,并帮助领导了TensorFlow项目,把大规模分布式系统与实用的机器学习基础设施联系起来。
谷歌2016年将TensorFlow开源,为研究人员和生产工程师提供了一个描述和执行众多机器学习工作负载的通用框架。它的普及凸显出框架、工具和部署环境如何影响哪些想法能从研究走向产品。
“一个共享平台能把孤立的技术能力,转化为可重复的组织能力。”
科勒在概率建模方面做出了重要贡献,并联合创办了Coursera和Insitro,把机器学习研究与大型运营组织联系起来。
在斯坦福大学,科勒与人合著了教材《概率图模型》,为学生和从业者提供了一套系统化的不确定性与结构化预测词汇。她后来围绕在线教育和药物发现构建组织的工作,展示了围绕模型所需要的各种系统。
“一个模型的价值,取决于能够使用、测试并维持它的组织。”
鲁丁在可解释机器学习方面的工作,促使团队在需要解释的高风险场景中使用透明模型。
鲁丁认为,在高风险决策中,一个不透明模型再配上事后解释,往往是一种糟糕的替代方案,远不如从一开始就设计成可解释的模型。这一观点直接影响了MLOps的评估和模型审批实践。
“当一项决策深刻影响人时,可解释性是一项设计要求,而不是仪表盘的附加功能。”
克莱普曼关于分布式数据系统的著作,为工程师提供了一套关于复制、一致性和流处理的实用框架——这些正是可靠机器学习数据流水线的核心问题。
他2017年出版的《数据密集型应用系统设计》一书,把来之不易的分布式系统经验,转化为一本广受阅读的工程指南。MLOps工程师在构建训练和推理数据流时,面对的正是同样关于血缘、延迟、正确性和故障的问题。
“数据流水线是生产系统;要为分歧、延迟和故障而设计它们。”
托马斯联合创办了fast.ai及其非营利社区,强调实用的深度学习教育以及已部署模型带来的社会后果。
通过fast.ai的课程,托马斯及其合作者让许多身处顶尖研究实验室之外的学习者也能接受到实用的深度学习教育。她后来在问责制方面的倡导,进一步强化了部署团队必须衡量伤害、而不仅仅是准确率的理念。
“让一个系统更容易构建,并不能免除理解它会影响谁的责任。”
黄佳关于机器学习系统设计的写作与教学,为MLOps领域提供了关于数据分布、部署和监控的实用词汇。
她在2022年出版的《设计机器学习系统》一书,收集了此前常常散落在各工程团队之间的运营经验——数据分布变化、反馈回路、评估和基础设施。这本书成为许多试图让MLOps具体化的人常用的参考资料。
“把部署视为一个模型证据积累的起点,而不是开发工作的终点。”
格布鲁关于数据集文档记录和大语言模型危害的研究,使评估、来源追溯和治理成为生产人工智能团队的核心关切。
格布鲁在2018年与人合著了论文《数据集的数据表》,提出了针对数据集动机、构成和收集方式的标准化文档规范。这一想法让运营团队在把一个模型部署到新场景之前,能够追问其训练材料所代表的到底是什么。
“如果数据没有记录在案的来源和局限,模型的自信并不能算作证据。”
柱状图以本榜单第一名为基准。
开关名字——每根柱都会按你所选组合的第一名重新缩放。
MLOps、机器学习工程、数据工程和平台工程之间的界限存在争议,因为不同公司对同样的工作有着不同的组织方式。真正有意义的问题不在于职称,而在于谁负责可复现性、部署、监控和模型风险。
团队也在争论,是否每一个模型都需要一个复杂的平台。规模小、风险低的应用或许用一条简单且文档完善的流水线会更安全;过度设计本身也会制造出一种运营债务。
不限同一领域,六项评分最接近的职业。
通过发现、防范和响应数字攻击,保护系统、数据与人员的安全。
抗AI 63 🧫使用临床、试验和卫生系统数据生成可靠的证据,以实现更安全的护理、研究和运营决策。
抗AI 68 🔌每台计算机,手机和武器内部的设计和编织晶体管,使用精确到只有地球上少数工厂能运行的机器.
抗AI 60 🦾设计那些能感知,决定和采取行动的机器 在物理世界里,困难的问题永远不是智能,而是世界本身.
抗AI 65 🌿领导战略、衡量和报告,帮助组织减少环境和社会危害,同时履行业务义务。
抗AI 66 👔为客户提供法律意见,起草具有约束力的文件,并在案件进入法庭时为其辩护——若建议有误,还须承担个人法律责任。
抗AI 58写作,测试和维护了管理现代生活的代码——也是最早观看AI将自己的日常工作自动化的职业之一.
抗AI 35 🤖设计并测试了机器智能背后的算法,在一个领域,现在竞相将自己研究过程中越来越大的份额自动化.
抗AI 50 🛰️设计、分析并认证离地而行的飞机、火箭与航天器,在不容猜测的安全裕度下工作。
抗AI 74 🌉把河流、岩石与重力变成桥梁、道路与清洁饮水的职业——自伊姆霍特普起,文明安静的承重行当。
抗AI 72 🔌每台计算机,手机和武器内部的设计和编织晶体管,使用精确到只有地球上少数工厂能运行的机器.
抗AI 60 🦾设计那些能感知,决定和采取行动的机器 在物理世界里,困难的问题永远不是智能,而是世界本身.
抗AI 65 🔐通过发现、防范和响应数字攻击,保护系统、数据与人员的安全。
抗AI 63 🌬️设计、建造和改进风能、太阳能、存储和电网系统,将可再生资源转化为可靠的电力。
抗AI 72