Skip to content 跳到章节

📦起源与演变

机器学习运维工程师 · 构建用于训练、部署、监控和治理生产环境中机器学习模型的系统。

一眼看清
年表

按时间排列的节点,不是每周活动格。

1959年 亚瑟·塞缪尔定义机器学习1998年 谷歌PageRank凸显数据驱动系统2006年 云计算走向主流2012年 ImageNet突破加速深度学习2015年 '隐藏技术债务'被提出2016年 Kubeflow与容器编排时代2017年 TensorFlow Extended发布2019年 MLOps成为业界通用术语2020年 机器学习生命周期标准趋于成熟2023—2024年 生成式人工智能扩展了运营范围
  1. 亚瑟·塞缪尔定义机器学习
  2. 谷歌PageRank凸显数据驱动系统
  3. 云计算走向主流
  4. ImageNet突破加速深度学习
  5. '隐藏技术债务'被提出
  6. Kubeflow与容器编排时代
  7. TensorFlow Extended发布
  8. MLOps成为业界通用术语
  9. 机器学习生命周期标准趋于成熟
  10. 生成式人工智能扩展了运营范围
指标浓度

格子越深,表示该主题在这项指标上越高。

最近审阅 来源与署名媒体署名方法说明

简短问答

机器学习运维工程师具体做什么?

机器学习运维工程师把机器学习实验转化为可重复、可监控的服务。他们构建数据和训练流水线,打包模型,将其部署到云端或边缘环境,追踪版本,监控性能,并制定回滚流程。在较小的团队中,他们也可能编写应用代码;在较大的团队中,他们运营一个供多个数据科学团队共用的平台。

MLOps与数据科学有何不同?

数据科学家通常专注于问题界定、数据分析和模型开发。MLOps专注于让模型在长期使用中保持可复现、可部署和可观测。这种区分并非绝对:优秀的团队会在评估和数据质量上展开协作,而MLOps工程师也需要具备足够的机器学习知识,以理解一个模型在部署后可能如何失效。

从事MLOps需要硕士学位吗?

不需要。计算机科学、工程或数据相关学位很常见,但实际的软件、云计算和数据平台经验,往往比高级研究学位更重要。开发新颖模型的岗位可能更看重研究生学历;而运营机器学习平台的岗位通常同样重视生产工程、基础设施和严谨的实验能力。

MLOps工程师使用哪些编程语言?

Python很常见,因为大多数机器学习生态系统都以它为基础。SQL对数据工作至关重要,而Docker、YAML和基础设施即代码的配置是日常工具。一些平台团队也会使用Go、Java、Scala或TypeScript。关键能力不是对某一种语言的忠诚,而是让流水线具备可测试性、可版本化和可观测性。

什么是模型漂移?

模型漂移是指一个已部署的模型因为外部世界、用户行为、输入或结果发生变化而变得不再那么有用。一个基于去年模式训练的反欺诈模型,可能会漏掉一种新型骗局。监控输入分布、预测质量和业务结果,有助于团队在一次未被察觉的性能下滑演变成有害决策之前,先发现漂移。

MLOps和DevOps是一回事吗?

MLOps借鉴了DevOps的理念——自动化、版本控制、持续交付和共同责任——但增加了数据和模型方面的考量。即使应用代码没有变化,一个模型也可能因为训练数据发生变化而改变。团队必须对数据集进行版本管理,评估模型行为,管理实验,并像监控服务器健康状况一样监控预测质量。

打开对比实验室

分享本页

MLOps是一个新的职位名称,对应的却是一个古老的运营问题:在受控实验中表现良好的模型,一旦遇到不断变化的数据、真实用户和生产预算,就可能失效。这一职业把机器学习的研究文化,与软件交付和运营的纪律结合了起来。

因此,它的历史与数据工程、云计算和DevOps是共通的。这个角色在2010年代末逐渐独立成型,当时各组织正从孤立的单个模型,转向需要持续管理数据、行为和合规的整批模型。

起源之地

2015—2019年全球云计算产业

随着云平台和机器学习团队面对生产维护成本的问题,'MLOps'一词逐渐流传开来。谷歌研究人员2015年发表的论文《机器学习系统中的隐藏技术债务》,为那些把一个模型变成长期存在的系统所涉及的依赖关系、反馈回路和运营复杂性,提供了一套被广泛引用的词汇。

时间线

1959年亚瑟·塞缪尔定义机器学习

塞缪尔在一个自我改进的跳棋程序研究中描述了机器学习,帮助命名了这个后来被投入生产使用的领域。

1998年谷歌PageRank凸显数据驱动系统

网络级别的排名展示了模型与数据基础设施如何能成为核心产品基础设施。

2006年云计算走向主流

亚马逊网络服务把弹性计算和存储变成一种运营服务,而非自建硬件。

2012年ImageNet突破加速深度学习

AlexNet在ImageNet上的成功,使基于GPU的训练成为许多机器学习项目的核心。

2015年'隐藏技术债务'被提出

谷歌研究人员描述了机器学习系统为何会在模型代码之外积累依赖关系和维护负担。

2016年Kubeflow与容器编排时代

Kubernetes的普及为打包和运行分布式工作负载创造了一个通用的运营层。

2017年TensorFlow Extended发布

谷歌推出TFX,作为面向端到端机器学习流水线的生产导向平台。

2019年MLOps成为业界通用术语

云服务商和初创公司正式推出用于实验追踪、流水线、模型注册表和部署的工具。

2020年机器学习生命周期标准趋于成熟

团队日益把数据验证、特征管理和模型监控视为生产环境的必要条件。

2023—2024年生成式人工智能扩展了运营范围

基础模型带来了对评估、检索、成本控制、提示词管理和人工智能治理的新需求。

时代脉络

1950年代—2005年

模型作为研究产物

机器学习主要存在于研究、专门产品和统计学领域。运营方面的考量虽然存在,但通常还不是一个独立的职业方向。

2006—2014年

云计算与大数据基础

弹性基础设施、分布式处理和开源框架,使更大规模的模型训练和服务成为可能。

2015—2018年

技术债务浮出水面

生产团队开始意识到,数据依赖、监控和再训练的成本可能超过最初模型本身的成本。

2019—2022年

平台与生命周期工具

实验追踪、模型注册表、特征存储和CI/CD模式,成为可辨识的MLOps构建模块。

2023年至今

基础模型与治理

大语言模型应用把工作范围扩展到评估、检索、访问控制、可观测性和负责任部署。

被它取代的行当

已不存在的邻近职业——被吸收、自动化或法规抹去。

人工模型交接员

2000年代—2010年代

研究人员曾经把序列化的模型和说明通过邮件发给应用团队。注册表、版本化制品和部署流水线取代了这种非正式的交接方式。

电子表格实验追踪员

2010年代

团队曾在本地文件或电子表格中记录运行结果、参数和指标。如今的实验追踪系统能集中保存制品、代码版本和对比结果。

一次性批量评分操作员

2000年代—2010年代

运营人员曾定期运行脚本以生成预测结果。调度化的工作流、托管平台和自动化质量检查,吸纳了这种重复执行的工作。

消失的行当 →

MLOps的出现,是因为一个模型的有用生命始于训练完成之后。这门学科把原型阶段可以推迟处理的运营问题——版本管理、故障、成本、偏差和回滚——变成了一流的工程工作。

下一阶段的关键将更少地取决于一个组织能否调用一个模型,而更多地取决于它能否证明这个模型在上线之后依然有用、安全且可控。

相近职业

不限同一领域,六项评分最接近的职业。

继续探索

继续探索

工程·技术领域的其他职业