Skip to content

📦起源与演变

机器学习运维工程师 · 构建用于训练、部署、监控和治理生产环境中机器学习模型的系统。

分享本页

MLOps是一个新的职位名称,对应的却是一个古老的运营问题:在受控实验中表现良好的模型,一旦遇到不断变化的数据、真实用户和生产预算,就可能失效。这一职业把机器学习的研究文化,与软件交付和运营的纪律结合了起来。

因此,它的历史与数据工程、云计算和DevOps是共通的。这个角色在2010年代末逐渐独立成型,当时各组织正从孤立的单个模型,转向需要持续管理数据、行为和合规的整批模型。

起源之地

2015—2019年全球云计算产业

随着云平台和机器学习团队面对生产维护成本的问题,'MLOps'一词逐渐流传开来。谷歌研究人员2015年发表的论文《机器学习系统中的隐藏技术债务》,为那些把一个模型变成长期存在的系统所涉及的依赖关系、反馈回路和运营复杂性,提供了一套被广泛引用的词汇。

时间线

1959年亚瑟·塞缪尔定义机器学习

塞缪尔在一个自我改进的跳棋程序研究中描述了机器学习,帮助命名了这个后来被投入生产使用的领域。

1998年谷歌PageRank凸显数据驱动系统

网络级别的排名展示了模型与数据基础设施如何能成为核心产品基础设施。

2006年云计算走向主流

亚马逊网络服务把弹性计算和存储变成一种运营服务,而非自建硬件。

2012年ImageNet突破加速深度学习

AlexNet在ImageNet上的成功,使基于GPU的训练成为许多机器学习项目的核心。

2015年'隐藏技术债务'被提出

谷歌研究人员描述了机器学习系统为何会在模型代码之外积累依赖关系和维护负担。

2016年Kubeflow与容器编排时代

Kubernetes的普及为打包和运行分布式工作负载创造了一个通用的运营层。

2017年TensorFlow Extended发布

谷歌推出TFX,作为面向端到端机器学习流水线的生产导向平台。

2019年MLOps成为业界通用术语

云服务商和初创公司正式推出用于实验追踪、流水线、模型注册表和部署的工具。

2020年机器学习生命周期标准趋于成熟

团队日益把数据验证、特征管理和模型监控视为生产环境的必要条件。

2023—2024年生成式人工智能扩展了运营范围

基础模型带来了对评估、检索、成本控制、提示词管理和人工智能治理的新需求。

时代脉络

1950年代—2005年

模型作为研究产物

机器学习主要存在于研究、专门产品和统计学领域。运营方面的考量虽然存在,但通常还不是一个独立的职业方向。

2006—2014年

云计算与大数据基础

弹性基础设施、分布式处理和开源框架,使更大规模的模型训练和服务成为可能。

2015—2018年

技术债务浮出水面

生产团队开始意识到,数据依赖、监控和再训练的成本可能超过最初模型本身的成本。

2019—2022年

平台与生命周期工具

实验追踪、模型注册表、特征存储和CI/CD模式,成为可辨识的MLOps构建模块。

2023年至今

基础模型与治理

大语言模型应用把工作范围扩展到评估、检索、访问控制、可观测性和负责任部署。

被它取代的行当

已不存在的邻近职业——被吸收、自动化或法规抹去。

人工模型交接员

2000年代—2010年代

研究人员曾经把序列化的模型和说明通过邮件发给应用团队。注册表、版本化制品和部署流水线取代了这种非正式的交接方式。

电子表格实验追踪员

2010年代

团队曾在本地文件或电子表格中记录运行结果、参数和指标。如今的实验追踪系统能集中保存制品、代码版本和对比结果。

一次性批量评分操作员

2000年代—2010年代

运营人员曾定期运行脚本以生成预测结果。调度化的工作流、托管平台和自动化质量检查,吸纳了这种重复执行的工作。

消失的行当 →

MLOps的出现,是因为一个模型的有用生命始于训练完成之后。这门学科把原型阶段可以推迟处理的运营问题——版本管理、故障、成本、偏差和回滚——变成了一流的工程工作。

下一阶段的关键将更少地取决于一个组织能否调用一个模型,而更多地取决于它能否证明这个模型在上线之后依然有用、安全且可控。

相近职业

不限同一领域,六项评分最接近的职业。

继续探索

继续探索

工程·技术领域的其他职业