模型作为研究产物
机器学习主要存在于研究、专门产品和统计学领域。运营方面的考量虽然存在,但通常还不是一个独立的职业方向。
按时间排列的节点,不是每周活动格。
格子越深,表示该主题在这项指标上越高。
低高
机器学习运维工程师把机器学习实验转化为可重复、可监控的服务。他们构建数据和训练流水线,打包模型,将其部署到云端或边缘环境,追踪版本,监控性能,并制定回滚流程。在较小的团队中,他们也可能编写应用代码;在较大的团队中,他们运营一个供多个数据科学团队共用的平台。
数据科学家通常专注于问题界定、数据分析和模型开发。MLOps专注于让模型在长期使用中保持可复现、可部署和可观测。这种区分并非绝对:优秀的团队会在评估和数据质量上展开协作,而MLOps工程师也需要具备足够的机器学习知识,以理解一个模型在部署后可能如何失效。
不需要。计算机科学、工程或数据相关学位很常见,但实际的软件、云计算和数据平台经验,往往比高级研究学位更重要。开发新颖模型的岗位可能更看重研究生学历;而运营机器学习平台的岗位通常同样重视生产工程、基础设施和严谨的实验能力。
Python很常见,因为大多数机器学习生态系统都以它为基础。SQL对数据工作至关重要,而Docker、YAML和基础设施即代码的配置是日常工具。一些平台团队也会使用Go、Java、Scala或TypeScript。关键能力不是对某一种语言的忠诚,而是让流水线具备可测试性、可版本化和可观测性。
模型漂移是指一个已部署的模型因为外部世界、用户行为、输入或结果发生变化而变得不再那么有用。一个基于去年模式训练的反欺诈模型,可能会漏掉一种新型骗局。监控输入分布、预测质量和业务结果,有助于团队在一次未被察觉的性能下滑演变成有害决策之前,先发现漂移。
MLOps借鉴了DevOps的理念——自动化、版本控制、持续交付和共同责任——但增加了数据和模型方面的考量。即使应用代码没有变化,一个模型也可能因为训练数据发生变化而改变。团队必须对数据集进行版本管理,评估模型行为,管理实验,并像监控服务器健康状况一样监控预测质量。
MLOps是一个新的职位名称,对应的却是一个古老的运营问题:在受控实验中表现良好的模型,一旦遇到不断变化的数据、真实用户和生产预算,就可能失效。这一职业把机器学习的研究文化,与软件交付和运营的纪律结合了起来。
因此,它的历史与数据工程、云计算和DevOps是共通的。这个角色在2010年代末逐渐独立成型,当时各组织正从孤立的单个模型,转向需要持续管理数据、行为和合规的整批模型。
随着云平台和机器学习团队面对生产维护成本的问题,'MLOps'一词逐渐流传开来。谷歌研究人员2015年发表的论文《机器学习系统中的隐藏技术债务》,为那些把一个模型变成长期存在的系统所涉及的依赖关系、反馈回路和运营复杂性,提供了一套被广泛引用的词汇。
塞缪尔在一个自我改进的跳棋程序研究中描述了机器学习,帮助命名了这个后来被投入生产使用的领域。
网络级别的排名展示了模型与数据基础设施如何能成为核心产品基础设施。
亚马逊网络服务把弹性计算和存储变成一种运营服务,而非自建硬件。
AlexNet在ImageNet上的成功,使基于GPU的训练成为许多机器学习项目的核心。
谷歌研究人员描述了机器学习系统为何会在模型代码之外积累依赖关系和维护负担。
Kubernetes的普及为打包和运行分布式工作负载创造了一个通用的运营层。
谷歌推出TFX,作为面向端到端机器学习流水线的生产导向平台。
云服务商和初创公司正式推出用于实验追踪、流水线、模型注册表和部署的工具。
团队日益把数据验证、特征管理和模型监控视为生产环境的必要条件。
基础模型带来了对评估、检索、成本控制、提示词管理和人工智能治理的新需求。
机器学习主要存在于研究、专门产品和统计学领域。运营方面的考量虽然存在,但通常还不是一个独立的职业方向。
弹性基础设施、分布式处理和开源框架,使更大规模的模型训练和服务成为可能。
生产团队开始意识到,数据依赖、监控和再训练的成本可能超过最初模型本身的成本。
实验追踪、模型注册表、特征存储和CI/CD模式,成为可辨识的MLOps构建模块。
大语言模型应用把工作范围扩展到评估、检索、访问控制、可观测性和负责任部署。
已不存在的邻近职业——被吸收、自动化或法规抹去。
研究人员曾经把序列化的模型和说明通过邮件发给应用团队。注册表、版本化制品和部署流水线取代了这种非正式的交接方式。
团队曾在本地文件或电子表格中记录运行结果、参数和指标。如今的实验追踪系统能集中保存制品、代码版本和对比结果。
运营人员曾定期运行脚本以生成预测结果。调度化的工作流、托管平台和自动化质量检查,吸纳了这种重复执行的工作。
MLOps的出现,是因为一个模型的有用生命始于训练完成之后。这门学科把原型阶段可以推迟处理的运营问题——版本管理、故障、成本、偏差和回滚——变成了一流的工程工作。
下一阶段的关键将更少地取决于一个组织能否调用一个模型,而更多地取决于它能否证明这个模型在上线之后依然有用、安全且可控。
不限同一领域,六项评分最接近的职业。
通过发现、防范和响应数字攻击,保护系统、数据与人员的安全。
抗AI 63 🧫使用临床、试验和卫生系统数据生成可靠的证据,以实现更安全的护理、研究和运营决策。
抗AI 68 🔌每台计算机,手机和武器内部的设计和编织晶体管,使用精确到只有地球上少数工厂能运行的机器.
抗AI 60 🦾设计那些能感知,决定和采取行动的机器 在物理世界里,困难的问题永远不是智能,而是世界本身.
抗AI 65 🌿领导战略、衡量和报告,帮助组织减少环境和社会危害,同时履行业务义务。
抗AI 66 👔为客户提供法律意见,起草具有约束力的文件,并在案件进入法庭时为其辩护——若建议有误,还须承担个人法律责任。
抗AI 58写作,测试和维护了管理现代生活的代码——也是最早观看AI将自己的日常工作自动化的职业之一.
抗AI 35 🤖设计并测试了机器智能背后的算法,在一个领域,现在竞相将自己研究过程中越来越大的份额自动化.
抗AI 50 🛰️设计、分析并认证离地而行的飞机、火箭与航天器,在不容猜测的安全裕度下工作。
抗AI 74 🌉把河流、岩石与重力变成桥梁、道路与清洁饮水的职业——自伊姆霍特普起,文明安静的承重行当。
抗AI 72 🔌每台计算机,手机和武器内部的设计和编织晶体管,使用精确到只有地球上少数工厂能运行的机器.
抗AI 60 🦾设计那些能感知,决定和采取行动的机器 在物理世界里,困难的问题永远不是智能,而是世界本身.
抗AI 65 🔐通过发现、防范和响应数字攻击,保护系统、数据与人员的安全。
抗AI 63 🌬️设计、建造和改进风能、太阳能、存储和电网系统,将可再生资源转化为可靠的电力。
抗AI 72