首页 / 教程专区 / 从 Notebook 到生产:机器学习平台的标准工作流
AI 实践

从 Notebook 到生产:机器学习平台的标准工作流

📖 10 分钟阅读 · 更新于 2026-07-10
机器学习MLOps平台

很多模型死在「实验阶段跑得通,上线却部署不了」。托管 ML 平台的价值,就是把这条路标准化——从数据准备到模型监控,每个阶段都有工具支撑,让模型从 Notebook 顺畅走向生产。

标准工作流的六个阶段

无论使用哪个云的 ML 平台,标准的 ML 工作流都包含以下六个阶段:

阶段核心任务AWS SageMakerGCP Vertex AIAzure ML
1. 数据准备特征工程+特征存储Data Wrangler + Feature StoreBigQuery + Feature StoreData Prep + 外部存储
2. 训练模型训练(单机/分布式)Training JobsCustom TrainingCompute Cluster
3. 调参自动超参优化Automatic Model TuningHyperparameter TuningHyperDrive
4. 注册模型版本管理Model RegistryModel RegistryModel Registry
5. 部署在线/批量推理Real-time + Batch + ServerlessEndpoints + BatchOnline + Batch
6. 监控数据漂移+性能Model MonitorModel MonitoringMonitor + Drift Detection

各阶段详解

阶段 1 - 数据准备:特征工程是 ML 中最耗时的环节。特征存储(Feature Store)保证训练和推理使用一致的特征计算逻辑,避免「训练-推理偏差」。SageMaker Feature Store 和 Vertex AI Feature Store 都提供托管服务,Azure 需要自建或使用第三方。

阶段 2 - 训练:从托管 Notebook(免费,只付计算费)起步,规模化后切换到分布式训练任务。三家都支持 GPU 训练(A100 约 $3-4/小时)。SageMaker 支持模型并行训练大模型;Vertex AI 与 BigQuery 集成方便大数据训练;Azure ML 的 Compute Cluster 自动管理节点。

阶段 3 - 调参:自动超参优化(HPO)替代手工试错。三家都支持贝叶斯优化、随机搜索和网格搜索。Vertex AI 的 HPO 算法选择最丰富,Azure HyperDrive 与 Optuna 集成好,SageMaker 支持自适应超参优化。

阶段 4 - 注册:模型注册表管理模型版本、指标和审批流程。三家都支持模型审批(approve/reject)和模型组管理。关键是在注册时记录完整的模型血缘(数据版本→训练代码→超参→评估指标),便于复现。

阶段 5 - 部署:三家都支持实时端点(REST API)、批量推理和边缘部署。成本差异大——SageMaker 实时端点最贵(按实例规格计费),建议用 Serverless 推理(按请求计费)降低成本。Vertex AI 的端点支持流量拆分(A/B 测试)。Azure ML 支持 Blue-Green 部署。

阶段 6 - 监控:部署后监控数据漂移(特征分布变化)和模型性能退化。SageMaker Model Monitor 自动检测漂移并触发告警。Vertex AI Model Monitoring 类似。Azure ML 的数据漂移检测需要配置数据集和基线。发现漂移后应触发再训练管道。

成本估算实例

以一个中等规模 ML 项目为例(每周训练一次,日均 10万次推理):

环节AWS SageMakerGCP Vertex AIAzure ML
Notebook (月)$50-100$50-100$50-100
训练 (月)$200-500 (GPU)$200-500 (GPU)$200-500 (GPU)
HPO (月)$100-300$100-300$100-300
实时端点 (月)$200-600$150-400$150-400
监控 (月)$50-100$30-80$30-80
总计 (月)$600-1600$530-1380$530-1380

省钱技巧:1) 训练用 Spot/抢占式实例(降 60-80%);2) 推理用 Serverless 或批量端点替代实时端点(降 50-70%);3) Notebook 用完即停(自动关机脚本);4) 模型压缩(量化、蒸馏)减小推理实例规格。

💡 先打通最小闭环(训练→注册→部署→监控)再谈优化。一开始就追求完美 MLOps,往往迟迟无法上线。推荐路径:Notebook 实验 → 托管训练 → 端点部署 → 基础监控,4 周内完成第一个 MVP。

常见问题

Q: 三个 ML 平台哪个最适合初学者? Vertex AI 上手最简单——AutoML 可以零代码训练模型,统一界面管理全流程。Azure ML 的 Designer 拖拽式建模也适合非编程用户。SageMaker 功能最多但学习曲线最陡。

Q: 实时端点和批量推理怎么选? 实时端点适合需要即时响应的场景(推荐、风控、搜索),但持续计费。批量推理适合非实时场景(日报、离线预测),按任务时长计费,成本可低 80%。如果推理频率 < 每分钟 1 次,优先用批量。

← 返回教程专区 订阅获取更多教程