外观
AI Infra与LLMOps学习路径
约 2178 字大约 7 分钟
AI实验室人工智能AI InfraLLMOps
AI Infra 与 LLMOps 是 2026 年最容易被低估的 AI 岗位。应用团队能做出 Demo,算法团队能训出模型,但真正上线后,谁来保证延迟、吞吐、成本、扩缩容、评测、追踪、权限和事故响应?这就是 AI Infra / LLMOps 工程师的工作。
资料口径:本文参考 2025-07-24 至 2026-07-24 之间发布的报告、技术新闻和项目动态,以及 2026-07-24 访问的官方文档。
岗位定义
AI Infra / LLMOps 工程师负责把模型和 Agent 变成可运维平台,典型职责包括:
- 模型推理服务:vLLM、SGLang、TensorRT-LLM、Triton、OpenAI-compatible API。
- GPU 与云原生平台:Docker、Kubernetes、NVIDIA GPU Operator、KServe、Ray Serve。
- 弹性与成本:批处理、KV cache、模型路由、限流、队列、FinOps。
- LLMOps:Prompt 版本、模型版本、评测集、灰度、回滚、A/B 测试。
- AgentOps:工具调用 trace、MCP 服务治理、审批流、沙箱、权限边界。
- 安全与合规:审计、敏感信息处理、供应链、Prompt injection 防护。
它适合后端、DevOps、SRE、云原生、数据平台工程师转向 AI。相比算法岗位,它不要求你从零训练基础模型;相比 Agent 应用岗位,它更关注平台可靠性和资源效率。
能力地图
| 能力层 | 重点内容 | 对应交付 |
|---|---|---|
| 系统基础 | Linux、网络、Docker、CI/CD | 可部署基础服务 |
| GPU 与推理 | vLLM、SGLang、KV cache、批处理 | 高吞吐模型服务 |
| Kubernetes 平台 | KServe、Ray Serve、自动扩缩容 | 多租户推理平台 |
| 观测与评测 | OpenTelemetry、Langfuse、MLflow | 可回放执行链路 |
| 成本与治理 | 模型路由、配额、成本归因 | 可控账单和资源 |
| 安全与发布 | 权限、审批、审计、灰度回滚 | 可上线 AI 平台 |
学习路径
阶段一:平台工程底座(6-8 周)
步骤 1:Linux、网络与容器
核心内容
- Linux 进程、文件系统、权限、systemd、日志定位。
- TCP/HTTP/gRPC、反向代理、TLS、DNS、连接池。
- Docker 镜像、GPU 容器、镜像安全、Compose。
- CI/CD:构建、测试、制品、部署、回滚。
达标作品
部署一个带鉴权、限流、日志和健康检查的 LLM API 网关,能用 Docker 一键启动。
步骤 2:Kubernetes 与 GPU 调度
核心内容
- Pod、Deployment、Service、Ingress、ConfigMap、Secret。
- HPA/KEDA、节点亲和、污点容忍、资源配额。
- GPU Runtime、NVIDIA Device Plugin、GPU Operator。
- 多租户隔离:namespace、RBAC、NetworkPolicy、Quota。
达标作品
在 Kubernetes 上部署一个 GPU 推理服务,配置请求资源、健康检查、滚动升级和回滚。
步骤 3:存储、数据与向量基础设施
核心内容
- 对象存储、模型权重缓存、数据集版本、artifact 管理。
- Postgres/pgvector、Qdrant、Milvus、Elasticsearch/OpenSearch。
- RAG 数据管线:解析、切分、Embedding、索引、增量更新。
- 权限过滤:用户、部门、文档级 ACL。
达标作品
做一个可增量更新的 RAG 数据管线,支持重新索引、版本回滚和权限过滤。
阶段二:LLM 推理服务(8-12 周)
步骤 4:推理引擎
核心内容
- vLLM:Paged Attention、continuous batching、prefix caching、OpenAI-compatible server。
- SGLang:RadixAttention、structured output、speculative decoding、多并行策略。
- TensorRT-LLM / Triton:高性能 NVIDIA 推理栈。
- 模型格式:Safetensors、GGUF、AWQ/GPTQ/FP8/INT4。
达标作品
用 vLLM 和 SGLang 分别部署同一模型,压测 TTFT、TPOT、吞吐、显存占用和并发稳定性,写出选型结论。
步骤 5:服务编排与弹性
核心内容
- KServe:Kubernetes 上的生成式和预测式模型服务。
- Ray Serve:Python 原生模型服务、动态批处理、队列和自动扩缩容。
- 冷启动、权重加载、模型预热、流式响应。
- 多模型路由:按成本、延迟、上下文、能力、供应商健康度切换。
达标作品
实现一个模型路由层:简单请求走低成本模型,复杂请求走强模型;供应商失败时自动降级;所有路由决策写入 trace。
步骤 6:性能与成本
核心内容
- 指标:QPS、TTFT、TPOT、P50/P95/P99、GPU 利用率、显存、Token/s。
- 优化:batching、prefix cache、prompt cache、KV cache、量化、模型蒸馏。
- 成本归因:按用户、项目、模型、工具调用、Agent 会话分摊成本。
- 配额与限流:避免 Agent 循环导致成本失控。
达标作品
做一份推理成本报告:比较 3 个模型、2 种推理引擎、不同并发和上下文长度下的单位成本。
阶段三:LLMOps 与 AgentOps(6-10 周)
步骤 7:观测与追踪
核心内容
- OpenTelemetry GenAI semantic conventions:LLM 调用、Token、模型、工具调用 trace。
- Langfuse:trace、prompt management、eval、dataset、cost。
- MLflow GenAI:tracing、evaluation、monitoring、生产 trace 评测。
- Trace 设计:一次 Agent 执行要能看到 prompt、检索、工具、审批、模型、错误。
达标作品
搭建一个 Agent 观测面板:按会话查看完整执行链,按模型统计成本,按工具统计错误率,按版本比较评测结果。
步骤 8:评测平台
核心内容
- 评测集管理:golden set、线上失败样例、红队样例、业务验收样例。
- 离线评测:RAG、Agent、结构化输出、安全、拒答。
- 在线评测:抽样评分、用户反馈、人工复核、告警。
- 发布门禁:Prompt、模型、检索策略、工具 schema 变更都要过回归。
达标作品
给一个 RAG/Agent 应用做发布流水线:提交代码后自动跑评测,指标下降则阻止发布。
步骤 9:安全、权限与治理
核心内容
- Prompt injection、工具越权、敏感信息泄露、供应链与模型依赖风险。
- Agent 身份:区分人类用户、应用服务、Agent 子任务。
- 审批流:高风险动作暂停,审批后恢复,不把审批写成聊天确认。
- 审计:工具参数、返回值、审批人、模型版本、Prompt 版本都要可查。
达标作品
设计一个 Agent 权限系统:只读工具默认开放,写工具需策略校验,高风险工具需审批,所有操作生成审计日志。
阶段四:平台作品集(持续)
步骤 10:三类必做项目
- 推理服务平台:vLLM/SGLang + API 网关 + 限流 + 压测。
- LLMOps 平台:Prompt 版本 + 评测集 + trace + 发布门禁。
- AgentOps 平台:MCP 服务治理 + 工具权限 + 审批 + 审计。
作品集要突出数字:延迟、吞吐、GPU 利用率、成本、错误率、评测通过率、回滚时间。
:::
2026 技术栈建议
| 层级 | 推荐优先学习 | 说明 |
|---|---|---|
| 系统 | Linux、Docker、Kubernetes、Helm | AI 平台的底座 |
| GPU | CUDA 基础、NVIDIA 工具链、GPU Operator | 不要求写 kernel,但要会定位资源问题 |
| 推理 | vLLM、SGLang、Triton、TensorRT-LLM | 关注 TTFT、TPOT、吞吐、显存 |
| 服务 | KServe、Ray Serve、FastAPI、Envoy/Nginx | 负责路由、弹性、网关 |
| 数据 | Postgres/pgvector、Qdrant、Milvus、对象存储 | 支撑 RAG 和训练数据 |
| 观测 | OpenTelemetry、Prometheus、Grafana、Langfuse、MLflow | 传统可观测性加 AI trace |
| 评测 | DeepEval、Ragas、MLflow GenAI | 让质量进入发布流程 |
| 治理 | RBAC、OPA/Gatekeeper、审计日志、Secret 管理 | 保障权限和合规 |
面试与作品集标准
一份合格的 AI Infra / LLMOps 作品集至少回答:
- 模型服务如何部署、扩缩容、回滚。
- 如何压测,指标是什么,瓶颈在哪里。
- GPU 利用率和成本如何观测,如何归因到用户或项目。
- Prompt、模型、检索策略如何版本化和灰度。
- 评测如何进入 CI/CD,线上失败如何回流评测集。
- Agent 工具权限、审批和审计如何设计。
常见误区
- 只会 Kubernetes,不懂 LLM 指标:AI 服务的关键指标是 TTFT、TPOT、Token/s、上下文长度和工具调用链路。
- 只看吞吐,不看质量:更快的模型如果让答案质量下降,平台价值会被业务否定。
- 没有成本归因:Agent 循环、长上下文和多模型调用会快速放大账单。
- 把日志当 trace:Agent 失败需要回放步骤,普通日志远远不够。
- 忽略权限边界:Agent 能调用工具后,安全模型必须按身份、工具、动作和数据分层。
参考资料与新闻
以下资料均为 2025-07-24 之后发布,或为官方文档在 2026-07-24 访问时的当前版本:
- DDN: 2026 State of AI Infrastructure Report
- CNCF: KServe project page, accepted as Incubating in 2025
- KServe Documentation
- vLLM Documentation
- vLLM: Disaggregated Prefilling
- SGLang Documentation
- Ray Serve Autoscaling Guide
- Ray Serve Dynamic Request Batching
- OpenTelemetry: GenAI Observability, 2026
- Langfuse Documentation
- MLflow GenAI Tracing
- MLflow LLM and Agent Evaluation
- PyTorch 2.13 Release Blog, 2026
- AMD ROCm: Autoscaling inference workloads in Ray Serve, 2026
更新日志
2026/7/24 14:06
查看所有更新日志
ab787-docs: 更新 2026 AI 学习路径于
版权所有
版权归属:huanghx02