外观
AI入门学习路径
约 2021 字大约 7 分钟
AI实验室人工智能学习路径职业规划
这组文章按 2026 年 AI 岗位重新整理,不再把“会调 API”和“会训练模型”混在一起。当前最值得入门者区分的三条主线是:
- 大模型 Agent 应用开发:把模型接入业务系统,让它能检索、调用工具、执行流程、接受人工审批并被评测监控。
- AI Infra 与 LLMOps:负责模型服务、GPU/Kubernetes 平台、推理性能、成本、可观测性、安全和发布治理。
- 大模型算法:研究和实现模型架构、数据、预训练、后训练、推理加速、评测与安全对齐。
资料口径:本文参考 2025-07-24 至 2026-07-24 之间发布的行业报告、研究论文和技术新闻;官方文档按 2026-07-24 访问时的最新页面处理。旧课程和经典论文只作为基础背景,不用于判断 2026 岗位趋势。
2026 年岗位图谱
| 岗位主线 | 学习顺序 | 最终交付 |
|---|---|---|
| Agent 应用开发 | 产品需求 -> 上下文工程 -> 工具调用与 MCP -> 工作流与状态 -> 评测与观测 | 可上线 Agent 产品 |
| AI Infra 与 LLMOps | Linux 与 GPU -> 容器与 Kubernetes -> 推理服务 -> 弹性与成本 -> LLMOps 与治理 | 可运维 AI 平台 |
| 大模型算法 | 数学与 PyTorch -> Transformer 与 MoE -> 数据与预训练 -> 后训练与推理 -> 评测与论文复现 | 模型算法工程能力 |
三个岗位对比
| 维度 | Agent 应用开发 | AI Infra / LLMOps | 大模型算法 |
|---|---|---|---|
| 交付物 | Agent、RAG、Copilot、自动化流程 | 推理平台、训练平台、观测评测平台、成本治理 | 模型、训练策略、后训练算法、评测报告 |
| 主要问题 | 如何让模型可靠完成业务任务 | 如何让 AI 系统稳定、便宜、可扩展 | 如何让模型能力更强、更高效、更安全 |
| 核心能力 | 软件工程、业务建模、上下文工程、工具调用 | 分布式系统、GPU、K8s、推理服务、SRE | 数学、深度学习、PyTorch、分布式训练、论文复现 |
| 2026 热点 | Agent 编排、MCP、Human-in-the-loop、Agent Eval | vLLM/SGLang、KServe/Ray Serve、GenAI Observability、FinOps | 推理模型、MoE、长上下文、RL/GRPO、Agentic Post-training |
| 入门难度 | 中等,适合开发背景快速切入 | 中高,适合后端、平台、DevOps、SRE 背景 | 高,适合数学/算法/研究背景 |
| 作品集标准 | 能演示真实业务闭环,有评测、有日志、有失败处理 | 有压测、监控、成本表、扩缩容、回滚方案 | 有论文复现、实验记录、消融分析、可复现实验脚本 |
| 学习周期 | 4-8 个月做出可投递作品 | 6-12 个月形成平台能力 | 12-24 个月形成竞争力 |
如何选择
选择 Agent 应用开发,如果你:
- 已经会 Python、TypeScript、后端接口或前端产品开发。
- 更关心业务闭环、用户体验、任务自动化,而不是从零训练模型。
- 想最快做出可展示项目,例如企业知识库助手、销售助理、代码审查 Agent、数据分析 Copilot。
- 能接受模型不可控,需要用评测、日志、权限、人工审批把系统约束住。
对应文章:大模型 Agent 应用开发学习路径
选择 AI Infra 与 LLMOps,如果你:
- 有后端、云原生、DevOps、SRE、平台工程或数据平台背景。
- 对 GPU 利用率、吞吐、延迟、队列、扩缩容、观测和成本敏感。
- 想做“把 AI Demo 变成稳定服务”的平台岗位。
- 愿意长期和 Kubernetes、Ray、vLLM、SGLang、MLflow、Langfuse、OpenTelemetry 这类工具打交道。
对应文章:[AI Infra 与 LLMOps 学习路径](./3.AI Infra与LLMOps.md)
选择大模型算法,如果你:
- 愿意长期补数学、深度学习、分布式训练和论文复现。
- 更关心模型能力来源:数据、架构、优化、后训练、推理时计算、评测。
- 能接受投入周期长、竞争更激烈、对实验质量和研究品味要求更高。
- 目标是算法工程师、模型训练工程师、后训练工程师、研究员。
对应文章:大模型算法学习路径
通用底座
无论选哪条路线,2026 年的 AI 岗位都默认你不是只会写 Prompt,而是能把模型放进真实系统。
编程与工程
- Python:类型标注、异步编程、FastAPI、pytest、数据处理。
- TypeScript:前端交互、Node 服务、SDK 封装、工具调用 UI。
- Git:分支、PR、代码审查、回滚、CI。
- Linux:进程、网络、文件权限、日志、systemd、Shell。
AI 基础
- Token、Embedding、上下文窗口、采样参数、结构化输出、工具调用。
- RAG:解析、切分、Embedding、检索、重排、引用、权限过滤。
- Evaluation:黄金集、离线评测、线上抽检、人工标注、回归测试。
- Safety:Prompt injection、越权工具调用、敏感信息泄露、供应链风险。
产品与沟通
- 能把“模型能力”翻译成“用户任务”和“业务指标”。
- 能说明准确率、召回率、延迟、吞吐、成本之间的取舍。
- 能写设计文档、复盘线上事故、维护可复现的实验记录。
2026 年趋势摘要
- Agentic AI 已经进入招聘关键词:Stanford AI Index 2026 与 Lightcast 数据显示,AI 技能在美国招聘中的出现比例继续上升,其中 Agentic AI 技能簇一年增长超过 280%,约对应 9 万个岗位提及。
- 企业关注点从 Demo 变成生产可靠性:LangChain 2026 State of Agent Engineering 把核心问题从“是否构建 Agent”转向“如何可靠、经济、规模化部署 Agent”。
- Infra 岗位变热:推理服务不再只是模型 API 包装,而是 GPU 调度、KV cache、批处理、弹性、模型路由、观测、评测、治理的组合工程。
- 算法方向从预训练扩展到后训练与推理时计算:DeepSeek-R1、DeepSeek-V3.2、Gemini 3、GPT-5 系列的信息都显示,推理能力、工具使用、长上下文、MoE 和可验证奖励成为模型算法的重要方向。
- 安全和评测成为默认能力:Agent 自主调用工具后,权限、审批、审计、沙箱、Prompt 注入防护、LLM-as-judge 回归评测都不再是加分项,而是上线门槛。
建议学习顺序
第 1 步:先完成通用底座
用 4-8 周补齐 Python、API、Git、Linux、LLM API、RAG 和基础评测。不要一开始就追 20 个框架,先能独立做出一个端到端小系统。
第 2 步:选择主岗位深挖
- 应用导向:先学 Agent 应用开发。
- 平台导向:先学 AI Infra 与 LLMOps。
- 研究导向:先学大模型算法。
第 3 步:做一个能面试的作品集
作品集不是“我调过 LangChain”,而是能说明:
- 解决了什么真实问题。
- 数据和权限怎么处理。
- 失败案例怎么收集。
- 如何评测质量。
- 如何观测延迟、成本、Token、工具调用。
- 如何回滚、降级、人工接管。
第 4 步:补交叉能力
Agent 工程师要懂一点 Infra,否则无法控制成本和稳定性。Infra 工程师要懂一点 Agent,否则平台抽象会脱离真实需求。算法工程师要懂一点应用和部署,否则模型改进很难落地。
参考资料与新闻
以下资料均为 2025-07-24 之后发布,或为官方文档在 2026-07-24 访问时的当前版本:
- Stanford HAI: The 2026 AI Index Report
- Lightcast and Stanford University: Annual AI Index 2026
- LangChain: State of Agent Engineering 2026
- The 2025 AI Agent Index, arXiv 2026
- International AI Safety Report 2026
- PyTorch 2.13 Release Blog, 2026
下一步请选择一个主方向开始。不要把三条路线同时作为主线推进,否则容易变成工具收藏而不是岗位能力。
更新日志
2026/7/24 14:06
查看所有更新日志
ab787-docs: 更新 2026 AI 学习路径于026ef-重构AI入门学习路径模块,聚焦大模型Agent应用与算法方向于84819-新增AI入门学习路径模块,完善AI学习体系于
版权所有
版权归属:huanghx1995