外观
大模型Agent应用开发学习路径
约 2397 字大约 8 分钟
AI实验室人工智能Agent开发LLM应用
Agent 应用开发不是“把 ChatGPT 接到网页上”。2026 年的企业 Agent 岗位更像 AI 产品工程师:你要把模型、上下文、工具、权限、审批、评测、日志和业务系统组织成一个可上线的工作流。
资料口径:本文参考 2025-07-24 至 2026-07-24 之间发布的报告、论文、技术新闻,以及 2026-07-24 访问的官方文档。
岗位定义
大模型 Agent 应用开发工程师负责构建能完成任务的 AI 应用,例如:
- 企业知识库问答、客服、销售助理、合同审阅、财务报销自动化。
- 代码生成、代码审查、测试生成、文档维护、研发流程 Copilot。
- 数据分析 Agent:自然语言查询、生成 SQL、解释图表、生成报告。
- 多步骤办公 Agent:读取邮件、调用 CRM、创建工单、等待人工审批、回写结果。
2026 年的核心变化是:企业不再只看“能不能回答”,而是看“能不能在真实流程里可靠执行”。LangChain 2026 State of Agent Engineering 把问题描述为如何可靠、经济、规模化地部署 Agent;MIT AI Agent Index 也指出,Agent 能力增强的同时,透明度、安全与评测披露仍不充分。
能力地图
| 能力层 | 重点内容 | 对应交付 |
|---|---|---|
| 工程底座 | Python、TypeScript、FastAPI、测试、日志 | 可部署 API 服务 |
| 上下文工程 | RAG、重排、引用、权限过滤 | 可追溯知识库问答 |
| 工具与协议 | Tool Calling、MCP、业务 API 集成 | 可控工具调用 |
| 工作流编排 | 状态、暂停恢复、人工审批 | 可执行业务流程 |
| 评测与观测 | Golden set、trace、回归测试 | 可持续迭代质量 |
| 安全与治理 | 沙箱、最小权限、审计 | 可上线 Agent 系统 |
学习路径
阶段一:工程底座(4-6 周)
步骤 1:Python 与 API 工程
核心内容
- Python 类型标注、异常处理、并发与异步。
- FastAPI、Pydantic、HTTP、鉴权、文件上传、流式响应。
- pytest、日志、配置管理、依赖隔离。
- TypeScript 基础,用于前端交互和 SDK 封装。
达标作品
做一个可部署的 API 服务:上传文件、解析内容、调用模型、返回结构化 JSON,并带测试和错误处理。
步骤 2:LLM API 与结构化输出
核心内容
- Chat/Responses API 的消息、上下文、采样参数、Token 成本。
- JSON Schema、函数调用、工具参数校验、重试与降级。
- 流式输出、长任务进度、取消任务。
- 多模型路由:强模型处理复杂任务,小模型处理分类、改写、摘要。
达标作品
实现一个“合同要点抽取器”:输入 PDF 或文本,输出固定 JSON,失败时能重试、记录原始响应、提示人工复核。
步骤 3:RAG 与上下文工程
核心内容
- 文档解析:PDF、HTML、Markdown、表格、图片 OCR 的取舍。
- Chunk 策略:按语义、标题、表格、代码块切分。
- Embedding、向量库、BM25、Hybrid Search、Rerank。
- 权限过滤、引用来源、检索失败兜底、上下文压缩。
达标作品
做一个企业知识库问答系统:答案必须带引用;无证据时拒答;能输出检索命中、重排分数和最终引用片段。
阶段二:Agent 核心能力(6-10 周)
步骤 4:工具调用与 MCP
核心内容
- Function calling 与工具 schema 设计。
- 工具权限:只读、写入、审批后执行、高风险操作隔离。
- MCP 的 Host、Client、Server 角色,以及 tools、resources、prompts。
- 工具描述质量:名称、参数、边界条件、错误返回会直接影响模型选工具。
达标作品
写一个 MCP Server,暴露三个工具:查询工单、创建草稿、提交审批。Agent 只能直接执行查询,写操作必须进入审批队列。
步骤 5:工作流、状态与 Human-in-the-loop
核心内容
- LangGraph:状态图、节点、边、checkpoint、durable execution。
- LlamaIndex Workflows:事件驱动的 Agent 流程。
- 人工介入:高风险工具调用前暂停、审批后恢复。
- 长期记忆:用户偏好、业务事实、历史任务,不把“记忆”当无限聊天记录。
达标作品
实现一个报销审核 Agent:读取票据、检查规则、生成审批意见;金额超阈值或缺少发票时暂停等待人工处理。
步骤 6:Agent 设计模式
核心内容
- Router:根据任务分发到不同专家 Agent。
- Planner-Executor:先生成计划,再逐步执行。
- Reflection:执行后自检,但要控制循环次数和成本。
- Multi-agent:只有当角色分工能降低复杂度时才使用,不把多 Agent 当装饰。
达标作品
做一个研发助理:Issue 分析、代码搜索、修改建议、测试建议、PR 摘要。要求每一步都有 trace,可以回放失败路径。
阶段三:评测、观测与安全(6-8 周)
步骤 7:离线评测与回归测试
核心内容
- Golden set:真实业务问题、期望答案、拒答样例、边界样例。
- RAG 评测:context precision、context recall、faithfulness、answer relevancy。
- Agent 评测:任务完成率、工具选择正确率、审批触发率、循环/超时率。
- CI:Prompt、模型、检索策略变更必须跑回归集。
达标作品
为知识库 Agent 建立 100 条评测集,比较两种模型、两种切片策略、两种 reranker,并输出表格化结论。
步骤 8:线上观测与成本治理
核心内容
- Trace:每次 LLM 调用、工具调用、检索、重排、人工审批都要可追踪。
- 指标:延迟、Token、费用、错误率、拒答率、工具失败率、用户反馈。
- Prompt 版本管理和灰度发布。
- 从生产 trace 反向生成评测样例。
达标作品
接入 Langfuse、MLflow Tracing 或 OpenTelemetry,把一次 Agent 执行拆成可视化 span,并能按用户、会话、工具、模型统计成本。
步骤 9:安全与治理
核心内容
- Prompt injection、防越权、敏感信息泄露、供应链风险。
- 工具最小权限:Agent 不应该默认拿数据库写权限、Shell 权限或管理后台权限。
- 审批策略:写操作、外发信息、支付、删除、账号权限变更必须有人或策略引擎确认。
- 沙箱与审计:工具输出不能直接进入命令、SQL、浏览器或办公系统。
达标作品
给自己的 Agent 做一次红队测试:构造提示注入、恶意文档、错误工具参数、越权请求、超长输入,并记录防护效果。
阶段四:作品集与面试(持续)
步骤 10:做三个可投递项目
建议项目:
- 企业知识库 Agent:RAG、引用、权限、拒答、评测。
- 流程自动化 Agent:工具调用、MCP、审批、状态恢复。
- 代码或数据分析 Agent:多步骤任务、trace、成本统计、失败复盘。
每个项目都要有 README、架构图、评测结果、失败案例、部署方式和演示截图。
:::
2026 技术栈建议
| 层级 | 推荐优先学习 | 说明 |
|---|---|---|
| 应用开发 | Python、FastAPI、TypeScript | 先把普通软件工程做好 |
| 模型接入 | OpenAI/Anthropic/Gemini/本地模型 API | 不绑定单一供应商 |
| Agent 编排 | LangGraph、OpenAI Agents SDK、LlamaIndex Workflows | 重点学状态、暂停恢复、工具调用 |
| RAG | LlamaIndex、LangChain、Qdrant/Milvus/pgvector | 重点是检索质量和权限,不是向量库名称 |
| 协议 | MCP | 工具、资源、Prompt 的标准化连接方式 |
| 评测 | DeepEval、Ragas、MLflow GenAI、人工标注 | 评测要进入 CI |
| 观测 | Langfuse、MLflow Tracing、OpenTelemetry | Trace 是定位 Agent 问题的基础 |
| 安全 | OWASP GenAI、审批、沙箱、最小权限 | 高风险工具必须可审计 |
面试与作品集标准
一份合格的 Agent 岗位作品集至少回答这些问题:
- 这个 Agent 服务哪个业务角色,完成什么任务。
- 它能调用哪些工具,每个工具的权限边界是什么。
- 失败时如何兜底:拒答、重试、换模型、人工接管、回滚。
- 如何评估质量:离线评测集、线上反馈、人工抽检。
- 如何控制成本:模型路由、缓存、上下文压缩、并发控制。
- 如何证明安全:Prompt 注入测试、敏感信息处理、审批日志。
常见误区
- 只学框架,不学业务闭环:Agent 的价值来自任务完成,不来自框架名称。
- 把 RAG 当万能补丁:检索不到、权限不对、文档质量差时,模型只会更自信地错。
- 多 Agent 过早复杂化:单 Agent 加明确工作流能解决的问题,不要拆成多个角色聊天。
- 没有评测就上线:Prompt 改一行、模型换一次,都可能让工具选择和答案风格变坏。
- 给 Agent 过大权限:自主执行系统必须默认最小权限,高风险动作必须可暂停和审计。
参考资料与新闻
以下资料均为 2025-07-24 之后发布,或为官方文档在 2026-07-24 访问时的当前版本:
- LangChain: State of Agent Engineering 2026
- LangChain: The best AI agent frameworks in 2026
- LangGraph Overview
- LangGraph Persistence
- OpenAI Agents SDK Documentation
- OpenAI API: Agents SDK Guide
- Model Context Protocol Specification 2025-11-25
- LlamaIndex: Human in the loop
- LlamaIndex: Evaluation
- LlamaIndex: Observability
- DeepEval Documentation, 2026
- OWASP: Agentic AI Threats and Mitigations
- The 2025 AI Agent Index, arXiv 2026
更新日志
2026/7/24 14:06
查看所有更新日志
ab787-docs: 更新 2026 AI 学习路径于026ef-重构AI入门学习路径模块,聚焦大模型Agent应用与算法方向于
版权所有
版权归属:NateHHX