Docs · App Dev Guide
大模型应用开发
从 Prompt 工程到 AI Agent,一站式覆盖大模型应用开发全链路 —— 让你能在 1 周内跑出生产级 MVP。
Agent · 实战项目
Agent 最适合用项目学习。下面 4 个项目按难度递增,每个都能把前面的 Prompt、Structured Outputs、RAG、MCP、Skills、Evals 串起来。
不要一开始追求炫技。每个项目都先跑通 happy path,再补失败处理、评测、权限和可观测性。
项目 1:数据分析 Agent
目标:上传 CSV 或 Excel,Agent 自动理解数据、选择分析方向、生成图表和报告。
| 维度 | 设计 |
|---|---|
| 用户输入 | 文件 + 分析目标,如「找出本季度销售异常」 |
| 核心能力 | 文件解析、数据预览、统计分析、图表生成、报告写作 |
| 推荐技术 | Python、Pandas、Structured Outputs、可选 Skills |
| 工具 | load_file、profile_data、run_python、plot_chart、write_report |
| 评测 | 图表是否正确、结论是否有数据依据、报告是否引用列名和指标 |
最小流程:
上传文件
↓
解析 schema 和数据质量
↓
生成分析计划
↓
执行统计 / 绘图
↓
生成报告
↓
人工确认后导出
验收标准:
- 能识别缺失值、异常值、重复数据
- 能根据用户目标选择合适图表
- 结论必须能追溯到具体列和计算结果
- 执行代码必须在沙箱里跑,不能访问无关文件
- 每次工具调用有 trace
项目 2:企业知识库问答 Agent
目标:基于公司文档回答问题,必要时调用工具查实时数据,并给出引用来源。
| 维度 | 设计 |
|---|---|
| 用户输入 | 员工问题,如「报销流程怎么走?」 |
| 核心能力 | RAG、权限过滤、引用溯源、拒答、工单升级 |
| 推荐技术 | Qdrant / pgvector、Hybrid Search、Reranker、MCP |
| 工具 | search_docs、get_policy、create_ticket、ask_human |
| 评测 | Hit Rate@K、Faithfulness、拒答准确率、用户满意度 |
最小流程:
用户问题
↓
判断是否需要检索
↓
按用户权限检索文档
↓
Rerank + 组装上下文
↓
生成带引用答案
↓
低置信度时拒答或升级工单
验收标准:
- 没有检索依据时不编答案
- 每个答案至少带 1 个来源引用
- 用户只能检索自己有权限看的知识库
- top-k、rerank、prompt 修改前后都有评测对比
- 失败问题会进入 bad case 队列
项目 3:论文研究助手
目标:给定 topic,Agent 自动检索论文、筛选资料、做综述,并输出结构化研究摘要。
| 维度 | 设计 |
|---|---|
| 用户输入 | 研究主题,如「Agentic RAG 的最新进展」 |
| 核心能力 | Web/Search 工具、论文解析、去重、摘要、引用管理 |
| 推荐技术 | Search API、PDF Parser、RAG、长上下文、LLM-as-Judge |
| 工具 | web_search、fetch_paper、parse_pdf、summarize_paper、rank_evidence |
| 评测 | 引用是否真实、综述是否覆盖主题、是否区分事实和推断 |
最小流程:
研究主题
↓
生成检索 query
↓
搜索论文和技术报告
↓
筛选高质量来源
↓
提取方法、实验、局限
↓
生成综述 + 引用列表
验收标准:
- 引用必须可追溯,不能伪造标题或作者
- 对每篇论文提取统一字段:问题、方法、实验、结论、局限
- 至少有一轮 evidence ranking
- 明确区分「论文声称」和「Agent 推断」
- 生成结果支持人工复核和重跑
项目 4:客服多智能体系统
目标:把客服问题自动分流到不同子 Agent:知识库问答、订单查询、退款规则、人工升级。
| 维度 | 设计 |
|---|---|
| 用户输入 | 客服对话 |
| 核心能力 | 意图识别、RAG、工具调用、handoff、人工审批 |
| 推荐技术 | LangGraph / Agents SDK、MCP、Structured Outputs、Evals |
| 工具 | classify_intent、search_faq、query_order、create_refund_ticket、handoff_to_human |
| 评测 | 分流准确率、首次解决率、越权率、人工升级质量 |
最小流程:
用户消息
↓
意图识别
↓
路由到子 Agent
↓
调用知识库 / 订单 / 工单工具
↓
生成回复
↓
高风险动作人工确认
验收标准:
- 退款、改地址、关闭账号等高风险动作必须人工确认
- 子 Agent 只能调用自己的工具白名单
- 对话状态能跨多轮保持
- 支持 handoff 给人工客服,并附带上下文摘要
- 每周用真实 bad case 回放评测
推荐完成顺序
| 顺序 | 项目 | 为什么 |
|---|---|---|
| 1 | 数据分析 Agent | 工具少、反馈快,适合练状态和工具调用 |
| 2 | 企业知识库问答 Agent | 练 RAG、权限、引用和拒答 |
| 3 | 论文研究助手 | 练开放式搜索、证据筛选和长上下文 |
| 4 | 客服多智能体系统 | 练 handoff、权限、人工审批和线上指标 |
每个项目都要补的工程项
| 工程项 | 最低要求 |
|---|---|
| Trace | 记录模型输入输出、工具调用、耗时、token、错误 |
| Evals | 至少 30 条离线测试样例,包含 happy path 和 bad case |
| Guardrails | 工具 allowlist、参数校验、敏感操作审批 |
| Cost | max steps、token 预算、模型路由、缓存 |
| Recovery | 工具失败重试、任务中断恢复、人工兜底 |
| Docs | 架构图、工具 schema、评测报告、上线风险清单 |
🚀
建议:先选项目 1 或项目 2,用 2-3 天做出可跑版本;之后不要急着加功能,先加评测、trace、权限和失败处理。能稳定跑 30 条测试样例,再进入下一个项目。