Docs · App Dev Guide

大模型应用开发

从 Prompt 工程到 AI Agent,一站式覆盖大模型应用开发全链路 —— 让你能在 1 周内跑出生产级 MVP。

Agent · 实战项目

Agent 最适合用项目学习。下面 4 个项目按难度递增,每个都能把前面的 Prompt、Structured Outputs、RAG、MCP、Skills、Evals 串起来。

不要一开始追求炫技。每个项目都先跑通 happy path,再补失败处理、评测、权限和可观测性。

项目 1:数据分析 Agent

目标:上传 CSV 或 Excel,Agent 自动理解数据、选择分析方向、生成图表和报告。

维度设计
用户输入文件 + 分析目标,如「找出本季度销售异常」
核心能力文件解析、数据预览、统计分析、图表生成、报告写作
推荐技术Python、Pandas、Structured Outputs、可选 Skills
工具load_fileprofile_datarun_pythonplot_chartwrite_report
评测图表是否正确、结论是否有数据依据、报告是否引用列名和指标

最小流程:

上传文件
         ↓
      解析 schema 和数据质量
         ↓
      生成分析计划
         ↓
      执行统计 / 绘图
         ↓
      生成报告
         ↓
      人工确认后导出

验收标准:

  • 能识别缺失值、异常值、重复数据
  • 能根据用户目标选择合适图表
  • 结论必须能追溯到具体列和计算结果
  • 执行代码必须在沙箱里跑,不能访问无关文件
  • 每次工具调用有 trace

项目 2:企业知识库问答 Agent

目标:基于公司文档回答问题,必要时调用工具查实时数据,并给出引用来源。

维度设计
用户输入员工问题,如「报销流程怎么走?」
核心能力RAG、权限过滤、引用溯源、拒答、工单升级
推荐技术Qdrant / pgvector、Hybrid Search、Reranker、MCP
工具search_docsget_policycreate_ticketask_human
评测Hit Rate@K、Faithfulness、拒答准确率、用户满意度

最小流程:

用户问题
         ↓
      判断是否需要检索
         ↓
      按用户权限检索文档
         ↓
      Rerank + 组装上下文
         ↓
      生成带引用答案
         ↓
      低置信度时拒答或升级工单

验收标准:

  • 没有检索依据时不编答案
  • 每个答案至少带 1 个来源引用
  • 用户只能检索自己有权限看的知识库
  • top-k、rerank、prompt 修改前后都有评测对比
  • 失败问题会进入 bad case 队列

项目 3:论文研究助手

目标:给定 topic,Agent 自动检索论文、筛选资料、做综述,并输出结构化研究摘要。

维度设计
用户输入研究主题,如「Agentic RAG 的最新进展」
核心能力Web/Search 工具、论文解析、去重、摘要、引用管理
推荐技术Search API、PDF Parser、RAG、长上下文、LLM-as-Judge
工具web_searchfetch_paperparse_pdfsummarize_paperrank_evidence
评测引用是否真实、综述是否覆盖主题、是否区分事实和推断

最小流程:

研究主题
         ↓
      生成检索 query
         ↓
      搜索论文和技术报告
         ↓
      筛选高质量来源
         ↓
      提取方法、实验、局限
         ↓
      生成综述 + 引用列表

验收标准:

  • 引用必须可追溯,不能伪造标题或作者
  • 对每篇论文提取统一字段:问题、方法、实验、结论、局限
  • 至少有一轮 evidence ranking
  • 明确区分「论文声称」和「Agent 推断」
  • 生成结果支持人工复核和重跑

项目 4:客服多智能体系统

目标:把客服问题自动分流到不同子 Agent:知识库问答、订单查询、退款规则、人工升级。

维度设计
用户输入客服对话
核心能力意图识别、RAG、工具调用、handoff、人工审批
推荐技术LangGraph / Agents SDK、MCP、Structured Outputs、Evals
工具classify_intentsearch_faqquery_ordercreate_refund_tickethandoff_to_human
评测分流准确率、首次解决率、越权率、人工升级质量

最小流程:

用户消息
         ↓
      意图识别
         ↓
      路由到子 Agent
         ↓
      调用知识库 / 订单 / 工单工具
         ↓
      生成回复
         ↓
      高风险动作人工确认

验收标准:

  • 退款、改地址、关闭账号等高风险动作必须人工确认
  • 子 Agent 只能调用自己的工具白名单
  • 对话状态能跨多轮保持
  • 支持 handoff 给人工客服,并附带上下文摘要
  • 每周用真实 bad case 回放评测

推荐完成顺序

顺序项目为什么
1数据分析 Agent工具少、反馈快,适合练状态和工具调用
2企业知识库问答 Agent练 RAG、权限、引用和拒答
3论文研究助手练开放式搜索、证据筛选和长上下文
4客服多智能体系统练 handoff、权限、人工审批和线上指标

每个项目都要补的工程项

工程项最低要求
Trace记录模型输入输出、工具调用、耗时、token、错误
Evals至少 30 条离线测试样例,包含 happy path 和 bad case
Guardrails工具 allowlist、参数校验、敏感操作审批
Costmax steps、token 预算、模型路由、缓存
Recovery工具失败重试、任务中断恢复、人工兜底
Docs架构图、工具 schema、评测报告、上线风险清单
🚀

建议:先选项目 1 或项目 2,用 2-3 天做出可跑版本;之后不要急着加功能,先加评测、trace、权限和失败处理。能稳定跑 30 条测试样例,再进入下一个项目。