Docs · App Dev Guide

大模型应用开发

从 Prompt 工程到 AI Agent,一站式覆盖大模型应用开发全链路 —— 让你能在 1 周内跑出生产级 MVP。

为什么学应用开发

2026 年的大模型应用开发,核心已经从「会不会调用模型」转向「能不能把模型稳定交付成产品」。

底层模型仍在快速迭代,但真正拉开差距的往往不是单次 benchmark,而是应用层的系统能力:上下文组织、工具集成、RAG 数据质量、Agent 运行时、评测与可观测性、成本控制,以及上线后的持续迭代。

这份指南聚焦一件事:把大模型能力封装成可落地、可观测、可迭代的应用系统

为什么这份指南值得读

  • 从应用入口切入:不从 Transformer 公式开始,而是从能跑通、能上线、能维护的应用架构开始。
  • 对齐主流开发栈:覆盖 Prompt / Context Engineering、结构化输出、Function Call、RAG、MCP、Skills、Agent、Evals、AI UI。
  • 代码和工程并重:每个模块都要能产出 demo,但重点不是 demo,而是错误处理、评测、监控、权限、成本这些上线后才会暴露的问题。
  • 不绑死单一厂商:OpenAI、Anthropic、Google、DeepSeek、Qwen、开源模型都可以接入;重点是掌握选型方法和工程边界。

行业现状速览

维度早期做法2026 主流做法
模型选择固定使用一个聊天模型多模型路由:快模型、推理模型、多模态模型、低成本模型组合
API 形态单轮 Chat CompletionResponses / Messages + Tools + Structured Outputs + Realtime
Prompt手写一段指令Prompt as Code + Context Engineering + Prompt Caching
RAG向量检索 + 拼接上下文文档解析、混合检索、Rerank、GraphRAG、Agentic RAG、评测闭环
工具集成应用内写死 Function CallFunction Call + MCP + Skills / Capability Registry
Agent简单 ReAct 循环有状态运行时、checkpoint、human-in-the-loop、handoff、权限控制
评测看 demo 凭感觉离线评测集、LLM-as-Judge、线上 A/B、trace 回放、红队测试
成本调用费不可控模型路由、缓存、批处理、预算上限、降级策略

简单说:应用开发的重点正在从「提示词技巧」升级为「LLM 系统工程」

本指南的主线

你会按 8 条能力线推进:

  1. 应用总览与环境准备:知道大模型应用由哪些层组成。
  2. Prompt 与上下文工程:把任务、上下文、约束、输出格式组织清楚。
  3. 模型 API 与结构化输出:让模型输出可校验、可执行、可入库的结果。
  4. RAG 与数据工程:让模型可靠读取私域知识和外部资料。
  5. 工具、MCP 与 Skills:把外部系统封装成模型可安全调用的能力。
  6. Agent 运行时与编排:让模型在有状态工作流里完成多步骤任务。
  7. 评测、监控与治理:让系统可上线、可回滚、可持续变好。
  8. 全栈 AI 应用:把后端能力变成流式、多模态、可交互的产品体验。

适合谁

🎯

最适合:有基础编程能力、想系统进入大模型应用层的开发者;已经在做 LLM 应用,但希望补齐工程方法论的同学。

⚠️

不太适合:主要目标是训练底层模型、研究 Transformer 结构、做 SFT/RLHF 的同学。本指南聚焦应用层,不替代模型训练路线。

怎么用这份指南

  1. 先读学习路径:用 1 小时建立全局地图,知道每个模块解决什么问题。
  2. 按项目倒推学习:企业问答先学 RAG,自动化任务先学工具和 Agent,AI SaaS 先补 MCP 与前端流式体验。
  3. 每章都留产出:不要只看概念,每个模块至少跑通一个小 demo 或整理一份设计清单。
  4. 用评测驱动迭代:改 prompt、换模型、调 RAG、加 Agent 之前,先定义怎么判断变好了。

下一节:「学习路径」会把 8 条能力线整理成可执行的 6-8 周路线。