第 01 讲 | AI 应用架构师,现在最稀有的人才
本节我们将掌握:
- AI 应用架构师 vs AI 开发者的能力边界
- 6 大技术方向的完整认知框架
- 判断一个技术决策"该不该这么做"的思维模型
- 22 讲课程的学习路径与我们的预期收获清单
背景:为什么需要 AI 应用架构师
AI应用架构师 Vs 常规AI开发者
我们拿到了一个大模型 API Key,三天搭了个 RAG 问答系统,效果还行。
然后老板说:上线吧。
接下来我们发现——
- 模型偶尔返回格式错误,前端渲染炸了,我们加了正则清洗,好了。又错了,又加正则。改了 6 版,还是出错。
- 用户量上来后,LLM 调用费用超标,我们换了个便宜模型,效果又不对了。
- 有人问"我们的系统准确率多少",我们答不上来,因为根本没定义"准确率"。
- Agent 方案做完了,步骤不可控(Agent 自己改了 3 版代码还不知道停)、成本不可控(一次任务烧了 ¥50 还没结果),最后又换回固定 Pipeline。
而这分别对应着:结构化输出、成本、评测、多Agent等架构知识节点。
这些问题,每一个单拿出来我们都能解决一点儿,但如果没有架构知识,系统就会变成一堆补丁的堆叠。
这就是"常规AI 开发者"和"AI 应用架构师"的区别——
| 常规AI开发者 | AI 应用架构师 | |
|---|---|---|
| 开发前 | 自我怀疑,陷入唯模型论/唯平台论/唯榜单论陷阱。 | 深入了解模型、平台功能、Harness等工程理论原理,知道技术的能力边界,根据场景灵活调整需求及选型。 |
| 开发时 | 不知道怎么提问,纯口语描述功能细节 | 精准、结构化的描述问题,推进开发,如建立"测试金字塔",设计产品的"数据飞轮"体系,使用合适的开发范式。 |
| 遇到问题 | 就问题解决问题 | 先定位问题在系统中的位置,再决定成体系的解决策略。 |
| 评估方案 | 跑个 demo 看效果 | 预先考虑生产环境的成本、稳定性、性能、可观测性、扩展性、评测体系、反馈体系... |
| 面试 | 讲细节,背考题,遇到不会的就是不会 | 结构化、体系化回答,灵活变通。 |
AI 应用架构师——一个前景广阔的高级岗位
传统 IT 体系,有"开发者"和"架构师"
在当前AI体系,只有"AI应用开发者",而"AI应用架构师"这个岗位还没有形成共识。
Russell经验⭐:"问题"已经先于岗位共识出现,"AI 应用架构师"将取代"传统架构师"成为新的"技术高峰"和人才热点,现在正是需要重构“架构知识”的时候,提早学习的人将领先一大步,而坚持“传统架构"的人,工作机会将会肉眼可见的减少。
市面上大量的是"AI 开发者"——能调 API、能写 Prompt、能用 LangChain、Dify 搭 demo。但能回答以下问题的人很少:
- Agent 和 RAG 的边界在哪? 什么场景该用哪个?什么场景两个都不该用?
- 一个 LLM 系统上线后怎么做灰度? 传统微服务灰度靠流量分流,LLM 灰度靠什么?
- AI 系统的 SLO 怎么定义? 延迟、可用性之外,还要定义什么指标?
- 十万并发的 AI 问答系统,瓶颈在哪? 和传统 Web 系统的瓶颈有什么本质不同?
这些问题不在任何一篇技术博客里,它们属于一个完整的知识体系。而这个知识体系,目前还没有被系统性地建立起来。
这就是这门课要填补的空白。
AI 架构师的双重视角
这门课覆盖两条线:
- 构建 AI 产品:我们为用户设计、开发、运维 AI 系统——七层架构、Agent 设计、Harness 治理,这是课程的主线。
- 用 AI 构建:我们用 AI 工具提升自己的研发效率——Claude Code 编程、Agent 辅助架构设计、Prompt 工程化、个人工具链(superpowers 等插件),这些在 AI Coding 篇展开。
两条线不是割裂的。一个优秀的 AI 架构师,既能设计生产级 AI 系统,也能把自己的日常工作流变成 AI 驱动的高效流程。面试中,"你怎么用 AI 提升自己的架构设计效率的?"已经是高频问题。
学完这门课的三个收获
我们将建立的认知
| 能力维度 | 学完前 | 学完后 |
|---|---|---|
| 技术选型 | "LangChain 挺火的,用它" | "我这个场景用状态机,因为需要条件分支和人工介入点" |
| 架构设计 | 按功能模块堆叠 | 按七层架构自检,知道每层做什么、不做什么、什么时候补 |
| 问题定位 | 哪里报错改哪里 | 能从治理层、模型层、应用层逐层排查,快速找到根因 |
| 成本管控 | 月底看账单 | 从模型选型、缓存策略、Token 优化三个维度做预算 |
| AI 工具链 | "Claude Code 挺好用" | 能设计个人 AI 工作流:Claude Code + Skill + MCP 工具链,把日常研发变成 AI 驱动流程 |
| 团队决策 | "我们试试这个" | 能给出"选 A 不选 B 的三个技术理由"和"选 A 的风险以及应对方案" |
我们将获得的可复用资产
- 每个方向的核心选型逻辑:每个技术方向结束时,会有一张选型决策总结表,可以直接用到我们的项目中
- 反模式清单:每讲至少 1 个反模式警告,课程完结后汇总为一份完整清单
- 三个真实产品的架构解剖:不是理想化设计,而是踩过坑的生产级架构(含真实成本数据与失败案例)
- 每讲思考题与面试题:每讲末尾附思考题,大纲覆盖的高频面试题融入对应章节
- 精准术语清单:AI 应用架构领域的核心术语定义,尤其是精准描述研发、测试、运营具体动作的术语,作为课程附录。
我们将掌握的判断力
这门课的价值不在知识本身,在于判断力——对"什么时候,该用什么,怎么用,用多少,代价是什么"这些核心判断信手拈来。
课程目录:6 大技术方向、22 讲
6 个技术方向覆盖 AI 应用架构师的完整知识体系。目标是让学完这门课程的人为"AI 时代的技术专家"奠定基础。
以下是完整的课程目录:
开篇(2 讲)
| 讲 | 标题 | 核心知识点 |
|---|---|---|
| 01 | AI 应用架构师:能力模型与学习路径(本讲) | 架构师 vs 开发者能力边界 |
| 02 | AI 应用架构全景:七层思维框架 | 七层架构模型、AI vs 传统应用差异 |
第一篇:Agentic Engineering(6 讲)
| 讲 | 标题 | 核心知识点 |
|---|---|---|
| 03 | Agent 核心范式 | ReAct / Plan-and-Execute / Reflexion,三大基础范式原理与选型 |
| 04 | Agent 进阶范式 | ToT / GoT / AutoGPT,自主度-成本-失败率权衡 |
| 05 | Agent 编排与工作流 | LangGraph / Dify / 自研状态机,编排五维度实战 |
| 06 | Agent 核心支撑技术 | MCP / Tool Calling / 记忆与缓存 / 无框架趋势 |
| 07 | 多 Agent 协作 | 四种模式 / 五种机制 / 框架选型与哲学 |
| 08 | Agent 评测与护栏 | 质量/效率六维评测、五道防线、工程闭环 |
第二篇:LLM 集成与知识增强(2 讲)
| 讲 | 标题 | 核心知识点 |
|---|---|---|
| 09 | RAG 全链路架构 | 数据预处理→分块→索引→检索→生成→后处理,六层全链路拆解 |
| 10 | LLM 模型选型与输出质量管控 | 模型选型与容灾 / 成本分析 / 四阶段清洗管道 / 一致性验证 |
第三篇:AI 生产运维(3 讲)
| 讲 | 标题 | 核心知识点 |
|---|---|---|
| 11 | 版本管理与灰度发布 | 模型/Prompt/知识库/工作流四版本联动,灰度策略与实验闭环 |
| 12 | 成本管控与性能调优 | Token 级核算、语义缓存、大小模型路由、提示词压缩、ROI 评估 |
| 13 | 稳定性治理与 SLO | 限流熔断、重试退避、多模型容灾降级、AI 特有 SLO 指标 |
第四篇:AI Coding(3 讲)
| 讲 | 标题 | 核心知识点 |
|---|---|---|
| 14 | AI 辅助编码与 Vibe Coding | Claude Code / Copilot / Cursor 全流程,人机高频迭代收敛 |
| 15 | Prompt 工程化 | Few-shot / CoT / 结构化,模板化管理、版本控制与效果评测 |
| 16 | 代码智能体与企业级平台 | 代码智能体架构设计,企业级 AI 开发平台核心模块与安全管控 |
第五篇:全栈工程 + 架构(3 讲)
| 讲 | 标题 | 核心知识点 |
|---|---|---|
| 17 | 后端架构与数据存储 | SSE/WebSocket 流式、异步任务、PGVector vs Milvus、多级存储协同 |
| 18 | 容器编排与可观测性 | Docker/K8s、GPU 调度策略、LLM 全链路追踪(Prompt/Token/耗时) |
| 19 | 高并发高可用架构 | 十万级并发 AI 问答系统分层设计、负载均衡、队列削峰 |
第六篇:云 + 领导力(3 讲)
| 讲 | 标题 | 核心知识点 |
|---|---|---|
| 20 | 云原生 AI SaaS 架构 | 多租户隔离、租户级模型配置、按 Token 计量计费、GPU 弹性伸缩 |
| 21 | 分布式高可用与微服务治理 | 异地多活、多区域推理路由、RAG/Agent/模型能力服务化拆分 |
| 22 | FinOps、多云选型与领导力 | GPU 算力 + Token 成本双维度治理、多云适配、0→1→N 架构演进、技术决策 |
课程结构:三个真实产品贯穿
这门课不讲空洞理论,所有知识点都用我独立开发的三个真实产品作为案例:
| 产品 | 定位 | 贯穿的课程模块 |
|---|---|---|
| 锦囊 StratSapien | AI 商业分析 SaaS(付费产品,已有用户) | Agent 编排、SaaS 架构、成本管控、0→1 全流程 |
| 拓令通 TokSlash | MCP 结构化文档编辑系统(大幅节省 Token) | MCP 实战、Tool 设计、Prompt 工程化、本地工具架构 |
| 明镜 SapienMira | Claude Code 行为分析系统(模式检测 + 评测) | 分层架构、可观测性、评测体系、数据一致性 |
每个案例不只讲"做了什么",更讲**"为什么这么做"、"踩过什么坑"、"如果重来会怎么做"**。
这门课和其他 AI 课程有什么不同?
| 工具教程 | 论文解读 | Demo 实战 | 这门课 | |
|---|---|---|---|---|
| 教我们 | 用工具 | 读理论 | 搭 Demo | 做决策 |
| 典型内容 | "LangChain 入门" | "ReAct 原理解析" | "30 分钟搭 RAG" | "什么时候该用 Agent,什么时候不该" |
| 我们的收获 | 会用一个框架 | 理解一篇论文 | 能跑通一个流程 | 能做架构决策 |
| 问题 | 框架换了就过时 | 不知道怎么落地 | 不知道怎么上线 | 能应对技术变化 |
一句话总结:其他课程教我们"怎么做",这门课教我们"什么时候该做、什么时候不该做、为什么"。
小结
这一讲做了三件事:
- 建立了认知框架:6 大技术方向——后续每一讲都在这个框架里定位
- 明确了价值承诺:可复用资产、判断力——不是空洞的"提升能力"
- 引出了全景视角:下一讲用七层架构把整个课程体系串起来
下一讲,我们看一张 AI 应用架构七层全景图——从基础设施到接入层的完整分层,用真实产品案例把每一层串起来。
思考题
- 我们能说出三个"AI 开发者和 AI 应用架构师会给出不同答案"的技术决策吗?