AI 应用开发转型学习手册:需要学习AI哪此关键技术点


本指南提炼自多场 AI 应用开发岗位面试的观察:候选人之间的分水岭往往不是"会不会用某个框架",而是对模型、检索、智能体、评测与生产化这些技术点的认知与工程能力。框架(LangChain、Spring AI、LangGraph 等)只是载体且迭代极快,以下能力才是可迁移的内功。适合从后端/传统开发转 AI 应用开发的技术人员作为学习清单。


随着AI技术发展,现有的普通软件工程师已经满足不了市场的需求,大部分软件业务都需要和AI结合,软件工程师对开发人员都提出了AI的要求,但是市面上并没有很好的系统性指导转型学习内容和方式。

最近帮朋友公司面试了一些AI工师的简历,通过岗位需求,以及候选人的经验要求、实践情况,系统性地总结出了这个手册,指出些作为AI应用应用开发工程师所需要的AI技能,并且重点列出学习的重点知识点,方便各位佬们参考并针对性的学习,以跟时代步伐,不然要丢饭碗了!

模块一 认知与选型

1. LLM 能力边界与模型选型

内容

  • token 与上下文窗口、temperature 等采样参数(温度越高越发散:事实类任务用低值、创作类可高)、幻觉的成因与表现形式(编造事实、编造出处、自信答错——根本缓解是检索接地 + 事后校验,与第 9 点呼应);

  • 不同档位模型的能力与价格差异、"复杂任务走旗舰、简单任务走轻量"的动态路由(路由可先用规则或轻量模型判断任务难度,采取"先轻量、失败再升级"策略);

  • token 成本核算(清楚每个模型的单价、每次请求的 token 消耗,成本优化才有依据)。

学习重点

  • 建立"模型不能做什么"的直觉。多数生产事故源于把模型不擅长的事交给模型;

  • 选型与路由是 AI 应用的第一个工程决策,也是成本控制的起点。

2. 微调、RAG、提示词三者的选型边界

内容:

  • 三者分工——提示词管全局规则与约束、RAG 管量大常变且需出处的知识、微调管风格与行为模式;

  • SFT/DPO/QLoRA 的基本流程;微调的前提条件(数据质量、评测集);

  • 何时该微调的典型信号:提示词 + 少样本已无法稳定风格/格式、需要缩短长提示省成本、且有千条级以上标注数据——三条不满足时优先提示词与 RAG。

学习重点:

  • 记住"微调管风格、RAG 管知识"并能解释原因——常变的事实进权重会带来更新成本高与泄露风险,选型的本质是成本、时效、可追溯三者的权衡。

  • 知道"什么时候不该微调"比会微调更重要。

模块二 核心开发能力

3. 提示词工程与提示词治理

内容:

  • 结构化提示(角色/任务/约束/输出格式)、思维链、少样本;

  • 结构化输出强约束(schema 校验、解析失败兜底);

  • 提示词版本管理(存配置中心或库、带版本号与变更记录、新版本过评测后才上线、可回滚)、分层治理(业务铁律 > 任务总纲 > 召回示例,规则冲突时上层压下,避免单个大提示内部互相矛盾)。

学习重点:

  • 把提示词当代码管理——可版本、可评测、可回滚。停在"改话术"是入门,治理与评测才是分水岭。

4. RAG 检索增强生成(重中之重)

内容:

  • 文档解析→切分→embedding→索引→检索→rerank→生成全链路;

  • 切分策略:固定长度切分、按标题/段落结构切分、语义切分(相邻句语义相似度下降处切)、父子切分(小块命中、取父块大上下文);选择看文档结构——结构清晰的文档用结构切分,口语化、结构松的用语义切分,并处理跨页断裂;

  • 向量索引(HNSW:M/efConstruction 越大召回越高但内存与建索引时间越贵,efSearch 在查询时权衡召回与速度);

  • 混合检索(向量 + BM25 稀疏:语料含大量专有名词、型号、短查询时,稀疏精确匹配弥补向量语义漏召);

  • rerank(Cross-Encoder 对粗召回 top-N 重排,用延迟换精度,精度要求高时加);

  • 元数据过滤、MMR 多样性(避免 top 结果全是相似内容)。

学习重点:

  • 两个 hardest 的点——切分决定检索上限,评测决定优化方向。

  • top-k、相似度阈值等参数必须用自己的评测集实测调出,不能抄博客。

5. Agent 与工具调用

内容:

  • Function Calling 原理(模型如何产出工具调用);

  • ReAct"推理→行动→观察"循环;

  • 循环护栏(最大步数、超时、超限转人工);

  • 工具抽象设计(单一职责、参数 schema 清晰、工具描述文本直接影响模型选择准确率)与异常处理(工具失败转 observation 让模型自纠,而非直接中断);

  • 状态持久化与恢复(长任务中断后可续跑,执行过程可审计、可重放);

  • 多智能体协作模式(supervisor 分发、子图分工;原则是单 Agent 装不下再拆,先做好单 Agent);

  • Human-in-the-loop。

学习重点:

  • 先自己手写一个最小 agent loop(几十行代码),搞懂终止条件与失败处理,再上框架。只会框架编排的人,框架不满足需求时就卡住。

6. MCP 与能力标准化

内容:

  • MCP 协议概念(Tool = 可调用能力、Prompt = 预置模板、Resource = 可读数据,经 Streamable HTTP 暴露);

  • 何时用 MCP、何时直接函数调用:能力要跨进程/跨语言/跨团队共享、需统一认证与计量时用 MCP;单应用内部调用,函数调用即可;

  • 写一个 MCP Server;

  • 与存量系统对接(REST→MCP 桥接);

  • 认证、配额、多租户。

学习重点:

  • 理解协议的价值——把"能力提供"与"业务编排"分离,是 AI 能力长在传统平台上的接口形态。

  • 动手目标:把自己现有系统的一组 API 封装成 MCP Server。

7. 上下文工程与记忆

内容:

  • 把上下文当"预算"而非"容器"(信噪比、context rot);

  • 短期/长期记忆设计(会话记忆、跨会话用户画像);

  • 摘要与压缩策略:滚动摘要(定期把旧对话压成摘要)、滑动窗口(只留最近 N 轮)、分层压缩(删低重要信息、搬细节到外部存储、折叠长内容成摘要)、结构化抽取(把事实抽成画像或知识条目);选择——短会话窗口即可,长任务摘要 + 外部存储组合,关键事实永远写外部存储、不靠压缩记忆;

  • 工具调用噪声剥离;

  • 关键事实外部存储。

学习重点:

  • 这是决定多轮对话与长任务稳定性的关键点。写 Agent 代码时永远问一句:这轮上下文里放了什么、代价多大、超了怎么办。

模块三 质量与生产化

8. 评测体系(玩具与产品的分界线)

内容:

  • 评测集构建(来源、规模、更新机制);

  • 自动化评分与版本对比:自动评分 = 评测集跑一遍流水线,用规则指标(格式、命中关键词、触红线)+ LLM-as-judge(固定评分维度与打分提示,让模型逐条打分)输出量化指标;版本对比 = 同一评测集跑新旧两版(prompt、模型、RAG 配置)对比指标差异,作为上线依据,防止"改好一处、改坏三处";

  • RAG 双层评测(检索层:context precision/recall;生成层:相关性/忠实度,如 RAGAS);

  • 人工复核校准(定期抽查机器打分,防评分模型漂移);负样本回流与迭代闭环(bad case 回灌评测集与训练数据)。

学习重点:

  • 建立"先上评测、再谈优化"的工作习惯。没有评测,一切调优都是凭感觉;

  • 能拿出评测集和前后数据的候选人,面试中普遍获得高评价。

9. 事实性约束、安全与脱敏

内容:

  • 证据接地生成(先检索证据、押着证据写、事后逐条校验、失败重写;逐条校验 = 把生成内容拆成原子主张,逐条回检索证据源,判支持/矛盾,无出处的重写或标注);

  • 红线规则治理;数据脱敏(检索数据与训练数据都要脱敏,防止模型把敏感信息"背下来"被诱导说出);

  • 人机审核分工(机器全检 + 人工抽查)。

学习重点:

  • 生产级 AI 必须可控、可审计。"事前口头交代"(提示词约束)与"事后逐条校验"(机器校验)是两种不同的可靠性,规模化必须建后者。

10. 推理性能与成本优化

内容:

  • 流式输出;PrefixCaching/KVCache 原理与 TTFT(首字延迟)优化——稳定提示词前缀、固定检索片段排序、合并系统消息以提高缓存命中;

  • 多模型动态路由;

  • token 预算分级管理:把上下文分系统固定层(角色/铁律)、检索注入层、对话历史层、当前请求层,各层设上限与截断优先级(超预算先压历史、再减检索注入);原因是上下文既是成本也是噪声——长文挤掉关键指令,效果与成本双输;

  • 成本核算。

学习重点:

  • 性能与成本是生产职责。理解"为什么提示词结构会影响缓存命中",比背优化技巧有用。

11. AI 数据流水线

内容:

  • 采集→清洗→质量分级→人工审核→多下游复用(RAG/微调/评测)的全链路;

  • 数据格式(ShareGPT/Alpaca/JSONL);

  • 数据回流沉淀:把线上 bad case、人工修正、高分样本按统一格式收进数据池(含去重、质量打分、脱敏),定期喂给评测集扩充、RAG 知识更新与微调语料;解决"系统不会越用越准"的问题,形成数据飞轮。

学习重点:

  • "AI 的一切都是数据"。检索与微调的质量上限由清洗质量决定;

  • 后端工程师的 ETL 能力可无缝迁移,这是转型者的天然优势。

12. AI 系统的生产化工程

内容:

  • LLM API 的限流/熔断/降级(模型服务天然不稳定;降级 = 超时/限流时换备用模型或退化为规则/模板应答,保证主流程不挂);

  • 异步并发与重试(指数退避);

  • 幂等;

  • 可观测性(tracing、request_id、每次调用的 token/延迟/错误率指标,能定位到单次请求做 bad case 分析);

  • Mock 开关体系(解耦外部服务、支持离线调试);

  • 容器化部署。

学习重点:

  • 这恰是后端工程师的老本行,关键是有意识地把它搬进 AI 系统。demo 与产品的差距就在这些点。

模块四 学习路径与方法

  • 建议顺序 模型认知(1、2)→ 提示词(3)→ RAG(4)+ 评测(8)→ Agent(5)→ MCP(6)→ 按项目需要补齐生产化点(7、9–12)。评测建议尽早引入,贯穿全程。

  • 一个项目串全部: 自己做一个知识问答或内容生成小系统,跑通"数据清洗→检索→生成→评测→回流"闭环,以上每个点都会真实踩到。

  • 两个习惯:

    • 用 AI 编程工具(Cursor、Claude Code 等)提效,但必须建立审查 AI 生成代码的习惯;

    • 学框架前先读它的最小实现或源码,再读文档。

  • 一个态度 以业务场景驱动、用评测数据说话。技术是手段,解决业务问题并能证明效果,才是 AI 应用开发的价值。

分享协议:  CC BY 4.0

©2026 AI全书. 保留部分权利

    备案号: 浙ICP备06043869号-8