预计阅读:30 分钟 | 学习目标:理解四种技术的定位、差异、适用场景和选型决策
全景图
复杂度 ↑
│ 微调(改模型本身,最重)
│ Agent(模型调用工具、自主执行多步任务)
│ RAG(先查资料再回答)
│ Prompt Engineering(优化提问方式,最轻最高频)
└──────────────────────────→ 实施难度
核心原则:能用 Prompt 解决的不用 RAG,能用 RAG 解决的不用微调。
一、Prompt Engineering(提示词工程)
本质:不修改模型,只优化输入方式。零成本、即时生效。
六个核心技巧: 1. 角色设定:让模型以特定身份回答 2. 结构化输出:明确输出格式 3. 分步推理(Chain-of-Thought):让模型「先想再说」 4. Few-shot:给 2-3 个范例 5. 约束设定:限制字数、风格、禁用词 6. 反面说明:明确告诉模型不要做什么
二、RAG(检索增强生成)
本质:回答前先去知识库检索相关文档,基于文档内容生成答案。
流程:用户提问 → 在知识库中检索相关文档片段 → 把文档+问题一起发给 LLM → LLM 基于文档生成答案。
关键组件: - 检索器(Retriever):从知识库找到最相关的文档片段(技术本质是向量相似度搜索) - 生成器(Generator):LLM 本身
适用场景:企业智能客服、内部知识问答、合同审查——任何需要基于私有文档准确回答的场景。
局限:检索质量决定回答质量;不适合需要跨文档综合推理的任务;文档预处理占了 60% 工作量。
三、Agent(智能体)
本质:不仅仅回答问题,还能使用工具、自主决策、完成多步骤任务。
公式:Agent = LLM + 工具调用 + 决策循环 + 记忆
核心能力: - 任务规划(分解复杂目标) - 工具调用(搜索、API、数据库、代码执行) - 自我纠错(结果不对→检查→调整→重试)
现状(2026):封闭+可验证的任务上表现好(代码、数据库查询);开放+模糊的任务仍不稳定。多步任务的「错误累积」是核心瓶颈——5 步每步 95% 正确率 = 最终 77%。
四、微调(Fine-tuning)
本质:用你自己的数据在已有大模型上做二次训练,注入领域特定能力。
能做什么:领域术语注入、输出风格统一、任务专化。
代价:需要至少几百条高质量标注数据;基座模型升级后微调版要跟着重做;数据质量远比数据数量重要。
什么时候该用:Prompt 试过了不够好 + 有足够的高质量标注数据 + 领域术语特别特殊。
五、选型决策树
客户要做什么?
├── 只是想让 AI 在通用任务上表现更好 → Prompt 工程
├── 需要基于私有文档准确回答 → RAG
├── 需要执行多步骤操作(查+判断+操作)→ Agent
├── 需要学习领域特定知识和风格 → 先试 Prompt → 不够用再微调
└── 不确定 → 从 Prompt 开始,不行加 RAG,再考虑 Agent,最后微调
六、大模型对比(2026)
| 模型 | 核心优势 | 最适合 |
|---|---|---|
| 豆包 Pro | C 端数据飞轮+AI原生生态 | 内容创作、智能客服 |
| DeepSeek-V4 | 极致性价比+开源最强 | 成本敏感、技术能力强 |
| Qwen | 开源生态最全+阿里云底座 | 已在阿里云上的企业 |
| Kimi | 长上下文王者 | 长文档分析 |
| GPT-5 | 全球综合最强 | 海外场景、能力对标 |
没有「最好」的模型,只有最适合这个场景的模型。
本文对应学习路线图第二层:AI 落地技术。上一个学习目标:大语言模型深度解析:从GPT到DeepSeek。