大模型选型
1. 今日主题与一句话结论
主题:大模型选型
一句话结论: 大模型选型不是问“哪个模型最强”,而是判断某个业务场景在中文能力、长上下文、推理、结构化输出、工具调用、成本、延迟、稳定性、合规和部署方式之间如何取舍。
从产品经理视角看,模型不是信仰对象,而是生产资源。选型要服务业务任务,而不是服务排行榜。
同一个模型,可能很适合长文档总结,但不适合低成本高并发客服;可能适合复杂推理,但不适合批量生成商品标题;可能 API 体验好,但企业私有化条件不满足。
所以今天的核心判断是:
模型选型 = 任务需求 × 质量要求 × 成本边界 × 延迟要求 × 数据安全 × 工程可用性2. 学习目标
-
区分通用模型、垂直模型、开源模型、私有化模型的适用场景。
-
用中文能力、长上下文、工具调用、结构化输出、推理能力、成本、延迟、安全合规等维度做模型选型。
-
给 3 个 AI 场景建立模型选型矩阵。
-
判断什么时候用强模型,什么时候用小模型、规则、缓存或模型路由。
-
形成一份可用于项目评审的模型选型说明。
3. 深度阅读:不要选“最强模型”,要选“最合适链路”
3.1 为什么模型选型不能只看排行榜
排行榜通常测的是一组通用能力,比如数学、代码、知识问答、推理、指令遵循、多语言等。但业务上线看的是另一组问题:
| 业务问题 | 排行榜不一定回答 |
|---|---|
| 我们的用户问法是否能稳定处理? | 需要真实样本测试 |
| 输出 JSON 是否稳定? | 需要格式合规率 |
| 高峰期延迟能否接受? | 需要压测 |
| 单次调用成本是否可承受? | 需要单位经济模型 |
| 是否支持私有化或专有云? | 需要合规评审 |
| 模型更新后会不会影响 Prompt? | 需要回归测试 |
| 供应商 SLA 是否可靠? | 需要工程和采购评估 |
产品经理不要问“哪个模型最好”,而要问:
在这个场景里,哪个模型以可接受成本稳定完成任务?3.2 模型能力维度
常用选型维度如下:
| 维度 | 说明 | 典型影响 |
|---|---|---|
| 中文能力 | 是否理解中文口语、行业词、复杂表达 | 客服、制度问答、访谈分析 |
| 长上下文 | 能否处理长文档、长对话、多资料 | 合同、会议、知识库 |
| 推理能力 | 能否处理多条件、多步骤判断 | 数据分析、复杂客服、方案评审 |
| 结构化输出 | JSON、表格、字段抽取是否稳定 | API 产品化、需求抽取 |
| 工具调用 | 是否稳定调用外部系统和函数 | Agent、客服、BI |
| 多模态 | 是否支持图片、语音、视频、表格 | 商品图、票据、会议 |
| 成本 | 输入/输出价格、缓存、并发成本 | 高频功能 |
| 延迟 | 首字延迟、完整响应时间 | 客服、搜索、交互工具 |
| 稳定性 | 多次调用是否一致 | 生产系统 |
| 合规 | 数据留存、隐私、审计、部署方式 | 金融、医疗、政企 |
3.3 通用模型、垂直模型、开源模型、私有化
| 类型 | 优势 | 风险 | 适合 |
|---|---|---|---|
| 通用闭源模型 | 能力强、API 成熟、迭代快 | 成本、数据合规、供应商依赖 | 快速验证、复杂生成 |
| 垂直模型 | 行业知识和格式更贴近 | 泛化能力可能弱 | 医疗、金融、法律、代码等 |
| 开源模型 | 可控、可私有化、成本可优化 | 运维、调优、工程复杂 | 数据敏感、规模化部署 |
| 私有化模型 | 数据安全、可定制 | 初始投入高、维护重 | 政企、金融、制造、医疗 |
选型不是二选一。真实项目常见组合是:
简单分类 -> 小模型复杂生成 -> 强模型企业知识 -> RAG + 通用模型高风险判断 -> 规则系统 + 人工审核敏感数据 -> 私有化或专有云3.4 为什么要做模型路由
如果所有请求都用最强模型,质量可能不错,但成本和延迟会很快失控。
更合理的方式是模型路由:
用户请求-> 任务分类-> 简单 FAQ:缓存/小模型-> 普通生成:中等模型-> 复杂推理:强模型-> 高风险审批:规则系统/人工例如智能客服:
| 问题类型 | 推荐处理 |
|---|---|
| 物流进度查询 | 查系统 + 模板回复 |
| 普通 FAQ | 缓存或小模型 |
| 售后政策解释 | RAG + 中等模型 |
| 投诉赔付 | 强模型辅助 + 人工接管 |
| 退款审批 | 规则系统,不由模型决定 |
模型路由的本质是:把模型能力当作资源调度,而不是单一入口。
3.5 模型选型和 Prompt 评估的关系
Day 10 讲过 Prompt 评估。模型选型不能脱离测试集。
正确流程是:
定义场景-> 设计 Prompt-> 准备测试集-> 多模型对比-> 统计通过率、成本、延迟-> 选择模型或路由策略不要只看一次体验。每个候选模型至少要用同一批样本测试:
-
格式合规率。
-
任务成功率。
-
引用支持率。
-
拒答正确率。
-
高风险拦截率。
-
平均成本。
-
平均延迟。
-
人工修改率。
3.6 成本不是越低越好
低成本模型适合高频、低风险、结构简单任务。但如果低成本导致错误率升高,最终可能更贵。
例如客服:
低价模型节省调用成本但错误承诺率上升导致投诉、赔付、人工复核增加最终总成本上升所以应看总成本:
总成本 =模型调用成本+ 检索和存储成本+ 人工审核成本+ 错误处理成本+ 客诉和信任损失3.7 模型选型必须进入项目评审
在 AI 项目评审会上,模型选型不应只是一句“使用某某大模型”。至少要说明:
-
为什么这个场景需要大模型。
-
任务是否拆分为多个子任务。
-
每个子任务用什么模型或系统能力。
-
候选模型的测试集结果。
-
成本和延迟估算。
-
数据安全和供应商风险。
-
失败时的降级方案。
一个合格的选型说明应该类似:
本场景采用 RAG + 中等通用模型作为主链路。原因:任务以制度解释为主,要求中文理解、引用稳定和拒答能力,不需要最高强度推理。高风险审批问题不由模型判断,转规则系统或人工。简单 FAQ 使用缓存。后续用 100 条真实问题评估引用支持率、拒答正确率和单次成本。3.8 国产模型生态的产品选型视角
在中文和国内企业场景中,常见模型生态包括通义、文心、混元、豆包、Kimi、DeepSeek、智谱、讯飞星火、Qwen 开源系列等。产品经理不需要背每个平台的参数和榜单,但要建立评估方法。
选型时重点看:
-
中文口语和行业词理解。
-
长文档处理稳定性。
-
结构化输出能力。
-
工具调用能力。
-
多模态能力。
-
API 可用性和限流。
-
企业数据政策。
-
私有化、专有云或本地部署支持。
-
价格和商务条件。
-
生态工具链。
对国内企业来说,模型能力只是第一层,合规、采购、售后、部署和生态往往同样重要。
3.9 强模型、小模型、规则系统如何协作
AI 产品稳定性来自协作,而不是模型单点能力。
规则系统:确定性判断小模型:分类、标签、低风险初稿中等模型:常规问答、摘要、结构化抽取强模型:复杂推理、多约束生成、困难样本人工:高风险确认和最终责任例如用户访谈需求抽取:
-
小模型可做初步标签分类。
-
中等模型可抽取痛点和证据。
-
强模型可处理长访谈、多角色和复杂归纳。
-
产品经理必须审核最终需求池。
这比“全量强模型处理”更可控,也比“全量小模型处理”更稳。
3.10 模型切换和供应商风险
模型选型还要考虑长期风险:
-
模型 API 价格变化。
-
模型版本升级导致输出变化。
-
供应商限流或故障。
-
数据合规政策变化。
-
私有化成本超预期。
-
Prompt 和评估集绑定某个模型。
因此关键 AI 功能应设计可切换能力:
业务系统-> AI 编排层-> 模型适配器-> 模型 A / 模型 B / 私有模型不要让业务代码直接绑定某个模型 API 的细节。后续 Day 12 会讲 API 产品化,这里先记住:模型选型要留出切换空间。
4. 案例一:企业知识库问答模型选型
业务背景
企业要做制度问答助手,覆盖报销、采购、合同、请假、信息安全等制度。用户用自然语言提问,系统基于文档回答并给引用。
关键要求
| 要求 | 说明 |
|---|---|
| 中文理解 | 员工问法口语化 |
| RAG 兼容 | 必须基于检索片段回答 |
| 引用稳定 | 结论必须有来源 |
| 拒答能力 | 资料不足不能硬答 |
| 权限安全 | 不同员工看到不同资料 |
| 成本可控 | 高频内部工具 |
原始流程
员工查制度文档-> 搜索关键词-> 打开多个制度 PDF-> 问 HR/财务/法务-> 等人工答复AI 改造流程
员工自然语言提问-> 权限校验-> 语义检索-> 重排-> 模型基于引用回答-> 资料不足拒答或转人工-> 用户反馈进入评估集选型方案
Embedding 模型:负责语义检索重排模型:提高关键片段排序中等/强语言模型:基于引用回答规则系统:权限、版本、拒答人工:高风险制度解释数据与系统依赖
-
制度文档库。
-
组织架构和权限。
-
文档版本和生效日期。
-
向量库。
-
评估样本集。
-
人工反馈记录。
模型评估指标
-
Top K 召回率。
-
引用准确率。
-
引用支持率。
-
无依据回答率。
-
拒答正确率。
-
平均响应时间。
-
单次问答成本。
-
员工满意度。
主要风险
-
旧制度误召回。
-
模型引用不支持结论。
-
高风险制度解释被模型说成确定承诺。
-
权限过滤不严。
-
高频内部工具成本被低估。
复盘结论
企业知识库问答不一定需要最强生成模型,更需要稳定的 RAG 链路、权限控制、引用约束和拒答能力。模型只是系统的一环。
5. 案例二:智能客服高峰期模型选型
业务背景
电商大促期间客服咨询激增,平台希望 AI 分担物流、退款、优惠券、发票和投诉问题。
任务拆分
| 任务 | 推荐方案 |
|---|---|
| 意图识别 | 小模型或分类器 |
| 高频 FAQ | 缓存/模板 |
| 政策解释 | RAG + 中等模型 |
| 情绪识别 | 小模型/规则结合 |
| 投诉赔付 | 强模型辅助 + 人工 |
| 退款资格 | 规则系统 |
原始流程
用户咨询-> FAQ 机器人尝试命中-> 命不中转人工-> 人工查订单和政策-> 回复或创建工单AI 改造流程
用户消息-> 意图识别-> 风险分级-> 查询订单/物流/优惠券-> 检索政策-> 模型路由 -> 缓存/小模型 -> 中等模型 -> 强模型辅助-> 自动回复或人工接管-> 质检和复盘数据与系统依赖
-
订单系统。
-
物流系统。
-
售后政策知识库。
-
优惠券系统。
-
工单系统。
-
客服质检系统。
-
风险标签规则。
指标
-
自助解决率。
-
错误承诺率。
-
高风险接管率。
-
平均响应时间。
-
单会话成本。
-
用户满意度。
-
人工客服节省工时。
主要风险
-
为降低接管率而让模型处理高风险赔付。
-
统一强模型导致成本失控。
-
小模型处理复杂问题导致错答。
-
工具调用失败时模型硬答。
-
大促政策更新滞后。
复盘结论
智能客服不应全量使用强模型。最优方案通常是任务分层和模型路由:简单问题低成本处理,复杂问题强模型辅助,高风险问题人工确认。
6. 动手实操任务
任务:设计一个模型选型矩阵
选择 3 个场景,例如:
-
企业知识库问答。
-
智能客服回复。
-
商品文案生成。
-
合同摘要。
-
用户访谈需求抽取。
-
运营日报生成。
按下面表格打分,1-5 分:
| 场景 | 中文能力 | 长上下文 | 推理 | 结构化输出 | 工具调用 | 成本 | 延迟 | 合规 | 推荐模型策略 |
|---|---|---|---|---|---|---|---|---|---|
| 企业知识库问答 | 5 | 4 | 3 | 4 | 2 | 3 | 3 | 5 | RAG + 中等/强模型 |
| 智能客服 | 5 | 3 | 3 | 4 | 5 | 5 | 5 | 4 | 模型路由 |
| 商品文案 | 4 | 2 | 2 | 3 | 1 | 5 | 3 | 3 | 小模型 + 审核 |
验收标准
合格:
-
至少选择 3 个场景。
-
每个场景至少评估 8 个维度。
-
写出推荐模型策略。
-
说明为什么不是只用最强模型。
优秀:
-
能设计模型路由。
-
能写出测试集指标。
-
能把成本、质量、风险和业务价值联系起来。
7. 测试题与参考答案
理解题
1. 模型选型为什么不能只看排行榜? 参考答案:排行榜不能代表真实业务样本、成本、延迟、合规、输出格式稳定性和供应商可用性。
2. 什么场景适合小模型? 参考答案:高频、低风险、结构简单、任务边界清晰的场景,如分类、标签、简单 FAQ、初稿生成。
3. 什么场景适合强模型? 参考答案:复杂推理、长文档、多约束生成、需要较强中文理解和结构化输出的场景。
4. 为什么需要模型路由? 参考答案:不同任务成本、风险和质量要求不同。模型路由能在质量和成本之间取得平衡。
5. 模型选型和 Prompt 评估有什么关系? 参考答案:必须用同一批测试集比较不同模型的格式合规率、任务成功率、风险通过率、成本和延迟。
应用题
6. 企业知识库问答选型重点是什么? 参考答案:RAG 兼容、引用稳定、拒答能力、中文理解、权限和版本控制,不只是生成能力。
7. 智能客服为什么不应全量用强模型? 参考答案:高频场景成本和延迟压力大,许多问题可用缓存、小模型或规则系统处理,高风险问题还需人工确认。
8. 当日产出模板
8.1 模型选型矩阵
| 维度 | 权重 | 模型 A | 模型 B | 模型 C | 说明 |
|---|---|---|---|---|---|
| 中文能力 | |||||
| 长上下文 | |||||
| 推理能力 | |||||
| 结构化输出 | |||||
| 工具调用 | |||||
| 多模态 | |||||
| 成本 | |||||
| 延迟 | |||||
| 合规 | |||||
| 稳定性 |
8.2 模型路由方案模板
场景名称:用户任务:任务类型:风险等级:推荐处理:- 规则系统:- 小模型:- 中等模型:- 强模型:- 人工接管:成本预估:评估指标:回退策略:8.3 三场景模型策略对比表
| 场景 | 主模型策略 | 辅助能力 | 不交给模型的环节 | 核心评估指标 |
|---|---|---|---|---|
| 企业知识库问答 | RAG + 中等/强模型 | Embedding、重排、权限 | 审批结论 | 引用支持率、拒答正确率 |
| 智能客服 | 模型路由 | 缓存、规则、工具调用 | 赔付和退款审批 | 错误承诺率、接管率 |
| 商品文案 | 小模型初稿 + 审核 | 禁词、商品字段 | 材质和功效确认 | 采用率、描述不符率 |
9. 延伸阅读资料
-
Prompt 评估方法:模型选型必须基于测试集。
-
准备你自己的 20 条测试样本,用至少 2 个模型对比输出。
-
关注模型官方文档的上下文长度、价格、工具调用、数据使用政策和部署方式。
-
API 产品化入门:会把模型调用接入真实系统链路。
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!












