AI 产品评估指标
1. 今日主题与一句话结论
主题:AI 产品评估指标
一句话结论: AI 产品不能只用“模型答得好不好”来评估,而要同时看模型质量、用户体验、业务结果、安全风险、成本效率和运营闭环;指标体系不是上线后的报表,而是决定 AI 功能能不能上线、能不能放量、能不能进入核心流程的产品治理工具。
前两天我们讨论了 AI 产品设计范式和概率性挑战。你已经看到,AI 产品和传统产品最大的不同,是系统输出不再完全确定。模型可能答错、漏答、同问不同答、格式不稳定,也可能在大多数场景里显著提高效率和体验。
这就带来一个实际问题:产品经理到底如何判断一个 AI 功能“可用”?
不能只看内部演示效果。不能只看模型排行榜。不能只看用户说“挺智能”。也不能只看调用量,因为调用量高可能意味着用户喜欢,也可能意味着用户反复追问仍然没解决问题。
AI 产品需要一套分层指标:
模型指标:答案是否准确、忠实、稳定、安全体验指标:用户是否愿意用、是否理解、是否能完成任务业务指标:是否提升转化、效率、留存、收入或降本安全指标:是否避免隐私、越权、错误承诺和高风险输出成本指标:Token、模型调用、缓存命中、单次任务成本是否可控运营指标:是否能发现失败样本、更新知识库、优化 Prompt 和流程如果没有这些指标,AI 项目就会变成主观争论:算法说模型不错,产品说体验不好,运营说用户投诉,研发说日志看不出来,老板说成本太高。指标体系的作用,是把这些争论变成可观测、可比较、可复盘的数据。
2. 学习目标
-
区分模型指标、体验指标、业务指标、安全指标、成本指标和运营指标。
-
为智能问答类 AI 功能设计准确率、引用率、拒答率、满意度等核心指标。
-
判断一个指标是离线评估指标、线上监控指标,还是业务结果指标。
-
设计 AI 功能上线前、灰度中、放量后的指标门槛。
-
识别“看起来好但会误导决策”的虚假指标,例如调用量、互动轮次和生成字数。
-
输出一份 12 项以上的 AI 功能指标体系表,用于产品评审和上线复盘。
3. 深度阅读:AI 指标体系要同时回答质量、体验、业务和风险
3.1 为什么传统产品指标不够
传统互联网产品常用指标包括访问量、点击率、转化率、留存率、任务完成率、页面停留时长、漏斗转化、客单价、GMV、NPS 等。这些指标仍然重要,但对 AI 产品不够。
原因很简单:AI 产品多了一层“生成质量”和“不确定性风险”。一个普通搜索功能,如果用户点击率高,基本说明结果有吸引力;一个 AI 问答功能,如果互动轮次高,可能说明用户很喜欢,也可能说明第一轮没答对,用户不得不反复追问。一个内容生成工具,如果生成量高,可能说明提效,也可能说明生成内容质量差,用户反复重生成。
因此,AI 产品指标必须同时回答四类问题:
它答得对吗?用户觉得有用吗?业务真的变好吗?风险和成本可控吗?只回答其中一类都会失真。比如一个智能客服机器人,自动回复率很高,但错误承诺率也高,这不是成功;一个导购助手用户满意度不错,但每次转化成本高于毛利,这也不可持续;一个数据分析助手模型评估分高,但用户不采纳建议,业务价值就没有闭环。
产品负责人需要建立“指标分层”意识。不同指标负责不同决策:
| 指标层级 | 主要回答 | 典型用途 |
|---|---|---|
| 离线模型指标 | 模型在测试集上是否达标 | 上线前评估、Prompt 回归 |
| 在线体验指标 | 用户使用过程是否顺畅 | 灰度监控、交互优化 |
| 业务结果指标 | 是否创造业务价值 | 资源投入、放量决策 |
| 风险安全指标 | 是否越过红线 | 上线准入、风控拦截 |
| 成本效率指标 | 单位价值成本是否合理 | 预算、商业模式、增长策略 |
| 运营闭环指标 | 是否能持续改进 | 质检、知识库、团队协作 |
3.2 模型指标:先判断输出是否可信
模型指标是 AI 产品评估的基础,但不是全部。它关注的是模型输出本身是否符合要求。
常见模型指标包括:
| 指标 | 含义 | 适用场景 |
|---|---|---|
| 准确率 | 答案是否符合事实或标准答案 | 客服问答、知识库问答、分类 |
| 忠实度 | 是否只基于给定资料回答,没有编造 | RAG、合同摘要、政策解释 |
| 引用准确率 | 引用资料是否真实支持答案 | 企业知识问答、法务、制度问答 |
| 格式合规率 | 输出是否符合 JSON、表格、字段要求 | API、自动化工作流 |
| 一致性 | 相同或相似输入是否得到稳定答案 | 客服、政策问答、审核 |
| 拒答正确率 | 不该回答时是否拒答或转人工 | 合规、高风险、权限场景 |
| 召回率 | 应识别的问题是否被识别出来 | 风险识别、投诉识别、审核 |
| 幻觉率 | 输出中无依据或错误事实的比例 | 问答、摘要、分析 |
这些指标需要评估集支撑。没有评估集,准确率就只是主观判断。评估集应覆盖常规问题、边界问题、高风险问题、恶意输入、格式要求和真实线上失败样本。
以智能问答为例,一个基本评估流程是:
准备 100 条问题-> 每条绑定标准答案或参考资料-> 运行当前 Prompt 和模型-> 标注答案是否正确-> 标注引用是否支持答案-> 标注是否应该拒答-> 统计准确率、引用率、拒答率、幻觉率-> 对失败样本归因产品经理要参与评估集设计,而不是完全交给算法。因为“正确答案”往往不是纯技术问题,而是业务口径问题。客服政策、运营规则、销售话术、合同风险、数据指标,都需要业务负责人确认标准。
3.3 体验指标:看用户是否真的完成任务
AI 输出正确,不代表体验好。体验指标关注用户在产品中是否顺利完成任务。
常见体验指标包括:
| 指标 | 含义 |
|---|---|
| 任务完成率 | 用户是否通过 AI 完成原本想做的任务 |
| 首轮解决率 | 第一轮回答是否解决问题 |
| 多轮澄清率 | 系统是否需要追问,追问是否有效 |
| 用户满意度 | 点赞、点踩、评分、问卷 |
| 采纳率 | 用户是否采用 AI 建议或草稿 |
| 编辑率 | 用户对 AI 输出修改多少 |
| 重生成率 | 用户是否频繁要求重新生成 |
| 转人工率 | AI 是否无法继续处理 |
| 放弃率 | 用户是否中途退出 |
| 响应时间 | 首字延迟、完整响应时间 |
这里要注意指标解释。比如转人工率不是越低越好。如果高风险问题应该转人工,转人工率太低反而可能危险。重生成率也不是绝对坏事,创意生成场景中用户本来就需要多个版本;但客服回复场景中频繁重生成说明答案不稳定。
体验指标必须结合场景解读:
客服:首轮解决率、转人工率、满意度、投诉率更重要。文案生成:采纳率、编辑率、重生成率、生成耗时更重要。数据分析:任务完成率、结论采纳率、口径纠错率更重要。导购:推荐点击率、加购率、澄清完成率、错误推荐率更重要。内部知识问答:引用点击率、追问率、无答案拒答率更重要。产品经理要避免单指标崇拜。比如只追求首轮解决率,模型可能在信息不足时硬答;只追求转人工率下降,可能牺牲高风险场景;只追求互动轮次,可能鼓励无效聊天。
3.4 业务指标:证明 AI 不是玩具
业务指标回答一个关键问题:AI 功能是否创造了真实业务价值。
不同业务的目标不同:
| 场景 | 业务指标 |
|---|---|
| 智能客服 | 人工工单减少、平均处理时长下降、满意度提升、投诉下降 |
| 电商导购 | 商品点击率、加购率、转化率、客单价、长尾曝光 |
| 商品文案 | 上架效率、点击率、转化率、运营人效 |
| 销售助手 | 客户跟进效率、有效触达率、续约率、扩容率 |
| 经营分析 | 报告产出时间、异常发现速度、决策采纳率 |
| 内部知识库 | 搜索成功率、员工自助率、重复咨询下降 |
业务指标通常不能只看 AI 使用用户,还要有对照组。否则很难判断增长来自 AI 还是其他因素。
例如电商导购上线后转化率提升 5%,可能是 AI 导购有效,也可能是活动折扣、季节因素或流量结构变化。正确做法是做 A/B 测试:
A 组:传统搜索筛选B 组:传统搜索 + AI 导购入口
对比:- 导购入口点击率- 推荐商品点击率- 加购率- 支付转化率- 客单价- 退款率- 单次转化 AI 成本对增长负责人来说,AI 功能必须进入单位经济模型。尤其使用外部模型 API 时,每一次交互都有边际成本。一个 AI 导购如果带来更多互动但没有带来足够转化,就不是合格增长;一个客服机器人如果减少人工但增加投诉和赔付,也不是成功。
3.5 安全指标:把红线变成可监控数据
Day 16 我们建立了错误分级。今天要把错误分级变成指标。
安全指标通常包括:
| 指标 | 含义 |
|---|---|
| 高风险错误率 | L4 / L5 错误占比 |
| 错误承诺率 | AI 是否承诺退款、赔付、疗效、收益等 |
| 隐私泄露率 | 是否输出无权限个人信息或敏感数据 |
| 越权调用率 | 是否调用用户无权限工具或数据 |
| 提示注入成功率 | 恶意指令是否绕过系统约束 |
| 拒答正确率 | 高风险问题是否正确拒答 |
| 人工接管命中率 | 应转人工问题是否成功转人工 |
| 内容安全拦截率 | 敏感、违法、违规内容是否被拦截 |
安全指标和业务指标可能冲突。比如提高拒答率可以降低风险,但可能伤害用户体验;降低转人工率可以减少成本,但可能增加错误承诺。产品负责人要定义优先级:红线指标优先级高于增长指标。
一般建议:
-
L5 安全红线:0 容忍。
-
L4 高风险业务错误:通常 0 容忍或极低阈值。
-
L3 关键任务错误:按场景设灰度阈值。
-
L1-L2 错误:可进入迭代优化。
安全指标也需要红线样本集。上线前必须测试提示注入、越权、隐私、错误承诺、违法违规等样本,不能等真实用户踩坑。
3.6 成本指标:AI 功能必须算账
AI 产品成本不只是服务器成本,还包括模型调用、Token、向量检索、重排、日志存储、人工质检、失败重试和人工接管。
常见成本指标包括:
| 指标 | 含义 |
|---|---|
| 单次调用成本 | 每次模型 API 平均成本 |
| 单任务完成成本 | 完成一次用户任务的总 AI 成本 |
| 输入 Token | Prompt、上下文、知识片段消耗 |
| 输出 Token | 模型生成长度 |
| 强模型调用占比 | 多少请求用了高成本模型 |
| 缓存命中率 | 多少请求避免了模型调用 |
| 重试率 | 失败后重新调用比例 |
| 无效调用率 | 空输入、误触、重复点击、低价值请求 |
| 成本 / 业务结果 | 每新增转化、每节省工单、每生成有效内容的成本 |
成本指标要和业务指标绑定。只看成本下降可能会误伤体验,只看业务提升可能会忽略亏损。正确问题是:
每多花 1 元 AI 成本,带来了多少收入、节省、效率或风险降低?客服场景可以算:
AI 成本 = 模型调用 + 检索 + 日志 + 质检收益 = 减少人工工单成本 + 提升满意度带来的留存价值 - 错误导致的投诉成本导购场景可以算:
AI 成本 / 增量成交订单AI 成本 / 增量毛利AI 导购用户转化率 - 对照组转化率如果 AI 功能要商业化,成本指标更关键。SaaS、API、订阅、按量计费都必须知道单位成本,否则定价会失真。
3.7 运营闭环指标:质量能否持续变好
AI 产品上线不是结束。模型、知识库、用户问题、业务规则都会变化,必须建立运营闭环。
运营闭环指标包括:
| 指标 | 含义 |
|---|---|
| 失败样本入库率 | 线上失败是否进入评估集 |
| 标注完成率 | 质检团队是否完成错误归因 |
| 知识库更新时效 | 新政策、新规则多久进入知识库 |
| Prompt 回归通过率 | 修改后是否通过测试 |
| 版本回滚次数 | 新版本是否频繁导致问题 |
| 人工修改率 | 人工对 AI 草稿改动比例 |
| 用户反馈处理时长 | 点踩、投诉多久被处理 |
| 评估集覆盖率 | 是否覆盖主要意图和高风险样本 |
这些指标决定 AI 产品能否长期可靠。如果失败样本不入库,团队会反复犯同样错误;如果知识库更新慢,模型会基于旧政策回答;如果 Prompt 修改没有回归测试,质量会随机波动。
产品经理要把运营闭环写进方案。AI 功能不是只交给算法团队维护,它需要产品、运营、客服、法务、数据和研发共同维护。
3.8 指标门槛:上线、灰度和放量要有准入标准
指标体系最终要服务决策。至少要定义三个阶段的门槛:
上线前:
-
离线评估集通过率是否达标。
-
红线样本是否全部拦截。
-
输出格式是否稳定。
-
成本预算是否可接受。
-
日志和监控是否完备。
灰度中:
-
用户满意度是否高于基线。
-
L3 以上错误是否低于阈值。
-
转人工率是否符合预期。
-
成本是否在预算内。
-
用户反馈是否可处理。
放量前:
-
业务指标是否显著改善。
-
风险指标是否稳定。
-
运营团队是否能承接质检。
-
模型和 Prompt 是否可回滚。
-
高峰流量下性能和成本是否可控。
没有门槛,灰度就会变成形式。团队会因为“已经做了”而继续放量,而不是因为指标真的达标。
4. 案例一:中国智能客服问答的准确率、引用率、拒答率和满意度
4.1 业务背景
某国内消费品牌上线智能客服,用于回答售后政策、物流、发票、会员积分、活动规则等问题。初期团队只看自动回复率,发现机器人能处理 60% 的会话,于是计划扩大范围。但投诉复盘发现,部分自动回复虽然减少了人工接入,却回答不完整或引用旧政策,导致用户重复咨询。
团队决定重建指标体系,不再只看“自动化率”,而是同时看质量、体验、业务和风险。
4.2 相关角色
| 角色 | 关注点 |
|---|---|
| 客服负责人 | 减少人工压力,提高满意度 |
| 产品经理 | 指标定义、灰度策略、转人工机制 |
| 算法团队 | 问答准确率、检索召回、拒答能力 |
| 运营团队 | 知识库维护、质检、失败样本标注 |
| 法务 / 风控 | 错误承诺、用户权益、隐私 |
| 数据分析师 | 看板、归因、A/B 测试 |
4.3 原始流程
用户提问-> AI 检索知识库-> 大模型生成回答-> 直接返回用户-> 用户满意或继续追问-> 必要时转人工原流程的问题:
-
只统计自动回复率,不知道回答是否正确。
-
知识库引用没有校验,模型可能答非所引。
-
拒答能力弱,不该回答的问题也尝试回答。
-
用户点踩后没有进入评估集。
-
没有区分政策类、订单类、投诉类问题。
4.4 AI 改造流程
用户提问-> 意图分类:政策 / 订单 / 活动 / 投诉 / 无关 / 高风险-> 权限和上下文检查-> 知识库检索-> 生成回答和引用-> 输出质检:准确性、引用支持、风险承诺-> 返回用户或转人工-> 收集满意度、追问、点踩、人工修改-> 失败样本进入评估集4.5 数据 / 系统依赖
| 系统 | 用途 |
|---|---|
| 客服会话系统 | 用户问题、上下文、满意度 |
| 知识库 | 政策、活动、流程、FAQ |
| 订单系统 | 订单状态和售后进度 |
| 工单系统 | 转人工、投诉、处理结果 |
| 质检后台 | 人工标注准确性和错误类型 |
| 日志系统 | Prompt、模型、引用、输出、成本 |
| BI 看板 | 指标监控和灰度分析 |
4.6 方案架构
客服入口 |AI 问答编排层 |-- 意图识别 |-- 权限检查 |-- 知识库检索 |-- 模型生成 |-- 引用校验 |-- 风险拦截 |-- 转人工 |数据闭环 |-- 用户反馈 |-- 人工质检 |-- 失败样本库 |-- 指标看板4.7 关键指标
| 指标 | 定义 | 目标 |
|---|---|---|
| 问答准确率 | 回答符合政策和事实 | 大于 95% |
| 引用准确率 | 引用内容能支持答案 | 大于 92% |
| 拒答正确率 | 不该回答时拒答或转人工 | 大于 98% |
| 首轮解决率 | 第一轮解决用户问题 | 大于 70% |
| 用户满意度 | 点赞或满意评价占比 | 大于 85% |
| 转人工合理率 | 应转人工问题成功转人工 | 大于 95% |
| 错误承诺率 | 错误赔付、退款、权益承诺 | 0 |
| 知识命中率 | 问题能命中有效知识 | 大于 80% |
| 失败样本入库率 | 点踩和投诉进入样本库 | 大于 90% |
| 单会话 AI 成本 | 平均模型和检索成本 | 低于预算 |
4.8 主要风险
| 风险 | 说明 | 应对 |
|---|---|---|
| 自动化率虚高 | AI 接了很多问题但没解决 | 用首轮解决率和满意度校正 |
| 引用不支持答案 | 模型答对但引用错误,或引用旧政策 | 引用校验和知识版本管理 |
| 拒答不足 | 高风险问题硬答 | 红线样本测试和转人工规则 |
| 成本不透明 | 高峰调用成本失控 | 按意图和模型拆分成本 |
| 反馈无闭环 | 用户点踩后没人处理 | 失败样本入库和质检 SLA |
4.9 复盘结论
客服 AI 的核心指标不是自动回复率,而是“正确地解决问题”。自动化率必须被准确率、引用率、拒答率、满意度、投诉率和成本共同约束。否则机器人看似减少人工,实际可能增加用户重复咨询和投诉。
5. 案例二:B2B 销售助手如何用指标证明业务价值
5.1 业务背景
一家 B2B SaaS 公司上线销售助手,帮助销售生成客户摘要、识别续约风险、草拟跟进邮件。内部试用时销售反馈“挺方便”,但管理层要求证明它是否真的提升续约和销售效率。
团队需要建立从模型质量到业务结果的完整指标体系。
5.2 相关角色
| 角色 | 关注点 |
|---|---|
| 销售代表 | 减少准备时间,提高跟进质量 |
| 销售主管 | 识别风险客户,提升团队效率 |
| 客户成功 | 续约风险、工单问题、客户健康度 |
| 产品经理 | 功能使用、采纳率、工作流嵌入 |
| 数据团队 | CRM、邮件、会议、工单数据 |
| 安全团队 | 客户数据权限和隐私 |
| 管理层 | 续约率、扩容率、销售人效 |
5.3 原始流程
销售打开 CRM-> 查看客户资料、会议、邮件、工单-> 手工总结风险和机会-> 写跟进邮件-> 主管检查重点客户原流程的问题:
-
销售准备客户会议耗时长。
-
不同销售总结质量不一致。
-
高风险客户发现不及时。
-
AI 试用后只看使用量,无法证明业务效果。
5.4 AI 改造流程
销售进入客户页-> AI 生成结构化客户摘要-> 标注风险、机会、下一步建议-> 销售采纳、编辑或忽略-> 跟进动作写回 CRM-> 对比客户后续续约和扩容结果5.5 数据 / 系统依赖
| 系统 | 用途 |
|---|---|
| CRM | 客户阶段、金额、续约日期、负责人 |
| 邮件 / 会议纪要 | 最近沟通、异议、承诺事项 |
| 工单系统 | 客户问题和满意度 |
| 客户健康度模型 | 风险评分和使用情况 |
| 权限系统 | 控制客户数据访问 |
| 埋点系统 | AI 使用、采纳、编辑、忽略 |
| BI 看板 | 指标分析和对照组比较 |
5.6 方案架构
CRM 客户页 |AI 销售助手 |-- 数据聚合 |-- 权限过滤 |-- 客户摘要生成 |-- 风险识别 |-- 邮件草稿 |-- 采纳和编辑记录 |业务结果追踪 |-- 跟进动作 |-- 续约结果 |-- 扩容结果 |-- 销售效率5.7 关键指标
| 指标 | 定义 | 目标 |
|---|---|---|
| 摘要准确率 | 摘要是否符合 CRM 和会议事实 | 大于 92% |
| 风险识别召回率 | 高风险客户是否被识别 | 大于 85% |
| 建议采纳率 | 销售采纳 AI 下一步建议 | 大于 30% |
| 草稿编辑率 | 邮件草稿被修改比例 | 中等且下降 |
| 准备时间节省 | 销售会议前准备时间下降 | 降低 20% |
| 有效触达率 | AI 建议后产生有效客户互动 | 提升 10% |
| 续约风险提前发现率 | 风险客户提前进入跟进 | 提升 15% |
| 续约率 | 实验组相对对照组变化 | 正向提升 |
| 权限违规数 | 无权限数据进入 Prompt | 0 |
| 单客户摘要成本 | 生成一次摘要的 AI 成本 | 低于预算 |
5.8 主要风险
| 风险 | 说明 | 应对 |
|---|---|---|
| 使用量高但无业务价值 | 销售觉得新鲜但不改变结果 | 关注采纳率、触达率、续约率 |
| 摘要遗漏关键信息 | 影响销售判断 | 增加人工反馈和失败样本 |
| 权限风险 | 客户数据越权进入上下文 | 后端权限过滤,日志审计 |
| 指标归因困难 | 续约受很多因素影响 | 设置对照组和分层分析 |
| 销售不信任 | AI 建议太泛 | 跟踪编辑率和忽略原因 |
5.9 复盘结论
销售助手不能只用“使用次数”证明价值。真正有用的指标是采纳率、准备时间节省、有效触达率、风险提前发现率和续约结果。AI 产品必须嵌入工作流,记录用户是否采纳,才能连接到业务结果。
6. 动手实操任务
任务:为一个 AI 功能设计 12 个指标
选择一个 AI 功能,例如智能客服、AI 导购、销售助手、合同摘要、经营分析、商品文案生成、内部知识问答。为它设计一套指标体系。
必须包含:
-
功能说明:用户是谁,任务是什么。
-
指标分层:模型、体验、业务、安全、成本、运营六类。
-
至少 12 个指标:每类至少 1 个。
-
指标定义:每个指标怎么计算。
-
数据来源:日志、埋点、业务系统、人工标注、用户反馈。
-
阈值:上线前、灰度中、放量前的目标。
-
决策用途:指标用于上线、优化、风控、增长还是预算。
验收标准
| 验收项 | 标准 |
|---|---|
| 指标数量 | 至少 12 个 |
| 分层完整 | 覆盖模型、体验、业务、安全、成本、运营 |
| 定义清晰 | 每个指标可计算,不是口号 |
| 数据来源明确 | 能说明从哪里采集 |
| 阈值明确 | 有上线、灰度或放量门槛 |
| 决策可用 | 能指导是否上线、是否放量、是否回滚 |
7. 测试题与参考答案
7.1 理解题
题 1:为什么 AI 产品不能只看调用量?
参考答案: 调用量只能说明有人使用,不说明问题被解决。调用量高可能来自用户喜欢,也可能来自 AI 没答好导致反复追问。AI 产品还要看准确率、任务完成率、满意度、业务结果、风险和成本。
题 2:模型指标和业务指标有什么区别?
参考答案: 模型指标衡量输出本身是否正确、安全、稳定,例如准确率、引用率、格式合规率。业务指标衡量 AI 是否创造业务价值,例如转化率、人工工单减少、续约率、运营效率提升。模型好不等于业务一定好。
题 3:为什么拒答率不能简单理解为越低越好?
参考答案: 在高风险、无权限或信息不足场景中,正确拒答或转人工是安全行为。拒答率过低可能说明模型硬答,带来错误承诺和合规风险。应看拒答正确率,而不是单纯降低拒答。
题 4:什么是运营闭环指标?
参考答案: 运营闭环指标衡量 AI 产品能否持续改进,例如失败样本入库率、标注完成率、知识库更新时效、Prompt 回归通过率。它们决定线上问题能否被发现、归因和修正。
7.2 应用题
题 5:智能客服自动回复率提升,但满意度下降,你会如何分析?
参考答案: 说明自动化可能处理了不该自动处理的问题。应拆分意图类型,看准确率、引用率、转人工合理率、错误承诺率、首轮解决率和投诉率。必要时降低高风险场景自动回复范围,增加转人工和知识库质检。
题 6:AI 导购入口点击率高,但转化没有提升,可能是什么原因?
参考答案: 可能是入口吸引但推荐不准、澄清流程太长、推荐理由不可信、商品库存价格不匹配、购买路径断裂,或 AI 成本高于增量收益。需要看推荐点击率、加购率、澄清完成率、错误推荐率、单次转化成本和对照组转化。
题 7:如何为合同摘要 AI 设计安全指标?
参考答案: 应包含关键条款遗漏率、错误解释率、引用准确率、无依据结论率、风险条款召回率、人工复核通过率、隐私泄露率、越权访问率。合同摘要应明确辅助阅读,不替代法务审查。
8. 当日产出模板
8.1 AI 功能指标体系表
| 指标层级 | 指标名称 | 定义 | 计算方式 | 数据来源 | 阈值 | 决策用途 |
|---|---|---|---|---|---|---|
| 模型 | 准确率 | 输出符合标准答案 | 正确样本数 / 总样本数 | 评估集、人工标注 | 上线准入 | |
| 模型 | 引用准确率 | 引用是否支持答案 | 正确引用数 / 有引用回答数 | 知识库、质检 | RAG 质量 | |
| 模型 | 格式合规率 | 输出结构是否可解析 | 合规输出数 / 总输出数 | API 日志 | 工程接入 | |
| 体验 | 任务完成率 | 用户是否完成目标任务 | 完成任务用户 / 使用用户 | 埋点、业务系统 | 体验优化 | |
| 体验 | 满意度 | 用户点赞或评分 | 满意反馈 / 总反馈 | 用户反馈 | 灰度监控 | |
| 体验 | 转人工率 | AI 无法处理转人工 | 转人工会话 / AI 会话 | 工单系统 | 人机协作 | |
| 业务 | 转化提升 | AI 组相对对照组提升 | B 组转化 - A 组转化 | A/B 测试 | 放量决策 | |
| 业务 | 人效提升 | 人工处理时间下降 | 节省时间 / 原时间 | 业务系统 | ROI | |
| 安全 | 高风险错误率 | L4/L5 错误占比 | 高风险错误 / 抽检样本 | 质检、安全日志 | 0 | 风控 |
| 安全 | 拒答正确率 | 应拒答问题是否拒答 | 正确拒答 / 应拒答样本 | 红线评估集 | 上线准入 | |
| 成本 | 单任务成本 | 完成一次任务的 AI 成本 | 总 AI 成本 / 完成任务数 | API 账单、日志 | 预算 | |
| 成本 | 缓存命中率 | 避免模型调用比例 | 缓存命中 / 总请求 | 缓存日志 | 成本优化 | |
| 运营 | 失败样本入库率 | 失败是否沉淀评估集 | 入库失败样本 / 失败样本 | 质检后台 | 持续优化 | |
| 运营 | Prompt 回归通过率 | 新版本是否通过测试 | 通过样本 / 回归样本 | 测试平台 | 发布管理 |
8.2 智能问答评估指标模板
功能名称:智能问答适用范围:知识来源:上线阶段:内部试用 / 灰度 / 全量
一、模型质量- 答案准确率:- 引用准确率:- 幻觉率:- 拒答正确率:- 同问一致性:
二、用户体验- 首轮解决率:- 平均追问轮次:- 用户满意度:- 转人工率:- 放弃率:
三、业务结果- 人工咨询减少:- 平均处理时长下降:- 投诉率变化:- 自助解决率:
四、安全风险- 错误承诺率:- 隐私泄露率:- 越权回答率:- 红线样本通过率:
五、成本效率- 单会话成本:- 平均输入 Token:- 平均输出 Token:- 缓存命中率:- 强模型调用占比:
六、运营闭环- 点踩样本入库率:- 质检完成率:- 知识库更新时效:- Prompt 回归通过率:
上线结论:- 允许上线:- 仅灰度:- 需人工审核:- 阻塞上线:8.3 指标评审问题清单
1. 这个指标用于什么决策?2. 指标是否可计算,数据从哪里来?3. 指标是否可能被误读?4. 是否需要按意图、用户、渠道、模型版本拆分?5. 是否有上线前、灰度中、放量前门槛?6. 哪些指标是红线指标?7. 哪些指标需要人工标注?8. 指标异常时谁负责处理?9. 指标是否能连接业务价值?10. 指标是否能支撑复盘和迭代?9. 延伸阅读资料
-
大模型评估方法:准确性、忠实度、引用准确率、拒答能力、一致性。
-
产品数据分析基础:漏斗、留存、A/B 测试、分群和归因。
-
客服质检指标:首轮解决率、转人工率、满意度、投诉率。
-
RAG 评估资料:检索召回、答案忠实度、引用正确率。
-
SRE 和风控指标:错误预算、红线指标、告警和回滚。
-
FinOps:云成本归因、单位经济模型、预算告警和 ROI 评估。
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!












