Token 与成本意识
1. 今日主题与一句话结论
主题:Token 与成本意识
一句话结论: Token 是大模型产品的“计量单位”,但对产品经理来说,它不只是技术概念,而是直接决定成本、延迟、上下文设计、功能边界、商业模式和增长 ROI 的核心变量。
很多 AI Demo 看起来都能跑通,但上线后会遇到几个非常具体的问题:
-
用户一多,模型调用成本明显上升。
-
长文档、长对话导致响应变慢。
-
Prompt 越写越长,质量可能提升,但成本也随之上升。
-
智能客服每轮都把全部历史对话塞给模型,成本失控。
-
商品文案批量生成时,单条看起来便宜,日调用量一上来就变成预算问题。
-
免费试用、低价套餐、内部工具如果没有用量限制,会被高频用户迅速打穿成本。
所以,AI 产品经理不能只会说“接一个大模型”。必须能把模型调用拆成可计算、可监控、可优化的成本结构。
2. 学习目标
今天学完后,你要能做到:
-
解释 Token 是什么,以及为什么中文、英文、代码、表格、长文档的 Token 消耗不同。
-
区分输入 Token、输出 Token、上下文窗口、缓存命中、批处理等成本变量。
-
为商品文案生成、智能客服、企业知识库问答等场景建立粗略成本模型。
-
判断一个 AI 功能的成本风险来自哪里:长输入、长输出、高频调用、多轮对话、低命中缓存、模型选型过重,还是无用上下文太多。
-
设计基本的成本优化方案:Prompt 压缩、上下文裁剪、RAG 精检索、结果缓存、小模型路由、人工确认前置、套餐限额。
3. 深度阅读:Token 是 AI 产品的成本语言
3.1 Token 到底是什么
大语言模型不是直接按“字”或“词”理解文本,而是先把文本切成一个个 Token。Token 可以粗略理解为模型处理文本的最小片段,但它不完全等于中文的“字”,也不完全等于英文的“单词”。
例如:
人工智能正在改变商品运营效率这句话可能被切成若干个中文片段。不同模型的 tokenizer 不同,切法也会不同。英文里,一个单词也可能被拆成多个子词。例如 unbelievable 可能被拆成 un、believ、able 一类片段。代码、URL、JSON、表格、特殊符号也会带来额外 Token 消耗。
产品经理不需要记住具体 tokenizer 算法,但要形成一个判断:
模型每次读进去的内容和写出来的内容,都会被换算成 Token;Token 越多,通常成本越高、延迟越高、上下文管理越复杂。
3.2 输入 Token 与输出 Token
一次模型调用通常包含两类 Token:
总 Token = 输入 Token + 输出 Token输入 Token 包括:
-
系统提示词。
-
用户问题。
-
历史对话。
-
RAG 检索出来的资料。
-
商品资料、合同文本、表格数据。
-
输出格式要求。
-
示例样本。
-
安全约束、拒答规则。
输出 Token 包括:
-
模型最终回答。
-
JSON 结构化结果。
-
摘要、文案、报告、代码。
-
推理说明或解释文本。
很多团队只关注用户输入,却忽略了系统提示词和检索资料。实际上,企业级 AI 功能里,用户一句话可能很短,但系统塞给模型的上下文很长。
例如用户问:
这个订单可以退款吗?用户输入只有几个字,但系统可能会拼接:
-
退款政策。
-
订单状态。
-
商品类目。
-
活动规则。
-
用户等级。
-
历史客服记录。
-
输出格式约束。
-
风险提示。
真正花钱的是整个请求,不是用户这句话。
3.3 上下文窗口不是免费空间
上下文窗口指模型一次能看到的 Token 范围。窗口越大,能塞进去的文档、对话、资料越多。但它不是免费空间。
产品上常见误区:
-
以为上下文越长越好。 实际上,上下文越长,成本越高,响应越慢,模型也可能忽略中间信息。
-
把所有历史对话都塞进去。 多轮客服、AI 助手、销售跟进场景里,这会快速拉高成本。
-
RAG 检索越多越安全。 检索片段太多会稀释重点,让模型更难定位答案。
-
Prompt 不断加规则。 为了解决一个问题就在 Prompt 里加一段规则,长期会变成“巨型 Prompt”,成本和维护性都变差。
更合理的做法是:
-
只放当前任务需要的信息。
-
历史对话做摘要,而不是全量塞入。
-
RAG 检索后做重排,只保留最相关片段。
-
高风险规则用系统侧规则校验,而不是全写进 Prompt。
-
对固定规范做版本化管理,而不是每个请求重复塞全部内容。
3.4 Token 成本公式
不同模型供应商的价格不同,而且会变化。产品经理不应该死记某个价格,而应该掌握估算公式。
可以用下面这个通用公式:
单次调用成本 = 输入 Token 数 / 1,000,000 × 输入单价+ 输出 Token 数 / 1,000,000 × 输出单价+ 其他成本其他成本可能包括:
-
Embedding 成本。
-
向量数据库成本。
-
重排模型成本。
-
图片、音频、视频模型成本。
-
日志和存储成本。
-
人工审核成本。
-
研发和运维成本。
如果只是做 Demo,可以只估算模型调用成本。但如果要上线,需要估算完整链路成本。
3.5 产品经理要做的是“单位经济模型”
AI 功能上线后,不能只看“模型单次调用很便宜”。真正要算的是单位经济模型。
例如智能客服:
单次会话成本 = 平均轮次 × 单轮模型成本+ RAG 检索成本+ 工单创建/查询接口成本+ 人工接管成本 × 接管率+ 日志与质检成本再看价值:
单次会话价值 = 节省人工客服成本+ 提升响应速度带来的满意度收益+ 提升转化或减少流失- 错答导致的赔付/投诉/信任损失如果只看模型成本,很容易误判。如果一个 AI 客服单次会话花 0.02 元,但错答率导致投诉和赔付增加,这个功能仍然可能不划算。
3.6 商品文案生成的成本结构
商品文案生成是一个适合理解 Token 成本的场景。
假设生成一个商品详情页,需要输入:
-
商品标题。
-
商品类目。
-
规格参数。
-
卖点。
-
目标人群。
-
平台规范。
-
品牌语气。
-
输出格式。
-
禁用词。
输出包括:
-
商品标题。
-
五点卖点。
-
详情页段落。
-
小红书/抖音/淘宝不同渠道文案。
-
SEO 关键词。
成本风险来自:
-
输入资料太长。 运营把整份商品说明、竞品文案、平台规范全塞进去。
-
输出版本太多。 一次生成 10 个版本,看似方便,但输出 Token 翻倍增长。
-
批量规模大。 单个商品成本很低,但每天几千、几万商品就明显了。
-
返工率高。 如果生成内容质量差,需要多次重试,成本成倍增加。
-
审核成本被忽略。 文案生成后还需要人工校对、合规审查、平台审核。
所以商品文案生成不是简单比较“一次调用多少钱”,而要看:
单商品最终可用成本 = 首次生成成本+ 平均重试次数 × 重试成本+ 人工审核时间成本+ 违规/驳回成本3.7 智能客服的成本结构
智能客服比商品文案更复杂,因为它是多轮对话。
一个用户可能连续问:
-
什么时候发货?
-
能不能催一下?
-
如果今天不发能退款吗?
-
我用了优惠券,退款怎么算?
-
那你帮我申请吧。
每一轮都可能需要订单查询、政策检索、历史对话上下文和风险判断。成本增长有几个特点:
-
轮次越多,历史上下文越长。
-
问题越复杂,RAG 检索资料越多。
-
高风险问题需要人工接管。
-
如果答案不准,用户会追问,进一步增加轮次。
因此,智能客服的成本优化不只是“换便宜模型”,更重要的是减少无效轮次:
-
第一轮就识别意图。
-
能用按钮和结构化信息解决的,不让用户反复自然语言输入。
-
高频问题直接走 FAQ 或缓存。
-
高风险问题尽早转人工。
-
对重复问题做语义缓存。
-
对长对话做摘要,不全量塞入。
3.8 成本、质量、体验三角
AI 产品永远在三角之间权衡:
质量 ▲ │ │成本 ───── 体验想提升质量,可能要用更强模型、更多上下文、更复杂 RAG、更高人工审核,成本和延迟会上升。
想降低成本,可能要用小模型、减少上下文、缓存、模板化,但质量和灵活性可能下降。
想提升体验,可能要流式输出、预加载、减少等待、简化交互,但后端复杂度增加。
产品经理要做的不是追求单点最优,而是为不同场景设置不同策略。
例如:
| 场景 | 策略 |
|---|---|
| 商品标题初稿 | 小模型 + 模板 + 批处理 |
| 高价值商品详情页 | 强模型 + 多版本 + 人工审核 |
| 普通客服 FAQ | 缓存 + RAG + 小模型 |
| 投诉/赔付问题 | RAG + 强模型辅助 + 人工确认 |
| 数据分析摘要 | 强模型 + 结构化输出 + 结果校验 |
| 内部头脑风暴 | 低成本模型即可 |
3.9 成本优化不是只砍 Token
很多人一听 Token 成本,就以为成本优化等于压缩 Prompt。这只是一部分。
完整优化手段包括:
-
任务路由:简单任务用规则或小模型,复杂任务用强模型。
-
上下文裁剪:只保留任务相关信息。
-
RAG 精准检索:不要把太多资料塞给模型。
-
缓存:高频问题、相似问题、固定说明直接复用。
-
批处理:批量生成商品文案、摘要、标签时统一处理。
-
结构化输入:用字段替代大段自然语言描述。
-
结构化输出:避免模型输出冗长解释。
-
限制重试:重试次数要有策略,不是失败就无限重跑。
-
人工前置:高风险或资料缺失时不要让模型反复猜。
-
监控异常用量:识别超长输入、异常高频用户、循环调用。
3.10 AI 商业化必须考虑用量边界
如果你未来做 AI 项目商业化,Token 成本会影响定价。
常见模式:
-
按账号订阅。
-
按调用次数。
-
按 Token 或额度包。
-
按功能套餐。
-
按项目交付 + 运维年费。
-
按业务结果分成。
其中最危险的是“固定低价不限量”。如果用户使用量没有上限,模型成本可能超过收入。
所以 AI 产品定价通常需要:
-
基础套餐包含固定额度。
-
超出额度按量计费。
-
高成本功能单独计费。
-
企业版支持更高额度和私有化。
-
后台实时展示用量。
-
管理员可设置预算和预警。
4. 详细案例一:国内电商商品详情页批量生成
业务背景
一个中小电商团队每天需要上新大量商品。运营要根据供应商资料、商品图片、规格参数、平台规则,生成淘宝、抖音、小红书、拼多多等不同渠道的标题、卖点、详情页文案和短视频口播稿。
原来人工流程通常是:
供应商给资料-> 运营整理参数-> 参考竞品-> 写标题和卖点-> 适配平台格式-> 检查禁用词-> 上架-> 根据点击率和转化率修改痛点:
-
上新慢。
-
文案质量依赖个人经验。
-
多平台重复改写。
-
违规词和夸大宣传容易漏。
-
很难快速做 A/B 测试。
相关角色
-
商品运营:负责上新和文案。
-
设计/内容团队:负责图片、短视频、详情页。
-
类目负责人:负责转化率和毛利。
-
合规/平台规则负责人:负责禁用词和广告法风险。
-
产品经理:设计生成流程、审核机制、指标和成本边界。
-
研发/AI 工程:实现模型调用、模板、缓存、批处理、日志。
原始流程成本
假设一个运营人工写一个商品详情需要 20 分钟。每天 500 个商品,需要 10000 分钟,也就是 166 小时。即使多人协作,整体上新效率也受限。
AI 可以把首次草稿生成压缩到秒级,但不能忽略审核、重试和平台适配成本。
AI 改造流程
商品结构化资料-> 图片/类目/参数识别-> 文案生成 Prompt 模板-> 平台规则和禁用词校验-> 多版本输出-> 人工审核-> 上架-> 点击率/转化率回流-> 优化 Prompt 和模板数据与系统依赖
-
商品主数据:类目、品牌、规格、价格、库存。
-
商品图片。
-
历史高转化文案。
-
平台规则库。
-
禁用词库。
-
竞品卖点库。
-
上架系统。
-
数据看板:曝光、点击、转化、退款、投诉。
Token 成本估算方法
不要一开始算精确值,先算量级。
假设每个商品:
-
输入 Token:商品资料 800,平台规则摘要 500,Prompt 700,竞品参考 800,总计约 2800。
-
输出 Token:标题、卖点、详情页、短视频脚本,总计约 1800。
-
首次生成总 Token:约 4600。
-
平均重试 0.5 次。
则:
单商品 Token 消耗 ≈ 4600 × 1.5 = 6900每日 500 商品 ≈ 3,450,000 Token每月 22 个工作日 ≈ 75,900,000 Token然后再套供应商价格:
月模型成本 =输入 Token / 1,000,000 × 输入单价+ 输出 Token / 1,000,000 × 输出单价这一步的目的不是追求精确到分,而是让项目评审能判断:
-
预算是否可接受。
-
是否需要小模型。
-
是否需要批处理。
-
是否需要平台规则摘要缓存。
-
是否需要限制单商品生成版本数。
方案架构
商品资料库 -> 字段清洗 -> 文案生成编排层 -> 类目 Prompt 模板 -> 平台规则摘要 -> 禁用词校验 -> 模型调用 -> 多版本结果 -> 人工审核工作台 -> 上架系统 -> 数据回流 -> 模板优化关键指标
-
单商品上新耗时。
-
文案一次通过率。
-
人工修改率。
-
平台审核驳回率。
-
商品点击率。
-
商品转化率。
-
单商品生成成本。
-
多版本测试收益。
主要风险
-
生成内容夸大宣传。
-
商品参数被模型改写错误。
-
平台规则更新但知识库未更新。
-
批量生成导致同质化严重。
-
输出版本过多导致成本上升。
-
人工审核被低估。
复盘结论
这个场景适合用 AI,但产品设计重点不是“让模型会写文案”,而是控制整个内容生产系统:
-
输入要结构化。
-
平台规则要可维护。
-
输出要可审核。
-
成本要按商品和渠道核算。
-
效果要回流到模板和 Prompt。
如果只做一个“输入商品信息,输出文案”的工具,价值有限。真正有价值的是把 AI 嵌入上新流程,形成内容生产流水线。
5. 详细案例二:智能客服多轮对话成本控制
业务背景
一个平台型业务每天有大量客服咨询,包括物流、退款、优惠券、售后、活动规则、账号问题。团队希望引入 AI 客服降低人工压力。
原始流程:
用户咨询-> 机器人 FAQ 命中-> 命不中转人工-> 人工查订单/规则-> 回复用户-> 创建工单或关闭会话痛点:
-
FAQ 命中率有限。
-
用户表达口语化,关键词匹配不准。
-
人工处理重复问题多。
-
高峰期响应慢。
-
新活动上线后客服压力激增。
AI 改造流程
用户输入-> 意图识别-> 风险分级-> 订单/用户信息查询-> RAG 检索政策-> 生成回答-> 低风险自动回复-> 高风险转人工-> 用户反馈-> 质检与评估Token 成本问题
智能客服最容易成本失控,因为它是多轮对话。
假设:
-
平均每个会话 5 轮。
-
每轮输入包含历史摘要、用户问题、政策片段和系统规则。
-
每轮输出 200-500 Token。
如果每一轮都塞完整历史记录,成本会随轮次增长:
第 1 轮:用户问题 + 政策片段第 2 轮:第 1 轮历史 + 新问题 + 政策片段第 3 轮:前 2 轮历史 + 新问题 + 政策片段...这会带来两个问题:
-
成本增长。
-
模型注意力被历史信息稀释。
成本优化策略
更合理的方式:
-
意图先行:先用轻量模型或规则判断问题类型。
-
高频问题缓存:物流时效、发票规则、活动说明等直接缓存。
-
历史对话摘要:不保留全量历史,只保留当前任务状态。
-
RAG 精检索:只给最相关 3-5 个片段。
-
风险分级:退款、赔付、投诉、法律威胁直接转人工或强约束。
-
结构化按钮:能用按钮收集信息,就不要让用户反复自然语言描述。
-
模型路由:简单 FAQ 用便宜模型,复杂投诉用强模型辅助。
方案架构
用户消息 -> 意图分类器 -> 风险分级器 -> 会话状态摘要 -> 知识库检索 -> 模型路由 -> 小模型:FAQ/低风险 -> 强模型:复杂解释/多约束 -> 回复生成 -> 置信度判断 -> 自动回复或人工接管 -> 反馈与质检关键指标
-
自助解决率。
-
人工接管率。
-
单会话平均 Token。
-
单会话平均成本。
-
平均轮次。
-
首次响应时间。
-
错答率。
-
用户满意度。
-
高风险问题拦截率。
主要风险
-
AI 错误承诺退款或赔付。
-
活动规则过期。
-
用户绕过安全限制诱导模型输出不当内容。
-
长对话中模型忘记关键上下文。
-
成本被高频用户或异常流量打穿。
复盘结论
智能客服不是越智能越好,而是要把低风险、高频、重复问题自动化,把高风险问题尽早识别并交给人工。Token 成本控制的核心不是“回答少一点”,而是“少走无效轮次、少塞无关上下文、少让强模型处理简单任务”。
6. 动手实操任务
任务:估算 3 个 AI 功能的 Token 成本
请选择 3 个你熟悉的场景,例如:
-
商品详情页生成。
-
智能客服问答。
-
合同条款摘要。
-
企业制度问答。
-
运营日报生成。
按下面模板估算。
| 场景 | 单次输入内容 | 估算输入 Token | 单次输出内容 | 估算输出 Token | 日调用量 | 重试/多轮系数 | 日 Token 总量 | 成本风险 |
|---|---|---|---|---|---|---|---|---|
| 商品文案生成 | 商品资料 + 规则 + Prompt | 标题 + 卖点 + 详情 |
验收标准
合格:
-
至少估算 3 个场景。
-
每个场景区分输入 Token 和输出 Token。
-
每个场景写明日调用量。
-
每个场景识别至少 1 个成本风险。
优秀:
-
能提出至少 2 个成本优化策略。
-
能说明成本优化是否会影响质量或体验。
-
能把成本和业务指标联系起来,例如转化率、人工节省、客诉率。
7. 测试题与参考答案
理解题
1. Token 为什么不等于中文的字或英文的词? 参考答案:Token 是模型 tokenizer 切分后的文本片段。中文、英文、代码、数字、符号的切分方式不同,一个词可能被拆成多个 Token,一个中文短语也可能被拆成不同片段。
2. 为什么企业 AI 问答里用户问题很短,但成本可能很高? 参考答案:因为输入不只包括用户问题,还包括系统提示词、历史对话、RAG 检索资料、权限规则、输出格式和安全约束。
3. 上下文窗口越大是否一定越好? 参考答案:不是。上下文越大通常成本越高、延迟越高,模型也可能忽略中间信息。产品应只放当前任务需要的信息。
4. 智能客服为什么容易成本失控? 参考答案:多轮对话会带来历史上下文累积;复杂问题需要检索资料;用户追问会增加轮次;高风险问题如果不及时转人工,会造成重复调用和错误成本。
5. 成本优化是否等于压缩 Prompt? 参考答案:不是。Prompt 压缩只是手段之一,还包括任务路由、缓存、上下文裁剪、RAG 精检索、批处理、结构化输入输出、限制重试、异常用量监控等。
应用题
6. 商品详情页生成如何降低成本但不明显降低质量? 参考答案:结构化商品输入;平台规则做摘要缓存;按类目维护 Prompt 模板;先用小模型生成初稿,高价值商品再用强模型优化;限制输出版本数;用禁用词和规则系统做后处理;将点击率和转化率回流优化模板。
7. 智能客服什么时候不应该继续调用模型? 参考答案:当问题涉及赔付、退款审批、法律威胁、用户情绪激烈、资料不足、低置信、权限不足或多轮未解决时,应转人工或触发确定性规则,而不是继续让模型猜。
8. 当日产出模板
8.1 Token 成本估算表
| AI 功能 | 用户任务 | 输入 Token 构成 | 输出 Token 构成 | 日调用量 | 多轮/重试系数 | 日 Token | 成本优化策略 | 关联业务指标 |
|---|---|---|---|---|---|---|---|---|
8.2 成本-质量-体验权衡表
| 场景 | 当前方案 | 成本风险 | 质量要求 | 体验要求 | 推荐优化 | 可能副作用 |
|---|---|---|---|---|---|---|
| 高/中/低 | 高/中/低 |
9. 延伸阅读资料
-
模型供应商官方价格页:用于查看输入/输出 Token 单价。不要死记价格,重点掌握公式和估算方式。
-
OpenAI tokenizer / tiktoken 类工具:用于理解文本如何被切成 Token。
-
本地材料:
AI产品商业化模式.pptx、AI产品性能优化.pptx、大模型API产品化.pptx。 -
飞书《AI每日同步》Day1、Day4、Day6,可对照 Token、API 产品化和商业化内容。
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!











