小程序接入 LLM 的 3 个隐藏成本
内容说明:本文用于讲解方案设计、实施步骤与验收方法。文中的企业、人物、工期、价格和成效数字如无公开来源,均为匿名化情境示例或验收指标示例,不代表经过公开证据核验的客户项目,也不构成效果承诺。实际结果以需求确认、测试数据和双方验收记录为准。
模拟需求或验收摘录(情境演示)
2024 年起,小程序接 LLM 几乎成了标配(智能客服、内容生成、推荐)。但真正上线后才发现 3 个预估不到的隐藏成本。
背景
小程序接 LLM 主要两条路:
- 云函数 + 大模型 API(腾讯混元/OpenAI/Claude) —— 主流
- 本地/边缘 + 小模型(WASM 量化版 LLaMA) —— 少见,性能差
我们接的 7 个项目里有 5 个选第一条路。预估 5 万,实际花了 12 万。今天讲这多出来的 7 万在哪。
隐藏成本 1:首字延迟
现象
客户测试时:首字 1.5 秒,体感流畅。
上线后:首字 4-6 秒,用户开始吐槽"加载慢"。
原因
测试时只发一两条请求,API 厂商冷启动很快。
上线后并发涨上来,API 厂商限流 + 模型预热 + 网络抖动,首字延迟飙到 5 秒+。
我们的标准方案
- 前端流式渲染 —— 用 SSE 或 WebSocket,模型输出第一个字就立刻显示,体感延迟压到 200ms 内
- 预生成响应 —— 用户进入页面时,根据上下文预请求一次,藏起来备用
- 客户端缓存 —— 相同问题的回答缓存 24 小时(用户感知不到第二次问)
- 冷启动降级 —— 接入初期用便宜模型(qwen-turbo),高峰期再升级
方案示例
情境示例一。客户说"小程序的智能客服要秒回",我们压预算压了流式渲染的成本。结果上线后客服反馈"我们的对话经常 5 秒才开始出字"。一周内投诉率涨了 15%。
补救:加班加点加了流式渲染 + WebSocket,2 周上线 2.0 版本。多花了 4 万(加班 + 重新设计前端架构)。
隐藏成本 2:token 失控
现象
合同里写"每月 50 万 token",客户觉得自己用得不多。
上线后第 2 个月账单:280 万 token,差点爆预算。
原因
- 用户对话越来越长(早期 3 轮,后期 10+ 轮)
- 上下文累积:每轮对话都要带之前所有历史,token 指数级涨
- System prompt 没优化:有些项目 system prompt 写了 2000 字,每次请求都带
我们的标准方案
- 滑动窗口 —— 历史对话只保留最近 5 轮,旧对话摘要压缩(1 轮历史 ≈ 50 token 摘要)
- System prompt 模板化 —— 区分"固定部分"(项目背景, 500 token)和"动态部分"(用户当前上下文, 变长)
- 客户端截断 —— 单条用户输入 > 200 字,前端先提示"请精简"
- 用量监控 —— 每个用户每天 token 用量设上限,超了发通知给管理员
方案示例
第二个项目栽过。客户做"AI 法律咨询小程序",用户喜欢问长问题(案情描述)。我们压预算没做滑动窗口,2 个月后 token 用量月均 250 万,客户差点弃用。
补救:加了滑动窗口 + 摘要压缩,token 降回 80 万/月。多花了 2 万(架构调整 + 1 个月观察期)。
隐藏成本 3:审核风险
现象
小程序审核时,接入 LLM 的应用可能被拒绝或下架。
常见原因:
- 内容安全(
wx.setStorageSync里藏的违禁词) - 用户数据收集(对话内容上传第三方 API)
- 虚拟支付(用 LLM 生成的内容收费,微信不允许)
我们的标准方案
- 内容安全前置 —— 用户输入先过腾讯云数美/网易易盾,违规直接拒
- 隐私协议明示 —— 在用户首次使用时弹窗告知"对话内容会上传 OpenAI/腾讯混元 API"
- 虚拟支付合规 —— LLM 收费走"会员订阅"或"虚拟道具",不走"按次付费"
- 数据存储本地化 —— 对话历史只存本地(
wx.setStorageSync),不同步到我们服务器
方案示例
第三个项目栽过。客户小程序上线 3 个月后被举报"违规收集用户隐私",被微信下架 7 天。恢复审核走了 2 周(找律师 + 出证明 + 改代码)。
补救:加了内容安全前置 + 隐私弹窗。多花了 1 万(接入易盾 + 改前端)。
总结:3 个隐藏成本
| 成本 | 预估偏差 | 我们的标准方案 |
|---|---|---|
| 首字延迟 | 1.5s → 5s+ | 流式渲染 + 预生成 + 缓存 |
| Token 失控 | 5x 预算 | 滑动窗口 + 截断 + 监控 |
| 审核风险 | 下架 1-2 周 | 内容前置 + 隐私明示 + 支付合规 |
预算加 30% 是行业基准。小程序接 LLM 不是"加个 API 调用"那么简单 —— 3 个隐藏成本预估不到,项目必超支。
常见问题
Q1:为什么不直接用 ChatGPT 的官方 API?
小程序内调 ChatGPT API 会被微信风控。海外大模型在国内访问慢,而且支付渠道(信用卡)不便民。国内场景首选腾讯混元/通义/智谱。
Q2:本地小模型(LLaMA WASM 量化版)行不行?
目前不行。3B 模型量化后在小程序里跑要 5-10 秒首字,且内存吃紧(小程序限制 200MB)。除非只是简单分类/推荐,生成场景必须走 API。
Q3:接 LLM 一定要做内容安全吗?
是的。LLM 偶尔会输出违规内容(尤其是用户引导),不做前置过滤会被微信一锅端。预算 + 1-2 万(接易盾 API),小钱但救命。
Q4:用户对话要存数据库吗?
别。对话历史敏感度高,存本地最稳。如果非要存(用于个性化推荐),一定要明示 + 加密 + 用户可删除。见过项目方没明示,被网信办约谈。
Q5:小程序的 LLM 调用收费怎么定价?
建议走会员订阅(微信原生支持),不要走"按次付费"(违规)。定价参考:基础会员 9.9 元/月(100 次对话),高级会员 29.9 元/月(500 次)。用户接受度高,合规。
信任网络科技工作室 — 苏州工业园区,做小程序 + AI 应用就找我们


