Files
cma-management/docs/token-optimization-checklist-20260830.md
T

4.1 KiB
Raw Blame History

Token 消耗优化清单(2026-08-30 固化)

依据:全系统一周用量分析(8/24-8/307,832次调用/输入14.8亿tokens/费用$9.05/平均单次输入18.9万tokens) 主因:上下文超长(每轮重发系统提示+记忆+历史)+ 高频agent cron长prompt 现状:缓存命中98.7%压住费用;一旦缓存失效费用暴增50倍

一、高风险项(缓存失效即爆费)

# 现状 动作 负责人
1 系统提示/记忆频繁改动 每次改动=缓存前缀失效→全量未命中计费 系统提示/SOUL 每周最多改1次,改后当天注意用量 各Bot维护
2 日志轮转/网关重启 重启后首轮缓存重建 重启/升级后首小时监控用量 运维
3 长会话不归档 单会话历史膨胀(单次输入19万) 超过24h无用的会话 /new;运维已有"超长会话自动归档-每周"(保留+执行) 各Bot

二、高频 agent cron 精简(输入大头,按周调用×prompt长度排序)

🔬 研学(2050次/周,$3.21——最高)

cron 动作
梦境模式-夜间复盘 prompt 精简(保留铁律三句+核心步骤,砍过程叙述)
知识库夜间维护 确认 no_agent 脚本化(非LLM步骤全脚本)
老板晨间进化简报 输出限200字(已有),prompt 检查冗余
pending任务扫描 已是 no_agent 脚本(零token)——保持

🖥️ 全栈(1502次/周,$1.15

cron 动作
cma-threshold-check 改 no_agent 脚本(阈值检查=确定性逻辑,无需LLM
knowledge-index-rebuild 已 no_agent(索引构建脚本)——保持
研学BOT周报 输出限200字

🔧 运维(964次/周,$1.07

cron 动作
wecom-group-analyzer 频率评估(如非实时需求,日1次够)
hot-topic-wiki-archive 输出限200字
实时系统监控/监控分级响应 改 no_agent 脚本(监控=确定性阈值判断)
CI状态检查-每15分钟 已是 no_agent(零token)——保持

🧪 QA1280次/周,$0.91

cron 动作
pending任务扫描 no_agent 保持
QA 调用高因 cron/会话) 检查是否有长会话未归档

🏗️ 项目(735次/周,$0.79

cron 动作
分域扫描-7域协调-v7 prompt 含采集规则5条(必要)——评估合并为脚本+agent混合
豆包算法每周跟踪/DeepSeek IPO/OpenCode审查 周频低,prompt 精简(输出限200字已有)
跨Profile日报汇总 输出限200字
记忆连续性引擎-1h 已是 no_agent 脚本botos-memory-extract.sh,零token)——无需改

🎨 品宣(112次/周,$0.15——已低)

cron 动作
creative-monday/内容运营报告 prompt 精简(可选)

三、机制级优化(长期)

# 动作
1 cron prompt 模板 新 cron 默认 no_agent 脚本优先;agent cron 必须输出限≤200字
2 会话生命周期 交互会话建议每日 /new(避免跨日历史累积)
3 缓存友好 系统提示/记忆/SOUL 变更批量合并(一次改完),避免碎片化改动
4 用量日报 部署 api_cost_monitor(脚本缺失需重建)→ 每日9点报用量
5 预算上限 设置周预算(如 $15),超 80% 告警(api_cost_monitor 支持)

四、预期效果

  • 立即(cron精简+no_agent化):agent cron 输入降 40-60% → 费用 $9/周 → $4-5/周
  • 机制(会话/缓存/日报):防止缓存失效爆费(最坏$200/周 → 可控$15内)
  • 月均预期:$36 → $18-20(含新功能增长)

五、执行分工

  • 项目Bot(本Bot cron):记忆连续性引擎 no_agent 化、分域扫描 prompt 评估、跨Profile日报精简
  • 运维Botwecom-group-analyzer 频率、实时监控 no_agent 化、日志轮转后用量检查
  • 研学Bot:梦境复盘/晨间简报 prompt 精简
  • 全栈Botcma-threshold-check no_agent 化
  • 财务Botapi_cost_monitor 部署(脚本重建)