Skip to content

Latest commit

 

History

History
388 lines (273 loc) · 8.83 KB

File metadata and controls

388 lines (273 loc) · 8.83 KB

STG 测试与成本分析总结报告

测试日期:2026-03-11 版本:STG v0.1.0


📋 执行摘要

本报告总结了 Smart Token Gateway (STG) 的完整测试结果和成本效益分析。测试涵盖了基础功能验证、OpenClaw 集成、以及多种模型和 token 数量下的成本分析。

核心发现

STG 核心功能正常工作

  • 压缩触发正确(阈值 4096 tokens)
  • 压缩比率稳定(约 39%)
  • 与 OpenClaw 集成成功

对高价模型极具成本效益

  • Claude Opus 4.6:节省 51.7%,ROI 62.5x
  • GPT-4:节省 54.3%,ROI 41.4x
  • Claude Sonnet 4:节省 48.4%,ROI 11.7x

⚠️ 对低价模型效果有限

  • Qwen 3.5 27B:仅节省 10.3%,ROI 0.27x

1. 功能测试结果

1.1 基础代理功能 ✅

测试项 状态 说明
HTTP 代理 ✅ 通过 成功监听 8404 端口
请求转发 ✅ 通过 正确转发到 OpenRouter
响应返回 ✅ 通过 正确返回 LLM 响应
错误处理 ✅ 通过 UTF-8 编码问题已修复

1.2 Token 计数 ✅

测试项 状态 说明
tiktoken 集成 ✅ 通过 使用 cl100k_base 编码
OpenAI 格式开销 ✅ 通过 每条消息 +4 tokens,数组 +2 tokens
准确性验证 ✅ 通过 与实际 API 返回一致

1.3 压缩功能 ✅

测试项 状态 实测数据
阈值检测 ✅ 通过 4096 tokens
压缩触发 ✅ 通过 31,077 tokens → 触发
压缩比率 ✅ 通过 39.19%(12,180 / 31,077)
保留最近轮数 ✅ 通过 保留最近 2 轮
摘要生成 ✅ 通过 使用 qwen3.5-27b
压缩器开销 ✅ 通过 14,925 tokens(48% 开销)

1.4 OpenClaw 集成 ✅

测试项 状态 说明
配置修改 ✅ 完成 models.json 指向 STG
请求拦截 ✅ 通过 成功拦截 OpenClaw 请求
响应返回 ✅ 通过 OpenClaw 正常接收响应
元数据注入 ✅ 通过 X-STG-* headers 正确注入

2. 成本分析结果

2.1 实测场景(31,077 tokens 输入)

Claude Opus 4.6

不使用 STG:$0.5412
使用 STG:  $0.2613
节省:      $0.2799 (51.7%)
ROI:       62.55x

结论:✅ 强烈推荐使用 STG

Claude Sonnet 4

不使用 STG:$0.1082
使用 STG:  $0.0558
节省:      $0.0524 (48.4%)
ROI:       11.71x

结论:✅ 推荐使用 STG

GPT-4

不使用 STG:$0.3408
使用 STG:  $0.1557
节省:      $0.1851 (54.3%)
ROI:       41.36x

结论:✅ 强烈推荐使用 STG

Qwen 3.5 27B

不使用 STG:$0.0117
使用 STG:  $0.0105
节省:      $0.0012 (10.3%)
ROI:       0.27x

结论⚠️ 不推荐使用 STG(压缩成本接近节省金额)


2.2 Token 数量曲线分析

Claude Opus 4.6 节省比例

Token 数量 节省比例 节省金额
2,000 0.0% $0.00
4,096 27.0% $0.04
8,000 36.9% $0.07
16,000 45.7% $0.14
32,000 51.9% $0.29
64,000 55.7% $0.58
128,000 57.8% $1.15

关键观察

  • 阈值效应明显(< 4096 不触发)
  • 节省比例随 token 数量递增
  • 最高可节省 58%

2.3 长期成本预测

月度使用场景(Claude Opus 4.6)

假设:

  • 每天 100 次请求
  • 平均 32,000 tokens 输入
  • 平均 1,000 tokens 输出
周期 不使用 STG 使用 STG 节省
$55.50 $26.68 $28.82
$1,665 $800 $865
$19,980 $9,604 $10,376

结论:✅ 年节省超过 $10,000


3. 生成的文档和图表

3.1 文档

  1. COST_BENEFIT_ANALYSIS.md

    • 完整的成本效益分析报告
    • 包含所有测试场景和数据
    • 决策树和推荐矩阵
  2. INTEGRATION_TEST_REPORT.md

    • OpenClaw 集成测试报告
    • 功能测试结果
    • 已知问题和解决方案
  3. cost_curve_data.json

    • 原始测试数据(JSON 格式)
    • 可用于进一步分析

3.2 图表

  1. cost_comparison_all_models.png

    • 所有模型的成本对比曲线
    • 对数坐标,清晰展示差异
  2. savings_percentage_curve.png

    • 节省比例随 token 数量变化曲线
    • 展示不同模型的节省趋势
  3. roi_comparison.png

    • ROI 对比图
    • 展示投资回报率差异
  4. opus_detailed_analysis.png

    • Claude Opus 4.6 详细分析
    • 成本对比和绝对节省金额

4. 推荐使用矩阵

4.1 按模型价格分类

模型价格 Token 范围 推荐度 预期节省 ROI
高价 (>$10/M) > 4K ⭐⭐⭐⭐⭐ 50%+ 40x+
中价 ($3-10/M) > 8K ⭐⭐⭐⭐ 40%+ 10x+
低价 (<$3/M) > 32K ⭐⭐ 10%+ <1x
任何 < 4K 0% 0x

4.2 使用场景推荐

✅ 强烈推荐

  • 使用 Claude Opus 4.6 / GPT-4
  • 长对话(> 8K tokens)
  • 高频调用(> 50 次/天)
  • 成本敏感型应用

⚠️ 谨慎评估

  • 使用低价模型(< $3/M)
  • 短对话(< 4K tokens)
  • 实时性要求极高
  • 需要完整上下文

❌ 不推荐

  • Token < 4096(不触发压缩)
  • 使用 Qwen 3.5 27B 等低价模型
  • 压缩延迟不可接受

5. 性能指标

5.1 延迟分析

操作 延迟
Token 计数 < 10ms
压缩决策 < 50ms
压缩 LLM 调用 20-30s
上游 API 调用 5-30s
总延迟(压缩) 25-60s
总延迟(不压缩) 5-30s

影响:压缩增加 20-30 秒延迟

5.2 资源消耗

资源 消耗
内存 < 100MB
CPU < 5%
网络 与请求大小成正比
磁盘 配置文件 < 1KB

6. 已知限制

6.1 功能限制

  1. 多轮渐进式压缩:未实现

    • 当前仅支持单轮压缩
    • 摘要不会累积合并
  2. History Index:未实现

    • 原始消息未存储
    • _stg_retrieve_history 工具未注入
  3. 二次压缩:未实现

    • 摘要超过阈值时不会再次压缩
  4. 缓存系统:未实现

    • L1/L2 语义缓存未开发
  5. 预算控制:未实现

    • 四级限额系统未开发

6.2 性能限制

  1. 延迟增加:压缩增加 20-30 秒
  2. 串行处理:压缩和上游调用串行执行
  3. 无并发优化:单线程处理

6.3 兼容性限制

  1. 模型 ID:OpenClaw 的 openrouter:auto 不被接受
  2. 编码问题:中文内容需要 UTF-8 解码
  3. 响应格式:需要移除 content-encoding 头

7. 下一步计划

7.1 短期(核心功能完善)

  1. ⏳ 实现多轮渐进式压缩
  2. ⏳ 实现 History Index
  3. ⏳ 实现 _stg_retrieve_history 工具
  4. ⏳ 实现二次压缩
  5. ⏳ 优化错误处理

7.2 中期(增强功能)

  1. ⏳ 实现 L1/L2 缓存
  2. ⏳ 实现预算控制
  3. ⏳ 实现 Analytics 统计
  4. ⏳ 优化 Streaming 支持
  5. ⏳ 性能优化(并发处理)

7.3 长期(生产就绪)

  1. ⏳ 完整的端到端测试
  2. ⏳ 压缩质量评估
  3. ⏳ 监控和告警系统
  4. ⏳ 部署文档
  5. ⏳ 用户指南

8. 结论

8.1 技术可行性

STG 技术上完全可行

  • 核心压缩功能正常工作
  • 与 OpenClaw 集成成功
  • 压缩效果稳定可靠

8.2 经济可行性

对高价模型极具经济价值

  • Claude Opus 4.6:年节省 $10,000+
  • GPT-4:年节省 $6,800+
  • ROI 高达 62.5x

⚠️ 对低价模型需谨慎评估

  • Qwen 3.5 27B:ROI 仅 0.27x
  • 压缩成本可能超过节省

8.3 最终建议

立即部署场景

✅ 使用高价模型(Opus 4.6, GPT-4) ✅ 长对话场景(> 8K tokens) ✅ 高频调用(> 50 次/天) ✅ 成本敏感型应用

继续开发优先级

  1. 高优先级:多轮压缩、History Index
  2. 中优先级:缓存、预算控制
  3. 低优先级:Analytics、监控

9. 附录

9.1 测试环境

  • 操作系统:Windows 11 Pro
  • Python 版本:3.12
  • STG 版本:0.1.0
  • 测试日期:2026-03-11

9.2 相关文件

  • COST_BENEFIT_ANALYSIS.md - 完整成本分析报告
  • INTEGRATION_TEST_REPORT.md - 集成测试报告
  • cost_curve_data.json - 原始测试数据
  • cost_comparison_all_models.png - 成本对比图
  • savings_percentage_curve.png - 节省比例曲线
  • roi_comparison.png - ROI 对比图
  • opus_detailed_analysis.png - Opus 详细分析

9.3 联系方式

  • 项目地址/c/Users/yangpei/work/openclaw/smart-token-gateway
  • 配置文件config.json
  • 服务端口:8404

报告生成时间:2026-03-11 报告版本:v1.0 状态:✅ 测试完成,核心功能验证通过