标签 token 下的文章

1. 先算一笔账:10K 能装几轮? 2. 核心思路:把上下文当成预算 3. 三层记忆 3.1 近期原文:只留最近 2 轮 3.2 摘要:把旧对话压成事实列表 3.3 长期记忆:BM25 + jieba 分词 4. 工具调用:让模型自己找记忆 5. 配置:TOML 比 JSON 更适合手写 6. 工具输出截断 7. 故障恢复:meta.json + conversation.jsonl 双保险 8. LLM 调用层 9. 日志 10. 100 轮压力测试 11. 怎么证明它没失忆? 12. 面试回答模板 本文首发地址 https://h89.cn/archives/637.html "10K 上下文怎么做 100 轮对话?" 窗口越大,推理成本越高,延迟越长,"lost in the middle" 也越严重。这道题考的是你有没有主

- 阅读剩余部分 -

一张表定乾坤 ¥72 能买多少 token? 盈亏平衡:用多少才不亏? 深层差异:不只是价格 Zen Go 的 6x 杠杆 Token Plan 的预付折扣 按用量选 本文首发地址 https://h89.cn/archives/623.html 三个方案摆在面前:OpenCode Zen Go 套餐月费 ¥72,MiMo Token Plan ¥39,DeepSeek API 按量付费。 选哪个?先说结论:看用量,别看广告。 编码场景实测:4 条会话,加权平均缓存命中率 97.31%,输入:输出 ≈ 165:1。下面用保守估计 95% 命中 + 95:5 输入输出来算。 一张表定乾坤 先看单价(95% 缓存命中 + 95:5 输入输出): 方案 Flash 等效单价 Pro 等效单价 月费 DeepSe

- 阅读剩余部分 -