面试官问:10K 上下文怎么跑 100 轮对话?我搭了一个 Agent 来回答
1. 先算一笔账:10K 能装几轮?
2. 核心思路:把上下文当成预算
3. 三层记忆
3.1 近期原文:只留最近 2 轮
3.2 摘要:把旧对话压成事实列表
3.3 长期记忆:BM25 + jieba 分词
4. 工具调用:让模型自己找记忆
5. 配置:TOML 比 JSON 更适合手写
6. 工具输出截断
7. 故障恢复:meta.json + conversation.jsonl 双保险
8. LLM 调用层
9. 日志
10. 100 轮压力测试
11. 怎么证明它没失忆?
12. 面试回答模板
本文首发地址 https://h89.cn/archives/637.html
"10K 上下文怎么做 100 轮对话?"
窗口越大,推理成本越高,延迟越长,"lost in the middle" 也越严重。这道题考的是你有没有主