标签 Agent 下的文章

1. 先算一笔账:10K 能装几轮? 2. 核心思路:把上下文当成预算 3. 三层记忆 3.1 近期原文:只留最近 2 轮 3.2 摘要:把旧对话压成事实列表 3.3 长期记忆:BM25 + jieba 分词 4. 工具调用:让模型自己找记忆 5. 配置:TOML 比 JSON 更适合手写 6. 工具输出截断 7. 故障恢复:meta.json + conversation.jsonl 双保险 8. LLM 调用层 9. 日志 10. 100 轮压力测试 11. 怎么证明它没失忆? 12. 面试回答模板 本文首发地址 https://h89.cn/archives/637.html "10K 上下文怎么做 100 轮对话?" 窗口越大,推理成本越高,延迟越长,"lost in the middle" 也越严重。这道题考的是你有没有主

- 阅读剩余部分 -

我用 opencode-loop 跑了一次完整的 Loop Engineering 实践,让 AI 自己写代码、自己 Review、自己跑测试。大约十几分钟后,测试从 8 个变成 23 个,全部通过。这不是魔法,关键在 verifier 和 checkpoint。 一、手动用 AI 写代码,人到哪都是瓶颈 过去两年,用 AI 写代码的基本流程是: 你写 prompt → AI 回复 → 你读代码 → 再写 prompt → AI 再回复 → ... 人是方向盘,每一轮都要在场。问题是,这个模式有几个死结: 写完就忘。Agent 可能一次改十几个文件,你不可能每一行都仔细看,bug 就藏在没看的那几行里。 测试后置。经常是代码写完了才想起来跑测试,失败了一堆再回头找,效率低。 Review 走形式。自己 R

- 阅读剩余部分 -

启动时发生了什么 全局配置也会加载 真正有意思的是运行时 这个功能什么时候加的 Claude Code 的做法 Codex 的做法 Hermes Agent 的做法 四端对比 什么时候该放子目录 AGENTS.md 验证方法 写在最后 本文首发地址 https://h89.cn/archives/627.html Monorepo(单一代码仓库,多个项目共用一个 Git 仓库)里写了分层的 AGENTS.md,每个子目录一套规范,Agent 应该按需加载——想得很美。但你有没有验证过,Agent 真的读到了你放的那些文件? 我之前以为得同时维护 CLAUDE.md 和 AGENTS.md,后来发现只放一个就行。 启动时发生了什么 OpenCode 启动时做了一件事:从当前目录向上遍历,按 AGENTS.md → CLAUDE.md → CONTEX

- 阅读剩余部分 -

一、三层观测:从"它说了什么"到"它做了什么" 二、实操:用 bpftrace 看 Claude Code 在干什么 三、语义鸿沟:eBPF 知道"它做了什么",但不知道"为什么做" 四、为什么通用安全工具不够:AI Agent 没有稳定行为基线 五、eBPF 不是银弹 沙箱防逃逸,审批防越权,但 Agent 拿到合法权限后的行为——没人看得见。 本文首发地址 https://h89.cn/archives/625.html 上个月披露的 TrapDoor 攻击,攻击者在 .cursorrules 里埋零宽 Unicode 字符,Agent 读取后自动遍历文件系统外发密钥。这个月 Miasma Wave 2 更进一步——后门配置文件直接丢进项目目录,你克隆仓库、打开项目,后门就激活了。 没有弹窗,没有告警,沙箱也不触发。攻击完全发生在授权边界内,A

- 阅读剩余部分 -

一、为什么是飞书 CLI 二、安装:第一道坎不在代码里 三、认证:Agent 登录飞书,比人类更麻烦 四、身份边界:机器人替我发言,还是我替机器人背锅? 测试 1:以 Bot 身份收发消息 测试 2:以 User 身份搜索历史消息 身份边界总结 五、四个工作流实测 工作流 1:晨间日程概览 工作流 2:群消息关键词响应 工作流 3:会议纪要整理 工作流 4:技术问题分析(翻车) 六、翻不过去的墙 1. 权限墙:scope 不够时,Agent 只能报错,无法自愈 2. 安全墙:高风险操作必须人类确认 3. 认知墙:Agent 没有上下文,只能执行,不能判断 七、结论:到底替我上了多少班? 本文首发地址 https://h89.cn/archives/612.html 过去一周,我把飞书官方 CLI 接入了我的工作流,试图回答这个问题。结果不是"可以"或"不可以",而是

- 阅读剩余部分 -

Harness Engineering:Agent 写代码不难,难的是让它别乱写 Harness Engineering:Agent 写代码不难,难的是让它别乱写 一、先看一个真实项目 二、Harness 到底解决什么问题 三、第一层:代码库本身就是真相源 四、第二层:规则要能自动拦住错误 五、第三层:反馈必须足够快 六、第四层:Agent 产出越多,越要管理熵 七、外部案例说明了同一件事 八、最小落地方案 九、冷一点看 参考与延伸阅读 本文首发地址 https://h89.cn/archives/610.html 2026 年 2 月,OpenAI Codex 团队发了一篇文章,里面有个数字很扎眼: 3 个工程师,5 个月,约 100 万行生产级代码,没有一行是人手写的。 他们大约合并了 1,500 个 Pull Reque

- 阅读剩余部分 -

一、四强并立 二、BYTEROVER:让 LLM 自己管理记忆 三、MemPalace:verbatim 哲学的极端实践 四、Mastra OM:极简架构反而最高分 五、四系统横向对比 六、benchmark 分数不是选型依据 七、选型建议 八、结语 本文首发地址 https://h89.cn/archives/597.html 2025 年 12 月,Hindsight 发了一篇论文,宣布自己在 LongMemEval 和 LoCoMo 两个 benchmark 上拿下 SOTA(State-of-the-Art)。Virginia Tech 复现了,The Washington Post 也复现了。MIT 开源,SDK 完整,Fortune 500 在用。 五个月后,它的 SOTA 位置已经被三个新系统抢走了。 但这不重要

- 阅读剩余部分 -

一、Agent Memory 的困境:RAG 和 Knowledge Graph 都卡在哪 二、Hindsight 的解法:仿生记忆三层架构 三、LLM 在 Hindsight 里不是只负责"聊天" 四、三个核心操作:Retain、Recall、Reflect Retain:不只是"存",而是"理解后存" Recall:四路检索 + 融合 + 重排 Reflect:从"回忆"到"学习"的关键 五、实战:5 分钟跑起来 纯嵌入模式(不用跑服务) 给 Claude Code 加记忆 六、性能数据:SOTA 是真的,但竞争在加剧 七、适合谁,不适合谁 八、总结 参考文献 本文首发地址 https://h89.cn/archives/598.html 你的 AI 客服记住了用户上周的问题,但再次遇到类似投诉时,它还是会按标准话术回复,

- 阅读剩余部分 -