标签 LLM 下的文章

1. 先算一笔账:10K 能装几轮? 2. 核心思路:把上下文当成预算 3. 三层记忆 3.1 近期原文:只留最近 2 轮 3.2 摘要:把旧对话压成事实列表 3.3 长期记忆:BM25 + jieba 分词 4. 工具调用:让模型自己找记忆 5. 配置:TOML 比 JSON 更适合手写 6. 工具输出截断 7. 故障恢复:meta.json + conversation.jsonl 双保险 8. LLM 调用层 9. 日志 10. 100 轮压力测试 11. 怎么证明它没失忆? 12. 面试回答模板 本文首发地址 https://h89.cn/archives/637.html "10K 上下文怎么做 100 轮对话?" 窗口越大,推理成本越高,延迟越长,"lost in the middle" 也越严重。这道题考的是你有没有主

- 阅读剩余部分 -

一、三层观测:从"它说了什么"到"它做了什么" 二、实操:用 bpftrace 看 Claude Code 在干什么 三、语义鸿沟:eBPF 知道"它做了什么",但不知道"为什么做" 四、为什么通用安全工具不够:AI Agent 没有稳定行为基线 五、eBPF 不是银弹 沙箱防逃逸,审批防越权,但 Agent 拿到合法权限后的行为——没人看得见。 本文首发地址 https://h89.cn/archives/625.html 上个月披露的 TrapDoor 攻击,攻击者在 .cursorrules 里埋零宽 Unicode 字符,Agent 读取后自动遍历文件系统外发密钥。这个月 Miasma Wave 2 更进一步——后门配置文件直接丢进项目目录,你克隆仓库、打开项目,后门就激活了。 没有弹窗,没有告警,沙箱也不触发。攻击完全发生在授权边界内,A

- 阅读剩余部分 -

一张表定乾坤 ¥72 能买多少 token? 盈亏平衡:用多少才不亏? 深层差异:不只是价格 Zen Go 的 6x 杠杆 Token Plan 的预付折扣 按用量选 本文首发地址 https://h89.cn/archives/623.html 三个方案摆在面前:OpenCode Zen Go 套餐月费 ¥72,MiMo Token Plan ¥39,DeepSeek API 按量付费。 选哪个?先说结论:看用量,别看广告。 编码场景实测:4 条会话,加权平均缓存命中率 97.31%,输入:输出 ≈ 165:1。下面用保守估计 95% 命中 + 95:5 输入输出来算。 一张表定乾坤 先看单价(95% 缓存命中 + 95:5 输入输出): 方案 Flash 等效单价 Pro 等效单价 月费 DeepSe

- 阅读剩余部分 -

一、RAG 的真相:48% 的失败率被藏起来了 二、Context Window 革命:1M 已成标配 三、Wiki 模式:不是复古,是重新对齐 四、六维度拆解:RAG 和 Wiki 到底差在哪 五、决策框架:什么时候选什么 六、收束:误区、行动建议、一句话结论 本文首发地址 https://h89.cn/archives/620.html 2024 年,每个做 AI 知识库的人都在说 RAG。检索增强生成,Retrieval-Augmented Generation,这串字母组合几乎成了企业知识管理的唯一答案。搭一个向量数据库,把文档切成块,灌进 Embedding 模型,再套个重排器——恭喜你,拥有了一个"AI 驱动"的知识库。 但 2026 年 4 月,OpenAI 联合创始人 Andrej Karpathy 发了一条 X 帖子,描述自己怎么用一组

- 阅读剩余部分 -

一、四强并立 二、BYTEROVER:让 LLM 自己管理记忆 三、MemPalace:verbatim 哲学的极端实践 四、Mastra OM:极简架构反而最高分 五、四系统横向对比 六、benchmark 分数不是选型依据 七、选型建议 八、结语 本文首发地址 https://h89.cn/archives/597.html 2025 年 12 月,Hindsight 发了一篇论文,宣布自己在 LongMemEval 和 LoCoMo 两个 benchmark 上拿下 SOTA(State-of-the-Art)。Virginia Tech 复现了,The Washington Post 也复现了。MIT 开源,SDK 完整,Fortune 500 在用。 五个月后,它的 SOTA 位置已经被三个新系统抢走了。 但这不重要

- 阅读剩余部分 -

整体架构 核心模块拆解 1. 多源采集:配置化接入,不硬编码 2. 热点发现:Embedding + DBSCAN 3. LLM 提炼:从 N 篇文章到 1 个结构化事件 4. 热度评分:不只是计数 5. 去重:48 小时滑动窗口 6. 实时推送:SSE 比 WebSocket 简单 踩过的坑 技术启示 参考文献 本文首发地址 https://h89.cn/archives/595.html 这个五一我哪也没去,在家把一个想了很久的项目做完了。 事情是这样的:每天早上刷 Twitter、Hacker News、微博、知乎、36氪……每个平台都有自己的热点,但它们散落各处。更烦的是,算法推荐的"猜你喜欢"往往让真正重要的事件被淹没在信息流里。刷半小时,感觉看了很多东西,但脑子里一团浆糊。 我不是缺新闻,我是缺组织好的信息。 五一假期第一天,我脑子里突然闪过一个念头:

- 阅读剩余部分 -

先说结论 一、ADB:最底层、最可控的方案 二、uiautomator2:Python 圈的自动化神器 三、多模态 Mobile Agent:最接近"自动驾驶"的路 AppAgent(2023.12)— 多模态 Agent 开创性工作 四、最成熟可用的开源方案:mobilerun 五、实际踩坑:为什么你的 AI 手机控制总是翻车 1. 截图质量决定一切 2. 界面动态内容让 LLM 困惑 3. 隐私数据脱敏 4. 国产定制系统的兼容性问题 六、我的判断 参考文献 本文首发地址 https://h89.cn/archives/580.html 上周我把公司项目跑在 AI 手机控制上,结果有点意外——不是惊喜,是意外。 说白了,现在 AI 控制手机这事,概念很火,但真刀真枪跑起来,要么是玩具,要么是半成品。本文把目前所有主流技术路线摸了一遍,从 ADB

- 阅读剩余部分 -

核心发现:6 个百分点的差距 为什么会这样 两层影响机制 第一层:减少基础设施错误(1x → 3x) 第二层:资源开始改变题目难度(3x → uncapped) 一个具体例子 资源限制会奖励不同类型的 Agent SWE-bench 也不是完全免疫 对榜单的影响 对开发者和企业的启发 如果你在看榜单选型 如果你在做 Agent 评测 对国内团队的特别提醒 其他隐藏变量 结语 引用来源 本文首发地址 https://h89.cn/archives/571.html 本文基于 Anthropic 工程博客 Quantifying infrastructure noise in agentic coding evals 整理,原文发布于 2026 年 4 月。 如果你经常关注 Coding Agent 榜单,大概率会看到这样的结论:某个模型在 S

- 阅读剩余部分 -