标签 benchmark 下的文章

OpenAI「Astra」多 Agent 模型家族曝光:内部版本解决 10 道未解数学难题 Cursor 移除用量页面成本信息:用户失去费用可视化 Codex 8 月 1 日额度重置,GPT-5.6 Sol 上下文窗口砍至 258K DeepSeek V4 Flash 0731 Agent 基准暴涨:Terminal Bench 82.7,DeepSWE 7.3→54.4 闭源 Coding Agent 信任危机:Claude Code 更新放缓与"偷偷外联"担忧 2026 年 8 月 2 日,OpenAI「Astra」多 Agent 模型家族曝光,内部版本已解决 10 道此前未解的数学难题,Sam Altman 已在华盛顿向政策制定者演示。Cursor 被曝移

- 阅读剩余部分 -

一、先摆数字:K3 到底强在哪? 二、2.8T 参数不是噱头,但 MoE 的取舍很真实 三、对开发者最实用的三个点 1. 代码库级别的上下文理解 2. 视觉 in the Loop 的编程 Agent 3. 直接替换 Claude Code / Cline 的底层模型 四、但有两个坑必须提前说 1. 幻觉率从 39% 涨到 51% 2. 定价不便宜,而且不是白菜价 五、K3 的真正意义:不是"最强",而是"中国开源能上桌了" 写在最后 本文首发地址 https://h89.cn/archives/655.html 7 月 16 号早上,我打开 V2EX 程序员节点,一条帖子直接把我看清醒了:Kimi K3 在 Frontend Code Arena 拿了 1679 分,超过 Claude Fable 5(

- 阅读剩余部分 -

核心发现:6 个百分点的差距 为什么会这样 两层影响机制 第一层:减少基础设施错误(1x → 3x) 第二层:资源开始改变题目难度(3x → uncapped) 一个具体例子 资源限制会奖励不同类型的 Agent SWE-bench 也不是完全免疫 对榜单的影响 对开发者和企业的启发 如果你在看榜单选型 如果你在做 Agent 评测 对国内团队的特别提醒 其他隐藏变量 结语 引用来源 本文首发地址 https://h89.cn/archives/571.html 本文基于 Anthropic 工程博客 Quantifying infrastructure noise in agentic coding evals 整理,原文发布于 2026 年 4 月。 如果你经常关注 Coding Agent 榜单,大概率会看到这样的结论:某个模型在

- 阅读剩余部分 -