2026 年 8 月 2 日,OpenAI「Astra」多 Agent 模型家族曝光,内部版本已解决 10 道此前未解的数学难题,Sam Altman 已在华盛顿向政策制定者演示。Cursor 被曝移除用量页面的成本信息,用户失去费用可视化,社区质疑定价不透明。Codex 8 月 1 日额度重置,GPT-5.6 Sol 上下文窗口从 353K 砍至 258K。DeepSeek V4 Flash 0731 的 Agent 基准数据浮出水面,全部 9 项 Agent 基准超越 V4 Pro Preview。V2EX 两帖联动反映开发者对闭源编程 Agent 的信任转变。

本文首发地址 https://h89.cn/archives/699.html

OpenAI「Astra」多 Agent 模型家族曝光:内部版本解决 10 道未解数学难题

2026 年 7 月 31 日至 8 月 1 日,多家科技媒体密集报道 OpenAI 正在构建名为「Astra」的新一代模型家族,核心创新在于多 Agent 协同机制——多个 Agent 可共同处理复杂问题,持续工作数小时甚至数天,而非一次性给出简短回答。OpenAI 同时公布了 Astra 内部版本解决了 10 道此前未解决的数学和理论计算机科学难题,每道题都附带 Lean 形式化验证证明。

Astra 将作为 OpenAI 新的模型类别,与现有的 Sol、Terra、Luna 系列并列,尚未最终确定是以 GPT-6 名义发布还是作为 GPT-5 的变体(如 GPT 5.7)。CEO Sam Altman 已在华盛顿向政策制定者做内部演示。10 道难题涵盖 von Neumann 代数、高维几何、编码理论、群论、量子复杂性、格密码学和极值组合学,每个解都附带可机器验证的 Lean 形式化证明证书。OpenAI 研究员表示,生成全部 10 个解消耗的 token 按 Sol API 价格计算约 $2,000。

模型设计用于运行数小时到数天的复杂推理任务,可通过 Test-time compute 扩展根据问题复杂度动态扩展推理计算量。OpenAI 研究员称 Astra 是「科学推理的重大一步」,解决此前未解的数学问题,AI 从「已知知识的检索/组合」迈向「新知识的发现」。

来源:

Cursor 移除用量页面成本信息:用户失去费用可视化

2026 年 8 月 1–2 日,Cursor 社区和 HN 出现多起投诉:Cursor 在最新版本中移除了用量页面(Usage page)和 CSV 导出的成本信息(dollar amounts),用户只能看到用量百分比而非实际花费金额。HN 首页热帖(ID: 49135257)引发广泛讨论,Cursor 社区论坛也出现多条相关投诉。

此前 Cursor 用量页会显示「本月已花费 $X.XX」的实际金额,新版本改为显示「已使用月度额度的 XX%」,CSV 导出的成本列也被移除。用户怀疑此举是为了掩盖高昂的 Agent 模式 Token 消耗。HN 评论指出不同 Agent 框架在同一任务、同一模型下的 Token 消耗差异巨大,有用户反馈"我跑了 10 个 Agent 任务,不同的 Agent 框架在同样的 Ubuntu VM 上产生了完全不同的 Token 用量"。Cursor 论坛帖(152140)称:"我用的是 $20 订阅,几天前还能看到花费,现在没有了"。

Cursor 2026 年定价体系为:Free(2,000 completions/月)→ Pro($20/月)→ Pro+(新增,推荐日活 Agent 用户)→ Ultra($200/月,重度 Agent 用户)→ Teams Business($40/用户/月)→ Teams Enterprise。2026 年 6 月 Cursor 更新 Teams 计划,引入 Premium 席位(3x 价格,5x 用量);7 月移除 Max Mode 模型选择器选项(影响用量计费用户)。用户表示 Auto Mode 的用量也被计入 Cursor Models 池,但计费标准不透明。

来源:

Codex 8 月 1 日额度重置,GPT-5.6 Sol 上下文窗口砍至 258K

2026 年 8 月 1 日 Codex 月度额度重置,V2EX 出现热帖「Codex 重置,2026.08.01 11:30」(23 replies)。与此同时,GitHub Issue #32806 显示 GPT-5.6 Sol 在 Codex 中的上下文窗口从 353K tokens 再次削减至 258K tokens(降幅 27%),而该模型官方宣传的上下文窗口是 1.05M tokens,GitHub Issue 标题标注「SEVERE REGRESSION」。

Codex 团队 Tibo 称「因用量消耗过高,待问题解决后恢复」。V2EX 用户抱怨 Agent 模式的 token 消耗增长过快,重置后很快就用完,关联讨论「PLUS 是不是额度砍半了」(4 replies)。此前的 GitHub Issue #26306(June 4, 2026)显示用户工作 2-3 小时消耗 20.559M tokens;Issue #28525(July)显示 Codex 在长时间运行任务中自动消耗了用户的 token 重置机会。用户普遍反映同一任务在 Codex 中的 token 消耗远超直接使用 API。

来源:

DeepSeek V4 Flash 0731 Agent 基准暴涨:Terminal Bench 82.7,DeepSWE 7.3→54.4

2026 年 7 月 31 日 DeepSeek V4 Flash 0731 正式版发布后,其 Agent 专项基准数据逐步浮出水面:一个 13B 激活参数的「Flash」模型,在全部 9 项公开 Agent 基准上超越了 1.6T 参数的 V4 Pro Preview。DeepSeek 同时预告了即将开源的「DeepSeek Harness」Agent 评测框架。

Agent 基准数据(0731 正式版 vs 预览版):Terminal Bench 2.1 从 61.8 升至 82.7(+34%),直接超越 V4-Pro-Preview(72.1);DeepSWE 从 7.3 升至 54.4(+645%,7.5x 暴增);DSBench-FullStack 和 DSBench-Hard 内部 Agent 基准同样大幅领先。模型架构不变:284B 总参数量,13B 激活参数/token,1M 上下文窗口,MIT 开源许可。评测使用 DeepSeek 自研的 DeepSeek Harness(即将开源)最小模式,配置为 max reasoning effort,temperature 1.0,top_p 0.95。新增 Codex 支持(Codex Support Added),可替代部分 Codex 工作流。

DeepSWE 分数 54.4 为厂商报告值,使用 DeepSeek 自有 Harness,DeepSeek 承认目前第三方尚无法复现该测试;Terminal Bench 2.1 为公开基准,82.7 分已具有较强参考价值。

来源:

闭源 Coding Agent 信任危机:Claude Code 更新放缓与"偷偷外联"担忧

2026 年 8 月 1–2 日,V2EX 社区出现两条相互关联的热帖,反映开发者对闭源编程 Agent 的信任正在发生转变。一帖质疑 Claude Code 的更新频率:用户注意到 Claude Code 最近版本更新放缓,对比 Cursor 和 Codex 的活跃更新节奏显得「静悄悄」,评论中有用户指出 Claude Code 的功能更新频率确实低于竞品,但稳定性尚可。

另一帖担心闭源 Coding Agent 可能偷偷上传代码到第三方服务器,提出能否构建一个本地代理来观察和分析 Claude Code 发出的提示词。同一用户还分享了自己做的「本地代理,看 Claude Code 发出去的提示词并进行分析」。更广泛的背景是,2026 年 7 月 29 日 Codex Security CLI 开源,但社区认为这还不够;V2EX 上出现「为什么到今天我又做了一个开源 Agent」的帖子(1,500+ 浏览),社区项目 Octo 定位为「最易用、最安全、最注重隐私的开源 Agent」。

来源:


本文链接:OpenAI Astra、Cursor 成本不透明、Codex 上下文削减、DeepSeek Agent 基准、闭源 Agent 信任 - https://h89.cn/archives/699.html

版权声明:原创文章 遵循 CC 4.0 BY-SA 版权协议,转载请附上原文链接和本声明。

标签: github, Agent, Cursor, deepseek, openai, codex, Token, benchmark, context window, V2EX, GPT-5.6 Sol, Astra

欸谨特公众号
微信扫码关注:欸谨特
Agent · 效率工具 · 实战笔记

添加新评论