8 月 13 日,Google 悄然上线 Gemini 3.7 Flash——距离 3.6 Flash 仅 23 天,是 4 个月内的第 4 款 Flash 模型,而旗舰 Pro 依旧缺席;同日 Cerebras 官宣为 OpenAI 的 GPT-5.6 Sol 提供 Ultrafast 硬件加速,最高 750 tokens/秒、提速 14 倍,推理速度首次成为与模型能力并列的竞争维度。与此同时,AI 编程时代的「认知债务」讨论在 Hacker News 持续发酵,AI 文本水印被开源工具一键去除的困境再次登上首页;V2EX 社区则集中抱怨 AI 编程工具「模型会飘」、多步任务精度衰退。

本文首发地址 https://h89.cn/archives/707.html

Gemini 3.7 Flash 发布:4 个月 4 款 Flash 模型,Pro 级编码能力半价开售

2026 年 8 月 13 日,Google 正式发布 Gemini 3.7 Flash,距离 3.6 Flash(7 月 21 日)仅 23 天,距离 3.5 Flash(3 月)约 5 个月。这是 Google 在 2026 年发布的第 4 款 Flash 系列模型,而旗舰 Gemini 3.5 Pro 至今仍未问世。Gemini 3.7 Flash 已通过 Google API 上线,并同步开始为 Gemini Spark AI agent 提供底层支持。Google 同时宣布 3.6 Flash 和 3.7 Flash 均执行新的半价策略至 2026 年底。

定价方面,3.7 Flash 上下文窗口延续 1M tokens 规格;输入价格 $0.75/百万 tokens,输出价格 $3.75/百万 tokens,均为 3.6 Flash 原价($1.50 / $7.50)的 50%;缓存输入价格进一步降低,低于 $0.15/百万 tokens。半价有效期至 2026 年 12 月 31 日。

基准测试方面,3.7 Flash 在 Artificial Analysis Intelligence Index 上得分 56,超过 Claude Sonnet 5(55),接近 GPT-5.6 Terra 和 Muse Spark 1.2(57)。三个月前 Gemini 3.5 Flash 的 Index 为 46,3.6 Flash 为 52,8 个月内 Flash 系列提升了 10 个点。DeepSWE v1.1 得分 65.3%(3.6 Flash 为 49.0%,提升 16.3 个百分点);FrontierCode 1.1 Main 得分 43.6%(3.5 Flash 为 34.4%,提升 9.2 个百分点);SWE-Bench Pro 得分 54.2%,超过 Gemini 3 Flash 的 49.6%。Agentic computer-use(OSWorld 2.0)为 38.1%,对比 GPT-5.6 Terra 仍有差距;Terminal-Bench 3.0 为 14.9%。Google API 实测推理速度 340.1 tokens/秒。

Gemini Spark(Google 的 24/7 AI agent,2026 年 I/O 发布)即日起由 3.7 Flash 提供底层模型支持,Spark 已连接 Google 自有产品及 30+ 第三方 MCP 集成(Adobe、Asana、Dropbox、Lyft、OpenTable、Uber、Zillow 等)。Google 正用 Flash 系列而非 Pro 系列支撑其旗舰 Agent 产品,「Flash 优先」战略日益清晰:3 月 Gemini 3.5 Flash(Index 46),5 月 3.5 Flash Cyber(安全专用版),7 月 21 日 3.6 Flash(Index 52),8 月 1 日 3.5 Flash Lite(经济版),8 月 13 日 3.7 Flash(Index 56)。同期 Gemini 3.5 Pro 自 2025 年 12 月预览以来正式版多次延期,最新传闻已推迟到 2026 年 Q4。3.7 Flash 在 DeepSWE 上的 65.3% 已接近半年前 Pro 模型的水准,Flash 型号的快速迭代正在填补 Pro 旗舰的空窗期。

来源:

Cerebras × OpenAI:GPT-5.6 Sol Ultrafast 达 750 tok/s,推理加速 14 倍

2026 年 8 月 13 日,OpenAI 与 Cerebras Systems 联合宣布推出 GPT-5.6 Sol Ultrafast——一个由 Cerebras Wafer-Scale Engine(WSE-3)硬件加速的新 API 服务层级。这是 OpenAI 首次将旗舰模型的推理工作负载外包给第三方 AI 芯片。Ultrafast 模式最高达到 750 output tokens/秒,是 Standard 层级的 14 倍,且保持完全相同的模型质量,无量化、无蒸馏。

速度对比上,Ultrafast 约为 Claude Fable 5 推理速度的 11 倍、Claude Opus 4.8 Fast 模式的 5 倍(对比 Artificial Analysis 数据)。在 Humanity's Last Exam(2,500 道研究生级题目)上,11 小时完成全部解答,而 Claude Fable 5 需要 3 天以上;GDP-Val 基准上显著快于所有对比模型。

技术原理上,Cerebras WSE-3 采用 Wafer-Scale 架构,一整片晶圆构成单一处理器,而非 GPU 的多芯片拼接。其片上内存和带宽是 NVIDIA B200 的 250 倍容量、2,625 倍带宽,可将模型权重一次性加载到片上 SRAM,避开 GPU 推理中的显存换入换出延迟。对 GPT-5.6 Sol 这类超大规模模型,内存带宽就是推理速度的终极天花板。

商业层面,过去两年 AI 芯片竞争围绕训练展开,2026 年焦点转向推理——谁能在不牺牲质量的前提下最快运行模型。Ultrafast 目前是 limited preview,仅面向特定 OpenAI API 客户开放。Cerebras 为上市公司(NASDAQ: CBRS),这一合作直接向资本市场证明了其商业价值。推理加速存在多条路径:用超大芯片消除带宽瓶颈(Cerebras 路线)、投机解码(小模型草稿加验证)、模型蒸馏、量化与 KV-cache 优化等;Cerebras 路线的优势是不需要更改模型,直接加速现有 API。

来源:

「理解成了新瓶颈」:AI 编程 Agent 时代的认知债务

2026 年 7–8 月,Notion 设计工程师 Geoffrey Litt 的博客文章「Understanding is the new bottleneck」在 Hacker News 和 AI Engineer 社区引发广泛讨论,8 月 13 日仍在 HN 首页持续发酵。文章核心论点:AI Agent 生成代码的速度已经超过人类理解的速度,「agents can write code faster than we can absorb it」,由此产生一种新的开发债务——认知债务(Cognitive Debt)。

AI Agent 可以轻松生成 50,000 行代码的 PR,并自我验证通过测试,但人类维护者无法在合理时间内通读并理解这么多 AI 生成的代码。传统的「通读 diff」流程成为瓶颈而非安全保障;系统正常运行,团队对系统的理解却碎片化甚至消失。认知债务被定义为「AI 生成代码的速度与人类理解速度之间剪刀差所累积的理解赤字」。

研究层面有量化佐证:Anthropic 2026 年 RCT(随机对照试验)显示,AI 辅助的开发者在代码理解测试中平均得分低 17%;分组看,用 AI 做概念探索(问问题、对比方案)的开发者得分 65% 以上,而完全委托("帮我写这个功能")的开发者得分低于对照组。Margaret Storey(维多利亚大学)的研究发现,团队对系统的共享理解(shared understanding)在引入 AI 后加速碎片化;Addy Osmani 提出「Comprehension Debt」概念,指 AI 生成代码的隐性成本是对人类智力和记忆的侵蚀。

Litt 提出的应对方案不是减少 AI 使用,而是改变使用方式:Explainer Docs(让 Agent 不仅生成代码,还生成解释文档和系统原理图)、Quizzes(用 AI 生成小测验,测试和维护开发者的系统理解)、Micro-worlds(创建交互式系统模型供开发者实验探索)、Shared Spaces(团队的共享理解需要工具支持,而非依赖个人记忆)。核心理念是 AI 可以让开发者理解得更多而不是更少,前提是有意识地设计理解过程。DX(Developer Experience)研究机构已将 Cognitive Debt 列为 2026 年最重要的开发者体验趋势之一;VirtusLab 发文称 AI 编码工具在静默侵蚀开发者理解力;Simon Willison 转载推荐了 Margaret Storey 的研究。

来源:

AI 文本水印困境:开源工具一键去除,EU AI Act 纸面合规

2026 年 8 月 11 日,开源工具 watermarks-remover 新增对 OpenAI 和 Gemini 文本水印的支持,此前该工具已支持去除 Anthropic Claude 的文本水印。同周,Sean Goedecke 的文章「Text AI watermarks will always be trivial to remove」登上 HN 首页(8 月 12–13 日持续热门)。EU AI Act 已于 8 月 2 日全面生效,要求 AI 生成文本嵌入「难以去除」的水印,但技术现实是文本水印几乎无法做到「难以去除」。

Anthropic 自 2025 年起在所有 Claude 模型中嵌入不可见的文本水印,通过选择特定 token 序列形成统计指纹;OpenAI 和 Google 也在生成文本中加入类似的 provenance marks。文本水印本质上可被简单改写(paraphrasing)破坏,watermarks-remover 通过自动替换同义词、重排句子结构、插入或删除标点等方法去除水印。

EU AI Act 要求 AI 生成内容的水印「嵌入内容中且难以分离」。与图像/视频水印可以嵌入像素级信号不同,文本是离散符号序列,任何语义保持的改写都会破坏水印,技术上无法满足「难以分离」的要求。结果是 AI 公司形式上合规,实际效果有限。

来源:

V2EX 社区观察:AI 编程工具「模型会飘」,多步任务精度衰退

2026 年 8 月,V2EX 程序员节点密集出现关于 AI 编程工具精度衰退的讨论。多篇热帖聚焦同一现象:无论使用 Claude Code、Codex 还是 Cursor,模型在多步骤任务中都存在持续的精度损失,社区称之为「模型会飘」。

代表性帖子包括:「claude code 实践心得:飘才是最大的敌人」(t/1221211),用户发现多 Agent 协作时信息逐级衰减——「模型会飘,就跟游戏传声筒一样,最后一个人复述出来的话跟第一个人说的完全对不上」;「大家常用的模型-Agent 组合是什么?」(t/1234036,8 月 13 日),用户在选择 Coding Agent 时面临「组合迷茫」,不同模型与 Agent 组合的效果差异大,缺少可靠的选型指南;「Cursor 的实际体验怎么样?」(t/1234043,8 月 14 日),讨论在同样的 $20 订阅价格下 Cursor 与 Codex/Claude Code 的体验差距;「手持多家模型,怎么选 Agent/CLI」(t/1233768)与「Codex 对比 Claude Code」(t/1209638)反映了多模型组合使用的选型困惑。

社区讨论归纳的技术原因:LLM 的自回归生成特性决定了每一步都有熵增,多轮 Agent 循环中错误和不一致会累积;越强大的模型「飘」的方向越不可预测;CLI 类工具(Codex、Claude Code)比 IDE 插件(Cursor)更易「飘」,因为自动化程度更高、用户介入更少;用户同时持有 OpenAI/Kimi/Qwen/GLM 等多模型账号,但「切模型等于切 CLI」,工具链碎片化。业界应对方向包括单回合命令(减少 LLM 往返)、MCP 协议标准化(降低工具调用出错率)、RAG 增强上下文保持。「飘」也被视为认知债务的技术原因——两者互为表里。

来源:


本文链接:Gemini3.7Flash、Cerebras推理加速、认知债务、AI水印困境 - https://h89.cn/archives/707.html

版权声明:原创文章 遵循 CC 4.0 BY-SA 版权协议,转载请附上原文链接和本声明。

标签: MCP, GPT-5.6 Sol, Artificial Analysis, Gemini 3.7 Flash, Cerebras, Ultrafast, WSE-3, 认知债务, AI水印, Gemini Spark, Hacker News, DeepSWE

欸谨特公众号
微信扫码关注:欸谨特
Agent · 效率工具 · 实战笔记

添加新评论