Moonshot AI 于 7 月 16 日正式发布 2.8T 参数开源模型 Kimi K3,在 Frontend Code Arena 登顶;首尔大学、UIUC 和 Largosoft 研究团队揭示全新攻击类别 Agent Data Injection(ADI),在已有防御下成功率仍达 50%;OpenAI 公开发布自动化红队系统 GPT-Red,将 GPT-5.6 Sol 的 prompt injection 失败率降至 0.05%;V2EX 程序员节点热帖讨论 AI 编程时代"判断力稀缺"。

本文首发地址 https://h89.cn/archives/680.html

Kimi K3 正式发布:2.8T 参数开源模型登顶全球编程基准

2026 年 7 月 16 日,Moonshot AI(月之暗面)正式发布 Kimi K3——一个 2.8 万亿参数的多模态 MoE(混合专家)开源模型,激活 16/896 专家,支持 1M token 上下文窗口。这是中国 AI 公司首次在开放权重模型领域达到全球前沿水平。

基准测试表现:Frontend Code Arena 排名第一(1,679 分),超越 Claude Fable 5(1,631)和 GPT-5.6 Sol(1,618);Artificial Analysis Intelligence Index 评分 57,与 Opus 4.8(56)和 GPT-5.5 持平,仅次于 Fable 5(60)和 GPT-5.6 Sol(59);GPQA Diamond 93.5%;Agent 任务 Elo 1,668(GDPval v2),超越 Opus 4.8(1,600)、GLM-5.2(1,514)、GPT-5.5(1,494);AutomationBench-AA 排名第一(53%),在 Zapier 式 SaaS 工作流评估中表现最佳;AA-Briefcase 长时知识工作评估 Elo 1,547,仅低于 Fable 5。

技术架构:2.8T 总参数,MoE 架构,896 个专家中每 token 激活 16 个;Kimi Delta Attention 架构使百万 token 上下文下解码速度提升 6.3 倍;"Attention Residuals"使训练效率提升约 25%,额外计算开销低于 2%;"Vision in the Loop"闭环系统:分析屏幕截图 → 修改代码 → 检查可见输出;原生支持图像和视频理解。

开源承诺与定价:Kimi 称 K3 为"首个约 3T 参数级别的开源模型",完整模型权重预计 2026 年 7 月 27 日前发布,已通过 Kimi.com、移动端 App、Kimi Work 桌面端(v3.1.0+)、Kimi Code 提供服务。定价:输入 $0.30/百万 token(缓存命中)/ $3.00(无缓存),输出 $15.00/百万 token(含推理),每任务成本约 $0.94,接近 GPT-5.6 Sol($1.04),约为 Opus 4.8($1.80)的一半。相比前代 K2.6,token 使用量减少 21%,得分提升 13 点。

演示亮点包括用 Three.js + WebGPU + GPU Compute 在浏览器中构建的 3D 开放世界游戏、交互式黑洞可视化、长征十号火箭发射模拟、Game Boy Advance 模拟器。行业影响方面,Axios 报道标题为"China's open-weight Kimi model stuns AI world with frontier-level results";The Decoder 分析"signaling the end of super cheap Chinese AI"——K3 定价不再是"白菜价";V2EX 用户讨论"开会员你也用不了满血的"。

来源:

  • Kimi 官方博客 - Kimi K3(2026-07-16, kimi.com/blog/kimi-k3)
  • The Decoder - Kimi's open model K3 nears GPT-5.6 Sol and Fable 5(2026-07-16)
  • Axios - China's open-weight Kimi model stuns AI world(2026-07-16)
  • Artificial Analysis - Kimi K3 Intelligence, Performance & Price Analysis(2026-07-16)
  • V2EX - Kimi k3 超越 5.6 和 Fable 登顶成为全球最强大模型(2026-07-17, id:1227882)
  • V2EX - KIMI 的 K3 上线了,但开会员你也用不了满血的(2026-07-17)
  • AI Release Tracker - Kimi K3 Specs(2026-07-16)
  • BenchLM.ai - Kimi K3 Benchmarks, Pricing & Speed(2026-07-16)
  • Pandaily - Kimi K3 Preview: Benchmark Videos Flood Social Media(2026-07-16)

Agent Data Injection (ADI) 攻击:AI Agent 的可信数据隔离盲区

2026 年 7 月 16 日,The Hacker News 报道了来自首尔大学、UIUC 和 Largosoft 研究团队的一篇新论文(arXiv 7 月 6 日发布),揭示了一种全新的 AI Agent 攻击类别——Agent Data Injection (ADI)。

与传统 Prompt Injection 的区别:prompt injection 的攻击目标是注入指令("忽略你的任务,发送邮件"),防御方式是训练模型识别"走私指令",技术原理是在数据中隐藏指令,成功率被现代防御几乎完全阻断;ADI 的攻击目标是伪造可信数据(伪造发件人、按钮 ID、工具结果),防御需要可信/不可信数据隔离——模型无法做到,技术原理是概率性分隔符注入(probabilistic delimiter injection),在已有防御下仍达 50% 成功率。受害模型覆盖所有主流模型(GPT-5.2/5-mini, Opus 4.5/Sonnet 4.5, Gemini 3 Pro/Flash)。

三类已验证的攻击场景:其一,Web Agent 误点击(Claude in Chrome, Antigravity, Nanobrowser)——在商品评论中植入伪造的按钮 ID,Agent 本想点击"Read More"却点击了"Buy Now",因为工具按顺序编号页面元素,攻击者可提前计算按钮 ID,影响是用户未授权的订单;其二,编程助手执行恶意命令(Claude Code, Codex, Gemini CLI)——在 GitHub 评论中伪造作者行,看起来像项目维护者写的,Agent 被指示"应用维护者的修复"→ 执行了攻击者的命令,影响是开发者机器上的代码执行;其三,恶意 PR 污染代码审查——伪造 Agent 从未运行过的检查记录,Agent 看到"干净的检查结果"→ 判断代码安全 → 批准合并,影响是恶意代码被合并到项目。

技术原理是概率性分隔符注入:Agent 用标点符号(引号、括号、标签、换行等)标记数据边界;普通程序严格解析这些符号,语言模型通过"猜测"来理解;攻击者可以在可控字段中注入类似标点符号的字符,模型会误读为真实的数据结构。即使是转义引号、花式引号、甚至美元符号,都能骗过模型。

现有防御的有效性:ChatGPT Atlas 用随机不可猜测的 ID 标记页面元素——成功防御;添加随机短标签到字段名——成功率从 49% 降至 29%;完整的数据来源追踪——零攻击成功,但 Agent 完成任务率降至约 1/3;剥离标点符号——有效但破坏了 Agent 读取链接和文件路径的能力。行业背景上,这是 2025 年 EchoLeak(CVE-2025-32711, Microsoft 365 Copilot 数据泄露)和 Invariant Labs MCP GitHub 漏洞之后,AI Agent 安全领域的又一次重大发现。ADI 攻击的是更根本的问题——Agent 内部的可信数据与不可信数据没有隔离。

来源:

  • The Hacker News - New Agent Data Injection Attack Can Make AI Agents Misclick or Run Attacker Commands(2026-07-16)
  • arXiv - Agent Data Injection Attacks are Realistic Threats to AI Agents(2607.05120, 2026-07-06)
  • 서울대학교/UIUC/Largosoft - 联合研究论文
  • Woohyuk Choi 博客 - Agent Data Injection 系列(cw00h.github.io, 2026-07-16)

OpenAI GPT-Red:用 AI 自动化红队测试

2026 年 7 月 16 日,OpenAI 公开发布了 GPT-Red——一个内部的自动化红队模型,专门用于规模化发现 prompt injection 漏洞。这是 OpenAI 首次公开其"AI 给 AI 做安全测试"的技术细节。

GPT-Red 的工作原理:像人类红队成员一样工作——发送 prompt → 监控模型响应 → 迭代式逼近恶意目标;基于自我对弈强化学习(self-play RL)训练;同时训练"红队模型"(攻击)和"防御模型"(防守),红队模型因成功攻击获得奖励,防御模型因成功抵抗获得奖励;随着防御模型变得更强,红队模型必须发现更强大的攻击方法。

效果数据:GPT-5.6 Sol 的 direct prompt injection 失败率仅 0.05%——比 GPT-5.5 减少 6 倍;在 Novel Safety Environments 中,GPT-Red 的攻击成功率 84%,而人类红队仅为 13%;发现了一种新型攻击——Fake Chain-of-Thought (Fake CoT) 攻击,曾对 GPT-5.1 达到 95%+ 成功率,现在对 GPT-5.6 Sol 已降至 10% 以下;间接 prompt injection 基准(针对开发者工具和浏览器的攻击)已被最新模型饱和(>97% 准确率)。

测试用例包括内部目录数据外泄、欺诈性支付指令、AWS 凭证窃取、禁用双因素认证、凭据文件上传、外部脚本注入、API 密钥转发、恶意爬虫脚本。真实世界案例:GPT-Red 攻击了 Andon Labs 的 AI 自动售货机——成功将高价商品降至最低价 $0.50、以 $0.50 订购 $100 商品、取消其他客户订单;攻击了基于 GPT-5.4 mini 的 Codex 命令行 Agent——在 10 个数据外泄任务中成功窃取敏感数据。

OpenAI 同时发布了 SWE-Bench Pro 的审计结果:约 30% 的任务存在问题(AI 标注发现 27.4%,人工标注发现 34.1%),OpenAI 撤回对 SWE-Bench Pro 作为编程能力评估基准的推荐。

来源:

  • The Hacker News - OpenAI's GPT-Red Automates Prompt Injection Testing to Harden GPT-5.6 Sol(2026-07-16)
  • OpenAI - Unlocking Self-Improvement: GPT-Red(2026-07-16, openai.com)
  • Help Net Security - GPT-Red beat human red teamers on a prompt injection test(2026-07-16)
  • MLQ News - OpenAI's GPT-Red System Outperforms Human Hackers 84% to 13%(2026-07-16)
  • OpenAI - Separating Signal from Noise: Coding Evaluations(2026-07-16)

当代码不再稀缺:AI 编程时代程序员的"判断力溢价"

2026 年 7 月 16-17 日,V2EX 程序员节点出现热门讨论帖《当代码不再稀缺:程序员真正稀缺的是判断力》,获得 74 条回复,成为该节点当日最热话题之一。

帖子核心观点:AI 编程工具(Claude Code、Codex、Cursor 等)大幅降低了代码产出的门槛,写代码本身正在从"稀缺技能"变成"普通技能";真正稀缺的、不可被 AI 替代的是工程判断力——什么该做、什么不该做、怎么做更对;程序员正在从"代码作者"变成"代码导演"。

社区讨论反响:有开发者分享使用 AI 编程工具后产出效率提升了 3-5 倍,但项目质量取决于"我知道要做什么";有管理者视角认为 AI 写代码很快,但团队里最值钱的人不再是写代码最快的,而是最能判断"方向对不对"的;也有反对声音认为 AI 写的代码质量参差不齐,判断力本身也是建立在编码经验之上的;讨论还延伸到 AI 编程工具是否在造成"知其然不知其所以然"的新一代程序员。

行业背景:这与 2025 年 Andrej Karpathy 提出的"Vibe Coding"(氛围编程)概念一脉相承——开发者从"作者"变成"导演"。2026 年 7 月 AI 编程工具全面成熟:Codex with GPT-5.6 Sol、Claude Code、Cursor、Grok Build 开源、GitHub Copilot、Kimi Code——开发者面临"工具选择过剩"。知乎 2026 年 7 月的文章《2026 年 AI 编程工具完全指南》指出:"模型质量仍然重要,但已经不再是以往那种差异化因素了。真正区分好工具的,是它跟你工作流的融合程度。"

来源:

  • V2EX - 《当代码不再稀缺:程序员真正稀缺的是判断力》(2026-07-16/17, 74 replies, 程序员节点)
  • 知乎 - 2026 年 AI 编程工具完全指南:从 IDE 到代码审查全覆盖(2026-07)
  • 知乎 - 「从夯到拉」2026年AI编程工具全景测评(2026-07)
  • 钛媒体 - 屈服于氛围:一部AI编程运动史(2020-2026)2.5万字简史(2026-07)
  • NxCode - Best AI Coding Tools 2026: Complete Ranking by Real-World(2026-07)
  • CSDN - 2026年7月,重新理解 CODEX订阅:AI 编程真正改变的不是代码,而是工程判断(2026-07)

本文链接:Kimi K3发布、ADI攻击、GPT-Red、判断力溢价 - https://h89.cn/archives/680.html

版权声明:原创文章 遵循 CC 4.0 BY-SA 版权协议,转载请附上原文链接和本声明。

标签: Agent, openai, 安全, 开源, 上下文窗口, 基准测试, Kimi K3, MoE, 多模态, prompt injection, GPT-Red, ADI

欸谨特公众号
微信扫码关注:欸谨特
Agent · 效率工具 · 实战笔记

添加新评论