Qwen3.8 Max登顶、Agent权限疲劳、GPT-5.6 Sol改进、AMD收购Taalas
- Qwen3.8 Max 登顶 Artificial Analysis Agentic Index
- ScaleX 实证:人类审核者漏掉 1/3 恶意 Agent 命令
- OpenAI 改进 GPT-5.6 Sol,Luna 向免费用户开放无限对话
- AMD 收购 Taalas:把模型权重蚀刻进硅片
- AWS/Google/Vercel Agent 工具绕过漏洞与「Ask AI」按钮投毒
2026 年 8 月 7 日,AI Agent 的能力天花板与安全底线同步移动。Qwen3.8 Max 登顶 Artificial Analysis Agentic Index 榜首,开放权重模型首次在 Agent 综合能力上超越除 Anthropic/OpenAI 以外的所有闭源模型;ScaleX 以 40,000 次运行实证人类审核者漏掉 1/3 的恶意 Agent 命令;OpenAI 发布 GPT-5.6 Sol 重要更新,并向免费用户开放 Luna 无限对话;AMD 宣布收购 Taalas,将模型权重蚀刻进硅片;AWS/Google/Vercel 三家 Agent 基础设施被曝可在模型未运行时触发工具,「Ask AI」按钮 Prompt Injection 正在商业网站蔓延。
Qwen3.8 Max 登顶 Artificial Analysis Agentic Index
2026 年 8 月 6 日,Artificial Analysis 更新其 Intelligence Index(智能指数)和 Agentic Index(Agent 指数),Alibaba 的 Qwen3.8 Max 在 Agentic Index 上登顶首位,同时在 Intelligence Index 上得分 56,与 Claude Opus 4.8 (max) 持平。开放权重模型首次在 Agent 能力综合排行上超越 Google、Meta、xAI 等全部闭源模型,仅落后于 Anthropic 和 OpenAI。
模型规格上,Qwen3.8 Max 为 2.4 万亿参数 MoE(Mixture of Experts)架构,128K 上下文窗口,Alibaba 于 2026 年 8 月 3 日正式发布,开放权重(open-weight),Apache 2.0 许可。Alibaba 官方基准数据:Terminal-Bench 2.1 得分 86.6,超过 Claude Opus 4.8(84.6)和 Claude Fable 5(84.6),GPT-5.6 Sol (max) 为 88.8 仍然领先;GPQA Diamond 92.4;SWE-bench Pro 67.7(低于 Fable 5 的 80.0);FrontierSWE 73.5(低于 Fable 5 的 88.8);LiveCodeBench 91.6。
行业影响上,这是开放权重模型首次在 Agent 综合能力上进入全球前三,可自托管、可微调、无 API 依赖的 Agent 模型首次达到接近闭源旗舰的水平;Qwen3.8 Max 的 API 定价远低于 GPT-5.6 Sol 和 Claude Opus 5。超过 10 家媒体报道,HN 热帖 393 分 / 253 评论,为当日最高。
来源:
- Artificial Analysis - Qwen3.8 Max Intelligence Index
- MarkTechPost - Alibaba Qwen Releases Qwen3.8-Max
- OfficeChai - Qwen 3.8 Max Scores 56 On Artificial Analysis
- HN - Qwen3.8 Max ranked best by agentic index
- Reddit r/singularity - Qwen 3.8 Max Artificial analysis scores
- NxCode - Qwen3.8 Benchmarks: A Coding-Agent Evaluation Guide
ScaleX 实证:人类审核者漏掉 1/3 恶意 Agent 命令
2026 年 8 月 6 日,ScaleX 发表了一项关于 AI Agent 权限审核的大规模实证研究——通过 40,000 次游戏化实验(让玩家扮演「人类审核者」,审批 AI Agent 提出的各类命令),量化「人机协作」模式下的人类审核瓶颈。
实验设计中,玩家面对 AI Agent 提出的各种命令(约 40,000 次运行),需要快速判断命令是否安全,命令类型包括文件读取、网络请求、环境变量访问、代码执行等,其中混入了刻意设计的恶意请求(如 cat AWS credentials、curl 到攻击者服务器、删除文件等)。
核心发现:人类漏掉了约 33% 的恶意命令,审核者批准了本应拒绝的攻击;15% 的安全命令被误拦截,审核疲劳导致过度谨慎;随着游戏时间延长,误判率非线性上升,权限审核疲劳(Permission Fatigue)真实存在;即使是专业开发者/安全工程师,在持续审核压力下表现也显著下降。
研究背景上,此前 7 月的「GhostApproval」事件(CVE-2025-59536 等)已暴露 AI 编程 Agent 的 Hook 机制可被利用;Stanford HAI 数据显示 AI 安全事件同比上升 56.4%;IBM X-Force 报告 30 万+ AI 聊天机器人凭证在暗网出售。当前主流 AI Agent(Claude Code、Codex、Cursor 等)均采用「human-in-the-loop」审核模式,该研究直接质疑了这一模式的有效性。The Register 同日发表深度报道:「You wouldn't let Claude Code cat your AWS credentials, would you?」
来源:
- ScaleX - Humans missed 1 in 3 threats approving AI agent commands across 40,000 plays
- ScaleX - Suffering from Agent Permission Fatigue?
- The Register - Humans in the loop miss a third of dangerous AI coding agent requests
- HN - Humans missed 1 in 3 threats approving AI agent commands
- arXiv - How Agents Ask for Permission
OpenAI 改进 GPT-5.6 Sol,Luna 向免费用户开放无限对话
2026 年 8 月 6 日,OpenAI 发布 GPT-5.6 Sol 在 ChatGPT 中的重要更新,核心包括:更好的准确性和一致性(Better accuracy and consistency)、更直接简洁的回复风格(More direct responses)、在无帮助时避免多余细节(Avoid extra detail when it doesn't help),并特别针对编程场景,对代码建议更加简洁、更少赘述。9to5Mac 解读为设计师旨在给用户「更直接的回答,更紧凑的格式,在不必要时避免多余细节」。
免费用户更新上,GPT-5.6 Luna 对免费用户开放 unlimited everyday chats,Luna 此前是 GPT-5.6 系列的轻量级版本。同日发布 Fast mode 新选项:适用于 GPT-5.6 Sol,为 2.5x 标准处理速度、2x 价格,智能水平保持不变。
8 月 6 日 V2EX 已有热帖「有没有人觉得 GPT 太啰嗦」,本次更新中 OpenAI 将「避免多余细节」列为核心改进点,说明该问题已被广泛反馈。
来源:
- OpenAI - Improving GPT‑5.6 Sol in ChatGPT
- 9to5Mac - OpenAI updating ChatGPT with smarter GPT-5.6 Sol and unlimited free chats
- Releasebot - OpenAI Release Notes August 2026
- HN - Improving GPT‑5.6 Sol in ChatGPT
AMD 收购 Taalas:把模型权重蚀刻进硅片
2026 年 8 月 6 日,AMD 宣布收购多伦多 AI 芯片初创公司 Taalas(价格未披露),纳入 AMD Instinct 路线图,CNBC、Bloomberg、The Register 同日报道。
Taalas 的核心技术是将特定 AI 模型权重直接蚀刻(hard-wire)进硅片,推理时绕过传统计算架构的限制。与传统 GPU 推理不同,不需要加载模型权重到显存、不需要逐层计算,性能提升一个数量级(10x 或更多),特别适合已确定(稳定)的模型架构进行大规模部署。
行业背景上,AMD 一直在 GPU/AI 芯片市场追赶 NVIDIA,此前已收购 Xilinx、Pensando;AI 推理市场快速增长,从训练转向推理部署是大趋势,分析师指出 Taalas 技术可能重新定义 AI 推理的基础设施成本。对 AI Agent/编程工具的间接影响上,推理成本下降 10x 意味着 Agent 每次工具调用的边际成本大幅降低,更便宜的推理支持更激进的 Agent 使用策略(更多重试、更多并行子 Agent);对于开源模型自托管的开发者,结合开放权重模型(如 Qwen3.8 Max)与低成本推理硬件,可以实现接近闭源的体验。
来源:
- AMD Press Release - AMD Acquires Taalas
- The Register - AMD acquires Taalas to boost inference performance
- CNBC - AMD buys Taalas, startup that hardwires AI models into its silicon
- Bloomberg - AMD to Acquire Taalas for AI Inference Chips
- HN - AMD acquires Taalas to boost inference
AWS/Google/Vercel Agent 工具绕过漏洞与「Ask AI」按钮投毒
2026 年 8 月 6 日,The Hacker News 连续报道两则 AI Agent 基础设施安全事件。
事件一:AWS/Google/Vercel 三家 Agent 产品被曝出安全漏洞,攻击者可以将不受信任或伪造的指令直接送达 Agent 的工具,模型根本不需要运行,system prompt、内容过滤器、模型级护栏全部没有机会介入。受影响的包括 Amazon Bedrock Agents、Google Vertex AI Agent Builder、Vercel AI SDK,三家厂商已在报告中确认并推出修复补丁。攻击路径利用 Agent 基础设施中「工具调用路由」与「模型推理」之间的解耦,通过注入特殊请求结构跳过模型的安全检查;工具被触发后,Agent 可以执行读取文件、发送请求、修改数据库等敏感操作。Pillar Security 参与了漏洞披露。
事件二:「Ask AI」按钮 Prompt Injection 蔓延。商业网站在页面中嵌入「Ask AI」按钮(预填充深度链接),按钮中嵌入隐藏的 prompt injection payload,用户点击按钮、AI 助手读取预填充链接时,payload 修改了 LLM 的「记忆」。THN 称「不需要恶意软件,不需要窃取凭证,不需要零日漏洞」。几乎每个主流 AI 助手(ChatGPT、Claude、Perplexity)都支持预填充深度链接,这成为一个新的攻击面:AI 推荐投毒(AI Recommendation Poisoning)。
来源:
本文链接:Qwen3.8 Max登顶、Agent权限疲劳、GPT-5.6 Sol改进、AMD收购Taalas - https://h89.cn/archives/697.html
版权声明:原创文章 遵循 CC 4.0 BY-SA 版权协议,转载请附上原文链接和本声明。