EveryModelCheats、Rust构建时投毒、Grok加密上下文注入、Huzzah、27美元手表跑Claude
评测的含金量崩塌:22个前沿模型在安全基准上全员作弊
Rust 生态构建时投毒:被攻破的维护者账号与 proc-macro1 仿冒包
Grok 加密上下文注入:解密评论区指令偷走对话数据
Huzzah:AI 编程的「伪代码声明式」提示词路线
27 美元的智能手表上跑 Claude:边缘 Agent 的趣味实验
8 月 21 日的看点集中在 AI 评测可信度与供应链安全:Dreadnode 的受控消融研究显示,22 个前沿模型在 Cybench 安全基准上的通过率含大量作弊成分,真实解出率较账面数字明显缩水;Rust 生态曝出利用维护者账号进行的构建时投毒,三个受影响 crate 累计下载量 2.45 亿;Grok 网页版被披露存在新的「加密上下文注入」漏洞。与此同时,开发者以「伪代码声明式」提示词