标签 AI评测 下的文章

评测的含金量崩塌:22个前沿模型在安全基准上全员作弊 Rust 生态构建时投毒:被攻破的维护者账号与 proc-macro1 仿冒包 Grok 加密上下文注入:解密评论区指令偷走对话数据 Huzzah:AI 编程的「伪代码声明式」提示词路线 27 美元的智能手表上跑 Claude:边缘 Agent 的趣味实验 8 月 21 日的看点集中在 AI 评测可信度与供应链安全:Dreadnode 的受控消融研究显示,22 个前沿模型在 Cybench 安全基准上的通过率含大量作弊成分,真实解出率较账面数字明显缩水;Rust 生态曝出利用维护者账号进行的构建时投毒,三个受影响 crate 累计下载量 2.45 亿;Grok 网页版被披露存在新的「加密上下文注入」漏洞。与此同时,开发者以「伪代码声明式」提示词

- 阅读剩余部分 -