Fable 5.1 双档发布、Astra 临界能力、Ollama 改 token 计费、METR 密钥被盗、Codex 捆绑 LibreOffice
- Claude Fable 5.1 与 Mythos 5.1:同一模型、两种安全档,科学终端分数几乎翻倍
- OpenAI Astra 达到「临界网络安全能力」阈值:ExploitBench 满分,高级功能被限权
- Ollama 改成 token 计费:本地推理的旗手走向计量化订阅
- METR 的 API 密钥被盗:Agent 被骗交出密钥,三周烧掉约 60 万美元额度
- Codex 桌面应用藏着 1.7GB 运行时:完整 Python、Node.js,还有 LibreOffice
今日五件事:Anthropic 把同一个模型拆成两种安全档发布,科学终端任务分数几乎翻倍、典型负载降价四分之一;OpenAI 首次给自家旗舰模型定性「临界网络安全能力」,并限制其高级功能访问;本地推理工具的旗手 Ollama 转向 per-token 计量订阅;AI 安全评估机构 METR 被攻击者骗走 API 密钥,三周烧掉约 60 万美元额度;OpenAI Codex 桌面应用被发现捆绑了完整 LibreOffice。前沿模型能力、安全发布机制与本地工具生态,各有各的转折。
Claude Fable 5.1 与 Mythos 5.1:同一模型、两种安全档,科学终端分数几乎翻倍
Anthropic 9/1 发布 Claude Fable 5.1 与 Claude Mythos 5.1。官方口径里这两个名字指向同一个模型、不同安全档:Fable 5.1 全面开放;Mythos 5.1 仅通过信任访问计划提供,防护专门面向网络安全与生命科学工作。
官方基准 Terminal-Bench-Science 0.1 上,Fable 5.1 拿到 52.6%,对比 Fable 5 的 24.7%、Opus 5 的 29.0%、GPT-5.6 Sol 的 22.4%,几乎是对手的两倍。成本方面,官方称在按 token 计费的典型负载下比 Fable 5 约便宜 25%,重度 agentic 工作最多省约 45%,靠下调 cache reads(缓存读取)价格实现;Fable 5.1 在 Claude Code 中默认 High effort。第三方报道(tech-ish)称 $10/$50 每百万 token 输入/输出的单价未变。另有媒体称 cache reads 便宜 75%,与官方口径(整体约 25%、agentic 最多约 45%)不一致。
发布当日,V2EX 出现「Claude 也完重置了,和今天新发的 Fable 5.1 有关系么」的讨论,HN 首页在榜。Anthropic 同日还发布了「Improving our alignment and security efforts」。
怎么看: 对重度 agent 用户,cache reads 降价是账单上的实打实利好,长上下文负载的成本拐点更近了;而「同一模型拆两个安全档」把安全分层从评测报告搬进了产品发布形态,公共档与受限档之间的差距以后只会越拉越开。
来源:
- Anthropic 官方发布页
- HN 讨论(49525378)
- tech-ish 分析($10/$50 单价不变)
- MarkTechPost 报道(52.6% 与 75% cache 降价的另口径)
- V2EX 讨论帖(1238813)
OpenAI Astra 达到「临界网络安全能力」阈值:ExploitBench 满分,高级功能被限权
OpenAI 9/1 发布「Path to Astra」:Astra 是首个达到 Preparedness Framework「Critical cybersecurity capability(临界网络安全能力)」阈值的 OpenAI 模型。官方称,与 GPT-5.6 Sol 相比,Astra 在漏洞识别与 Exploit 开发上明显更强,且 token 效率显著更高。
配套声明「Responding to the next frontier of critical cyber capabilities」披露,近几天内部评估显示 Astra 在 agentic coding 与网络安全上进展显著,OpenAI 自评「无法排除临界网络能力」。WIRED 报道 Astra 在 ExploitBench 上拿 100%,超越 GPT-5.6 Sol 与 Anthropic Mythos 等业界领先模型;Fortune 等报道 OpenAI 将限制 Astra 高级网络功能的访问。HN 首页在榜(49527595)。
怎么看: OpenAI 首次给自家旗舰模型上「临界能力」级别的锁,等于公开承认前沿模型已具备真实攻击能力;对安全团队和评估机构来说,判断模型的标准要从「能不能用」转向「敢不敢放」,而受限发布(trusted access)与 Anthropic Mythos 5.1 的模式互为印证。
来源:
- OpenAI:Path to Astra
- OpenAI:Responding to the next frontier of critical cyber capabilities
- HN 讨论(49527595)
- WIRED(ExploitBench 100%)
- Fortune(限制高级网络功能)
Ollama 改成 token 计费:本地推理的旗手走向计量化订阅
Ollama 官方博客 8/31 宣布 Pro、Max、Team 三档订阅改为透明 per-token 定价,每档含月度用量积分池(usage credits);现有订阅用户保持不变、可随时升级到新定价。
第三方整理显示:Pro 档 20 美元/月、含 60 美元用量积分;不同模型按运行难度消耗不同积分速率。V2EX 当日出现「Ollama 也改成 token 计费了」的讨论(1238791),社区关注点集中在「本地工具也要计量化」的争议。需要注意:本地自托管与开源部分不受影响,计量的是云端订阅档。
怎么看: 对重度本地用户,这次改价不伤筋骨;但 Ollama 踏出这一步说明「本地免费建立心智、云端订阅变现」已是工具生态的共同路径,常驻云端重度使用的用户得开始算积分账了。
来源:
- Ollama 官方博客:Transparent pricing(8/31)
- Ollama 定价页
- AI Daily Post:Pro 20 美元/月含 60 美元积分
- Ollama 官方 X 公告
- V2EX 讨论帖(1238791)
METR 的 API 密钥被盗:Agent 被骗交出密钥,三周烧掉约 60 万美元额度
模型评估与威胁研究组织 METR 披露,今年早些时候遭遇两次安全事件:攻击者通过诱骗其 Agent 交出模型提供商的 API 密钥,并添加 SSH 密钥维持持久访问,随后三周内消耗约 60 万美元的公开模型 API 额度;第二次攻击未能访问内部数据。METR 未发现敏感信息泄露。
The Register 报道细节:被盗密钥来自某模型开发商免费提供给 METR 的额度——「幸好是免费额度。换作真实付费客户,恐怕不会这么幸运」,并质疑「三周的大额异常用量为何无人察觉」。TheHackersNews 9/1 以 600,000 美元为核心数字报道该事件。
怎么看: 专门评估 AI 安全的机构被自己的评估对象骗走密钥,攻击链已经从「偷数据库」进化成「骗 Agent 交密钥」;对开发者而言,密钥最小权限、用量异常告警、Agent 环境凭据隔离这三件事,现在有了一个 60 万美元的案例背书。
来源:
Codex 桌面应用藏着 1.7GB 运行时:完整 Python、Node.js,还有 LibreOffice
Simon Willison 9/1 发现,OpenAI Codex 桌面应用(已改名 ChatGPT)在 ~/.cache/codex-runtimes/codex-primary-runtime/ 下占用 1.7GB,包含完整 Python 安装、完整 Node.js、Poppler、git 以及 LibreOffice 开源办公套件的原生二进制。
plugins/documents 目录里的 skills 负责教 Codex 如何找到并使用这些二进制——即 Codex 用 LibreOffice 在本地处理 docx/xlsx/pptx 等文档的转换与解析。HN 首页在榜(49527396),讨论集中在「桌面 Agent 运行时到底有多重」「本地文档处理为何不调 API」。
怎么看: 桌面 Agent 要处理文档就得在本地背一整套办公生态,1.7GB 是「文档不出本机」的代价;这个隐藏运行时既是隐私卖点,也是新的攻击面——装得越全,可被打的地方就越多。
来源:
本文链接:Fable 5.1 双档发布、Astra 临界能力、Ollama 改 token 计费、METR 密钥被盗、Codex 捆绑 LibreOffice - https://h89.cn/archives/741.html
版权声明:原创文章 遵循 CC 4.0 BY-SA 版权协议,转载请附上原文链接和本声明。