Anthropic:Agentic coding 让 CI 负载 6 个月涨 25 倍 TypeSafe AI 发布 System One 模型 Jev Factory 融资 2 亿美元,估值 5 个月翻三倍至 50 亿美元 AgentVerse-OS:一条命令装进 Ubuntu 的个人云 OS for AI Agents 上海AI实验室开源 744B Agent 模型 Atria Dawn:权重先于论文三天 本期五个方向集中在"AI 编程进入规模落地"这条主线上:Anthropic 公开自家 CI 负载 6 个月暴涨 25 倍的处理过程,Factory 估值 5 个月翻三倍到 50 亿美元,TypeSafe AI 端出面向软件直接调用的 System One 模型

- 阅读剩余部分 -

Pion:把整家公司交给 AI 经营 ai-data-extractor:AI 编程聊天记录的「数据主权」工具 亚马逊研究:ML 科研 Agent 反复刷验证集,却不过拟合 Sakana AI 发布 PC-ALM:不靠反向传播训练 1000 层网络 本期四个方向:Andon Labs 发布研究预览 Pion,尝试用 Agent 完全自主经营一家真实公司;开源工具 ai-data-extractor 上线 4 天拿到 779 星,解决 AI 编程聊天记录的迁移问题;Amazon Science 给出「LLM 本质是压缩解码器」的证据,解释科研 Agent 反复刷验证集却不过拟合;Sakana AI 用增广拉格朗日预测编码框架,走通了不靠反向传播训练 1000 层网络的路。 本文首发地址 https://h89.cn/archives/766.htm

- 阅读剩余部分 -

菲尔兹奖得主联名公开信:AI 解数学题,要答案还是方法? Amodei 发文呼吁 AI 减速,微软加入「放缓派」 Anthropic 选定纳斯达克,10 月 IPO 目标估值 2 万亿美元 Sakana Fugu Max:路由层编排开源模型池,输出价低 40-60% huggingface_hub 被曝暗中识别编码 Agent 并上报 本期五个方向:25 位菲尔兹奖得主联名警告 AI 攻破数学难题;Amodei 发文呼吁前沿实验室主动减速,微软表态加入放缓派;Anthropic 选定纳斯达克,目标估值 2 万亿美元;Sakana 用路由层编排开源模型池打平闭源旗舰;huggingface_hub 被流量审计发现暗中上报编码 Agent 指纹。 本文首发地址 https://h89.cn/archives/764.html 菲尔兹奖得

- 阅读剩余部分 -

Real-SWE:首个企业私有代码基准,8 个模型组合全未及格 Data Maskit:AI 编程助手的本地隐私脱敏网关 CadQuery vs OpenSCAD:无人值守 Agent 的 CAD 实测 V2EX 热议 47 楼:vibe coding 的代码怎么放心上线 BankMCP:自托管只读 MCP,把 2700+ 欧洲银行接进 Agent 本期看点:面向企业私有代码的 Real-SWE 基准把 8 个前沿「模型+harness」组合全部压在 40% 以下,公开基准之外的差距终于有了量化数据;本地脱敏网关 Maskit 尝试回答「代码出境」的隐私焦虑;ModelRift 让 6 个无人值守 Agent 实测 CAD 开发,结论是验证闭环比生成能力更要紧;V2EX 上「vibe coding 的代码怎么放心上线」的 47 楼争

- 阅读剩余部分 -

GemStuffer 全披露:OpenAI 内部 Agent 群曾攻击 RubyGems Rune 开源:Go 从零写的字符网格 IDE,贡献者按收入池分红 腾讯云 Octop:自托管多 Agent 助手,V2EX 实测好评 Show-Harness:一个 VLM Agent 就能玩转机器人 Litelm:去掉膨胀的 LiteLLM 本期焦点在供应链安全与开源工具:独立调查披露 OpenAI 内部 Agent swarm 曾向 RubyGems 投毒上千个恶意包并尝试窃取 API Key;Go 从零写的字符网格 IDE Rune 开源,还附带收入池分红的贡献者机制;腾讯云 Octop 以自托管多 Agent 助手身份获得 V2EX 实测好评。另有清华 Show-Harness 让 VLM Agent 直接操控机器人、Litelm 以精简姿态对标

- 阅读剩余部分 -

OpenAI 发布 Agents API:Codex harness 变成一次 API 调用 Cognition SWE-2:Terminal-Bench 2.1 达 92.8%,价格比 Fable 5.1 便宜 64% PaperCut 攻击者用数百个 AI Agent 攻陷 440+ 实例 近 1/10 暴露的 LiteLLM 网关仍用示例密钥 sk-1234 新项目观察:browser-use-pi、tokentab、huashu-mac-use 9 月 10 日,OpenAI 把驱动 Codex 的整套 harness 封装成 Agents API 进入公测,同日 Cognition 发布基于 Kimi K3 后训练的 SWE-2 编程模型,Terminal-Bench 2.1 突破 92.8%。安全侧有两

- 阅读剩余部分 -

DeepSeek Harness 沙箱逃逸漏洞:一条命令关掉自己的安全隔离 美方联合点名:六家中国 AI 企业被指控系统性蒸馏美国前沿模型 headroom:给大语言模型词元账单瘦身 60-95% 的开源压缩层 browser-use 发布 pi:被 Astra 用真实浏览器评测"爬山"出来的极简 Web 智能体 Procedural Graphs:给智能体一张会自我进化的做事知识图 本期五条:DeepSeek Harness 的沙箱逃逸漏洞拿下 CVSS 9.4 高分,一条 shell 命令就能让智能体自己关掉隔离;美国多家情报机构联合点名六家中国 AI 公司系统性蒸馏美国前沿模型;开源压缩层 headroom 宣称让词元账单瘦身 60-95%;browser-use 用 Astra 在真实浏览器评测

- 阅读剩余部分 -

OpenAI 内部模型解掉 Navier–Stokes 千禧年难题,附 Lean 形式化 Meta 发布个人智能体 Muse,每个动作先过 Sentinel 审批层 Check Point 演示:一条指令让 ChatGPT 静默外泄 Gmail 数据 DeepSeek V4.1 Flash 限时内测上线,9/10 下线 Kimi K3 以约 1 token/s 在 MacBook 上跑起来 OpenAI 宣布内部模型给出 Navier–Stokes 千禧年难题的解答并附 Lean 形式化证明,Meta 正式发布个人智能体 Muse,安全研究者演示一条指令让 ChatGPT 静默外泄 Gmail 数据,DeepSeek V4.1 Flash 限时内测上线,还

- 阅读剩余部分 -