国内大模型 Benchmarks 与定价调研报告
- 一、核心结论
- 二、详细 Benchmark 数据
- Artificial Analysis Intelligence Index(2026 年 9 月 16 日快照,v4.3)
- 🔥 Kimi K3 深度解析(2026.07.16 发布,07.27 已开源)
- 🔥 GLM-5.3 入榜说明(2026.08.14 发布,08.19 API 上线)
- 🔥 GLM-5.3-Flash 入榜说明(2026.08.26 发布开源——即「牛来」Ox Alpha)
- 🆕 Qwen3.8-Flash / Qwen3.8-Flash-Next 入榜说明(2026.08.26 发布开源)
- 🆕 Qwen3.8-Max-0902(2026.09.02 上线)
- 其他值得关注的国产模型(AA 9/16 v4.3 快照)
- 🔥 Hy3(腾讯混元,2026.07.06 正式版)深度解析
- 🆕 Hy4 preview(腾讯混元,2026.08.28 发布并开源)
- 🆕 字节跳动 Seed(豆包)系列(2026.06.23 火山引擎 FORCE 发布)
- 关键能力对比
- 三、定价详情
- 四、Benchmark 排名概况 (AA Intelligence Index v4.3)
- 五、综合推荐
- 六、来源
一、核心结论
⚠️ AA 口径说明(2026-09-16): 下表「混合价格」为 Artificial Analysis 平台 9/16 快照显示值(v4.3 评测体系,9/7 上线至今未再更版)。AA 9/16 快照较 9/13 一处变化:Qwen3.8-Max-0902 首次单列入榜即 45 分(9/15 评估;AA 参考价显示 $5.41,上下文按 984k 计),与 GLM-5.3 并列国产第一;原 qwen3.8-max 条目保持 40 分($2.67);其余国产模型分数不变。AA 价格列口径保持 9/8 调整后的显示值(K3 $2.00、GLM-5.3 $2.01、Qwen3.8 Max $2.67),另有部分国产模型 AA 未显示参考价——均属 AA 显示口径而非官方调价;官方按量定价以「三、定价详情」为准(9/16 复核全部无变化)。全球头部:Claude Fable 5.1 与 OpenAI GPT-6 Astra 并列第一(均 53 分);国产第一:GLM-5.3 与 Qwen3.8-Max-0902(均 45 分)、Kimi K3(44)次之(K3 仍为全球最大开源权重模型,详见二)。
| 模型 | 厂商 | Intelligence Index (AA 9/16, v4.3) |
上下文 | AA 参考价 $/1M | 备注 |
|---|---|---|---|---|---|
| GLM-5.3 | 智谱AI | 45 | 1M | $2.01 | 国产第一(并列);8/19 API 上线 |
| Qwen3.8-Max-0902 🆕 | 阿里 | 45 | 984k | $5.41 | 9/15 AA 单列;与 GLM-5.3 并列 |
| Kimi K3 | 月之暗面 | 44 | 1M | $2.00 | 国产第二;开源权重#1 |
| GLM-5.3-Flash 🆕 | 智谱AI | 42 | 1M | $0.25 | 8/26 开源;原生多模态 |
| Qwen3.8 Max | 阿里 | 40 | 1M | $2.67 | 8/12 开源;0902 版单列 45 |
| Qwen3.8-2.4T-A95B | 阿里 | 40 | 984k | $2.16 | 开源权重版 |
| Qwen3.8-Flash-Next 🆕 | 阿里 | 40 | 256k | $0.37 (9/10 起) | Qwen4 预览;9/10 42→40 |
| DeepSeek V4.1 Flash 🆕 | DeepSeek | 40 | 1M | $0.27 | 9/13 入榜;MIT 开源 |
| DeepSeek V4 Pro 0813 | DeepSeek | 36 | 1M | $0.67 | 9/11 撤销退役;峰谷价 |
| DeepSeek V4 Flash 0731 | DeepSeek | 35 | 1M | $0.22 | 9/10 退役 |
| GLM-5.2 | 智谱AI | 34 | 1M | $0.96 (9/13 起) | 开源旗舰;9/13 39→34 |
| Qwen3.8-27B | 阿里 | 34 (xhigh) | 256k | $0.82 | 8/15 开源;本地可跑 |
| MiniMax-M3 | MiniMax | 30 | 1M | $0.51 | Coding/Agent 前沿 |
| MiMo-V2.5-Pro | 小米 | 26 | 1M | $0.05 | 旗舰多模态 |
| Kimi K2.7 Code | 月之暗面 | 26 | 256k | $0.54 | 编码专用 |
| Hy3 | 腾讯 | 26 | 256k | $0.07 | Apache 2.0 开源 |
| Qwen3.7 Plus | 阿里 | 26 | 1M | $0.33 | 均衡之选 |
| MiMo-V2.5 | 小米 | 22 | 1M | $0.02 | 极致低价 |
| Seed 2.1 Pro | 字节 | — | — | — | AA 未收录;SciCode 第一 |
说明:Qwen3.7 Max、Qwen3.6 Plus、GLM-5.1、MiniMax-M2.7、Kimi K2.6 不在 AA 9/16 v4.3 快照(上代/过渡型号淡出,均仍可正常调用,定价见第三章);阿里百炼已把 qwen3.7-max 归入「旧版模型」。腾讯 Hy4 preview(8/28 发布开源)与字节 Seed 2.1 系列 AA 仍未收录(详见二);DeepSeek V4 Flash Vision 亦随 Flash 线 9/10 退役(并入 V4.1 Flash 原生多模态);「Kimi K3 (low)」档保持 9/13 下调后的 30 分($1.15)。
二、详细 Benchmark 数据
Artificial Analysis Intelligence Index(2026 年 9 月 16 日快照,v4.3)
版本沿革: 2026-06-30 AA 发布 v4.1(转向重 Agent 工作负载,9 项评测);8/6 发布 v4.1.1(基础设施升级);9/4 发布 v4.2(新增 AA-Briefcase/GDP.pdf,移除 GPQA Diamond);2026-09-07 发布 v4.3:Terminal-Bench v2.1→v4.0(66 道更难的终端任务集)、𝜏³-Banking 替换为 AutomationBench-AA(与 Zapier 合作的企业工作流自动化评测,657 个业务流程,私有题集),评测总数仍 10 项;40%→45% 权重为私有 held-out 题集。类别权重不变(Agents 30% / Coding 20% / General 30% / Scientific Reasoning 20%)。v4.1/v4.1.1/v4.2/v4.3 分数标尺均重新校准,不直接可比(v4.3 下多数模型较 v4.2 再下移 4-8 分)。 9/16 快照要点: 全球并列第一为 Claude Fable 5.1(max with fallback 53)与 GPT-6 Astra(max 53)(v4.2 时代 57/55 分列一二),Claude Opus 5(max 51)居三、Claude Fable 5(50)居四、Muse Spark 1.3(max 48)居五、GPT-5.6 Sol(max 47)居六;国产第一:GLM-5.3(45)与 Qwen3.8-Max-0902(45,9/15 首次单列)、Kimi K3(44)次之;40 分以上国产 8 席:GLM-5.3 45、Qwen3.8-Max-0902 45(9/15 新单列)、K3 44、GLM-5.3-Flash 42、Qwen3.8 Max 40、Qwen3.8-2.4T-A95B 40、Qwen3.8-Flash-Next 40(9/10 由 42 微调)、DeepSeek V4.1 Flash 40(9/13 首次入榜)。AA 称开源权重榜 GLM-5.3 与 K3 仍居前二、GLM-5.3-Flash(42)第三。(下表分数/参考价为 AA 9/16 显示值,口径见文首注)
| 分数 | 模型 | AA 参考价 $/1M |
|---|---|---|
| 53 | Claude Fable 5.1 (max with fallback) | $7.63 |
| 53 | GPT-6 Astra (max)(Terminal-Bench/AutoBench 第一) | $3.26 |
| 51 | Claude Fable 5.1 (high) | $3.91 |
| 51 | GPT-6 Astra (high) | $1.72 |
| 51 | Claude Opus 5 (max) | $5.86 |
| 50 | Claude Fable 5 (with fallback) | $8.75 |
| 50 | GPT-6 Astra (medium) | $1.54 |
| 50 | Claude Opus 5 (xhigh) | $4.88 |
| 48 | Muse Spark 1.3 (max)(Meta 9/2) | $1.60 |
| 48 | Claude Opus 5 (high) | $3.61 |
| 47 | GPT-5.6 Sol (max)(8/21 降价) | $1.99 |
| 47 | Claude Fable 5.1 (low) | $2.37 |
| 46 | GPT-6 Astra (low) | $0.82 |
| 45 | GLM-5.3 (max)(国产第一·并列) | $2.01 |
| 45 | Qwen3.8-Max-0902(9/15 单列;国产第一·并列) | $5.41 |
| 45 | GPT-6 Astra (非推理) | $1.71 |
| 45 | Claude Opus 5 (medium) | $2.19 |
| 45 | Muse Spark 1.3 (xhigh) | $1.37 |
| 44 | Kimi K3 (max)(国产第二) | $2.00 |
| 44 | Grok 4.6 (high) | $1.86 |
| 44 | Grok 4.6 (xhigh) | $2.32 |
| 44 | GPT-5.6 Sol (xhigh) | $1.18 |
| 43 | Grok 4.6 (medium) | $1.50 |
| 42 | GLM-5.3-Flash | $0.25 |
| 42 | GPT-5.6 Terra (max) | $1.40 |
| 42 | GPT-5.6 Sol (high) | $0.81 |
| 41 | Gemini 3.8 Flash (high)(9/2 发布) | $1.24 |
| 40 | Qwen3.8 Max | $2.67 |
| 40 | Qwen3.8-2.4T-A95B(开源权重版) | $2.16 |
| 40 | Qwen3.8-Flash-Next(Qwen4 预览) | $0.37 |
| 40 | DeepSeek V4.1 Flash(9/13 入榜) | $0.27 |
| 40 | Gemini 3.8 Flash (medium) | $0.93 |
| 40 | Muse Spark 1.2 (xhigh) | $0.97 |
| 40 | Claude Opus 5 (low) | $1.10 |
| 39 | GPT-5.6 Sol (medium) | $0.50 |
| 39 | Gemini 3.7 Flash (high) | $0.93 |
| 39 | Grok 4.5 (high) | $1.04 |
| 38 | Claude Sonnet 5 (max) | $5.09 |
| 38 | GPT-5.6 Luna (max) | $0.18 |
| 38 | GPT-5.6 Terra (xhigh) | $0.63 |
| 36 | DeepSeek V4 Pro 0813 (max)(9/11 撤销退役) | $0.67 |
| 35 | DeepSeek V4 Flash Vision (max)(9/10 退役) | $0.31 |
| 35 | DeepSeek V4 Flash 0731 (max)(9/10 退役) | $0.22 |
| 35 | Agnes 2.5 Pro Beta | — |
| 35 | GPT-5.6 Luna (xhigh) | $0.09 |
| 34 | Qwen3.8-27B (xhigh)(8/15 开源) | $0.82 |
| 34 | GLM-5.2 (max)(9/13 39→34) | $0.96 |
| 34 | Gemini 3.6 Flash | $0.93 |
| 34 | Gemini 3.8 Flash (low) | — |
| 34 | GPT-5.6 Sol (low) | $0.26 |
| 30 | MiniMax-M3 | $0.51 |
| 30 | Kimi K3 (low) | $1.15 |
| 27 | JT-4.1 Flash 236B (中国移动) | — |
| 26 | MiMo-V2.5-Pro | $0.05 |
| 26 | Kimi K2.7 Code | $0.54 |
| 26 | Qwen3.7 Plus | $0.33 |
| 26 | Hy3 | $0.07 |
| 22 | MiMo-V2.5 | $0.02 |
| 22 | KAT-Coder-Pro V2 (快手) | — |
| 22 | Qwen3.6 27B | $0.62 |
| ≤20 | 见下方「其他值得关注的国产模型」(LongCat 2.0 等 6 个) | — |
说明:上表按 v4.3 分数降序排列(同分内顺序不代表 AA 精确排名,表中未列出全部模型)。上代国产 Qwen3.7 Max、Qwen3.6 Plus、GLM-5.1、MiniMax-M2.7、Kimi K2.6 不在 9/16 v4.3 快照,官方渠道仍可调用、定价见第三章;Qwen3.7 Plus(26)仍在榜。腾讯 Hy4 preview、字节 Seed 2.1 系列 AA 仍未收录;DeepSeek V4.1 Flash 已于 9/13 入榜(40 分),Qwen3.8-Max-0902 于 9/15 单列(45 分)。数据来源: Artificial Analysis LLM Leaderboard (2026-09-16 v4.3 快照)
🔥 Kimi K3 深度解析(2026.07.16 发布,07.27 已开源)
| 指标 | 数据 |
|---|---|
| AA Intelligence Index v4.3 | 44(9/16 v4.3;国产第二) |
| 参数规模 | 2.8T MoE(896 experts,16 激活) |
| 上下文 | 1,048,576 tokens |
| 输出速度 | ~62 t/s(早期测值) |
| Arena.ai 前端编程 | 全球#1 |
| 开源 | ✅ Modified MIT(2026.07.27) |
| 官方 API 定价 | ¥2 输入 / ¥20 输出 / ¥100 缓存命中 |
| 多模态 | 原生文本 + 图片输入 |
| 推理模式 | 始终推理;low / high / max 三档 |
- K3 在 v4.3 评分体系(新增 Terminal-Bench v4.0/AutomationBench-AA 等)下退居国产第二(44;被 GLM-5.3 45 与 Qwen3.8-Max-0902 45 超车),但与 GLM-5.3 仍是 AA 口径下开源权重第一梯队两强
- 分数沿革(v4.2 / v4.1.1 标尺与 v4.3 不同,不直接可比):9/5 v4.2 曾 50(国产第一)、9/2 v4.1.1 曾 60(与 GLM-5.3 并列);v4.1 时代曾登顶全球#3
- v4.1.1 时代的 AA-Briefcase Elo 1547(#2)、GDPval-AA v2 1668(#3)等组件数据已随后续重评过期,不再引用
- ⚠️ 9/16 复核:官方价无调整;AA 显示参考价 $2.00 系 AA 口径变化(见文首注);Kimi K3 (low) 档 AA v4.3 评分保持 9/13 下调后的 30(参考价 $1.15)
- 定价高于多数国产模型,但凭借性能与开源权重获得市场认可
🔥 GLM-5.3 入榜说明(2026.08.14 发布,08.19 API 上线)
| 指标 | 数据 |
|---|---|
| AA Intelligence Index v4.3 | 45(9/16 v4.3;国产第一·并列;AA 价 $2.01) |
| 参数规模 | 743B(同 GLM-5.2 基座、纯后训练) |
| 上下文 | 1M(最大输出 128K) |
| API 定价 | 与 GLM-5.2 一致:¥8 输入 / ¥28 输出 / ¥2 缓存命中 |
| 开放状态 | ✅ 权重 8/28 10:00 开源(HuggingFace zai-org) |
| 定位 | "为编程而生";官方称部分安全能力持平 Mythos 5 |
- 官方称编程能力较 GLM-5.2 提升 50%,Terminal-Bench 3.0 4.6→28.3、DeepSWE v1.1 46.2→66.9(第三方复述),累计识别 2436 个安全漏洞
- 分数沿革(标尺不同,不直接可比):9/5 v4.2 曾 49(国产第二)、9/2 v4.1.1 曾 60(与 K3 并列);v4.3 口径 45 分与 Qwen3.8-Max-0902 并列国产第一(9/15 前独居第一)
- v4.3 组件亮点: 新增的 AutomationBench-AA(企业工作流自动化)GLM-5.3 (max) 得分 62.2%、全球第三(仅次于 GPT-6 Astra 68.5% 与 Grok 4.6 high 66.7%),为国产在该项最高
- 8/19 起已接入 ZCode / AutoClaw / GLM Coding Plan,API 开放调用
- 详见「三、3.6 GLM(智谱AI)」
🔥 GLM-5.3-Flash 入榜说明(2026.08.26 发布开源——即「牛来」Ox Alpha)
| 指标 | 数据 |
|---|---|
| AA Intelligence Index v4.3 | 42(9/16 v4.3;AA 价 $0.25) |
| 参数规模 | 320B 总参 / 18B 激活(MoE) |
| 上下文 | 1M(最大输出 131K) |
| 多模态 | ✅ 系列首个原生多模态:文本 + 图像 + 视频 |
| 国内定价 | ¥0.8 / ¥2.8 / ¥0.23(入/出/缓存)——约为 5.3 的 1/10;5 折已截止 |
| 海外定价 | $0.15 / $0.50 / $0.03(5 折已截止) |
| 开源 | ✅ MIT(权重已发布) |
| 定位 | 对标 DeepSeek Flash 线;晚点:10 万张国产芯片支撑 |
- 身份确认: 8/20 前后匿名上线 OpenRouter 的隐身模型
stealth/ox-alpha(社区称「牛来」)8/26 官宣即 GLM-5.3-Flash,tokenizer 指纹推测得到证实 - AA v4.3 公告: Z.AI 仍与 Anthropic/OpenAI/Meta 同占「智能 vs 每任务成本」Pareto 前沿;GLM-5.3-Flash(42)为开源权重第三强,混合参考价 $0.25(仅为同分 GPT-5.6 Terra $1.40 的 18%)
- 生态: 已接入 API、GLM Coding Plan 与本地部署入口;兼容 OpenAI 格式;9/3-9/20 期间 GLM Coding Plan「Flash × ZCode」夜间畅用活动(每晚 23:00-次日 9:00 付费套餐额度全免)
- 国内 ¥0.8/¥2.8 对比 GLM-5.3 的 ¥8/¥28 恰为 1/10;对比 DeepSeek V4.1 Flash 新价(闲时 ¥1/¥4)输入/输出均更低
- 分数沿革:8/27 以 v4.1.1 口径入榜 56 → 9/5 v4.2 46 → v4.3 42(同一模型、标尺三次调整)
🆕 Qwen3.8-Flash / Qwen3.8-Flash-Next 入榜说明(2026.08.26 发布开源)
| 指标 | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| 定位 | 生产版轻量模型 | Qwen4 架构预览 |
| 参数 | 125B MoE(训练成本 1/9) | 125B 总参;激活 ~6B + 51B n-gram |
| 多模态 | ✅ | ✅ |
| AA 评分(v4.3) | 未单列 | 40(9/16;9/8 曾 42) |
| API 定价 | ¥1 / ¥3($0.16/$0.47) | 同 Flash(QwenCloud API) |
| 开源 | ✅ 8/26(ModelScope/HF) | ✅ 与 Flash 同步开源 |
- 发布时间线: 8/25 魔搭预告 → 8/26 晚正式发布,Flash 与 Flash-Next 权重同步开放
- 性价比: 输入 ¥1/1M,与 DeepSeek V4.1 Flash 新闲时输入价(¥1)持平,低于 Qwen3.7-Plus(¥2.5)
- 平台: 已上线千问 AI 平台并提供 API(生产版默认 1M 上下文与官方内置工具);9/2 起 qwen3.8-flash 已上架阿里百炼推荐列表;qwen3.8-flash-next 未见于百炼模型列表,以千问 AI 平台 / QwenCloud 通道为主(9/16 复核)
- 这两款是本轮国产模型重大发布,与 GLM-5.3-Flash 同一天(8/26)登场,加入「轻量性价比档」的竞争
- 分数沿革(Flash-Next):8/27 以 v4.1.1 口径入榜 56 → 9/5 v4.2 46 → 9/8 v4.3 曾 42 → 9/16 40(自 9/10 微调后不变);官方称其新架构为 Qwen4 系列雏形
🆕 Qwen3.8-Max-0902(2026.09.02 上线)
| 指标 | 数据 |
|---|---|
| 定位 | qwen3.8-max 后训练快照版(别名 qwen3.8-max-2026-09-02) |
| 编程表现 | CodeArena 前端编程 1691 分,暂列第一 |
| 能力升级 | 工程级长程开发;多工具调度;视觉理解精进 |
| 上下文 | 1M(最大输入 991K / 输出 131K) |
| API 定价 | 同 qwen3.8-max:¥12 / ¥36 / ¥1.5 |
| 渠道 | 千问 AI 平台 + 阿里百炼(推荐列表) |
- 9/2 上线的后训练升级版,重点优化编程与 Cowork 协作类任务,延续 1M 上下文、思考模式与完整工具生态;AA 9/15 起单列 Qwen3.8-Max-0902 条目:45 分(与 GLM-5.3 并列国产第一;AA 参考价显示 $5.41、上下文按 984k 计,系 AA 显示口径,官方价不变);原 qwen3.8-max 条目保持 40 分($2.67)
- 与 8/26 的 Flash/Flash-Next 轻量档互补:旗舰档以「版本快照」方式持续迭代,编程能力再次领跑
其他值得关注的国产模型(AA 9/16 v4.3 快照)
| 模型 | 厂商 | 分数 | AA 参考价 $/1M |
|---|---|---|---|
| JT-4.1 Flash 236B | China Mobile (中国移动) | 27 | — |
| JT-35B-Flash 🆕 | China Mobile (中国移动) | 19 | — |
| Ling-3.0-flash-VL 🆕 | InclusionAI | 25 | — |
| LongCat 2.0 | 美团 | 20 | $0.06 |
| KAT-Coder-Pro V2 | KwaiKAT (快手) | 22 | — |
| Ling 3.0 Flash | InclusionAI | 21 | $0.03 |
| Ring-2.6-1T | InclusionAI | 17 | $0.29 |
| Step 3.7 Flash | StepFun (阶跃星辰) | 19 | — |
| Qwen3.6 27B | 阿里 | 22 | $0.62 |
| ERNIE 5.0 Thinking Preview | 百度 | 14 | — |
| Doubao Seed Code | 字节 | 17* | — |
| Kimi Linear 48B A3B | 月之暗面 | 7 | — |
为非推理模式或 estimate 分数(标 *)。数据来源: AA Leaderboard (2026-09-16 v4.3)
- LongCat 2.0(美团):2026.06.30 开源,1.6T MoE(~48B 激活),全国产 AI ASIC 训练,1M 上下文;OpenRouter 预览 API $0.3/$1.2
- KAT-Coder-Pro V2(快手):编码专用,256k 上下文
- Ring-2.6-1T(InclusionAI):262k 上下文
- Step 3.7 Flash(阶跃星辰):价格低(历史测速 90+ t/s 档,AA 速度值随负载波动)
- Qwen3.6 27B:上代开源轻量,仍在榜
- ERNIE 5.0 Thinking Preview(百度):首次出现在 AA 榜单(2026.09 快照)
- Doubao Seed Code(字节):AA 仅 estimate,Seed 2.1 旗舰仍未收录
- Kimi Linear 48B A3B(月之暗面):开源效率模型(2025-10 开源,混合线性注意力、1M 上下文),AA 9/8 起收录
- JT-4.1 Flash 236B(中国移动):九天系列;9/16 快照新增 JT-35B-Flash(19 分)
- Ling 3.0 Flash / Ling-3.0-flash-VL(InclusionAI):前者 9/16 快照 25→21 分;VL 版 9/10 起收录(25 分)
🔥 Hy3(腾讯混元,2026.07.06 正式版)深度解析
| 指标 | 数据 |
|---|---|
| AA Intelligence Index v4.3 | 26(reasoning 模式,9/16 v4.3;AA 价 $0.07) |
| 参数规模 | 295B MoE / 21B 激活 / 3.8B MTP / 80 层 / 192 experts top-8 |
| 上下文 | 256K |
| 输出速度 | 66.1 t/s |
| API 定价 | ¥1 输入 / ¥4 输出 / ¥0.25 缓存命中 |
| 开源 | ✅ Apache 2.0(GitHub / HuggingFace / ModelScope / AtomGit) |
| 发布时间线 | 2025.12 重建训练基建 → 2026.04.23 preview →2026.07.06 正式版 |
- AA 横向参照(v4.3):26 分低于国产第一梯队(GLM-5.3 45 / K3 44 / GLM-5.3-Flash 42 / Flash-Next 40),与 MiMo-V2.5-Pro / K2.7 Code / Qwen3.7 Plus 同档(26);正式版相对 preview 的提升主要体现在后训练体验(幻觉/任务完成率/工具调用稳定性)而非评测总分
- 分数沿革(标尺不同,不直接可比):9/5 v4.2 曾 33、9/2 v4.1.1 曾 42
- 与 preview 的关系:架构完全不变,是后训练升级版——官方口径为「提升后训练数据质量与多样性 + 扩大 RL 算力规模」,并吸收 50+ 业务反馈
- 相对 preview 内部实测提升:任务解决率 72%→90%、平均耗时 -34%;幻觉率 12.5%→5.4%、常识错误率 25.4%→12.7%
- 盲测:270 位专家基于真实工作的盲测 2.67/4,胜过 GLM-5.1(2.51/4),前端/数据与存储/CI-CD 优势最大
- 代码:SWE-Bench Verified 78.0、SWE-Pro 57.9、Terminal-Bench 2.1 71.7;跨脚手架泛化好
- Token 效率:比 GLM-5.2 文档处理省 47.4%、PPT 制作省 49.0%
- 本地部署:7/14 出量化版,1bit 量化至 85.5GiB,单张 96GB 显卡可跑
- WorkBuddy 首发接入并限时免费,腾讯云同步下调 API 价格
- 价格对比: preview 版原价 $0.18/$0.60(OpenRouter 加权实际 $0.13/$0.60),正式版 ¥1/¥4 约合 $0.14/$0.56,价格更低
🆕 Hy4 preview(腾讯混元,2026.08.28 发布并开源)
| 指标 | 数据 |
|---|---|
| 定位 | Hy4 系列早期 preview(非稳定版);长程软件工程、跨文件分析、游戏开发 |
| 参数规模 | 770B 总参 / 49B 激活(78 层,256 专家 top-8;MTP 10B/0.7B) |
| 上下文 | 1M(1,048,576 tokens) |
| 架构 | Gated DSA + IndexCache;四路 identity Hyper-Connections;hidden 6144 / 64 头 |
| 推理模式 | high(深度推理)/ no_think(直接回答) |
| API 定价 | 国内 ¥0.3 / ¥6 / ¥18;国际 $0.042 / $0.834 / $2.50 |
| 开源 | ✅ Apache 2.0;BF16 + FP8 权重(HF) |
| AA 收录 | ❌ 9/16 v4.3 快照尚未收录 |
- 官方评测(厂商自测口径,DataLearner 收录):SWE-bench Multilingual 82.9、SWE-bench Pro 65.7、DeepSWE 64.3、Terminal-Bench 2.1 85.4(Hy3 为 71.7)、CyberGym 78.4、MCP-Atlas 83.7、Toolathlon-Verified 74.1、GPQA Diamond 92.3、HLE 43.4(无工具)/ 55.4(带工具)
- 内部盲测:163 名专家对 203 个工程任务打分 2.99/4,略高于同场 GLM-5.3(2.92)与 Kimi K3(2.94)——厂商自测口径,仅供参考
- 平台:已上线腾讯云 TokenHub(API 型号
hy4-preview)与 OpenRouter;WorkBuddy / CodeBuddy(国内+国际)、元宝、ima 同步首发,其中 WorkBuddy / CodeBuddy 限时免费 2 周 - 路线图:机构预期(美银美林 2026-09-01 研报)Hy4 正式版与 Hy5 preview 于四季度推出
- 已知限制:官方承认早期版本,复杂任务思考时间可能过长、有反复检查/过度自我验证倾向
🆕 字节跳动 Seed(豆包)系列(2026.06.23 火山引擎 FORCE 发布)
| 模型 | 定位 | 定价 ¥/1M 入/出/缓存 | 备注 |
|---|---|---|---|
| doubao-seed-2.1-pro | 旗舰深度思考 | ¥6 / ¥30 / ¥1.2 | 闭源;文/图/视频输入 |
| doubao-seed-2.1-turbo | 高吞吐 | — | 2.1 蒸馏 + INT4;~95 tok/s;时延 -40% |
| doubao-seed-evolving | 实验基座 | — | 共享 2.1 主干;在线微调 |
| doubao-seed-2-0-pro / code | 上代旗舰 | ¥3.2 / ¥16 / ¥0.64 | 2026.02 发布;全系 4 款 |
- Seed 2.1 三大升级方向:工程级代码交付、Agent 长链路执行、多模态理解;任务完成率较前代 +51%,CUA 平均步数 -16%
- Seed 2.1 Pro 实战验证:RTL 芯片设计连续运行近 18 小时、9 轮迭代、生成 1303 行 RTL 代码并通过完整工程流程;可调度 500+ 智能体协同完成 3D 城市构建
- 中文评测(晓天衡宇):Seed 2.1 Pro 总分 64.35 总榜第 7(Agentic 53.52 短板);Seed 2.1 Turbo 61.54 已超 Seed 2.0 Pro 的 58.04
- Seed 2.1 Pro 基准: Terminal-Bench 2.1 71、SciCode 59.8(全球第一)、MMMU-Pro 82.7、GDPval 最高分、Agents' Last Exam 第一梯队;兼容 Claude Code / Codex
- 平台地位:火山引擎中国公有云 MaaS 份额 49.5%,豆包日均 Token 调用 180 万亿(同比 +10 倍)
- ⚠️ AA 统一标准缺失:截至 9/16,AA Intelligence Index(v4.3)仍未收录 Seed 2.1 系列(仅 Doubao Seed Code 17* estimate);横向对比需用同套标准:晓天衡宇榜(Pro 64.35 总榜#7,GLM-5.2 64.53 / Qwen3.7 Max 64.32 紧邻)
- 机构预期(美银美林 2026-09-01):Seed 系列升级版有望 2026 下半年亮相
关键能力对比
Coding (SWE-bench / Code):
- Kimi K3: Arena.ai 前端编程 #1,长程 Agent 编码新标杆(AA v4.3 44 分国产第二)
- GLM-5.3: "为编程而生",AA v4.3 45 分国产第一(与 0902 并列)(v4.2 时代为第二),Terminal-Bench 3.0 大幅提升,官方称编程较 5.2 提升 50%;权重 8/28 开源
- GLM-5.3-Flash 🆕: 8/26 发布,多项编码/Agent 基准超 GLM-5.2,AA v4.3 42 分且价格仅为 GLM-5.3 的 1/10
- Qwen3.8 Max (2026.08.03 发布): 编程(Coding)能力大幅提升,官方演示连续自主编程约 16 天、留下 265 次提交;9/2 上线 0902 后训练版,CodeArena 前端编程 1691 分暂列第一,AA 9/15 单列 45 分与 GLM-5.3 并列国产第一(详见二、Qwen3.8-Max-0902);Qwen3.8-27B(8/15 开源 Apache 2.0)编程能力超 Qwen3.7-Plus,两天下载破百万
- Qwen3.8-Flash / Flash-Next 🆕 (8/26): 训练成本 1/9、激活仅 6B,Flash-Next AA v4.3 40 分(9/16 复核不变),面向高频 Coding/Agent 调用
- MiniMax-M3: 前方 Coding/SWE 评测中表现突出,原生多模态(AA v4.3 30)
- DeepSeek: 开源社区最强 Coding 模型之一;V4.1 Flash 🆕 (9/10): 新一代主力,552B CED 架构、原生多模态,官方称全面超越 V4 Pro,旧 Flash/Vision-Exp 退役(AA v4.3 9/13 入榜 40 分,详见三);V4 Pro 0813: 8/13 转正、Agent 能力跃升(AA v4.3 36),9/11 官方撤销退役计划——9/14 后继续按原价提供服务
- GLM-5.2: Terminal-Bench 2.1 得分 81.0,逼近 Claude Opus 4.8 的 85.0,开源最强 Coding 之一(AA v4.3 34,9/13 由 39 下调,9/16 复核不变)
- Kimi K2.7 Code (2026.06.12 发布): 专为长程 Agent 编码设计,Kimi Code Bench v2 达 62.0(AA v4.3 26)
- Hy3 (腾讯, 2026.07.06): SWE-Bench Verified 78.0、SWE-Pro 57.9、Terminal-Bench 2.1 71.7,270 专家盲测 2.67/4 胜过 GLM-5.1
- Hy4 preview 🆕 (腾讯, 2026.08.28): 官方宣称 Terminal-Bench 2.1 85.4、SWE-bench Pro 65.7、DeepSWE 64.3(厂商自测,详见二、Hy4 preview;AA v4.3 仍未收录)
- Seed 2.1 Pro (字节, 2026.06.23): SciCode 59.8 全球第一,Terminal-Bench 2.1 71
中文能力 (C-Eval / CMMLU / MMLU):
- Qwen 系列: 中文生态最强,阿里百炼平台工具链最完善
- GLM 系列: 智谱中文场景深耕,知识问答和文本摘要表现好
推理 (MATH / GSM8K):
- GLM-5.3 / Kimi K3: 国产推理第一梯队(AA v4.3 45 / 44,GLM-5.3 与 Qwen3.8-Max-0902 并列 45)
- GLM-5.3-Flash: 推理同样顶尖(AA v4.3 42)
- DeepSeek V4 Pro 0813: 推理性价比高(1M 上下文 + 384K 输出),AA v4.3 36
多模态 / 视觉:
- GLM-5.3-Flash 🆕 (8/26): GLM-5 系列首个原生多模态,文本+图像+视频输入
- Qwen3.8-Flash / Flash-Next 🆕 (8/26): 多模态 MoE,图像/视频输入
- DeepSeek V4.1 Flash 🆕 (9/10): 新一代架构原生多模态(视觉能力内建,替代外挂视觉模型的 V4-Flash-Vision-Exp),图像输入随 V4.1 定价,9/10 起旧 Vision-Exp 退役
- Kimi K3 / Qwen3.8 Max / MiniMax-M3 / Seed 2.1 Pro: 均支持图像输入
三、定价详情
3.1 DeepSeek
官方 API 定价 (来源: api-docs.deepseek.com,2026-09-16 复核;V4.1 Flash 9/10 12:00 上线并下调 Flash 线价格)
当前价格(官方人民币价;峰谷定价;闲时价为高峰一半;2026-09-10 12:00 起 Flash 线新价):
| 模型 | 时段 | 输入(缓存命中) | 输入(缓存未命中) | 输出 |
|---|---|---|---|---|
| deepseek-flash(V4.1)🆕 | 高峰 | ¥0.04 | ¥2.0 | ¥8.0 |
| deepseek-flash(V4.1)🆕 | 闲时 | ¥0.02 | ¥1.0 | ¥4.0 |
| deepseek-v4-pro | 高峰 | ¥0.30 | ¥9.0 | ¥27.0 |
| deepseek-v4-pro | 闲时 | ¥0.15 | ¥4.5 | ¥13.5 |
- 🆕 V4.1 Flash 新价较旧 v4-flash 全面下调:缓存命中 -60%、输入 -33%、输出 -11%——报道口径"最高降 60%"(9/16 页面复核价格无新调整)
- 峰谷时段 = 工作日(周一至周五) 北京时间 9:00-12:00 / 14:00-18:00 为高峰(官方:UTC 01:00-04:00 / 06:00-10:00);周末(周六/周日)全天按闲时价——8/23 00:00 起调整;9/16 复核英文页标注一致(仅工作日有高峰段)
- 上表为官方人民币定价(zh-cn 定价页);官方英文页对应美元价约为人民币价 ÷6.82(Flash 高峰 $0.006/$0.3/$1.2;Pro 高峰 $0.044/$1.32/$3.96),两页同价不同币种
- 上下文: 1M tokens,最大输出 384K;支持 thinking / non-thinking 模式;兼容 OpenAI 与 Anthropic 格式
- 🆕🔥 DeepSeek-V4.1-Flash(2026.09.09 官宣、9/10 12:00 API 上线,调用名
deepseek-flash): 新一代架构 Flash(官方称"新架构家族最小成员"),552B 参数 MoE、CED(Causal Encoder-Decoder)非对称架构——输入仅 8B 激活参数、输出 16B 激活;原生多模态视觉理解(视觉能力内建主架构,替代 V4-Flash-Vision-Exp 外挂方案);KV cache 大幅压缩(较前代 HBM 1/4、SSD 1/8);官方称性能/成本/速度/总时间全面超越 V4 Pro;权重 MIT 开源(HuggingFace deepseek-ai/DeepSeek-V4.1-Flash,含技术报告);官方合作 WorkBuddy(含 CodeBuddy)与 OpenCode 已全面支持;AA v4.3 9/13 首次入榜:40 分、参考价 $0.27、输出速度约 210 t/s - 📌 旧模型退役(9/10 起):
deepseek-v4-flash/deepseek-v4-flash-vision-exp退役,调用名暂仍接受、请求路由至 V4.1 Flash 并按 Flash 价计费;deepseek-chat/deepseek-reasoner已于 07/24 废弃 - ✅ deepseek-v4-pro 退役计划已撤销(9/11 官方更新): 原定 2026-09-14 12:00(北京时间)起路由至 V4.1 Flash 并按 Flash 价计费——应广大用户需求,官方决定 9/14 之后继续提供 V4 Pro API 服务、计费方式不变(如有变动另行通知);「有序退役」「直至 V4.1 Pro 发布」口径作废
- 🔥 DeepSeek-V4-Pro-0813(2026.08.13 上线,Preview 转正,API 模型名不变): Agent 能力大幅跃升(DeepSWE 大幅提升),支持 Responses API / Codex 接入,AA v4.3 36 分(v4.2 曾 42)
- ⚠️ 峰谷定价(2026-08-17 00:00 生效): 背景为单日 8 万亿 Token 调用量 + 算力成本高企;8/23 00:00 起周末不再区分峰谷、全天按闲时价
- 机构预期(美银美林 2026-09-01):DeepSeek V5 有望 2026 下半年亮相
3.2 Qwen(阿里百炼)
百炼平台定价 (来源: help.aliyun.com,9/16 复核)
| 模型 | 输入 ¥/1M | 输出 ¥/1M | 上下文 |
|---|---|---|---|
| qwen3.8-max | ¥12 | ¥36 | 1M |
| qwen3.8-max-0902 🆕 | ¥12 | ¥36 | 1M(0902 版,详见二) |
| qwen3.8-flash 🆕 | ¥1 | ¥3 | 1M(生产版默认) |
| qwen3.8-flash-next 🆕 | ¥1(QwenCloud) | ¥3 | 256k(AA 口径) |
| qwen3.7-plus | ¥2.5 | ¥10 | 1M |
| qwen3.7-flash | ¥0.5 | ¥2 | 1M |
| qwen3.8-max-preview | Token Plan | Token Plan | 1M |
| qwen3.6-plus | ¥2.4 | ¥9.6 | 1M(已归旧版区) |
| qwen3.6-flash | ¥0.4 | ¥1.7 | 1M(已归旧版区) |
| qwen3.5-plus | ¥1.5 | ¥6 | 1M(已归旧版区) |
| qwen3.5-flash | ¥0.3 | ¥1.2 | 1M(已归旧版区) |
精确的百炼模型价格需在模型广场查看,由阿里云统一计费。 ⚠️ qwen3.7-max 已归入百炼「旧版模型」(9/16 复核):不再作为首选推荐,旗舰位由 qwen3.8-max 接管;qwen3.7-max 原价 ¥12/¥36、限时 5 折已回收,AA v4.3 快照亦未收录。qwen3.7-plus / qwen3.7-flash 仍为推荐(9/16 复核)。qwen3.6-plus / qwen3.6-flash / qwen3.5-plus / qwen3.5-flash 也已移入百炼「旧版模型」区(9/16 复核),上表保留价格供参考。 AA 上展示的参考价为(9/16 v4.3 快照,AA 口径):Qwen3.8 Max $2.67、Qwen3.8-Max-0902 $5.41(9/15 单列)、Qwen3.8-2.4T-A95B $2.16、Qwen3.8-Flash-Next $0.37(9/10 起显示)、Qwen3.8-27B $0.82(xhigh 档)、Qwen3.7 Plus $0.33——均系 AA 显示值,官方价无变化。 新模型: qwen3.8-max(2.4T 总参/95B 激活,缓存命中 ¥1.5/1M,最大输出 131K;权重 8/12 上线 HuggingFace,新许可协议;原生 262,144 Token 上下文可扩至 1M);Qwen3.8-27B(dense 27B,2026.08.15 开源,Apache 2.0)——编程能力超 Qwen3.7-Plus,两天下载破百万登顶 HF 全球趋势榜,被海外开发者称为"本地 Opus 4.6"(AA v4.3 34) 🆕 Qwen3.8-Max-0902(2026.09.02 上线): 详见「二、Qwen3.8-Max-0902」——qwen3.8-max 后训练快照版,CodeArena 前端编程 1691 分暂列第一,定价与 qwen3.8-max 相同(¥12/¥36/¥1.5),已上架百炼推荐列表 🆕 Qwen3.8-Flash(2026.08.26 发布开源): 详见「二、Qwen3.8-Flash 入榜说明」——生产版输入 ¥1/输出 ¥3(缓存命中约 ¥0.1),已上线千问 AI 平台 API,9/16 复核在百炼推荐列表;qwen3.8-flash-next 未见于百炼模型列表(以千问 AI 平台 / QwenCloud 通道为主) ⚠️ 百炼 DeepSeek 定价: DeepSeek-v4 系列已按 8/17 峰谷定价同步调整(阿里帮助页确认);8/23 起周末按闲时价规则同步生效;9/10 起 Flash 线新价待百炼同步(以百炼控制台为准) 💰 百炼活动: 阿里云"全模型通享低至 4.5 折";Token Plan 已纳入 Qwen3.8-Max(千问 AI 平台首发尝鲜,夜间低至 2 折);Kimi-K3 已上架千问/百炼模型市场(NEW) 机构预期(美银美林 2026-09-01):阿里或于 9/22-24 云栖大会期间发布新版模型
阿里百炼平台第三方模型同样支持(9/16 复核):
- deepseek-v4-pro / flash ✓
- kimi-k2.7-code ✓(百炼推荐列表)、kimi-k3 ✓(模型市场)
- glm-5.2 ✓(百炼推荐列表)、glm-5.1 ✓
- MiniMax-M3 ✓(9/16 复核:已上架百炼推荐列表;平台标注 192k 上下文)、MiniMax-M2.5 ✓、MiniMax-M2.7 ✓
- mimo-v2.5-pro ✓(百炼推荐列表)
3.3 Kimi(月之暗面 / Moonshot AI)
🔥 Kimi K3(2026.07.16 发布,旗舰模型;9/16 复核价格无变化)
| 模型 | 输入(缓存命中) | 输入(缓存未命中) | 输出 | 上下文 |
|---|---|---|---|---|
| kimi-k3 | ¥2.00 | ¥20.00 | ¥100.00 | 1M |
- 国际定价: $0.30 / $3.00 / $15.00 每百万 tokens(缓存命中 $0.30)
- 官方确认无调价;AA 参考价显示 $2.00 系 AA 口径变化(见文首注)
- ⚠️ 7月19日因需求过载暂停 C 端新用户付费订阅,API 仍可用
- 2026.08.31 起 Moonshot V1 / K2.5 全平台下线(官方公告;K2.6 及以上为当前主力)
Kimi K2.6 API 定价 (来源: platform.kimi.com,9/16 复核无变化)
| 模型 | 输入(缓存命中) | 输入(缓存未命中) | 输出 | 上下文 |
|---|---|---|---|---|
| kimi-k2.6 | ¥1.10 | ¥6.50 | ¥27.00 | 256k |
- 约合: 输入 $0.15 / 输出 $3.75 (按 7.2 汇率)
- 支持文本 + 图片 + 视频输入、thinking / non-thinking、自动上下文缓存
- ⚠️ 平台提示其联网搜索(web_search)正在升级中
Kimi K2.7 Code (2026.06.12 发布,编码专用模型;来源: platform.kimi.com,9/16 复核;9/13 定价页更新后未再变)
| 模型 | 输入(缓存命中) | 输入(缓存未命中) | 输出 | 上下文 |
|---|---|---|---|---|
| kimi-k2.7-code | ¥1.30 | ¥6.50 | ¥27.00 | 256k |
| kimi-k2.7-code-highspeed 🆕 | ¥2.60 | ¥13.00 | ¥54.00 | 256k |
- 9/13 更新:新增缓存命中价 ¥1.30、输入/输出下调(¥6.84→¥6.50、¥28.80→¥27.00),并新增高速版 kimi-k2.7-code-highspeed
- 约合: 输入 $0.18 / 输出 $3.75 (按 7.2 汇率)
- 专注长程 Agent 编码,Kimi Code Bench v2 达 62.0;AA v4.3 26;开源 MIT
3.4 MiniMax
Token Plan 订阅制 (来源: platform.minimaxi.com,9/16 复核)(注:2026-08-24 前后起积分包赠送额度上调约 4.8%,订阅费不变)
| 方案 | 月费 | 适合场景 |
|---|---|---|
| Plus | ¥49 | 轻量个人开发(3-4 个 Agent) |
| Max | ¥119 | 高频 Agent / 多模态(4-5 个 Agent) |
| Ultra | ¥469 | 重度工作流(6-7 个 Agent) |
积分包:(1,000 积分 = ¥7;9/16 页面显示赠送额度保持 8/24 上调后水平)
| 价格 | 获得积分 |
|---|---|
| ¥30 | 4,489 积分(此前 4,285) |
| ¥150 | 22,460 积分(此前 21,430) |
| ¥500 | 74,900 积分(此前 71,435) |
按量参考价(AA 9/16 口径 / 官方):
| 模型 | 参考价 $/1M | 明细 |
|---|---|---|
| MiniMax-M3 | $0.51 (AA) / $0.22 (7:2:1) | 官方 $0.30/$1.20;AA v4.3 30 分 |
| MiniMax-M2.7 | $0.22 (7:2:1) | 上代旗舰 |
- MiniMax-M3: 新 MSA 注意力架构,1M 上下文,原生多模态(9/16 复核:已上架阿里百炼推荐列表,平台口径 192k)
- M3 按量价说明: 官方 $0.30/$1.20 为原价 $0.60/$2.40 经永久 5 折后价格
- 🆕 MiniMax H3(2026.07.31 发布,08.03 开源): 全模态视频生成模型("海螺 3.0"),AA 视频编辑榜单 Elo 1130 全球第一;非 LLM,未计入 AA Intelligence Index 文本榜单
- Token Plan 覆盖 MiniMax 全系模型(M3 / M2.7 / 图像 / 语音);H3、音色设计等特殊模型暂不支持
- 支持 Anthropic SDK 兼容接入
- 机构预期(美银美林 2026-09-01):MiniMax 预计 9-10 月推出 M3.1 及 M3 Pro
3.5 MiMo(小米)
| 模型 | AA 评分(v4.3) | 上下文 | 参考价 $/1M | 状态 |
|---|---|---|---|---|
| MiMo-V2.5-Pro (Max 推理) | 26 | 1M | $0.05 (AA) / $0.18 (7:2:1) | ✅ 当前旗舰 |
| MiMo-V2.5 | 22 | 1M | $0.02 (AA) / $0.06 (7:2:1) | ✅ 次旗舰 |
| V2 系列(3 款) | — | — | — | ❌ 已下线(6/30) |
- V2.5 系列:Pro 推理模式下更强,非 Pro 为极致低价选择
- V2 系列(V2-Flash / V2-Omni / V2-Omni-0327)已于 2026 年 6 月 30 日全面下线,旧模型名称已失效(AA 榜仍残留 V2 系历史条目,以官方下线为准)
- MiMo-V2.5 系列在阿里百炼也可调用
- ✅ 按量定价 (9/16 复核,5/27 降价后无新调整): V2.5-Pro ¥0.025/¥3.00/¥6.00(缓存命中/输入/输出 per 1M,国内),海外 $0.0036/$0.435/$0.87;V2.5 ¥0.02/¥1.00/¥2.00
- 其他计费项: ASR ¥0.5/小时(国内);TTS 系列(voiceclone / voicedesign)限时免费;联网搜索 ¥16/1000 次(国内)/ $5/1000 次(海外)
- Token Plan(4/3 上线,4 档 ¥39/¥99/¥329/¥659 每月,夜间 8 折)与按量计费额度不互通
3.6 GLM(智谱AI)
| 模型 | 混合价格 $/1M | 明细(¥ 入/出/缓存) |
|---|---|---|
| GLM-5.3 🆕 | ~$0.90 / AA $2.01 | ¥8/¥28/¥2;1M;AA 45 国产第一 |
| GLM-5.3-Flash 🆕 | ~$0.10 / AA $0.25 | ¥0.8/¥2.8/¥0.23(1/10);海外 $0.15/$0.50;AA 42 |
| GLM-5.2 | ~$0.90 / AA $0.96 | ¥8/¥28/¥2;1M |
| GLM-5.1 | $0.90 | ¥6-8/¥24-28/¥1.3-2(按输入长度);200k(未收录) |
| GLM-5-Turbo | — | ¥5-7/¥22-26/¥1.2-1.8;200k |
- GLM-5.2 (2026.06.13-16 发布): 最新开源旗舰,1M上下文,开源 MIT;Terminal-Bench 2.1 得分 81.0,接近 Claude Opus 4.8(85.0);AA v4.3 34(9/13 由 39 下调、9/16 复核不变;AA 首次显示参考价 $0.96)
- 🔥 GLM-5.3(2026.08.14 发布): 详见「二、GLM-5.3 入榜说明」;API 8/19 上线、定价 ¥8/¥28/¥2,权重已于 8/28 上午 10 点开源(HuggingFace zai-org),AA v4.3 45 分国产第一
- 🔥 GLM-5.3-Flash(2026.08.26 发布并开源): 详见「二、GLM-5.3-Flash 入榜说明」——即此前匿名上线 OpenRouter 的「牛来」Ox Alpha(
stealth/ox-alpha),身份已获官方确认;320B/18B、原生多模态(文/图/视频)、MIT 开源、AA v4.3 42 分;国内 ¥0.8/¥2.8/¥0.23 约为 GLM-5.3 的 1/10,发布期 5 折已于 2026-09-09 24:00 结束(9/10 起恢复标准价);海外标准价 $0.15/$0.50(5 折同步结束);已接入 API / GLM Coding Plan / 本地部署 - GLM Coding Plan 回归(2026.07.31 重启): 透明积分制,月费 ¥118 起;GLM-5.3 与 GLM-5.3-Flash 均已纳入
- 🚧 GLM-5.5 预告落空: 摩根大通 6/25 研报曾预测 2026 年 8 月发布、总参数或超 1 万亿——8 月已过仍未发布(智谱 8 月以同基座后训练的 GLM-5.3 迭代、又补 Flash 轻量多模态档);截至 9/16 无新发布窗口信息
3.7 腾讯混元(Hy)
API 定价、架构、开源与实测详见「二、Hy3(腾讯混元)深度解析」;Hy4 preview(8/28 发布开源,国内 ¥0.3/¥6/¥18,AA 未收录)详见「二、Hy4 preview」。机构预期(美银美林 2026-09-01):Hy4 正式版与 Hy5 preview 预计四季度推出。
3.8 字节跳动豆包(Seed)
定价、基准、平台地位与 AA 收录状态详见「二、字节跳动 Seed(豆包)系列」。
四、Benchmark 排名概况 (AA Intelligence Index v4.3)
快照分数、AA 口径与逐模型变化详见「一、核心结论」与「二、详细 Benchmark 数据」,此处仅给分布示意。上一代国产型号(Qwen3.7 Max / GLM-5.1 / Qwen3.6 Plus / MiniMax-M2.7 / Kimi K2.6)不在榜但官方仍可调用;Qwen3.7 Plus(26)仍在榜;腾讯 Hy4 preview(8/28 发布)、字节 Seed 2.1 系列 AA 仍未收录。Qwen3.8-Max-0902 9/15 起单列 45 分,与 GLM-5.3 并列国产第一。
分数分布(AA 9/16 v4.3 快照,示意;横轴仅为价格带示意,v4.3 下 AA 参考价口径已多次调整):
|||| 53 ┤ Claude Fable 5.1 (max) ── GPT-6 Astra (max)
|||| 51 ┤ Claude Fable 5.1 (high) ── GPT-6 Astra (high) ── Claude Opus 5 (max)
|||| 50 ┤ Claude Fable 5 ── GPT-6 Astra (medium) ── Claude Opus 5 (xhigh)
|||| 48 ┤ 🆕 Muse Spark 1.3 (max) ── Claude Opus 5 (high)
|||| 47 ┤ GPT-5.6 Sol (max) ── Fable 5.1 (low)
||||| 45 ┤ GLM-5.3 (max) ── Qwen3.8-Max-0902
||||| 44 ┤ Kimi K3 (max) ── Grok 4.6 (high)
|||| 42 ┤ GLM-5.3-Flash
|||| 40 ┤ Qwen3.8 Max ── Qwen3.8-2.4T-A95B(开源) ── Qwen3.8-Flash-Next ── DeepSeek V4.1 Flash
|||| 36 ┤ DeepSeek V4 Pro 0813
|||| 35 ┤ DeepSeek V4 Flash 0731 ── DeepSeek V4 Flash Vision
|||| 34 ┤ Qwen3.8-27B (轻量开源) ── GLM-5.2
|||| 30 ┤ MiniMax-M3 ── Kimi K3 (low)
|||| 26 ┤ MiMo-V2.5-Pro ── Kimi K2.7 Code ── Qwen3.7 Plus ── Hy3
|||| 22 ┤ MiMo-V2.5
|||| └─────────────────────────────────────────
|||| 高价(>$2) 中价 低价(<$0.3)
五、综合推荐
| 场景 | 推荐模型 | 理由 |
|---|---|---|
| 最强推理(国产) | GLM-5.3 / Qwen3.8-Max-0902 | AA 45 并列国产第一;K3 44 次之 |
| 最新旗舰(国产) | Qwen3.8 Max | 权重开源;0902 版 AA 45 并列国产第一 |
| 编程旗舰(国产) | GLM-5.3 | AA 45 并列第一;8/19 API |
| 轻量多模态性价比 | GLM-5.3-Flash 🆕 | AA 42;¥0.8/¥2.8 为 1/10 |
| 轻量 Coding 性价比 | Qwen3.8-Flash / Flash-Next 🆕 | AA 40;¥1/¥3 开源 |
| 最强开源(AA 分) | GLM-5.3 | AA 45 分开源权重居首 |
| 最强开源(规模) | Kimi K3 | 2.8T MoE 全球最大开源 |
| 极致性价比 | DeepSeek V4.1 Flash 🆕 | 闲时 ¥1/¥4,1M 上下文 |
| 原生内建视觉 | DeepSeek V4.1 Flash 🆕 | 视觉内建主架构 |
| Coding/Agent 前沿 | Kimi K3 | Arena.ai 前端编程#1 |
| Coding/Agent 性价比 | MiniMax-M3 | MSA 架构,1M 多模态 |
| 编码专用 | Kimi K2.7 Code | 长程 Agent 编码 |
| 中文生态 | Qwen3.7 Plus / Qwen3.8 Max | 百炼工具链完善 |
| 多模态(旗舰) | Kimi K3 / GLM-5.3-Flash | K3 多模态 + Flash 新晋 |
| 多模态(高性价比) | MiMo-V2.5-Pro | 1M 上下文,价格低 |
| 极致低价多模态 | MiMo-V2.5 | 1M 上下文 |
| 长上下文 | Kimi K3 / V4.1 Flash / Qwen3.8 Max 等 5 款 | 均支持 1M |
| 低价高速 | Step 3.7 Flash | 90+ t/s;价格低 |
| 腾讯系 | Hy4 preview 🆕 / Hy3 | Hy4 开源;Hy3 ¥1/¥4 |
| 字节系(Agent/多模态) | Seed 2.1 Pro | SciCode 第一;闭源 |
| 最新轻量 / 本地部署 | Qwen3.8-27B / Flash-Next | 27B 可跑;Next AA 40 |
六、来源
Benchmark / 榜单
- Artificial Analysis LLM Leaderboard — AA Intelligence Index、速度、价格列(9/16 v4.3 快照)
- AA Changelog — Qwen3.8-Max-0902 9/15 评估记录(Intelligence Index 45)
- AA Intelligence Index v4.3 公告 — 2026-09-07;Terminal-Bench v4.0、AutomationBench-AA、私有题权重 45%
厂商 / 平台官方
- DeepSeek API Pricing — 峰谷价;V4.1 Flash 9/10 新价(9/16 复核)
- DeepSeek 官方 Changelog — V4 Flash Vision 上线(2026-08-21)等
- DeepSeek-V4.1-Flash 官方公告 — 2026-09-09;CED 架构、原生多模态;V4 Pro 退役计划已撤销
- DeepSeek-V4.1-Flash (HuggingFace) — 权重 9/10、license:mit
- 阿里云百炼模型广场 — Qwen 系列模型列表(9/16 复核)
- 阿里云百炼模型价格 — DeepSeek-v4 峰谷价
- Qwen3.8-2.4T-A95B (HuggingFace)
- Kimi K3 Pricing — ¥2/¥20/¥100
- Kimi K2.6 Pricing — ¥1.10/¥6.50/¥27.00
- Kimi K2.7 Code Pricing — ¥1.30/¥6.50/¥27.00,高速版 ¥2.60/¥13.00/¥54.00
- Kimi 模型文档 — Moonshot V1 / K2.5 于 2026.08.31 下线
- MiniMax Token Plan — ¥49/¥119/¥469
- MiniMax H3 官方博客 — 全模态视频生成
- 智谱开放平台定价 — GLM-5.3-Flash 定价;发布期 5 折 9/9 截止
- MiMo 官方定价页 — V2.5 定价(5/27 降价后无新调整)
- MiMo V2 下线公告 — V2 系列 2026.06.30 下线
- 腾讯混元 Hy3 官方博客 — API ¥1/¥4/¥0.25
- tencent/Hy3 (HuggingFace) — Apache 2.0,295B/21B 激活/256K
- 腾讯混元 Hy4 preview 官方发布页 — 2026-08-28 发布开源
- Tencent/Hy4-preview (HuggingFace) — BF16/FP8 权重
- Seed2.1 官方页面 — 豆包 Seed 2.1 系列
- Claude Fable 5.1 / Mythos 5.1(Anthropic 官方) — 9/1 发布
- GPT-6 Astra(OpenAI 官方) — 9/3 限量预览
本文链接:国内大模型 Benchmarks 与定价调研报告 - https://h89.cn/archives/661.html
版权声明:原创文章 遵循 CC 4.0 BY-SA 版权协议,转载请附上原文链接和本声明。