一、核心结论

⚠️ AA 口径说明(2026-09-16): 下表「混合价格」为 Artificial Analysis 平台 9/16 快照显示值(v4.3 评测体系,9/7 上线至今未再更版)。AA 9/16 快照较 9/13 一处变化:Qwen3.8-Max-0902 首次单列入榜即 45 分(9/15 评估;AA 参考价显示 $5.41,上下文按 984k 计),与 GLM-5.3 并列国产第一;原 qwen3.8-max 条目保持 40 分($2.67);其余国产模型分数不变。AA 价格列口径保持 9/8 调整后的显示值(K3 $2.00、GLM-5.3 $2.01、Qwen3.8 Max $2.67),另有部分国产模型 AA 未显示参考价——均属 AA 显示口径而非官方调价;官方按量定价以「三、定价详情」为准(9/16 复核全部无变化)。全球头部:Claude Fable 5.1 与 OpenAI GPT-6 Astra 并列第一(均 53 分)国产第一:GLM-5.3 与 Qwen3.8-Max-0902(均 45 分)、Kimi K3(44)次之(K3 仍为全球最大开源权重模型,详见二)。

模型 厂商 Intelligence Index
(AA 9/16, v4.3)
上下文 AA 参考价 $/1M 备注
GLM-5.3 智谱AI 45 1M $2.01 国产第一(并列);8/19 API 上线
Qwen3.8-Max-0902 🆕 阿里 45 984k $5.41 9/15 AA 单列;与 GLM-5.3 并列
Kimi K3 月之暗面 44 1M $2.00 国产第二;开源权重#1
GLM-5.3-Flash 🆕 智谱AI 42 1M $0.25 8/26 开源;原生多模态
Qwen3.8 Max 阿里 40 1M $2.67 8/12 开源;0902 版单列 45
Qwen3.8-2.4T-A95B 阿里 40 984k $2.16 开源权重版
Qwen3.8-Flash-Next 🆕 阿里 40 256k $0.37 (9/10 起) Qwen4 预览;9/10 42→40
DeepSeek V4.1 Flash 🆕 DeepSeek 40 1M $0.27 9/13 入榜;MIT 开源
DeepSeek V4 Pro 0813 DeepSeek 36 1M $0.67 9/11 撤销退役;峰谷价
DeepSeek V4 Flash 0731 DeepSeek 35 1M $0.22 9/10 退役
GLM-5.2 智谱AI 34 1M $0.96 (9/13 起) 开源旗舰;9/13 39→34
Qwen3.8-27B 阿里 34 (xhigh) 256k $0.82 8/15 开源;本地可跑
MiniMax-M3 MiniMax 30 1M $0.51 Coding/Agent 前沿
MiMo-V2.5-Pro 小米 26 1M $0.05 旗舰多模态
Kimi K2.7 Code 月之暗面 26 256k $0.54 编码专用
Hy3 腾讯 26 256k $0.07 Apache 2.0 开源
Qwen3.7 Plus 阿里 26 1M $0.33 均衡之选
MiMo-V2.5 小米 22 1M $0.02 极致低价
Seed 2.1 Pro 字节 AA 未收录;SciCode 第一

说明:Qwen3.7 Max、Qwen3.6 Plus、GLM-5.1、MiniMax-M2.7、Kimi K2.6 不在 AA 9/16 v4.3 快照(上代/过渡型号淡出,均仍可正常调用,定价见第三章);阿里百炼已把 qwen3.7-max 归入「旧版模型」。腾讯 Hy4 preview(8/28 发布开源)与字节 Seed 2.1 系列 AA 仍未收录(详见二);DeepSeek V4 Flash Vision 亦随 Flash 线 9/10 退役(并入 V4.1 Flash 原生多模态);「Kimi K3 (low)」档保持 9/13 下调后的 30 分($1.15)。

本文首发地址 https://h89.cn/archives/661.html

二、详细 Benchmark 数据

Artificial Analysis Intelligence Index(2026 年 9 月 16 日快照,v4.3)

版本沿革: 2026-06-30 AA 发布 v4.1(转向重 Agent 工作负载,9 项评测);8/6 发布 v4.1.1(基础设施升级);9/4 发布 v4.2(新增 AA-Briefcase/GDP.pdf,移除 GPQA Diamond);2026-09-07 发布 v4.3Terminal-Bench v2.1→v4.0(66 道更难的终端任务集)、𝜏³-Banking 替换为 AutomationBench-AA(与 Zapier 合作的企业工作流自动化评测,657 个业务流程,私有题集),评测总数仍 10 项;40%→45% 权重为私有 held-out 题集。类别权重不变(Agents 30% / Coding 20% / General 30% / Scientific Reasoning 20%)。v4.1/v4.1.1/v4.2/v4.3 分数标尺均重新校准,不直接可比(v4.3 下多数模型较 v4.2 再下移 4-8 分)。 9/16 快照要点: 全球并列第一为 Claude Fable 5.1(max with fallback 53)与 GPT-6 Astra(max 53)(v4.2 时代 57/55 分列一二),Claude Opus 5(max 51)居三、Claude Fable 5(50)居四、Muse Spark 1.3(max 48)居五、GPT-5.6 Sol(max 47)居六;国产第一:GLM-5.3(45)与 Qwen3.8-Max-0902(45,9/15 首次单列)、Kimi K3(44)次之;40 分以上国产 8 席:GLM-5.3 45、Qwen3.8-Max-0902 45(9/15 新单列)、K3 44、GLM-5.3-Flash 42、Qwen3.8 Max 40、Qwen3.8-2.4T-A95B 40、Qwen3.8-Flash-Next 40(9/10 由 42 微调)DeepSeek V4.1 Flash 40(9/13 首次入榜)。AA 称开源权重榜 GLM-5.3 与 K3 仍居前二、GLM-5.3-Flash(42)第三。(下表分数/参考价为 AA 9/16 显示值,口径见文首注)

分数 模型 AA 参考价 $/1M
53 Claude Fable 5.1 (max with fallback) $7.63
53 GPT-6 Astra (max)(Terminal-Bench/AutoBench 第一) $3.26
51 Claude Fable 5.1 (high) $3.91
51 GPT-6 Astra (high) $1.72
51 Claude Opus 5 (max) $5.86
50 Claude Fable 5 (with fallback) $8.75
50 GPT-6 Astra (medium) $1.54
50 Claude Opus 5 (xhigh) $4.88
48 Muse Spark 1.3 (max)(Meta 9/2) $1.60
48 Claude Opus 5 (high) $3.61
47 GPT-5.6 Sol (max)(8/21 降价) $1.99
47 Claude Fable 5.1 (low) $2.37
46 GPT-6 Astra (low) $0.82
45 GLM-5.3 (max)(国产第一·并列) $2.01
45 Qwen3.8-Max-0902(9/15 单列;国产第一·并列) $5.41
45 GPT-6 Astra (非推理) $1.71
45 Claude Opus 5 (medium) $2.19
45 Muse Spark 1.3 (xhigh) $1.37
44 Kimi K3 (max)(国产第二) $2.00
44 Grok 4.6 (high) $1.86
44 Grok 4.6 (xhigh) $2.32
44 GPT-5.6 Sol (xhigh) $1.18
43 Grok 4.6 (medium) $1.50
42 GLM-5.3-Flash $0.25
42 GPT-5.6 Terra (max) $1.40
42 GPT-5.6 Sol (high) $0.81
41 Gemini 3.8 Flash (high)(9/2 发布) $1.24
40 Qwen3.8 Max $2.67
40 Qwen3.8-2.4T-A95B(开源权重版) $2.16
40 Qwen3.8-Flash-Next(Qwen4 预览) $0.37
40 DeepSeek V4.1 Flash(9/13 入榜) $0.27
40 Gemini 3.8 Flash (medium) $0.93
40 Muse Spark 1.2 (xhigh) $0.97
40 Claude Opus 5 (low) $1.10
39 GPT-5.6 Sol (medium) $0.50
39 Gemini 3.7 Flash (high) $0.93
39 Grok 4.5 (high) $1.04
38 Claude Sonnet 5 (max) $5.09
38 GPT-5.6 Luna (max) $0.18
38 GPT-5.6 Terra (xhigh) $0.63
36 DeepSeek V4 Pro 0813 (max)(9/11 撤销退役) $0.67
35 DeepSeek V4 Flash Vision (max)(9/10 退役) $0.31
35 DeepSeek V4 Flash 0731 (max)(9/10 退役) $0.22
35 Agnes 2.5 Pro Beta
35 GPT-5.6 Luna (xhigh) $0.09
34 Qwen3.8-27B (xhigh)(8/15 开源) $0.82
34 GLM-5.2 (max)(9/13 39→34) $0.96
34 Gemini 3.6 Flash $0.93
34 Gemini 3.8 Flash (low)
34 GPT-5.6 Sol (low) $0.26
30 MiniMax-M3 $0.51
30 Kimi K3 (low) $1.15
27 JT-4.1 Flash 236B (中国移动)
26 MiMo-V2.5-Pro $0.05
26 Kimi K2.7 Code $0.54
26 Qwen3.7 Plus $0.33
26 Hy3 $0.07
22 MiMo-V2.5 $0.02
22 KAT-Coder-Pro V2 (快手)
22 Qwen3.6 27B $0.62
≤20 见下方「其他值得关注的国产模型」(LongCat 2.0 等 6 个)

说明:上表按 v4.3 分数降序排列(同分内顺序不代表 AA 精确排名,表中未列出全部模型)。上代国产 Qwen3.7 Max、Qwen3.6 Plus、GLM-5.1、MiniMax-M2.7、Kimi K2.6 不在 9/16 v4.3 快照,官方渠道仍可调用、定价见第三章;Qwen3.7 Plus(26)仍在榜。腾讯 Hy4 preview、字节 Seed 2.1 系列 AA 仍未收录;DeepSeek V4.1 Flash 已于 9/13 入榜(40 分),Qwen3.8-Max-0902 于 9/15 单列(45 分)。数据来源: Artificial Analysis LLM Leaderboard (2026-09-16 v4.3 快照)

🔥 Kimi K3 深度解析(2026.07.16 发布,07.27 已开源)

指标 数据
AA Intelligence Index v4.3 44(9/16 v4.3;国产第二
参数规模 2.8T MoE(896 experts,16 激活)
上下文 1,048,576 tokens
输出速度 ~62 t/s(早期测值)
Arena.ai 前端编程 全球#1
开源 ✅ Modified MIT(2026.07.27)
官方 API 定价 ¥2 输入 / ¥20 输出 / ¥100 缓存命中
多模态 原生文本 + 图片输入
推理模式 始终推理;low / high / max 三档
  • K3 在 v4.3 评分体系(新增 Terminal-Bench v4.0/AutomationBench-AA 等)下退居国产第二(44;被 GLM-5.3 45 与 Qwen3.8-Max-0902 45 超车),但与 GLM-5.3 仍是 AA 口径下开源权重第一梯队两强
  • 分数沿革(v4.2 / v4.1.1 标尺与 v4.3 不同,不直接可比):9/5 v4.2 曾 50(国产第一)、9/2 v4.1.1 曾 60(与 GLM-5.3 并列);v4.1 时代曾登顶全球#3
  • v4.1.1 时代的 AA-Briefcase Elo 1547(#2)、GDPval-AA v2 1668(#3)等组件数据已随后续重评过期,不再引用
  • ⚠️ 9/16 复核:官方价无调整;AA 显示参考价 $2.00 系 AA 口径变化(见文首注);Kimi K3 (low) 档 AA v4.3 评分保持 9/13 下调后的 30(参考价 $1.15)
  • 定价高于多数国产模型,但凭借性能与开源权重获得市场认可

🔥 GLM-5.3 入榜说明(2026.08.14 发布,08.19 API 上线)

指标 数据
AA Intelligence Index v4.3 45(9/16 v4.3;国产第一·并列;AA 价 $2.01)
参数规模 743B(同 GLM-5.2 基座、纯后训练)
上下文 1M(最大输出 128K)
API 定价 与 GLM-5.2 一致:¥8 输入 / ¥28 输出 / ¥2 缓存命中
开放状态 权重 8/28 10:00 开源(HuggingFace zai-org)
定位 "为编程而生";官方称部分安全能力持平 Mythos 5
  • 官方称编程能力较 GLM-5.2 提升 50%,Terminal-Bench 3.0 4.6→28.3、DeepSWE v1.1 46.2→66.9(第三方复述),累计识别 2436 个安全漏洞
  • 分数沿革(标尺不同,不直接可比):9/5 v4.2 曾 49(国产第二)、9/2 v4.1.1 曾 60(与 K3 并列);v4.3 口径 45 分与 Qwen3.8-Max-0902 并列国产第一(9/15 前独居第一)
  • v4.3 组件亮点: 新增的 AutomationBench-AA(企业工作流自动化)GLM-5.3 (max) 得分 62.2%、全球第三(仅次于 GPT-6 Astra 68.5% 与 Grok 4.6 high 66.7%),为国产在该项最高
  • 8/19 起已接入 ZCode / AutoClaw / GLM Coding Plan,API 开放调用
  • 详见「三、3.6 GLM(智谱AI)」

🔥 GLM-5.3-Flash 入榜说明(2026.08.26 发布开源——即「牛来」Ox Alpha)

指标 数据
AA Intelligence Index v4.3 42(9/16 v4.3;AA 价 $0.25)
参数规模 320B 总参 / 18B 激活(MoE)
上下文 1M(最大输出 131K)
多模态 ✅ 系列首个原生多模态:文本 + 图像 + 视频
国内定价 ¥0.8 / ¥2.8 / ¥0.23(入/出/缓存)——约为 5.3 的 1/10;5 折已截止
海外定价 $0.15 / $0.50 / $0.03(5 折已截止)
开源 ✅ MIT(权重已发布)
定位 对标 DeepSeek Flash 线;晚点:10 万张国产芯片支撑
  • 身份确认: 8/20 前后匿名上线 OpenRouter 的隐身模型 stealth/ox-alpha(社区称「牛来」)8/26 官宣即 GLM-5.3-Flash,tokenizer 指纹推测得到证实
  • AA v4.3 公告: Z.AI 仍与 Anthropic/OpenAI/Meta 同占「智能 vs 每任务成本」Pareto 前沿;GLM-5.3-Flash(42)为开源权重第三强,混合参考价 $0.25(仅为同分 GPT-5.6 Terra $1.40 的 18%)
  • 生态: 已接入 API、GLM Coding Plan 与本地部署入口;兼容 OpenAI 格式;9/3-9/20 期间 GLM Coding Plan「Flash × ZCode」夜间畅用活动(每晚 23:00-次日 9:00 付费套餐额度全免)
  • 国内 ¥0.8/¥2.8 对比 GLM-5.3 的 ¥8/¥28 恰为 1/10;对比 DeepSeek V4.1 Flash 新价(闲时 ¥1/¥4)输入/输出均更低
  • 分数沿革:8/27 以 v4.1.1 口径入榜 56 → 9/5 v4.2 46 → v4.3 42(同一模型、标尺三次调整)

🆕 Qwen3.8-Flash / Qwen3.8-Flash-Next 入榜说明(2026.08.26 发布开源)

指标 Qwen3.8-Flash Qwen3.8-Flash-Next
定位 生产版轻量模型 Qwen4 架构预览
参数 125B MoE(训练成本 1/9) 125B 总参;激活 ~6B + 51B n-gram
多模态
AA 评分(v4.3) 未单列 40(9/16;9/8 曾 42)
API 定价 ¥1 / ¥3($0.16/$0.47) 同 Flash(QwenCloud API)
开源 ✅ 8/26(ModelScope/HF) ✅ 与 Flash 同步开源
  • 发布时间线: 8/25 魔搭预告 → 8/26 晚正式发布,Flash 与 Flash-Next 权重同步开放
  • 性价比: 输入 ¥1/1M,与 DeepSeek V4.1 Flash 新闲时输入价(¥1)持平,低于 Qwen3.7-Plus(¥2.5)
  • 平台: 已上线千问 AI 平台并提供 API(生产版默认 1M 上下文与官方内置工具);9/2 起 qwen3.8-flash 已上架阿里百炼推荐列表;qwen3.8-flash-next 未见于百炼模型列表,以千问 AI 平台 / QwenCloud 通道为主(9/16 复核)
  • 这两款是本轮国产模型重大发布,与 GLM-5.3-Flash 同一天(8/26)登场,加入「轻量性价比档」的竞争
  • 分数沿革(Flash-Next):8/27 以 v4.1.1 口径入榜 56 → 9/5 v4.2 46 → 9/8 v4.3 曾 42 → 9/16 40(自 9/10 微调后不变);官方称其新架构为 Qwen4 系列雏形

🆕 Qwen3.8-Max-0902(2026.09.02 上线)

指标 数据
定位 qwen3.8-max 后训练快照版(别名 qwen3.8-max-2026-09-02)
编程表现 CodeArena 前端编程 1691 分,暂列第一
能力升级 工程级长程开发;多工具调度;视觉理解精进
上下文 1M(最大输入 991K / 输出 131K)
API 定价 同 qwen3.8-max:¥12 / ¥36 / ¥1.5
渠道 千问 AI 平台 + 阿里百炼(推荐列表)
  • 9/2 上线的后训练升级版,重点优化编程与 Cowork 协作类任务,延续 1M 上下文、思考模式与完整工具生态;AA 9/15 起单列 Qwen3.8-Max-0902 条目:45 分(与 GLM-5.3 并列国产第一;AA 参考价显示 $5.41、上下文按 984k 计,系 AA 显示口径,官方价不变);原 qwen3.8-max 条目保持 40 分($2.67)
  • 与 8/26 的 Flash/Flash-Next 轻量档互补:旗舰档以「版本快照」方式持续迭代,编程能力再次领跑

其他值得关注的国产模型(AA 9/16 v4.3 快照)

模型 厂商 分数 AA 参考价 $/1M
JT-4.1 Flash 236B China Mobile (中国移动) 27
JT-35B-Flash 🆕 China Mobile (中国移动) 19
Ling-3.0-flash-VL 🆕 InclusionAI 25
LongCat 2.0 美团 20 $0.06
KAT-Coder-Pro V2 KwaiKAT (快手) 22
Ling 3.0 Flash InclusionAI 21 $0.03
Ring-2.6-1T InclusionAI 17 $0.29
Step 3.7 Flash StepFun (阶跃星辰) 19
Qwen3.6 27B 阿里 22 $0.62
ERNIE 5.0 Thinking Preview 百度 14
Doubao Seed Code 字节 17*
Kimi Linear 48B A3B 月之暗面 7

为非推理模式或 estimate 分数(标 *)。数据来源: AA Leaderboard (2026-09-16 v4.3)

  • LongCat 2.0(美团):2026.06.30 开源,1.6T MoE(~48B 激活),全国产 AI ASIC 训练,1M 上下文;OpenRouter 预览 API $0.3/$1.2
  • KAT-Coder-Pro V2(快手):编码专用,256k 上下文
  • Ring-2.6-1T(InclusionAI):262k 上下文
  • Step 3.7 Flash(阶跃星辰):价格低(历史测速 90+ t/s 档,AA 速度值随负载波动)
  • Qwen3.6 27B:上代开源轻量,仍在榜
  • ERNIE 5.0 Thinking Preview(百度):首次出现在 AA 榜单(2026.09 快照)
  • Doubao Seed Code(字节):AA 仅 estimate,Seed 2.1 旗舰仍未收录
  • Kimi Linear 48B A3B(月之暗面):开源效率模型(2025-10 开源,混合线性注意力、1M 上下文),AA 9/8 起收录
  • JT-4.1 Flash 236B(中国移动):九天系列;9/16 快照新增 JT-35B-Flash(19 分)
  • Ling 3.0 Flash / Ling-3.0-flash-VL(InclusionAI):前者 9/16 快照 25→21 分;VL 版 9/10 起收录(25 分)

🔥 Hy3(腾讯混元,2026.07.06 正式版)深度解析

指标 数据
AA Intelligence Index v4.3 26(reasoning 模式,9/16 v4.3;AA 价 $0.07)
参数规模 295B MoE / 21B 激活 / 3.8B MTP / 80 层 / 192 experts top-8
上下文 256K
输出速度 66.1 t/s
API 定价 ¥1 输入 / ¥4 输出 / ¥0.25 缓存命中
开源 ✅ Apache 2.0(GitHub / HuggingFace / ModelScope / AtomGit)
发布时间线 2025.12 重建训练基建 → 2026.04.23 preview →2026.07.06 正式版
  • AA 横向参照(v4.3):26 分低于国产第一梯队(GLM-5.3 45 / K3 44 / GLM-5.3-Flash 42 / Flash-Next 40),与 MiMo-V2.5-Pro / K2.7 Code / Qwen3.7 Plus 同档(26);正式版相对 preview 的提升主要体现在后训练体验(幻觉/任务完成率/工具调用稳定性)而非评测总分
  • 分数沿革(标尺不同,不直接可比):9/5 v4.2 曾 33、9/2 v4.1.1 曾 42
  • 与 preview 的关系:架构完全不变,是后训练升级版——官方口径为「提升后训练数据质量与多样性 + 扩大 RL 算力规模」,并吸收 50+ 业务反馈
  • 相对 preview 内部实测提升:任务解决率 72%→90%、平均耗时 -34%;幻觉率 12.5%→5.4%、常识错误率 25.4%→12.7%
  • 盲测:270 位专家基于真实工作的盲测 2.67/4,胜过 GLM-5.1(2.51/4),前端/数据与存储/CI-CD 优势最大
  • 代码:SWE-Bench Verified 78.0、SWE-Pro 57.9、Terminal-Bench 2.1 71.7;跨脚手架泛化好
  • Token 效率:比 GLM-5.2 文档处理省 47.4%、PPT 制作省 49.0%
  • 本地部署:7/14 出量化版,1bit 量化至 85.5GiB,单张 96GB 显卡可跑
  • WorkBuddy 首发接入并限时免费,腾讯云同步下调 API 价格
  • 价格对比: preview 版原价 $0.18/$0.60(OpenRouter 加权实际 $0.13/$0.60),正式版 ¥1/¥4 约合 $0.14/$0.56,价格更低

🆕 Hy4 preview(腾讯混元,2026.08.28 发布并开源)

指标 数据
定位 Hy4 系列早期 preview(非稳定版);长程软件工程、跨文件分析、游戏开发
参数规模 770B 总参 / 49B 激活(78 层,256 专家 top-8;MTP 10B/0.7B)
上下文 1M(1,048,576 tokens)
架构 Gated DSA + IndexCache;四路 identity Hyper-Connections;hidden 6144 / 64 头
推理模式 high(深度推理)/ no_think(直接回答)
API 定价 国内 ¥0.3 / ¥6 / ¥18;国际 $0.042 / $0.834 / $2.50
开源 ✅ Apache 2.0;BF16 + FP8 权重(HF)
AA 收录 ❌ 9/16 v4.3 快照尚未收录
  • 官方评测(厂商自测口径,DataLearner 收录):SWE-bench Multilingual 82.9、SWE-bench Pro 65.7、DeepSWE 64.3、Terminal-Bench 2.1 85.4(Hy3 为 71.7)、CyberGym 78.4、MCP-Atlas 83.7、Toolathlon-Verified 74.1、GPQA Diamond 92.3、HLE 43.4(无工具)/ 55.4(带工具)
  • 内部盲测:163 名专家对 203 个工程任务打分 2.99/4,略高于同场 GLM-5.3(2.92)与 Kimi K3(2.94)——厂商自测口径,仅供参考
  • 平台:已上线腾讯云 TokenHub(API 型号 hy4-preview)与 OpenRouter;WorkBuddy / CodeBuddy(国内+国际)、元宝、ima 同步首发,其中 WorkBuddy / CodeBuddy 限时免费 2 周
  • 路线图:机构预期(美银美林 2026-09-01 研报)Hy4 正式版与 Hy5 preview 于四季度推出
  • 已知限制:官方承认早期版本,复杂任务思考时间可能过长、有反复检查/过度自我验证倾向

🆕 字节跳动 Seed(豆包)系列(2026.06.23 火山引擎 FORCE 发布)

模型 定位 定价 ¥/1M 入/出/缓存 备注
doubao-seed-2.1-pro 旗舰深度思考 ¥6 / ¥30 / ¥1.2 闭源;文/图/视频输入
doubao-seed-2.1-turbo 高吞吐 2.1 蒸馏 + INT4;~95 tok/s;时延 -40%
doubao-seed-evolving 实验基座 共享 2.1 主干;在线微调
doubao-seed-2-0-pro / code 上代旗舰 ¥3.2 / ¥16 / ¥0.64 2026.02 发布;全系 4 款
  • Seed 2.1 三大升级方向:工程级代码交付、Agent 长链路执行、多模态理解;任务完成率较前代 +51%,CUA 平均步数 -16%
  • Seed 2.1 Pro 实战验证:RTL 芯片设计连续运行近 18 小时、9 轮迭代、生成 1303 行 RTL 代码并通过完整工程流程;可调度 500+ 智能体协同完成 3D 城市构建
  • 中文评测(晓天衡宇):Seed 2.1 Pro 总分 64.35 总榜第 7(Agentic 53.52 短板);Seed 2.1 Turbo 61.54 已超 Seed 2.0 Pro 的 58.04
  • Seed 2.1 Pro 基准: Terminal-Bench 2.1 71、SciCode 59.8(全球第一)、MMMU-Pro 82.7、GDPval 最高分、Agents' Last Exam 第一梯队;兼容 Claude Code / Codex
  • 平台地位:火山引擎中国公有云 MaaS 份额 49.5%,豆包日均 Token 调用 180 万亿(同比 +10 倍)
  • ⚠️ AA 统一标准缺失:截至 9/16,AA Intelligence Index(v4.3)仍未收录 Seed 2.1 系列(仅 Doubao Seed Code 17* estimate);横向对比需用同套标准:晓天衡宇榜(Pro 64.35 总榜#7,GLM-5.2 64.53 / Qwen3.7 Max 64.32 紧邻)
  • 机构预期(美银美林 2026-09-01):Seed 系列升级版有望 2026 下半年亮相

关键能力对比

Coding (SWE-bench / Code):

  • Kimi K3: Arena.ai 前端编程 #1,长程 Agent 编码新标杆(AA v4.3 44 分国产第二)
  • GLM-5.3: "为编程而生",AA v4.3 45 分国产第一(与 0902 并列)(v4.2 时代为第二),Terminal-Bench 3.0 大幅提升,官方称编程较 5.2 提升 50%;权重 8/28 开源
  • GLM-5.3-Flash 🆕: 8/26 发布,多项编码/Agent 基准超 GLM-5.2,AA v4.3 42 分且价格仅为 GLM-5.3 的 1/10
  • Qwen3.8 Max (2026.08.03 发布): 编程(Coding)能力大幅提升,官方演示连续自主编程约 16 天、留下 265 次提交;9/2 上线 0902 后训练版,CodeArena 前端编程 1691 分暂列第一,AA 9/15 单列 45 分与 GLM-5.3 并列国产第一(详见二、Qwen3.8-Max-0902);Qwen3.8-27B(8/15 开源 Apache 2.0)编程能力超 Qwen3.7-Plus,两天下载破百万
  • Qwen3.8-Flash / Flash-Next 🆕 (8/26): 训练成本 1/9、激活仅 6B,Flash-Next AA v4.3 40 分(9/16 复核不变),面向高频 Coding/Agent 调用
  • MiniMax-M3: 前方 Coding/SWE 评测中表现突出,原生多模态(AA v4.3 30)
  • DeepSeek: 开源社区最强 Coding 模型之一;V4.1 Flash 🆕 (9/10): 新一代主力,552B CED 架构、原生多模态,官方称全面超越 V4 Pro,旧 Flash/Vision-Exp 退役(AA v4.3 9/13 入榜 40 分,详见三);V4 Pro 0813: 8/13 转正、Agent 能力跃升(AA v4.3 36),9/11 官方撤销退役计划——9/14 后继续按原价提供服务
  • GLM-5.2: Terminal-Bench 2.1 得分 81.0,逼近 Claude Opus 4.8 的 85.0,开源最强 Coding 之一(AA v4.3 34,9/13 由 39 下调,9/16 复核不变)
  • Kimi K2.7 Code (2026.06.12 发布): 专为长程 Agent 编码设计,Kimi Code Bench v2 达 62.0(AA v4.3 26)
  • Hy3 (腾讯, 2026.07.06): SWE-Bench Verified 78.0、SWE-Pro 57.9、Terminal-Bench 2.1 71.7,270 专家盲测 2.67/4 胜过 GLM-5.1
  • Hy4 preview 🆕 (腾讯, 2026.08.28): 官方宣称 Terminal-Bench 2.1 85.4、SWE-bench Pro 65.7、DeepSWE 64.3(厂商自测,详见二、Hy4 preview;AA v4.3 仍未收录)
  • Seed 2.1 Pro (字节, 2026.06.23): SciCode 59.8 全球第一,Terminal-Bench 2.1 71

中文能力 (C-Eval / CMMLU / MMLU):

  • Qwen 系列: 中文生态最强,阿里百炼平台工具链最完善
  • GLM 系列: 智谱中文场景深耕,知识问答和文本摘要表现好

推理 (MATH / GSM8K):

  • GLM-5.3 / Kimi K3: 国产推理第一梯队(AA v4.3 45 / 44,GLM-5.3 与 Qwen3.8-Max-0902 并列 45)
  • GLM-5.3-Flash: 推理同样顶尖(AA v4.3 42)
  • DeepSeek V4 Pro 0813: 推理性价比高(1M 上下文 + 384K 输出),AA v4.3 36

多模态 / 视觉:

  • GLM-5.3-Flash 🆕 (8/26): GLM-5 系列首个原生多模态,文本+图像+视频输入
  • Qwen3.8-Flash / Flash-Next 🆕 (8/26): 多模态 MoE,图像/视频输入
  • DeepSeek V4.1 Flash 🆕 (9/10): 新一代架构原生多模态(视觉能力内建,替代外挂视觉模型的 V4-Flash-Vision-Exp),图像输入随 V4.1 定价,9/10 起旧 Vision-Exp 退役
  • Kimi K3 / Qwen3.8 Max / MiniMax-M3 / Seed 2.1 Pro: 均支持图像输入

三、定价详情

3.1 DeepSeek

官方 API 定价 (来源: api-docs.deepseek.com,2026-09-16 复核;V4.1 Flash 9/10 12:00 上线并下调 Flash 线价格)

当前价格(官方人民币价;峰谷定价;闲时价为高峰一半;2026-09-10 12:00 起 Flash 线新价):

模型 时段 输入(缓存命中) 输入(缓存未命中) 输出
deepseek-flash(V4.1)🆕 高峰 ¥0.04 ¥2.0 ¥8.0
deepseek-flash(V4.1)🆕 闲时 ¥0.02 ¥1.0 ¥4.0
deepseek-v4-pro 高峰 ¥0.30 ¥9.0 ¥27.0
deepseek-v4-pro 闲时 ¥0.15 ¥4.5 ¥13.5
  • 🆕 V4.1 Flash 新价较旧 v4-flash 全面下调:缓存命中 -60%、输入 -33%、输出 -11%——报道口径"最高降 60%"(9/16 页面复核价格无新调整)
  • 峰谷时段 = 工作日(周一至周五) 北京时间 9:00-12:00 / 14:00-18:00 为高峰(官方:UTC 01:00-04:00 / 06:00-10:00);周末(周六/周日)全天按闲时价——8/23 00:00 起调整;9/16 复核英文页标注一致(仅工作日有高峰段)
  • 上表为官方人民币定价(zh-cn 定价页);官方英文页对应美元价约为人民币价 ÷6.82(Flash 高峰 $0.006/$0.3/$1.2;Pro 高峰 $0.044/$1.32/$3.96),两页同价不同币种
  • 上下文: 1M tokens,最大输出 384K;支持 thinking / non-thinking 模式;兼容 OpenAI 与 Anthropic 格式
  • 🆕🔥 DeepSeek-V4.1-Flash(2026.09.09 官宣、9/10 12:00 API 上线,调用名 deepseek-flash): 新一代架构 Flash(官方称"新架构家族最小成员"),552B 参数 MoECED(Causal Encoder-Decoder)非对称架构——输入仅 8B 激活参数、输出 16B 激活;原生多模态视觉理解(视觉能力内建主架构,替代 V4-Flash-Vision-Exp 外挂方案);KV cache 大幅压缩(较前代 HBM 1/4、SSD 1/8);官方称性能/成本/速度/总时间全面超越 V4 Pro权重 MIT 开源(HuggingFace deepseek-ai/DeepSeek-V4.1-Flash,含技术报告);官方合作 WorkBuddy(含 CodeBuddy)与 OpenCode 已全面支持;AA v4.3 9/13 首次入榜:40 分、参考价 $0.27、输出速度约 210 t/s
  • 📌 旧模型退役(9/10 起): deepseek-v4-flash / deepseek-v4-flash-vision-exp 退役,调用名暂仍接受、请求路由至 V4.1 Flash 并按 Flash 价计费;deepseek-chat / deepseek-reasoner 已于 07/24 废弃
  • deepseek-v4-pro 退役计划已撤销(9/11 官方更新): 原定 2026-09-14 12:00(北京时间)起路由至 V4.1 Flash 并按 Flash 价计费——应广大用户需求,官方决定 9/14 之后继续提供 V4 Pro API 服务、计费方式不变(如有变动另行通知);「有序退役」「直至 V4.1 Pro 发布」口径作废
  • 🔥 DeepSeek-V4-Pro-0813(2026.08.13 上线,Preview 转正,API 模型名不变): Agent 能力大幅跃升(DeepSWE 大幅提升),支持 Responses API / Codex 接入,AA v4.3 36 分(v4.2 曾 42)
  • ⚠️ 峰谷定价(2026-08-17 00:00 生效): 背景为单日 8 万亿 Token 调用量 + 算力成本高企;8/23 00:00 起周末不再区分峰谷、全天按闲时价
  • 机构预期(美银美林 2026-09-01):DeepSeek V5 有望 2026 下半年亮相

3.2 Qwen(阿里百炼)

百炼平台定价 (来源: help.aliyun.com,9/16 复核)

模型 输入 ¥/1M 输出 ¥/1M 上下文
qwen3.8-max ¥12 ¥36 1M
qwen3.8-max-0902 🆕 ¥12 ¥36 1M(0902 版,详见二)
qwen3.8-flash 🆕 ¥1 ¥3 1M(生产版默认)
qwen3.8-flash-next 🆕 ¥1(QwenCloud) ¥3 256k(AA 口径)
qwen3.7-plus ¥2.5 ¥10 1M
qwen3.7-flash ¥0.5 ¥2 1M
qwen3.8-max-preview Token Plan Token Plan 1M
qwen3.6-plus ¥2.4 ¥9.6 1M(已归旧版区)
qwen3.6-flash ¥0.4 ¥1.7 1M(已归旧版区)
qwen3.5-plus ¥1.5 ¥6 1M(已归旧版区)
qwen3.5-flash ¥0.3 ¥1.2 1M(已归旧版区)

精确的百炼模型价格需在模型广场查看,由阿里云统一计费。 ⚠️ qwen3.7-max 已归入百炼「旧版模型」(9/16 复核):不再作为首选推荐,旗舰位由 qwen3.8-max 接管;qwen3.7-max 原价 ¥12/¥36、限时 5 折已回收,AA v4.3 快照亦未收录。qwen3.7-plus / qwen3.7-flash 仍为推荐(9/16 复核)。qwen3.6-plus / qwen3.6-flash / qwen3.5-plus / qwen3.5-flash 也已移入百炼「旧版模型」区(9/16 复核),上表保留价格供参考。 AA 上展示的参考价为(9/16 v4.3 快照,AA 口径):Qwen3.8 Max $2.67、Qwen3.8-Max-0902 $5.41(9/15 单列)、Qwen3.8-2.4T-A95B $2.16、Qwen3.8-Flash-Next $0.37(9/10 起显示)、Qwen3.8-27B $0.82(xhigh 档)、Qwen3.7 Plus $0.33——均系 AA 显示值,官方价无变化。 新模型: qwen3.8-max(2.4T 总参/95B 激活,缓存命中 ¥1.5/1M,最大输出 131K;权重 8/12 上线 HuggingFace,新许可协议;原生 262,144 Token 上下文可扩至 1M);Qwen3.8-27B(dense 27B,2026.08.15 开源,Apache 2.0)——编程能力超 Qwen3.7-Plus,两天下载破百万登顶 HF 全球趋势榜,被海外开发者称为"本地 Opus 4.6"(AA v4.3 34) 🆕 Qwen3.8-Max-0902(2026.09.02 上线): 详见「二、Qwen3.8-Max-0902」——qwen3.8-max 后训练快照版,CodeArena 前端编程 1691 分暂列第一,定价与 qwen3.8-max 相同(¥12/¥36/¥1.5),已上架百炼推荐列表 🆕 Qwen3.8-Flash(2026.08.26 发布开源): 详见「二、Qwen3.8-Flash 入榜说明」——生产版输入 ¥1/输出 ¥3(缓存命中约 ¥0.1),已上线千问 AI 平台 API,9/16 复核在百炼推荐列表;qwen3.8-flash-next 未见于百炼模型列表(以千问 AI 平台 / QwenCloud 通道为主) ⚠️ 百炼 DeepSeek 定价: DeepSeek-v4 系列已按 8/17 峰谷定价同步调整(阿里帮助页确认);8/23 起周末按闲时价规则同步生效;9/10 起 Flash 线新价待百炼同步(以百炼控制台为准) 💰 百炼活动: 阿里云"全模型通享低至 4.5 折";Token Plan 已纳入 Qwen3.8-Max(千问 AI 平台首发尝鲜,夜间低至 2 折);Kimi-K3 已上架千问/百炼模型市场(NEW) 机构预期(美银美林 2026-09-01):阿里或于 9/22-24 云栖大会期间发布新版模型

阿里百炼平台第三方模型同样支持(9/16 复核):

  • deepseek-v4-pro / flash ✓
  • kimi-k2.7-code ✓(百炼推荐列表)、kimi-k3 ✓(模型市场)
  • glm-5.2 ✓(百炼推荐列表)、glm-5.1 ✓
  • MiniMax-M3 ✓(9/16 复核:已上架百炼推荐列表;平台标注 192k 上下文)、MiniMax-M2.5 ✓、MiniMax-M2.7 ✓
  • mimo-v2.5-pro ✓(百炼推荐列表)

3.3 Kimi(月之暗面 / Moonshot AI)

🔥 Kimi K3(2026.07.16 发布,旗舰模型;9/16 复核价格无变化)

模型 输入(缓存命中) 输入(缓存未命中) 输出 上下文
kimi-k3 ¥2.00 ¥20.00 ¥100.00 1M
  • 国际定价: $0.30 / $3.00 / $15.00 每百万 tokens(缓存命中 $0.30)
  • 官方确认无调价;AA 参考价显示 $2.00 系 AA 口径变化(见文首注)
  • ⚠️ 7月19日因需求过载暂停 C 端新用户付费订阅,API 仍可用
  • 2026.08.31 起 Moonshot V1 / K2.5 全平台下线(官方公告;K2.6 及以上为当前主力)

Kimi K2.6 API 定价 (来源: platform.kimi.com,9/16 复核无变化)

模型 输入(缓存命中) 输入(缓存未命中) 输出 上下文
kimi-k2.6 ¥1.10 ¥6.50 ¥27.00 256k
  • 约合: 输入 $0.15 / 输出 $3.75 (按 7.2 汇率)
  • 支持文本 + 图片 + 视频输入、thinking / non-thinking、自动上下文缓存
  • ⚠️ 平台提示其联网搜索(web_search)正在升级中

Kimi K2.7 Code (2026.06.12 发布,编码专用模型;来源: platform.kimi.com,9/16 复核;9/13 定价页更新后未再变)

模型 输入(缓存命中) 输入(缓存未命中) 输出 上下文
kimi-k2.7-code ¥1.30 ¥6.50 ¥27.00 256k
kimi-k2.7-code-highspeed 🆕 ¥2.60 ¥13.00 ¥54.00 256k
  • 9/13 更新:新增缓存命中价 ¥1.30、输入/输出下调(¥6.84→¥6.50、¥28.80→¥27.00),并新增高速版 kimi-k2.7-code-highspeed
  • 约合: 输入 $0.18 / 输出 $3.75 (按 7.2 汇率)
  • 专注长程 Agent 编码,Kimi Code Bench v2 达 62.0;AA v4.3 26;开源 MIT

3.4 MiniMax

Token Plan 订阅制 (来源: platform.minimaxi.com,9/16 复核)(注:2026-08-24 前后起积分包赠送额度上调约 4.8%,订阅费不变)

方案 月费 适合场景
Plus ¥49 轻量个人开发(3-4 个 Agent)
Max ¥119 高频 Agent / 多模态(4-5 个 Agent)
Ultra ¥469 重度工作流(6-7 个 Agent)

积分包:(1,000 积分 = ¥7;9/16 页面显示赠送额度保持 8/24 上调后水平)

价格 获得积分
¥30 4,489 积分(此前 4,285)
¥150 22,460 积分(此前 21,430)
¥500 74,900 积分(此前 71,435)

按量参考价(AA 9/16 口径 / 官方):

模型 参考价 $/1M 明细
MiniMax-M3 $0.51 (AA) / $0.22 (7:2:1) 官方 $0.30/$1.20;AA v4.3 30 分
MiniMax-M2.7 $0.22 (7:2:1) 上代旗舰
  • MiniMax-M3: 新 MSA 注意力架构,1M 上下文,原生多模态(9/16 复核:已上架阿里百炼推荐列表,平台口径 192k)
  • M3 按量价说明: 官方 $0.30/$1.20 为原价 $0.60/$2.40 经永久 5 折后价格
  • 🆕 MiniMax H3(2026.07.31 发布,08.03 开源): 全模态视频生成模型("海螺 3.0"),AA 视频编辑榜单 Elo 1130 全球第一;非 LLM,未计入 AA Intelligence Index 文本榜单
  • Token Plan 覆盖 MiniMax 全系模型(M3 / M2.7 / 图像 / 语音);H3、音色设计等特殊模型暂不支持
  • 支持 Anthropic SDK 兼容接入
  • 机构预期(美银美林 2026-09-01):MiniMax 预计 9-10 月推出 M3.1 及 M3 Pro

3.5 MiMo(小米)

模型 AA 评分(v4.3) 上下文 参考价 $/1M 状态
MiMo-V2.5-Pro (Max 推理) 26 1M $0.05 (AA) / $0.18 (7:2:1) ✅ 当前旗舰
MiMo-V2.5 22 1M $0.02 (AA) / $0.06 (7:2:1) ✅ 次旗舰
V2 系列(3 款) ❌ 已下线(6/30)
  • V2.5 系列:Pro 推理模式下更强,非 Pro 为极致低价选择
  • V2 系列(V2-Flash / V2-Omni / V2-Omni-0327)已于 2026 年 6 月 30 日全面下线,旧模型名称已失效(AA 榜仍残留 V2 系历史条目,以官方下线为准)
  • MiMo-V2.5 系列在阿里百炼也可调用
  • ✅ 按量定价 (9/16 复核,5/27 降价后无新调整): V2.5-Pro ¥0.025/¥3.00/¥6.00(缓存命中/输入/输出 per 1M,国内),海外 $0.0036/$0.435/$0.87;V2.5 ¥0.02/¥1.00/¥2.00
  • 其他计费项: ASR ¥0.5/小时(国内);TTS 系列(voiceclone / voicedesign)限时免费;联网搜索 ¥16/1000 次(国内)/ $5/1000 次(海外)
  • Token Plan(4/3 上线,4 档 ¥39/¥99/¥329/¥659 每月,夜间 8 折)与按量计费额度不互通

3.6 GLM(智谱AI)

模型 混合价格 $/1M 明细(¥ 入/出/缓存)
GLM-5.3 🆕 ~$0.90 / AA $2.01 ¥8/¥28/¥2;1M;AA 45 国产第一
GLM-5.3-Flash 🆕 ~$0.10 / AA $0.25 ¥0.8/¥2.8/¥0.23(1/10);海外 $0.15/$0.50;AA 42
GLM-5.2 ~$0.90 / AA $0.96 ¥8/¥28/¥2;1M
GLM-5.1 $0.90 ¥6-8/¥24-28/¥1.3-2(按输入长度);200k(未收录)
GLM-5-Turbo ¥5-7/¥22-26/¥1.2-1.8;200k
  • GLM-5.2 (2026.06.13-16 发布): 最新开源旗舰,1M上下文,开源 MIT;Terminal-Bench 2.1 得分 81.0,接近 Claude Opus 4.8(85.0);AA v4.3 34(9/13 由 39 下调、9/16 复核不变;AA 首次显示参考价 $0.96)
  • 🔥 GLM-5.3(2026.08.14 发布): 详见「二、GLM-5.3 入榜说明」;API 8/19 上线、定价 ¥8/¥28/¥2,权重已于 8/28 上午 10 点开源(HuggingFace zai-org),AA v4.3 45 分国产第一
  • 🔥 GLM-5.3-Flash(2026.08.26 发布并开源): 详见「二、GLM-5.3-Flash 入榜说明」——即此前匿名上线 OpenRouter 的「牛来」Ox Alpha(stealth/ox-alpha),身份已获官方确认;320B/18B、原生多模态(文/图/视频)、MIT 开源、AA v4.3 42 分;国内 ¥0.8/¥2.8/¥0.23 约为 GLM-5.3 的 1/10,发布期 5 折已于 2026-09-09 24:00 结束(9/10 起恢复标准价);海外标准价 $0.15/$0.50(5 折同步结束);已接入 API / GLM Coding Plan / 本地部署
  • GLM Coding Plan 回归(2026.07.31 重启): 透明积分制,月费 ¥118 起;GLM-5.3 与 GLM-5.3-Flash 均已纳入
  • 🚧 GLM-5.5 预告落空: 摩根大通 6/25 研报曾预测 2026 年 8 月发布、总参数或超 1 万亿——8 月已过仍未发布(智谱 8 月以同基座后训练的 GLM-5.3 迭代、又补 Flash 轻量多模态档);截至 9/16 无新发布窗口信息

3.7 腾讯混元(Hy)

API 定价、架构、开源与实测详见「二、Hy3(腾讯混元)深度解析」;Hy4 preview(8/28 发布开源,国内 ¥0.3/¥6/¥18,AA 未收录)详见「二、Hy4 preview」。机构预期(美银美林 2026-09-01):Hy4 正式版与 Hy5 preview 预计四季度推出。

3.8 字节跳动豆包(Seed)

定价、基准、平台地位与 AA 收录状态详见「二、字节跳动 Seed(豆包)系列」。

四、Benchmark 排名概况 (AA Intelligence Index v4.3)

快照分数、AA 口径与逐模型变化详见「一、核心结论」与「二、详细 Benchmark 数据」,此处仅给分布示意。上一代国产型号(Qwen3.7 Max / GLM-5.1 / Qwen3.6 Plus / MiniMax-M2.7 / Kimi K2.6)不在榜但官方仍可调用;Qwen3.7 Plus(26)仍在榜;腾讯 Hy4 preview(8/28 发布)、字节 Seed 2.1 系列 AA 仍未收录。Qwen3.8-Max-0902 9/15 起单列 45 分,与 GLM-5.3 并列国产第一

分数分布(AA 9/16 v4.3 快照,示意;横轴仅为价格带示意,v4.3 下 AA 参考价口径已多次调整):

|||| 53 ┤  Claude Fable 5.1 (max) ── GPT-6 Astra (max)
|||| 51 ┤  Claude Fable 5.1 (high) ── GPT-6 Astra (high) ── Claude Opus 5 (max)
|||| 50 ┤  Claude Fable 5 ── GPT-6 Astra (medium) ── Claude Opus 5 (xhigh)
|||| 48 ┤  🆕 Muse Spark 1.3 (max) ── Claude Opus 5 (high)
|||| 47 ┤  GPT-5.6 Sol (max) ── Fable 5.1 (low)
||||| 45 ┤  GLM-5.3 (max) ── Qwen3.8-Max-0902
||||| 44 ┤  Kimi K3 (max) ── Grok 4.6 (high)
|||| 42 ┤  GLM-5.3-Flash
|||| 40 ┤  Qwen3.8 Max ── Qwen3.8-2.4T-A95B(开源) ── Qwen3.8-Flash-Next ── DeepSeek V4.1 Flash
|||| 36 ┤  DeepSeek V4 Pro 0813
|||| 35 ┤  DeepSeek V4 Flash 0731 ── DeepSeek V4 Flash Vision
|||| 34 ┤  Qwen3.8-27B (轻量开源) ── GLM-5.2
|||| 30 ┤  MiniMax-M3 ── Kimi K3 (low)
|||| 26 ┤  MiMo-V2.5-Pro ── Kimi K2.7 Code ── Qwen3.7 Plus ── Hy3
|||| 22 ┤  MiMo-V2.5
||||    └─────────────────────────────────────────
||||     高价(>$2)            中价              低价(<$0.3)

五、综合推荐

场景 推荐模型 理由
最强推理(国产) GLM-5.3 / Qwen3.8-Max-0902 AA 45 并列国产第一;K3 44 次之
最新旗舰(国产) Qwen3.8 Max 权重开源;0902 版 AA 45 并列国产第一
编程旗舰(国产) GLM-5.3 AA 45 并列第一;8/19 API
轻量多模态性价比 GLM-5.3-Flash 🆕 AA 42;¥0.8/¥2.8 为 1/10
轻量 Coding 性价比 Qwen3.8-Flash / Flash-Next 🆕 AA 40;¥1/¥3 开源
最强开源(AA 分) GLM-5.3 AA 45 分开源权重居首
最强开源(规模) Kimi K3 2.8T MoE 全球最大开源
极致性价比 DeepSeek V4.1 Flash 🆕 闲时 ¥1/¥4,1M 上下文
原生内建视觉 DeepSeek V4.1 Flash 🆕 视觉内建主架构
Coding/Agent 前沿 Kimi K3 Arena.ai 前端编程#1
Coding/Agent 性价比 MiniMax-M3 MSA 架构,1M 多模态
编码专用 Kimi K2.7 Code 长程 Agent 编码
中文生态 Qwen3.7 Plus / Qwen3.8 Max 百炼工具链完善
多模态(旗舰) Kimi K3 / GLM-5.3-Flash K3 多模态 + Flash 新晋
多模态(高性价比) MiMo-V2.5-Pro 1M 上下文,价格低
极致低价多模态 MiMo-V2.5 1M 上下文
长上下文 Kimi K3 / V4.1 Flash / Qwen3.8 Max 等 5 款 均支持 1M
低价高速 Step 3.7 Flash 90+ t/s;价格低
腾讯系 Hy4 preview 🆕 / Hy3 Hy4 开源;Hy3 ¥1/¥4
字节系(Agent/多模态) Seed 2.1 Pro SciCode 第一;闭源
最新轻量 / 本地部署 Qwen3.8-27B / Flash-Next 27B 可跑;Next AA 40

六、来源

Benchmark / 榜单

  1. Artificial Analysis LLM Leaderboard — AA Intelligence Index、速度、价格列(9/16 v4.3 快照)
  2. AA Changelog — Qwen3.8-Max-0902 9/15 评估记录(Intelligence Index 45)
  3. AA Intelligence Index v4.3 公告 — 2026-09-07;Terminal-Bench v4.0、AutomationBench-AA、私有题权重 45%

厂商 / 平台官方

  1. DeepSeek API Pricing — 峰谷价;V4.1 Flash 9/10 新价(9/16 复核)
  2. DeepSeek 官方 Changelog — V4 Flash Vision 上线(2026-08-21)等
  3. DeepSeek-V4.1-Flash 官方公告 — 2026-09-09;CED 架构、原生多模态;V4 Pro 退役计划已撤销
  4. DeepSeek-V4.1-Flash (HuggingFace) — 权重 9/10、license:mit
  5. 阿里云百炼模型广场 — Qwen 系列模型列表(9/16 复核)
  6. 阿里云百炼模型价格 — DeepSeek-v4 峰谷价
  7. Qwen3.8-2.4T-A95B (HuggingFace)
  8. Kimi K3 Pricing — ¥2/¥20/¥100
  9. Kimi K2.6 Pricing — ¥1.10/¥6.50/¥27.00
  10. Kimi K2.7 Code Pricing — ¥1.30/¥6.50/¥27.00,高速版 ¥2.60/¥13.00/¥54.00
  11. Kimi 模型文档 — Moonshot V1 / K2.5 于 2026.08.31 下线
  12. MiniMax Token Plan — ¥49/¥119/¥469
  13. MiniMax H3 官方博客 — 全模态视频生成
  14. 智谱开放平台定价 — GLM-5.3-Flash 定价;发布期 5 折 9/9 截止
  15. MiMo 官方定价页 — V2.5 定价(5/27 降价后无新调整)
  16. MiMo V2 下线公告 — V2 系列 2026.06.30 下线
  17. 腾讯混元 Hy3 官方博客 — API ¥1/¥4/¥0.25
  18. tencent/Hy3 (HuggingFace) — Apache 2.0,295B/21B 激活/256K
  19. 腾讯混元 Hy4 preview 官方发布页 — 2026-08-28 发布开源
  20. Tencent/Hy4-preview (HuggingFace) — BF16/FP8 权重
  21. Seed2.1 官方页面 — 豆包 Seed 2.1 系列
  22. Claude Fable 5.1 / Mythos 5.1(Anthropic 官方) — 9/1 发布
  23. GPT-6 Astra(OpenAI 官方) — 9/3 限量预览

本文链接:国内大模型 Benchmarks 与定价调研报告 - https://h89.cn/archives/661.html

版权声明:原创文章 遵循 CC 4.0 BY-SA 版权协议,转载请附上原文链接和本声明。

标签: Terminal-Bench, Kimi K3, Benchmarks, 定价, Artificial Analysis, Hy3, GLM-5.3, mimo-v2.5, DeepSeek V4.1 Flash, Intelligence Index, MiniMax-M3, Qwen3.8-Max-0902

欸谨特公众号
微信扫码关注:欸谨特
Agent · 效率工具 · 实战笔记

添加新评论