平台基线:高通骁龙 8397/8797(Hexagon NPU 320 TOPS 稠密,舱驾融合 64GB 共享)|网络策略:本地优先,信息类任务经云服务网关|文中数据出处见文末参考来源 本文首发地址 :https://h89.cn/archives/690.html


64GB 舱驾融合内存账

1. 背景与目标

1.1 背景

智能座舱交互正从"规则指令式"(意图分类 → 触发动作)转向 agentic、多模态的推理与规划系统。端侧大模型上车这事,数据已经很硬:

  • 2026 年 2 月车载 AI 大模型安装量同比 +135.1%,渗透率同比 +173.6%,30+ 大模型上车
  • ABI Research:agentic AI 车辆从 2025 年约 500 万辆增长到 2035 年 7000 万辆
  • 头部车厂(理想、蔚来、吉利、小米)都已构建服务于汽车的专用模型,而不是直接拿通用大模型来用

但"上大模型"和"上得好"是两回事。真上车之后,预算怎么算、模型怎么选,每一层都有坑。这篇把一套完整方案的账摊开算。

1.2 目标

在 8397/8797 级座舱算力上,实现全链路本地化 Agent

  1. 本地承载 7B~13B 级 LLM 推理(多轮对话、工具调用、任务规划)
  2. 融合多模态(语音、舱内/车外摄像头、车辆遥测)
  3. 与云端 agent 协同完成信息类任务,断网自动降级为纯本地
  4. 满足车规级延迟、内存、安全、隐私约束

1.3 非功能约束(硬指标)

指标 目标 依据
首 token 延迟 <500ms(文本请求口径) NVIDIA 端侧 Agent 要求;语音全链路 <1.5s(见第 10 章语音链路)
解码吞吐 >30 tokens/s NVIDIA 端侧 Agent 要求
模型权重驻留 <8GB(推理峰值另计) 行业技术分析(龙腾亚泰)
用户无感延迟 <100ms 感知阈值 行业技术分析(龙腾亚泰)
数据边界 车内数据默认不出车;出车须白名单 隐私合规
可用性 断网场景全功能可用(信息类降级) 混合架构要求

2. 算力与资源预算

2.1 平台画像(高通 8397/8797)

资源 高通 8397/8797 说明
CPU Oryon 18 核(8P+10E,行业口径);SPECint2017 rate ~80(中科创达披露) 编排、ASR/TTS、工具调度
GPU Adreno 7 系 渲染 + 部分推理
NPU Hexagon,320 TOPS(INT8 稠密,中科创达 RazorDCX Sylvania 官方披露) LLM/VLM 推理主承载
内存 64GB 融合共享(LPDDR5X,带宽 272 GB/s raw,中科创达披露) 座舱 Agent + 安卓娱乐 + 智驾共享,QoS 分区
软件 Gunyah Hypervisor + QNX/Linux VM 隔离 智驾/座舱 FFI(freedom from interference)关键
安全岛 Cortex-R52(行业口径) 系统级监控与故障处理
模型上限 端侧 30B MoE(中科创达官宣)/ 14B 稠密(高通口径) 超过 Orin ~13B 上限

与智驾芯片 8797 同一颗物理 Die(锁核区分 SKU,行业口径):8397 锁掉部分 ADAS 核专注座舱,8797 开放全核支持舱驾融合(座舱 + L2+/L3 ADAS)。本文主推融合形态,对应 8797 全核配置。

2.2 平台选型:高通 8397/8797(主选)vs NVIDIA Orin(对照)

维度 高通 8397/8797(本文主选) NVIDIA DRIVE AGX Orin(对照)
定位 2026 新一代座舱旗舰(官方第五代:8155 第三代→8295 第四代→8397 第五代);与智驾芯片 8797 同 Die(锁核区分),舱驾融合线对应 8797 全核 车规 AI Box / 舱驾一体(智驾芯片出身,座舱需 AI Box 外挂)
AI 算力 320 TOPS(稠密,中科创达 RazorDCX Sylvania 官方披露) 241~275 TOPS(官方型号指标)
端侧大模型 主打"端侧大模型 + 物理 AI",神行者 8 中国首批量产;中科创达官宣 30B MoE 端侧推理 官方支持 ~13B(TensorRT Edge-LLM)
推理工具链 QNN(AI Engine Direct)+ AI Hub TensorRT Edge-LLM / TensorRT-LLM
生态形态 座舱 IVI 集成 + AI Box(与云途等合作);滴水 AIOS 2.1 已在 8397/8797 全局适配(官方) 独立 AI Box ECU 或 Thor 融合
代表量产 神行者 8(中国首批)、滴水 AIOS 2.1 适配 8397/8797 吉利(200 TOPS AI Box 跑 7B,据媒体报道)、小米 YU7(Thor 700 TOPS)

结论:本文选 8397/8797 为主选平台——座舱原生旗舰(8295 升级线)、与智驾芯片同 Die 天然支撑舱驾融合、端侧大模型量产节奏更快(神行者 8 中国首批、滴水 AIOS 2.1 全局适配、30B MoE 官宣)。Orin 的优势在大规模量产历史与 CUDA 工具链成熟度,作为对照保留。端侧 LLM 实际体验还取决于内存带宽、工具链成熟度与量化支持,得实测了才算数(P0 阶段双向基准)。下文按 8397/8797 展开;真换了 NVIDIA 平台,动的是推理引擎层,Agent 架构不用重来。

2.3 部署形态:舱驾一体融合(主推)或 AI Box(备选)

形态决策:EE 架构向中央计算收敛,本文主推 舱驾一体融合。NVIDIA 官方给出三种 EE 架构(AI Box 独立 ECU / Thor 多域融合 / + MediaTek Dimensity AX 中央计算),高通线对应 8797 全核融合(与 8397 同 Die);本方案落在 8797 / Thor 类融合平台,理由如下:

  • 单芯片承载座舱 Agent + 智驾 + 安卓娱乐,少一块 ECU、少布线散热,硬件成本与 EE 架构更简
  • 芯片内共享内存通信,摄像头/音频无需跨以太网编码转发,时延更低
  • 算力与模型上限更高(8797 开放全核;Thor 支撑 13B+,小米 YU7 700 TOPS 等已量产),Agent 能力增长空间大
  • 行业趋势:EE 架构向中央计算收敛,舱驾融合是主流方向

决策矩阵(融合 vs AI Box)

维度 舱驾一体融合(8797 / Thor 类,本文选型) AI Box(独立 ECU) 占优
内存 64GB 共享为下限,须跨域静态分区协商 32GB 专属 Agent 域,无需跨域协商 AI Box
性能隔离 依赖 Hypervisor VM 隔离(高通 Gunyah / DriveOS 7)+ FFI 认证 物理隔离 + 专用带宽 QoS AI Box
量产节奏 涉及 EE 架构变更,认证周期长 不动 EE 架构,独立升级不阻塞认证 AI Box
硬件成本 单芯片,成本更优 多一块 ECU(布线/散热/供电) 融合
通信时延 芯片内共享内存,时延更低 摄像头/音频跨以太网编码转发 融合
算力与模型上限 8797 全核 / Thor 支撑 13B+ 旗舰(小米 YU7 700 TOPS 等已量产) 单芯片 ~13B 封顶 融合

适用边界:融合方案要求 64GB 共享内存起步,须依赖 Hypervisor 的 QNX/Linux VM 隔离(高通 Gunyah / NVIDIA DriveOS 7)保证智驾与座舱 Agent 的 FFI(freedom from interference),且涉及 EE 架构变更、认证周期长。若短期内不打算动 EE 架构(存量平台、快速量产、AI 独立升级节奏),AI Box(独立 ECU,32GB 专属)仍是稳妥备选。

2.4 资源预算分配(按部署形态区分)

先说结论:本方案主推舱驾一体融合,64GB 共享内存起步(同芯片跑大模型 + 安卓娱乐 + 智驾);32GB 专属内存仅适用于 AI Box 独立形态,作为不动 EE 架构的备选。

形态 A:舱驾一体融合(64GB 共享,主推)

用途 内存预算 说明
LLM 7B INT8 ~8GB L2 主对话/推理模型
L1 轻量模型(1B 级) ~1GB 单轮模糊意图+槽位(快路径主体)
VLM 3B~4B ~4GB 环境视觉问答(按需加载;非驻留)
视觉检测器(YOLO 级) <0.5GB 滞留/靠近检测,NPU 常驻
KV Cache 1~2GB 会话上下文
Agent 运行时 + 向量库 ~1GB 编排、记忆
安卓娱乐(IVI 域) 20~24GB 多 App 常驻 + 车机渲染(QNX/Linux VM 隔离)
智驾域 10~12GB 感知/规划(8797 全核)
系统/OS 余量 6~8GB 各域 OS + 缓冲

形态 B:AI Box 独立形态(32GB 专属,备选)

用途 内存预算 说明
LLM 7B INT8 ~8GB L2 主对话/推理模型
L1 轻量模型(1B 级) ~1GB 单轮模糊意图+槽位(快路径主体)
VLM 3B~4B ~4GB 环境视觉问答(按需加载;非驻留)
视觉检测器(YOLO 级) <0.5GB 滞留/靠近检测,NPU 常驻
KV Cache 1~2GB 会话上下文
Agent 运行时 + 向量库 ~1GB 编排、记忆
Linux 系统 + 引擎 + 余量 ~16GB AI 域专用;安卓娱乐不在此域

融合形态合计约 51~60.5GB,64GB 是融合下限,须与 IVI/智驾域协商静态内存分区,并在量产前用内存基准验证;若选 Thor 128GB 配置则余量充足。32GB 下强行融合不可接受(模型 OOM、App 被杀、首 token 延迟劣化),故融合形态不做 32GB 方案。


3. 总体架构

3.1 架构分层

智能座舱Agent设计总览

分层说明:交互层(语音 ASR/TTS · 屏幕/仪表/HUD · 舱内摄像头 · 按键)→ Agent 运行时(意图路由 → 规划 → 工具调用 → 执行 → 反思的 ReAct 循环,会话状态/策略引擎/流式输出与打断)→ 推理引擎(QNN + AI Hub 边缘/云侧)→ 能力层(车控/导航/媒体/记忆 RAG/云服务网关)→ 安全层(行车锁 · 敏感操作二次确认 · 出车数据白名单 · 护栏)。

3.2 现代座舱 Agent 八大能力(NVIDIA 的定义)

能力 本文落地
推理 Reasoning 本地 7B LLM ReAct 循环
多模态 Multi-Modal 语音 + 舱内外摄像头 VLM + 遥测
多 Agent Multi-Agent 本地 Agent 编排 + 云端信息 Agent 协同
车云混合 Edge-Cloud Hybrid 意图路由到本地/云端,断网回退
主动与常驻 Proactive & Always-on 事件触发(路况/日程/遗忘提醒)
上下文感知 Context-Aware 车辆状态、行程、乘员实时注入
个性化 Personalized 本地记忆 + 偏好模型
自然交互 Natural Interaction 流式对话 + 打断 + 多轮

3.3 核心数据流(一次完整交互)

一次完整交互的核心数据流


4. 模型选型与专有化策略

4.1 2026 开源模型对比(区分端侧候选与云端对照)

表 A:端侧候选基座(可量化上车,7~14B 档)

基座 规模档位 许可证 端侧适配性 备注
Gemma 4 12B(Unified)/ 31B + MoE(E2B/E4B/26B-A4B) Apache 2.0 ★★★★☆ 官方定位笔记本/边缘 12B 为统一多模态(encoder-free)、部署友好、Google 生态
Qwen 3.6 27B(稠密)+ 35B-A3B(MoE) Apache 2.0 ★★★☆☆ 总量偏大 工具调用/编码强;27B 量化后 ~16GB(Q4)超 Agent 域预算,仅云端/旗舰对照;Qwen 线端侧代表为 Qwen3.5-9B
Qwen 3.5 4B / 9B 档 Apache 2.0 ★★★★☆ 2026 新代际,原生集成多模态(视觉),中文+工具调用均衡,据社区评测 Q4 后 ~6GB,一模型双用(语言+视觉)
Phi-4 14B MIT ★★★★☆ 官方定位小模型 微软;据社区评测 8GB 内存即可自托管,数学/工具调用强,推理快
Gemma 4 MoE(对照) 26B-A4B(激活 4B) Apache 2.0 ★★★☆☆ 总量偏大 量化后 ~15GB,逼近 Agent 域预算上限,仅旗舰配置考虑

老一代蒸馏/小模型(DeepSeek-R1 蒸馏 7B/14B、GLM-4-9B、Llama-3.3-8B)还能跑,但能力已被 2026 新代际(Gemma 4 / Qwen 3.5~3.6 / Phi-4)甩开,直接出局。

表 B:云端对照模型(数据中心级,无法车机端运行,仅作云端信息任务/能力对标)

模型 实际规模 许可证 说明
GLM-5.2 数百 B 级 开放权重 据社区评测为综合最强 open-weight,仅云端
Nemotron 3 100B+ 级 开放(权重+配方全开) NVIDIA 生态原生,训练配方开放;端侧用其家族小尺寸型号需另行评估
DeepSeek-V4-Flash 284B 总参 / 约 13B 激活 MoE MIT 厂商宣称后训练使 Agent 能力提升 7.5 倍;量化后仍 100GB+,端侧不可行
Kimi K3 2.8T 总参 / 16/896 激活 MoE 开放权重(2026-07 已开源) 长程编码/Agent 旗舰,云端级规模,端侧不可行

端侧可行性判断标准:量化后权重 + KV Cache 必须落在 Agent 域内存预算内(<15GB)。GLM-5.2、Nemotron 3、DeepSeek-V4-Flash、Kimi K3(2.8T)均超 100GB,不可上车。

选型结论:端侧候选锁定 Gemma 4 12B / Qwen 3.5 9B / Phi-4 14B 三基座,统一实测后决策(按 <500ms 首响应、>30 tok/s、工具调用准确率三指标排序);Qwen 3.6-27B 因量化后超内存预算,留作云端信息任务与 Thor 旗舰平台对照;DeepSeek-V4-Flash 作为云端信息任务模型的强候选(MIT 开源、成本低、Agent 强)。Qwen2.5、DeepSeek-R1 蒸馏那批已经过时,别再当基线了。

4.2 专有模型路线(车载必须专有化)

直接拿通用模型糊不上座舱体验,理想 Mind GPT、蔚来 NOMI GPT、吉利 EVA、小米 MiMo 都是先例。专有化路径:

车载专有化流水线

微调数据来源(三类):

数据 内容 获取
通用对话 开源中文指令集 + 座舱场景增强 HuggingFace / 自采
工具调用 车控 API 的 function-calling 语料(人工标注 + 合成) 自建标注流水线
领域知识 车辆手册、售后知识库、法规 主机厂内部资产

工具链:通用开源微调栈(LLaMA-Factory / axolotl / Unsloth),训练与推理框架解耦,不绑定厂商生态;量化走 QNN 转换工具链(AI Engine Direct 校准)或 llama.cpp 通用量化。

4.3 模型规模选择矩阵

配置 模型 内存 场景
标准(本文基线) 7B INT8 LLM + VLM 3~4B(按需加载)+ 视觉检测器(<200MB) ~12GB 主流体验,满足 <500ms
旗舰(Thor) 13B INT8/FP16 ~18GB 复杂推理、更强 agentic
经济型(8155 类低算力) 3B INT4 ~4GB 非本文范围,仅对照

4.4 视觉感知:模型与专有数据集策略

结论:检测类任务(车外人/物提醒、车内滞留提醒)必须车型/场景专有数据集,但模型不需要"大模型",用轻量专用检测器就够了;VLM 只负责语义理解。

任务 模型选型 数据集 数据来源
车内滞留检测(儿童/宠物/物品) YOLO11/12 级检测器(NPU 常驻,毫秒级) 车型专属数据(必需):座舱布局各车型差异大,通用集迁移差 实车多车型采集(不同光线/座椅形态/安全座椅朝向)+ 3D 渲染合成数据 + 公开儿童/宠物集增强
车外人/物靠近 YOLO 级检测器 通用行人/车辆集 + 车周视角增强 COCO / BDD100K + 自采周视场景
乘员/情绪/手势 检测器 + 轻量分类器 车型专属 + 公开表情集 自采 + 开源
环境视觉问答 VLM(Qwen3.5 原生多模态 4B/9B 档,或 Gemma 4 vision) 通用 VLM 能力即可,无需专有 开源 VLM 权重
滞留确认(降误报) VLM 二次确认(可选) 车型专属验证集(负样本=正常离车) 自采

要点

  • 检测器输出结构化为事件(谁/在哪/持续多久)注入 Agent 上下文,供 LLM 组织话术。LLM 不做原始视觉判断
  • 安全关键功能(滞留告警)禁止直接依赖 VLM 概率输出;检测器连续 N 帧确定触发 + VLM 确认,超时后告警
  • 数据闭环:误报/漏报样本 OTA 回流,增量训练检测器

5. 推理引擎

5.1 引擎选型

引擎 定位 选型结论
QNN(AI Engine Direct) 高通官方 AI 推理框架,直接调度 Hexagon NPU,配套 AI Hub 模型库与量化转换工具链 主选:NPU 原生、与 8397/8797 生态一体;滴水 AIOS 2.1 已在 8397/8797 全局适配(Agent 全链路落地实证);开源模型转换支持矩阵需 P0 实测
llama.cpp 通用 CPU/GPU 开源推理 备选:评估期快速验证、跨平台兜底
TensorRT Edge-LLM NVIDIA 开源边缘 LLM/VLM 推理框架(JetPack 7.1) 备选:仅当平台切换为 NVIDIA(Orin/Thor)时;已有基于 Orin 的量产 AI Box 案例(ThunderSoft)

5.2 推理优化措施

  • 量化:INT8(首选,实测精度损失通常 <1%)/ AWQ 低比特(内存吃紧时);走 QNN 量化转换工具链(AI Engine Direct 校准);整体指标口径:精度损失 ≤5%,按工具调用成功率、车控意图准确率、拒答率分别评测
  • KV Cache 管理:PagedAttention 式分配、会话级复用(同驾驶时段热启动)
  • Prefill/Decode 分离:批量 prefill + 流式 decode,保证首 token 低延迟
  • 并发控制:单用户低并发场景(1-2 路),预留 50% GPU 余量给 VLM/ASR 突发
  • 模型加载:常驻内存(Agent 常开),支持模型热切换(OTA 升级不重启系统)

6. Agent 运行时

6.1 编排框架(三级分级:规则 / 轻量模型 / 7B)

采用通用开源 agent 编排框架(首选 LangGraph;备选 AutoGen / 自研轻量编排,按座舱资源约束选型,需支持流式输出、工具调用、断点恢复且运行时开销 <200MB),实现三级分级推理架构:

三级分级路由 L0→L1→L2

处理对象 载体 延迟 触发条件
L0 规则层 精确指令、固定格式("导航到X"、"关窗") 规则模板 + 语义匹配 <100ms 模板命中
L1 轻量模型 上下文无关的单轮模糊表达("太热了"、"脚冷"、"声音大点") 1B 级模型(Qwen3-1.7B 类)意图分类+槽位提取 <150ms L0 未命中,且无 L2 升级条件(见下)
L2 7B LLM 多意图、多轮指代、规划、记忆推理、工具组合、知识问答、主动服务 专有微调 7B LLM(ReAct + Function Calling) 300ms~数秒 L1 低置信 / 场景需要
  • 降级链:L0 → L1 → L2 逐级升级,7B 只处理 L1 覆盖不了的场景,多数模糊表达被 L1 吃掉(省算力省电)
  • L1 的边界:单轮、上下文无关的语义落位可以胜任;一旦依赖会话历史、车辆状态推理、记忆(如"和上次一样"、"宝宝睡着了"叠加场景判断)或需规划多工具,L1 置信度低 → 升级 L2
  • ReAct 循环:Thought → Action → Observation 迭代,最大 5 轮工具调用,超时/超轮强制收敛(仅 L2)
  • 策略引擎:工具级权限(读/写)、超时、频控、驾驶状态锁:三级都过,安全一致

6.2 语义理解 → 车控执行的完整链路(安全闭环)

核心原则:LLM 只输出"意图",不直接执行任何车控动作;执行权在策略引擎与车控服务。 语义理解按复杂度分级:单轮模糊表达由 L1(1B 级轻量模型)承担;需推理/规划/记忆/多轮的场景由专有微调 7B LLM 承担(车载 SFT 后,通用模型在车控场景不可用:工具调用格式不稳定、车控术语理解差、存在幻觉调车风险)。

7B LLM 的完整价值清单

价值域 具体能力 归属分级
单轮模糊语义落位 "太热了"→降温、"脚冷"→吹脚(上下文无关映射) L1(1B 模型)可覆盖,无需 7B
上下文+记忆的模糊决策 "太热了"叠加车内温度/季节/用户怕热偏好→差异化动作;"宝宝睡着了"→音量+调光多工具联动 L2(需车辆状态+记忆推理)
多意图拆解与规划 "下班回家,路过超市停一下"→导航到家+经停超市+到家联动家居 L2(任务规划)
多轮对话与指代消解 "刚才说的那个餐厅"、"它还没关" L2(会话状态)
长期记忆与个性化 结合通勤模式/常去地点/口味做推荐与预判 L2(记忆检索+推理)
主动服务决策 电量临界→建议充电站;工作日早晨→预热+播报 L2(场景推理)
知识问答与 RAG 车辆手册、维保知识、断网时信息兜底 L2
工具组合与技能编排 "回家模式"=导航+空调+音乐+灯光联动 L2(模板可覆盖固定组合则 L0/L1)
话术与体验 确认复述、执行解释("已调到24度,风力3档")、拒绝话术、安抚 L2
视觉事件融合 检测器检出滞留→组织告警话术+后续建议流程 L2(多模态推理)
兜底判定 路由不确定时仲裁、低置信场景二次确认话术 L2

ROI 说明:三级分级后,单轮模糊表达由 L1(1B,~1GB 内存)吃掉,7B 只处理真正需要推理/规划/记忆/多轮的场景(占交互量的比例暂按 20~40% 假设,需用真实交互日志校准)。这条分界线,就是"智能座舱 Agent"和"传统语音助手(精确指令匹配)"的区别。砍掉 7B 只剩传统方案+单轮模糊,撑不起多轮、规划、主动服务;反过来让 7B 干 L0/L1 的活,也是浪费。每级只干自己不可替代的活。

语义理解到车控执行的完整链路

契约示例(LLM 输出 → 策略引擎输入):

{
  "tool": "climate.set",
  "params": {"target_temp": 24, "zone": "driver", "unit": "celsius"},
  "confidence": 0.92,
  "confirmation_required": false
}

策略引擎校验点(每一条都可能导致拒绝/降级):

校验 规则示例
行车锁 车速 >10km/h 禁止天窗/尾门等动作;车速 >80km/h 压缩长文本回复
权限 ACL 乘客/儿童模式禁调驾驶位座椅记忆、付费功能
参数校验 温度范围 16~32℃、档位枚举校验,越界自动 clamp 并告知
危险操作标记 解锁/天窗/运动模式 → 强制语音复述确认(7.2)
频控 同类写操作 ≤1次/10s,防连珠炮误触

为什么语义理解必须专有模型(L1 与 L2 均需领域适配)

  1. L1(1B 级):意图分类+槽位提取需车载语料微调(车控术语、表达习惯),通用开源模型车控域准确率不足;但无需 7B 级,限定域单轮任务 1B 足够
  2. L2(7B):Function Calling 输出格式须与工具注册表 schema 严格对齐(通用模型格式漂移率高)
  3. L2:多意图拆解与歧义消解("凉快一点"依赖车辆上下文)需要领域化训练
  4. L2:安全边界(哪些操作需确认、哪些场景拒绝)通过微调 + 提示词双层固化,Guardrail 兜底

6.3 上下文管理

机制 设计
窗口预算 活跃窗口 8K~16K token;超出即摘要
会话摘要 每轮结束生成结构化摘要(意图/执行/结果),压缩注入下轮
车辆上下文 车速、档位、电量、导航状态实时注入系统消息(轻量模板)
KV Cache 复用 同会话持续复用,仅追加增量

6.4 流式输出与打断

  • 流式 TTS(边生成边播放),首音频 <500ms
  • 语音打断(barge-in):麦克风 VAD 检测到新指令 → 停止生成 → 重置上下文指针
  • 生成中工具执行结果以"语音+屏幕卡片"双通道呈现

7. 工具与技能系统

7.1 工具分类与注册表

工具注册表

7.2 车控工具抽象

  • 统一 Vehicle Control Service 接口(gRPC/共享内存),屏蔽 CAN/以太网差异
  • 状态只读工具:立即响应;状态写工具:须过策略引擎(行车锁 + 二次确认 + 权限)
  • 危险操作(解锁、天窗、运动模式)强制语音复述确认

导航/音乐不是另一套逻辑,只是另一个执行服务。 语音控导航、切歌和调空调走同一条管线:三级路由 → 意图 JSON → 策略引擎 → 工具调度器 → 对应服务。区别在两处:执行服务不同(导航走导航 SDK、媒体走播放服务,只有车控走 Vehicle Control Service);策略分级不同——行车锁主要约束车控写操作,"导航到 X"是行车刚需不锁,付费内容才需要二次确认。策略引擎是统一闸门,规则按工具类型差异化,频控、ACL、护栏对所有域一视同仁。

7.3 技能扩展机制

  • 技能 = 工具组合 + 触发模板 + 提示词片段(如"回家模式"= 导航+空调+音乐)
  • 新技能通过 OTA 下发 manifest 注册,无需升级模型

8. 云服务网关

8.1 职责边界

  • 原则:LLM 推理默认本地;仅"信息获取"类任务按白名单出车
  • 出车数据最小化:只发送查询词与必要上下文(位置 token 化、去标识化),车况/隐私数据不出车

8.2 混合编排(按 NVIDIA 三要素)

要素 设计
Agent 编排 意图路由按需调起本地/云端 agent;一次行程可混合(如规划路线 = 本地导航 agent + 云端景点检索 agent + 本地知识 agent)
上下文共享 云端 agent 继承用户已给上下文,不得重复询问;云端结果结构化回传注入本地上下文
UX 透明性 云端任务异步跟踪(进度提示)、预计耗时展示、断网 fallback:云端超时/无网 → 本地模型给出降级回答(如"网络不可用,可尝试本地导航")

8.3 网关实现

  • 车云通道:5G 模块 + 主机厂云端(私有协议/HTTP),鉴权 + 端到端加密
  • 超时阈值:2s 内未返回即切换降级路径
  • 可用性:网关故障不影响本地全部能力

9. 记忆系统

9.1 记忆分层

内容 载体
会话记忆 当前行程对话、上下文摘要 KV Cache + 摘要文本
短期记忆 当日行为(目的地、偏好动作) 本地 KV 存储
长期记忆 用户画像、通勤模式、常去地点、媒体口味 本地向量库
场景记忆 天气/时段/乘员组合 → 偏好动作映射 规则 + 向量混合

9.2 向量库选型

方案 优点 缺点 结论
sqlite-vec 零依赖、嵌入座舱进程、事务安全 大规模召回略弱 主选(座舱数据量级 10^5 内足够)
FAISS 检索性能强 独立进程/依赖重 备选(记忆规模扩大时)
  • Embedding 模型:本地 1B 级(或量化小模型),文档切块 + 去重 + 过期策略
  • 隐私生命周期:记忆默认存本地;用户可一键清除;迁移(换车/换账号)走加密导出,云端仅存画像摘要(可选)

9.3 主动服务触发

  • 事件触发:工作日早晨通勤时间 → 预热导航、播报天气路况
  • 遗忘检测:VLM 周期性检查舱内是否有宠物/儿童遗留(停车断电场景)
  • 电量/保养临界 → 主动建议充电站/预约维保

10. 交互与安全

10.1 语音链路

先说结论:"录制 wav → 一次性识别为文字"是非流式方案,只适合调试/离线兜底;量产语音交互必须流式管线(边说边识别、边生成边播放),否则首反馈延迟撑不住。

链路分层与延迟预算

语音链路分层与延迟预算

关键设计点

环节 设计 说明
唤醒 本地唤醒词常驻(DSP/轻量模型),多词支持("小X同学"/"你好车机"),误唤醒 <1次/小时 唤醒后会话持续,无需重复唤醒
流式 ASR 流式识别为主(每 100ms 块输出中间结果);"录制 wav 再识别"仅用于:调试、离线日志回放、低资源兜底 文本流式推进,Agent 可提前预判
Endpointing 静音时长 + 语义完整度双判据;行车噪声环境下放宽静音阈值 避免"说完没反应"与"没说完就打断"
打断(barge-in) 唤醒词/VAD 检测到新指令 → 停止 TTS 与 LLM 生成 → 重置上下文指针 全双工:TTS 播放中 ASR 持续工作
多乘客 波束成形定向拾音 + 说话人分离(diarization);声纹识别区分司机/乘客,分别建会话与权限 司机语音优先响应;儿童模式限权
噪声适配 车型专属噪声场景(高速、开窗、空调最大档)采集,微调 ASR 声学模型 通用 ASR 车况表现差,必须专有化
车载术语 热词表(车辆功能词、路名、品牌)+ ASR 纠错映射 "打开座椅通风"不会被识别为"打开座椅通风扇"类歧义

架构路线:级联为主,端到端可选

路线 方案 结论
路线 A:级联(推荐) 流式 ASR(端侧模型,如 Nemotron Speech 类)→ 文本 → LLM Agent → TTS(Magpie 类) 主流量产方案(理想/蔚来同路线):可控、工具调用稳、可调试、延迟可预测
路线 B:端到端语音模型 语音直接进 LLM(Qwen-Omni 类),文字作为旁路输出 体验自然、可带副语言信息(语气/情绪),但端侧资源重、工具调用与可控性弱、调试难;作为可选增强,不阻塞主线
  • ASR 模型:本地常驻(<1GB,INT8),支持中英混说;车型专属微调数据 = 车噪环境 + 口音 + 车载术语(数据闭环模式见视觉感知章节)
  • 全链路断网可用:本地 ASR → 本地 LLM → 本地 TTS

10.2 多模态(双轨架构:确定性检测器 + 按需 VLM)

关键原则:检测类任务(车外人/物靠近、车内儿童/宠物滞留)用轻量专用检测器(YOLO11/12 级,毫秒级、低功耗、确定性强),不用大模型;VLM 仅用于语义理解与确认。

任务 载体 说明
车内滞留检测(儿童/宠物/物品) 专用检测器(YOLO 级) NPU 常驻,安全关键功能必须确定性触发,不依赖 LLM 概率性输出
车外人/物靠近提醒 专用检测器(YOLO 级) 周视摄像头 + 检测器,接近警戒区触发语音/灯光提醒
乘员识别/情绪/手势 检测器 + 轻量分类器 配合 VLM 按需增强
环境视觉问答("那家店营业到几点") VLM(Qwen3.5 原生多模态 4B/9B / Gemma 4 vision) 按需加载,配合检测器先定位再理解
滞留检测的语义确认 VLM(可选增强) 检测器触发 → VLM 二次确认(降低误报);VLM 超时/不可用则跳过,直接告警
  • 两级确认:滞留告警 = 检测器连续 N 帧检出(确定触发)→ VLM 语义确认(降低误报)→ 声光告警 + App 通知;VLM 确认超时或不可用(断电、模型未加载)时不阻塞告警,直接按检测器结果触发
  • 专有数据集是必需品:车内布局各车型差异大,通用数据集迁移效果差,必须车型专属数据(同视觉感知章节的数据策略)
  • 摄像头数据仅在本地推理,不上云

10.3 安全机制

机制 实现
行车锁 车速 >阈值:禁止分心类多轮交互、长文本输出压缩为语音摘要
敏感操作二次确认 舒适类写操作执行后语音复述确认;危险操作(解锁/天窗/运动模式)强制执行前语音复述 + 明确同意
权限模型 工具级 ACL(司机/乘客/儿童模式),儿童模式禁用付费/隐私功能
护栏(Guardrail) 输出过滤(违规内容)、输入注入防护、幻觉声明(不确定时明确"我不确定")
隐私 摄像头/麦克风物理开关 + 软件级白名单出车

11. 性能指标与验证

11.1 端到端指标

指标 目标 验证方式
语音→首反馈延迟 <1.5s(ASR+LLM首token+TTS首音) 真机压测,50 分位
ASR 流式首字延迟 <200ms 引擎基准
ASR 字准率(车内噪声场景) >95%(120km/h 风噪) 车型专属语料回归
打断恢复时间 <300ms(新指令可立即输入) 实车长测
LLM 首 token <300ms 引擎基准
解码吞吐 >30 tokens/s 高通 AI Hub 基准方法
工具调用准确率 >95%(标准车控指令集) 脚本化回归
断网全流程可用率 100%(本地能力) 断网场景测试
误唤醒率 <1次/小时 实车长测
敏感操作漏确认率 0 安全测试
内存峰值 Agent 域 <15GB(融合 64GB 分区预算;AI Box 32GB 预留 17GB 余量)/ 模型权重驻留 <8GB 长会话监控
模型热切换 <30s,不中断会话 OTA 演练

11.2 验证路径

  1. 实验室:引擎基准 + 模拟器(SIL)
  2. 台架:真实 SoC + 传感器接入(HIL)
  3. 实车:长测(驾驶场景、断网隧道、噪音环境)

12. 风险与落地节奏

12.1 风险清单

风险 等级 缓解
13B/30B MoE 模型端侧效果不及预期 首版锁定 7B,大模型作为旗舰增强(30B MoE 已有中科创达官宣案例);评估期双基座并行
微调语料不足导致车控/领域能力弱 合成数据 + 人工标注流水线前置启动
QNN 对开源模型支持矩阵不全 选型阶段用 llama.cpp 并行验证;优先选 AI Hub 已有模型;滴水 AIOS 2.1 适配 8397/8797 可作参考
车规认证(功能安全/隐私合规)周期长 融合形态涉及 EE 变更,认证排期前置;Guardrail + 日志审计
断网时云端依赖功能体验落差 信息类任务本地缓存 + 降级话术模板
混载时 IVI 高负载影响推理 融合形态 VM 隔离 + 静态分区 + QoS(形态上已隔离)

12.2 落地节奏(P0~P3 只是阶段代号)

阶段 周期 内容 交付
P0 验证 1~2 月 三基座(Gemma4-12B / Qwen3.5-9B / Phi-4-14B)在 8397 开发环境跑 QNN + llama.cpp 基准(验证 QNN 对开源模型的支持矩阵如可获取 Orin DevKit,同期跑 TensorRT Edge-LLM 对比);采集车载语料样本 引擎/基座/平台决策报告
P1 MVP 2~3 月 7B 模型 SFT(车控+工具调用)、Agent 框架(路由/ReAct/策略)、车控工具接入、云网关(天气/新闻) 台架可演示 Agent
P2 增强 3~4 月 记忆系统、VLM 视觉能力、主动服务、Guardrail、性能调优至指标 通过 11.2 全部验证
P3 量产 持续 微调数据闭环(OTA 用户反馈回流)、多车型适配、8797 全核融合扩展(30B MoE)、如选 NVIDIA 平台则切换 TensorRT Edge-LLM 引擎 量产发布

12.3 还没定的事

  1. 微调基座最终锁定:取决于第一阶段实测(Gemma4-12B vs Qwen3.5-9B vs Phi-4-14B;Qwen3.6-27B 仅云端/旗舰对照)
  2. 融合平台落地细节:8797 全核(高通线)还是 Thor(NVIDIA 线),取决于主机厂既有智驾方案与 EE 架构节奏;AI Box 仅作"不动 EE 架构"的过渡选项
  3. QNN 端侧 LLM 实际体验(内存带宽/工具链/量化支持):中科创达 30B MoE 已官宣,但公开基准有限,P0 实测后定
  4. 语音链路自研 vs 采购(Cerence/科大讯飞等):影响 ASR/TTS 模块边界

参考来源

  • 高通骁龙座舱至尊版(Cockpit Elite / Ride Elite 官方页):https://www.qualcomm.com/automotive/products/elite
  • 中科创达 RazorDCX Sylvania 规格(320 TOPS 稠密 / 272GB/s,CES 2026):https://www.thundersoft.com/thundersoft-new-gen-ai-domain-control-released-at-ces-2026/
  • 中科创达滴水 AIOS 2.1 适配 8397/8797 + 30B MoE 端侧推理(2026-05 投资者关系):https://www.9fzt.com/detail/sz_300496_9_f7738f8b4b59d3a27eec931c5b9a26d0.html
  • 神行者 8 搭载骁龙 8397(IT之家):https://m.ithome.com/html/934657.htm
  • NVIDIA 端侧 Agent 指标口径(<500ms 首 token、>30 tok/s,行业通行定义):https://developer.nvidia.com/blog/how-to-build-in-vehicle-ai-agents-with-nvidia-from-cloud-to-car/
  • NVIDIA TensorRT Edge-LLM(JetPack 7.1,备选引擎):https://developer.nvidia.com/blog/accelerating-llm-and-vlm-inference-for-automotive-and-robotics-with-nvidia-tensorrt-edge-llm/
  • NVIDIA DRIVE Orin 官方规格(对照平台):https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-orin/
  • ABI Research agentic AI 车辆预测(2025→2035):https://developer.nvidia.com/blog/how-to-build-in-vehicle-ai-agents-with-nvidia-from-cloud-to-car/
  • 车载 AI 大模型安装量/渗透率(2026.2 知乎行业月报):https://zhuanlan.zhihu.com/p/2035663796484712331
  • 吉利 200 TOPS AI Box 跑 7B(媒体报道):https://finance.sina.com.cn/(2026-04-26,原文复核时抓取失败,以官方/实测为准)
  • 小米 YU7 Thor 700 TOPS:https://www.xiaomiev.com/pilot

本文链接:把 Agent 塞进舱驾融合平台:座舱端侧大模型全链路设计 - https://h89.cn/archives/690.html

版权声明:原创文章 遵循 CC 4.0 BY-SA 版权协议,转载请附上原文链接和本声明。

标签: Agent, 智能座舱, LLM, 端侧大模型, 多模态, 高通骁龙, Hexagon NPU, 舱驾融合

欸谨特公众号
微信扫码关注:欸谨特
Agent · 效率工具 · 实战笔记

添加新评论