把 Agent 塞进舱驾融合平台:座舱端侧大模型全链路设计
- 1. 背景与目标
- 2. 算力与资源预算
- 3. 总体架构
- 4. 模型选型与专有化策略
- 5. 推理引擎
- 6. Agent 运行时
- 7. 工具与技能系统
- 8. 云服务网关
- 9. 记忆系统
- 10. 交互与安全
- 11. 性能指标与验证
- 12. 风险与落地节奏
- 参考来源
平台基线:高通骁龙 8397/8797(Hexagon NPU 320 TOPS 稠密,舱驾融合 64GB 共享)|网络策略:本地优先,信息类任务经云服务网关|文中数据出处见文末参考来源 本文首发地址 :https://h89.cn/archives/690.html
1. 背景与目标
1.1 背景
智能座舱交互正从"规则指令式"(意图分类 → 触发动作)转向 agentic、多模态的推理与规划系统。端侧大模型上车这事,数据已经很硬:
- 2026 年 2 月车载 AI 大模型安装量同比 +135.1%,渗透率同比 +173.6%,30+ 大模型上车
- ABI Research:agentic AI 车辆从 2025 年约 500 万辆增长到 2035 年 7000 万辆
- 头部车厂(理想、蔚来、吉利、小米)都已构建服务于汽车的专用模型,而不是直接拿通用大模型来用
但"上大模型"和"上得好"是两回事。真上车之后,预算怎么算、模型怎么选,每一层都有坑。这篇把一套完整方案的账摊开算。
1.2 目标
在 8397/8797 级座舱算力上,实现全链路本地化 Agent:
- 本地承载 7B~13B 级 LLM 推理(多轮对话、工具调用、任务规划)
- 融合多模态(语音、舱内/车外摄像头、车辆遥测)
- 与云端 agent 协同完成信息类任务,断网自动降级为纯本地
- 满足车规级延迟、内存、安全、隐私约束
1.3 非功能约束(硬指标)
| 指标 | 目标 | 依据 |
|---|---|---|
| 首 token 延迟 | <500ms(文本请求口径) | NVIDIA 端侧 Agent 要求;语音全链路 <1.5s(见第 10 章语音链路) |
| 解码吞吐 | >30 tokens/s | NVIDIA 端侧 Agent 要求 |
| 模型权重驻留 | <8GB(推理峰值另计) | 行业技术分析(龙腾亚泰) |
| 用户无感延迟 | <100ms 感知阈值 | 行业技术分析(龙腾亚泰) |
| 数据边界 | 车内数据默认不出车;出车须白名单 | 隐私合规 |
| 可用性 | 断网场景全功能可用(信息类降级) | 混合架构要求 |
2. 算力与资源预算
2.1 平台画像(高通 8397/8797)
| 资源 | 高通 8397/8797 | 说明 |
|---|---|---|
| CPU | Oryon 18 核(8P+10E,行业口径);SPECint2017 rate ~80(中科创达披露) | 编排、ASR/TTS、工具调度 |
| GPU | Adreno 7 系 | 渲染 + 部分推理 |
| NPU | Hexagon,320 TOPS(INT8 稠密,中科创达 RazorDCX Sylvania 官方披露) | LLM/VLM 推理主承载 |
| 内存 | 64GB 融合共享(LPDDR5X,带宽 272 GB/s raw,中科创达披露) | 座舱 Agent + 安卓娱乐 + 智驾共享,QoS 分区 |
| 软件 | Gunyah Hypervisor + QNX/Linux VM 隔离 | 智驾/座舱 FFI(freedom from interference)关键 |
| 安全岛 | Cortex-R52(行业口径) | 系统级监控与故障处理 |
| 模型上限 | 端侧 30B MoE(中科创达官宣)/ 14B 稠密(高通口径) | 超过 Orin ~13B 上限 |
与智驾芯片 8797 同一颗物理 Die(锁核区分 SKU,行业口径):8397 锁掉部分 ADAS 核专注座舱,8797 开放全核支持舱驾融合(座舱 + L2+/L3 ADAS)。本文主推融合形态,对应 8797 全核配置。
2.2 平台选型:高通 8397/8797(主选)vs NVIDIA Orin(对照)
| 维度 | 高通 8397/8797(本文主选) | NVIDIA DRIVE AGX Orin(对照) |
|---|---|---|
| 定位 | 2026 新一代座舱旗舰(官方第五代:8155 第三代→8295 第四代→8397 第五代);与智驾芯片 8797 同 Die(锁核区分),舱驾融合线对应 8797 全核 | 车规 AI Box / 舱驾一体(智驾芯片出身,座舱需 AI Box 外挂) |
| AI 算力 | 320 TOPS(稠密,中科创达 RazorDCX Sylvania 官方披露) | 241~275 TOPS(官方型号指标) |
| 端侧大模型 | 主打"端侧大模型 + 物理 AI",神行者 8 中国首批量产;中科创达官宣 30B MoE 端侧推理 | 官方支持 ~13B(TensorRT Edge-LLM) |
| 推理工具链 | QNN(AI Engine Direct)+ AI Hub | TensorRT Edge-LLM / TensorRT-LLM |
| 生态形态 | 座舱 IVI 集成 + AI Box(与云途等合作);滴水 AIOS 2.1 已在 8397/8797 全局适配(官方) | 独立 AI Box ECU 或 Thor 融合 |
| 代表量产 | 神行者 8(中国首批)、滴水 AIOS 2.1 适配 8397/8797 | 吉利(200 TOPS AI Box 跑 7B,据媒体报道)、小米 YU7(Thor 700 TOPS) |
结论:本文选 8397/8797 为主选平台——座舱原生旗舰(8295 升级线)、与智驾芯片同 Die 天然支撑舱驾融合、端侧大模型量产节奏更快(神行者 8 中国首批、滴水 AIOS 2.1 全局适配、30B MoE 官宣)。Orin 的优势在大规模量产历史与 CUDA 工具链成熟度,作为对照保留。端侧 LLM 实际体验还取决于内存带宽、工具链成熟度与量化支持,得实测了才算数(P0 阶段双向基准)。下文按 8397/8797 展开;真换了 NVIDIA 平台,动的是推理引擎层,Agent 架构不用重来。
2.3 部署形态:舱驾一体融合(主推)或 AI Box(备选)
形态决策:EE 架构向中央计算收敛,本文主推 舱驾一体融合。NVIDIA 官方给出三种 EE 架构(AI Box 独立 ECU / Thor 多域融合 / + MediaTek Dimensity AX 中央计算),高通线对应 8797 全核融合(与 8397 同 Die);本方案落在 8797 / Thor 类融合平台,理由如下:
- 单芯片承载座舱 Agent + 智驾 + 安卓娱乐,少一块 ECU、少布线散热,硬件成本与 EE 架构更简
- 芯片内共享内存通信,摄像头/音频无需跨以太网编码转发,时延更低
- 算力与模型上限更高(8797 开放全核;Thor 支撑 13B+,小米 YU7 700 TOPS 等已量产),Agent 能力增长空间大
- 行业趋势:EE 架构向中央计算收敛,舱驾融合是主流方向
决策矩阵(融合 vs AI Box):
| 维度 | 舱驾一体融合(8797 / Thor 类,本文选型) | AI Box(独立 ECU) | 占优 |
|---|---|---|---|
| 内存 | 64GB 共享为下限,须跨域静态分区协商 | 32GB 专属 Agent 域,无需跨域协商 | AI Box |
| 性能隔离 | 依赖 Hypervisor VM 隔离(高通 Gunyah / DriveOS 7)+ FFI 认证 | 物理隔离 + 专用带宽 QoS | AI Box |
| 量产节奏 | 涉及 EE 架构变更,认证周期长 | 不动 EE 架构,独立升级不阻塞认证 | AI Box |
| 硬件成本 | 单芯片,成本更优 | 多一块 ECU(布线/散热/供电) | 融合 |
| 通信时延 | 芯片内共享内存,时延更低 | 摄像头/音频跨以太网编码转发 | 融合 |
| 算力与模型上限 | 8797 全核 / Thor 支撑 13B+ 旗舰(小米 YU7 700 TOPS 等已量产) | 单芯片 ~13B 封顶 | 融合 |
适用边界:融合方案要求 64GB 共享内存起步,须依赖 Hypervisor 的 QNX/Linux VM 隔离(高通 Gunyah / NVIDIA DriveOS 7)保证智驾与座舱 Agent 的 FFI(freedom from interference),且涉及 EE 架构变更、认证周期长。若短期内不打算动 EE 架构(存量平台、快速量产、AI 独立升级节奏),AI Box(独立 ECU,32GB 专属)仍是稳妥备选。
2.4 资源预算分配(按部署形态区分)
先说结论:本方案主推舱驾一体融合,64GB 共享内存起步(同芯片跑大模型 + 安卓娱乐 + 智驾);32GB 专属内存仅适用于 AI Box 独立形态,作为不动 EE 架构的备选。
形态 A:舱驾一体融合(64GB 共享,主推)
| 用途 | 内存预算 | 说明 |
|---|---|---|
| LLM 7B INT8 | ~8GB | L2 主对话/推理模型 |
| L1 轻量模型(1B 级) | ~1GB | 单轮模糊意图+槽位(快路径主体) |
| VLM 3B~4B | ~4GB | 环境视觉问答(按需加载;非驻留) |
| 视觉检测器(YOLO 级) | <0.5GB | 滞留/靠近检测,NPU 常驻 |
| KV Cache | 1~2GB | 会话上下文 |
| Agent 运行时 + 向量库 | ~1GB | 编排、记忆 |
| 安卓娱乐(IVI 域) | 20~24GB | 多 App 常驻 + 车机渲染(QNX/Linux VM 隔离) |
| 智驾域 | 10~12GB | 感知/规划(8797 全核) |
| 系统/OS 余量 | 6~8GB | 各域 OS + 缓冲 |
形态 B:AI Box 独立形态(32GB 专属,备选)
| 用途 | 内存预算 | 说明 |
|---|---|---|
| LLM 7B INT8 | ~8GB | L2 主对话/推理模型 |
| L1 轻量模型(1B 级) | ~1GB | 单轮模糊意图+槽位(快路径主体) |
| VLM 3B~4B | ~4GB | 环境视觉问答(按需加载;非驻留) |
| 视觉检测器(YOLO 级) | <0.5GB | 滞留/靠近检测,NPU 常驻 |
| KV Cache | 1~2GB | 会话上下文 |
| Agent 运行时 + 向量库 | ~1GB | 编排、记忆 |
| Linux 系统 + 引擎 + 余量 | ~16GB | AI 域专用;安卓娱乐不在此域 |
融合形态合计约 51~60.5GB,64GB 是融合下限,须与 IVI/智驾域协商静态内存分区,并在量产前用内存基准验证;若选 Thor 128GB 配置则余量充足。32GB 下强行融合不可接受(模型 OOM、App 被杀、首 token 延迟劣化),故融合形态不做 32GB 方案。
3. 总体架构
3.1 架构分层
分层说明:交互层(语音 ASR/TTS · 屏幕/仪表/HUD · 舱内摄像头 · 按键)→ Agent 运行时(意图路由 → 规划 → 工具调用 → 执行 → 反思的 ReAct 循环,会话状态/策略引擎/流式输出与打断)→ 推理引擎(QNN + AI Hub 边缘/云侧)→ 能力层(车控/导航/媒体/记忆 RAG/云服务网关)→ 安全层(行车锁 · 敏感操作二次确认 · 出车数据白名单 · 护栏)。
3.2 现代座舱 Agent 八大能力(NVIDIA 的定义)
| 能力 | 本文落地 |
|---|---|
| 推理 Reasoning | 本地 7B LLM ReAct 循环 |
| 多模态 Multi-Modal | 语音 + 舱内外摄像头 VLM + 遥测 |
| 多 Agent Multi-Agent | 本地 Agent 编排 + 云端信息 Agent 协同 |
| 车云混合 Edge-Cloud Hybrid | 意图路由到本地/云端,断网回退 |
| 主动与常驻 Proactive & Always-on | 事件触发(路况/日程/遗忘提醒) |
| 上下文感知 Context-Aware | 车辆状态、行程、乘员实时注入 |
| 个性化 Personalized | 本地记忆 + 偏好模型 |
| 自然交互 Natural Interaction | 流式对话 + 打断 + 多轮 |
3.3 核心数据流(一次完整交互)
4. 模型选型与专有化策略
4.1 2026 开源模型对比(区分端侧候选与云端对照)
表 A:端侧候选基座(可量化上车,7~14B 档)
| 基座 | 规模档位 | 许可证 | 端侧适配性 | 备注 |
|---|---|---|---|---|
| Gemma 4 | 12B(Unified)/ 31B + MoE(E2B/E4B/26B-A4B) | Apache 2.0 | ★★★★☆ 官方定位笔记本/边缘 | 12B 为统一多模态(encoder-free)、部署友好、Google 生态 |
| Qwen 3.6 | 27B(稠密)+ 35B-A3B(MoE) | Apache 2.0 | ★★★☆☆ 总量偏大 | 工具调用/编码强;27B 量化后 ~16GB(Q4)超 Agent 域预算,仅云端/旗舰对照;Qwen 线端侧代表为 Qwen3.5-9B |
| Qwen 3.5 | 4B / 9B 档 | Apache 2.0 | ★★★★☆ | 2026 新代际,原生集成多模态(视觉),中文+工具调用均衡,据社区评测 Q4 后 ~6GB,一模型双用(语言+视觉) |
| Phi-4 | 14B | MIT | ★★★★☆ 官方定位小模型 | 微软;据社区评测 8GB 内存即可自托管,数学/工具调用强,推理快 |
| Gemma 4 MoE(对照) | 26B-A4B(激活 4B) | Apache 2.0 | ★★★☆☆ 总量偏大 | 量化后 ~15GB,逼近 Agent 域预算上限,仅旗舰配置考虑 |
老一代蒸馏/小模型(DeepSeek-R1 蒸馏 7B/14B、GLM-4-9B、Llama-3.3-8B)还能跑,但能力已被 2026 新代际(Gemma 4 / Qwen 3.5~3.6 / Phi-4)甩开,直接出局。
表 B:云端对照模型(数据中心级,无法车机端运行,仅作云端信息任务/能力对标)
| 模型 | 实际规模 | 许可证 | 说明 |
|---|---|---|---|
| GLM-5.2 | 数百 B 级 | 开放权重 | 据社区评测为综合最强 open-weight,仅云端 |
| Nemotron 3 | 100B+ 级 | 开放(权重+配方全开) | NVIDIA 生态原生,训练配方开放;端侧用其家族小尺寸型号需另行评估 |
| DeepSeek-V4-Flash | 284B 总参 / 约 13B 激活 MoE | MIT | 厂商宣称后训练使 Agent 能力提升 7.5 倍;量化后仍 100GB+,端侧不可行 |
| Kimi K3 | 2.8T 总参 / 16/896 激活 MoE | 开放权重(2026-07 已开源) | 长程编码/Agent 旗舰,云端级规模,端侧不可行 |
端侧可行性判断标准:量化后权重 + KV Cache 必须落在 Agent 域内存预算内(<15GB)。GLM-5.2、Nemotron 3、DeepSeek-V4-Flash、Kimi K3(2.8T)均超 100GB,不可上车。
选型结论:端侧候选锁定 Gemma 4 12B / Qwen 3.5 9B / Phi-4 14B 三基座,统一实测后决策(按 <500ms 首响应、>30 tok/s、工具调用准确率三指标排序);Qwen 3.6-27B 因量化后超内存预算,留作云端信息任务与 Thor 旗舰平台对照;DeepSeek-V4-Flash 作为云端信息任务模型的强候选(MIT 开源、成本低、Agent 强)。Qwen2.5、DeepSeek-R1 蒸馏那批已经过时,别再当基线了。
4.2 专有模型路线(车载必须专有化)
直接拿通用模型糊不上座舱体验,理想 Mind GPT、蔚来 NOMI GPT、吉利 EVA、小米 MiMo 都是先例。专有化路径:
微调数据来源(三类):
| 数据 | 内容 | 获取 |
|---|---|---|
| 通用对话 | 开源中文指令集 + 座舱场景增强 | HuggingFace / 自采 |
| 工具调用 | 车控 API 的 function-calling 语料(人工标注 + 合成) | 自建标注流水线 |
| 领域知识 | 车辆手册、售后知识库、法规 | 主机厂内部资产 |
工具链:通用开源微调栈(LLaMA-Factory / axolotl / Unsloth),训练与推理框架解耦,不绑定厂商生态;量化走 QNN 转换工具链(AI Engine Direct 校准)或 llama.cpp 通用量化。
4.3 模型规模选择矩阵
| 配置 | 模型 | 内存 | 场景 |
|---|---|---|---|
| 标准(本文基线) | 7B INT8 LLM + VLM 3~4B(按需加载)+ 视觉检测器(<200MB) | ~12GB | 主流体验,满足 <500ms |
| 旗舰(Thor) | 13B INT8/FP16 | ~18GB | 复杂推理、更强 agentic |
| 经济型(8155 类低算力) | 3B INT4 | ~4GB | 非本文范围,仅对照 |
4.4 视觉感知:模型与专有数据集策略
结论:检测类任务(车外人/物提醒、车内滞留提醒)必须车型/场景专有数据集,但模型不需要"大模型",用轻量专用检测器就够了;VLM 只负责语义理解。
| 任务 | 模型选型 | 数据集 | 数据来源 |
|---|---|---|---|
| 车内滞留检测(儿童/宠物/物品) | YOLO11/12 级检测器(NPU 常驻,毫秒级) | 车型专属数据(必需):座舱布局各车型差异大,通用集迁移差 | 实车多车型采集(不同光线/座椅形态/安全座椅朝向)+ 3D 渲染合成数据 + 公开儿童/宠物集增强 |
| 车外人/物靠近 | YOLO 级检测器 | 通用行人/车辆集 + 车周视角增强 | COCO / BDD100K + 自采周视场景 |
| 乘员/情绪/手势 | 检测器 + 轻量分类器 | 车型专属 + 公开表情集 | 自采 + 开源 |
| 环境视觉问答 | VLM(Qwen3.5 原生多模态 4B/9B 档,或 Gemma 4 vision) | 通用 VLM 能力即可,无需专有 | 开源 VLM 权重 |
| 滞留确认(降误报) | VLM 二次确认(可选) | 车型专属验证集(负样本=正常离车) | 自采 |
要点:
- 检测器输出结构化为事件(谁/在哪/持续多久)注入 Agent 上下文,供 LLM 组织话术。LLM 不做原始视觉判断
- 安全关键功能(滞留告警)禁止直接依赖 VLM 概率输出;检测器连续 N 帧确定触发 + VLM 确认,超时后告警
- 数据闭环:误报/漏报样本 OTA 回流,增量训练检测器
5. 推理引擎
5.1 引擎选型
| 引擎 | 定位 | 选型结论 |
|---|---|---|
| QNN(AI Engine Direct) | 高通官方 AI 推理框架,直接调度 Hexagon NPU,配套 AI Hub 模型库与量化转换工具链 | 主选:NPU 原生、与 8397/8797 生态一体;滴水 AIOS 2.1 已在 8397/8797 全局适配(Agent 全链路落地实证);开源模型转换支持矩阵需 P0 实测 |
| llama.cpp | 通用 CPU/GPU 开源推理 | 备选:评估期快速验证、跨平台兜底 |
| TensorRT Edge-LLM | NVIDIA 开源边缘 LLM/VLM 推理框架(JetPack 7.1) | 备选:仅当平台切换为 NVIDIA(Orin/Thor)时;已有基于 Orin 的量产 AI Box 案例(ThunderSoft) |
5.2 推理优化措施
- 量化:INT8(首选,实测精度损失通常 <1%)/ AWQ 低比特(内存吃紧时);走 QNN 量化转换工具链(AI Engine Direct 校准);整体指标口径:精度损失 ≤5%,按工具调用成功率、车控意图准确率、拒答率分别评测
- KV Cache 管理:PagedAttention 式分配、会话级复用(同驾驶时段热启动)
- Prefill/Decode 分离:批量 prefill + 流式 decode,保证首 token 低延迟
- 并发控制:单用户低并发场景(1-2 路),预留 50% GPU 余量给 VLM/ASR 突发
- 模型加载:常驻内存(Agent 常开),支持模型热切换(OTA 升级不重启系统)
6. Agent 运行时
6.1 编排框架(三级分级:规则 / 轻量模型 / 7B)
采用通用开源 agent 编排框架(首选 LangGraph;备选 AutoGen / 自研轻量编排,按座舱资源约束选型,需支持流式输出、工具调用、断点恢复且运行时开销 <200MB),实现三级分级推理架构:
| 级 | 处理对象 | 载体 | 延迟 | 触发条件 |
|---|---|---|---|---|
| L0 规则层 | 精确指令、固定格式("导航到X"、"关窗") | 规则模板 + 语义匹配 | <100ms | 模板命中 |
| L1 轻量模型 | 上下文无关的单轮模糊表达("太热了"、"脚冷"、"声音大点") | 1B 级模型(Qwen3-1.7B 类)意图分类+槽位提取 | <150ms | L0 未命中,且无 L2 升级条件(见下) |
| L2 7B LLM | 多意图、多轮指代、规划、记忆推理、工具组合、知识问答、主动服务 | 专有微调 7B LLM(ReAct + Function Calling) | 300ms~数秒 | L1 低置信 / 场景需要 |
- 降级链:L0 → L1 → L2 逐级升级,7B 只处理 L1 覆盖不了的场景,多数模糊表达被 L1 吃掉(省算力省电)
- L1 的边界:单轮、上下文无关的语义落位可以胜任;一旦依赖会话历史、车辆状态推理、记忆(如"和上次一样"、"宝宝睡着了"叠加场景判断)或需规划多工具,L1 置信度低 → 升级 L2
- ReAct 循环:Thought → Action → Observation 迭代,最大 5 轮工具调用,超时/超轮强制收敛(仅 L2)
- 策略引擎:工具级权限(读/写)、超时、频控、驾驶状态锁:三级都过,安全一致
6.2 语义理解 → 车控执行的完整链路(安全闭环)
核心原则:LLM 只输出"意图",不直接执行任何车控动作;执行权在策略引擎与车控服务。 语义理解按复杂度分级:单轮模糊表达由 L1(1B 级轻量模型)承担;需推理/规划/记忆/多轮的场景由专有微调 7B LLM 承担(车载 SFT 后,通用模型在车控场景不可用:工具调用格式不稳定、车控术语理解差、存在幻觉调车风险)。
7B LLM 的完整价值清单:
| 价值域 | 具体能力 | 归属分级 |
|---|---|---|
| 单轮模糊语义落位 | "太热了"→降温、"脚冷"→吹脚(上下文无关映射) | L1(1B 模型)可覆盖,无需 7B |
| 上下文+记忆的模糊决策 | "太热了"叠加车内温度/季节/用户怕热偏好→差异化动作;"宝宝睡着了"→音量+调光多工具联动 | L2(需车辆状态+记忆推理) |
| 多意图拆解与规划 | "下班回家,路过超市停一下"→导航到家+经停超市+到家联动家居 | L2(任务规划) |
| 多轮对话与指代消解 | "刚才说的那个餐厅"、"它还没关" | L2(会话状态) |
| 长期记忆与个性化 | 结合通勤模式/常去地点/口味做推荐与预判 | L2(记忆检索+推理) |
| 主动服务决策 | 电量临界→建议充电站;工作日早晨→预热+播报 | L2(场景推理) |
| 知识问答与 RAG | 车辆手册、维保知识、断网时信息兜底 | L2 |
| 工具组合与技能编排 | "回家模式"=导航+空调+音乐+灯光联动 | L2(模板可覆盖固定组合则 L0/L1) |
| 话术与体验 | 确认复述、执行解释("已调到24度,风力3档")、拒绝话术、安抚 | L2 |
| 视觉事件融合 | 检测器检出滞留→组织告警话术+后续建议流程 | L2(多模态推理) |
| 兜底判定 | 路由不确定时仲裁、低置信场景二次确认话术 | L2 |
ROI 说明:三级分级后,单轮模糊表达由 L1(1B,~1GB 内存)吃掉,7B 只处理真正需要推理/规划/记忆/多轮的场景(占交互量的比例暂按 20~40% 假设,需用真实交互日志校准)。这条分界线,就是"智能座舱 Agent"和"传统语音助手(精确指令匹配)"的区别。砍掉 7B 只剩传统方案+单轮模糊,撑不起多轮、规划、主动服务;反过来让 7B 干 L0/L1 的活,也是浪费。每级只干自己不可替代的活。
契约示例(LLM 输出 → 策略引擎输入):
{
"tool": "climate.set",
"params": {"target_temp": 24, "zone": "driver", "unit": "celsius"},
"confidence": 0.92,
"confirmation_required": false
}
策略引擎校验点(每一条都可能导致拒绝/降级):
| 校验 | 规则示例 |
|---|---|
| 行车锁 | 车速 >10km/h 禁止天窗/尾门等动作;车速 >80km/h 压缩长文本回复 |
| 权限 ACL | 乘客/儿童模式禁调驾驶位座椅记忆、付费功能 |
| 参数校验 | 温度范围 16~32℃、档位枚举校验,越界自动 clamp 并告知 |
| 危险操作标记 | 解锁/天窗/运动模式 → 强制语音复述确认(7.2) |
| 频控 | 同类写操作 ≤1次/10s,防连珠炮误触 |
为什么语义理解必须专有模型(L1 与 L2 均需领域适配):
- L1(1B 级):意图分类+槽位提取需车载语料微调(车控术语、表达习惯),通用开源模型车控域准确率不足;但无需 7B 级,限定域单轮任务 1B 足够
- L2(7B):Function Calling 输出格式须与工具注册表 schema 严格对齐(通用模型格式漂移率高)
- L2:多意图拆解与歧义消解("凉快一点"依赖车辆上下文)需要领域化训练
- L2:安全边界(哪些操作需确认、哪些场景拒绝)通过微调 + 提示词双层固化,Guardrail 兜底
6.3 上下文管理
| 机制 | 设计 |
|---|---|
| 窗口预算 | 活跃窗口 8K~16K token;超出即摘要 |
| 会话摘要 | 每轮结束生成结构化摘要(意图/执行/结果),压缩注入下轮 |
| 车辆上下文 | 车速、档位、电量、导航状态实时注入系统消息(轻量模板) |
| KV Cache 复用 | 同会话持续复用,仅追加增量 |
6.4 流式输出与打断
- 流式 TTS(边生成边播放),首音频 <500ms
- 语音打断(barge-in):麦克风 VAD 检测到新指令 → 停止生成 → 重置上下文指针
- 生成中工具执行结果以"语音+屏幕卡片"双通道呈现
7. 工具与技能系统
7.1 工具分类与注册表
7.2 车控工具抽象
- 统一 Vehicle Control Service 接口(gRPC/共享内存),屏蔽 CAN/以太网差异
- 状态只读工具:立即响应;状态写工具:须过策略引擎(行车锁 + 二次确认 + 权限)
- 危险操作(解锁、天窗、运动模式)强制语音复述确认
导航/音乐不是另一套逻辑,只是另一个执行服务。 语音控导航、切歌和调空调走同一条管线:三级路由 → 意图 JSON → 策略引擎 → 工具调度器 → 对应服务。区别在两处:执行服务不同(导航走导航 SDK、媒体走播放服务,只有车控走 Vehicle Control Service);策略分级不同——行车锁主要约束车控写操作,"导航到 X"是行车刚需不锁,付费内容才需要二次确认。策略引擎是统一闸门,规则按工具类型差异化,频控、ACL、护栏对所有域一视同仁。
7.3 技能扩展机制
- 技能 = 工具组合 + 触发模板 + 提示词片段(如"回家模式"= 导航+空调+音乐)
- 新技能通过 OTA 下发 manifest 注册,无需升级模型
8. 云服务网关
8.1 职责边界
- 原则:LLM 推理默认本地;仅"信息获取"类任务按白名单出车
- 出车数据最小化:只发送查询词与必要上下文(位置 token 化、去标识化),车况/隐私数据不出车
8.2 混合编排(按 NVIDIA 三要素)
| 要素 | 设计 |
|---|---|
| Agent 编排 | 意图路由按需调起本地/云端 agent;一次行程可混合(如规划路线 = 本地导航 agent + 云端景点检索 agent + 本地知识 agent) |
| 上下文共享 | 云端 agent 继承用户已给上下文,不得重复询问;云端结果结构化回传注入本地上下文 |
| UX 透明性 | 云端任务异步跟踪(进度提示)、预计耗时展示、断网 fallback:云端超时/无网 → 本地模型给出降级回答(如"网络不可用,可尝试本地导航") |
8.3 网关实现
- 车云通道:5G 模块 + 主机厂云端(私有协议/HTTP),鉴权 + 端到端加密
- 超时阈值:2s 内未返回即切换降级路径
- 可用性:网关故障不影响本地全部能力
9. 记忆系统
9.1 记忆分层
| 层 | 内容 | 载体 |
|---|---|---|
| 会话记忆 | 当前行程对话、上下文摘要 | KV Cache + 摘要文本 |
| 短期记忆 | 当日行为(目的地、偏好动作) | 本地 KV 存储 |
| 长期记忆 | 用户画像、通勤模式、常去地点、媒体口味 | 本地向量库 |
| 场景记忆 | 天气/时段/乘员组合 → 偏好动作映射 | 规则 + 向量混合 |
9.2 向量库选型
| 方案 | 优点 | 缺点 | 结论 |
|---|---|---|---|
| sqlite-vec | 零依赖、嵌入座舱进程、事务安全 | 大规模召回略弱 | 主选(座舱数据量级 10^5 内足够) |
| FAISS | 检索性能强 | 独立进程/依赖重 | 备选(记忆规模扩大时) |
- Embedding 模型:本地 1B 级(或量化小模型),文档切块 + 去重 + 过期策略
- 隐私生命周期:记忆默认存本地;用户可一键清除;迁移(换车/换账号)走加密导出,云端仅存画像摘要(可选)
9.3 主动服务触发
- 事件触发:工作日早晨通勤时间 → 预热导航、播报天气路况
- 遗忘检测:VLM 周期性检查舱内是否有宠物/儿童遗留(停车断电场景)
- 电量/保养临界 → 主动建议充电站/预约维保
10. 交互与安全
10.1 语音链路
先说结论:"录制 wav → 一次性识别为文字"是非流式方案,只适合调试/离线兜底;量产语音交互必须流式管线(边说边识别、边生成边播放),否则首反馈延迟撑不住。
链路分层与延迟预算
关键设计点
| 环节 | 设计 | 说明 |
|---|---|---|
| 唤醒 | 本地唤醒词常驻(DSP/轻量模型),多词支持("小X同学"/"你好车机"),误唤醒 <1次/小时 | 唤醒后会话持续,无需重复唤醒 |
| 流式 ASR | 流式识别为主(每 100ms 块输出中间结果);"录制 wav 再识别"仅用于:调试、离线日志回放、低资源兜底 | 文本流式推进,Agent 可提前预判 |
| Endpointing | 静音时长 + 语义完整度双判据;行车噪声环境下放宽静音阈值 | 避免"说完没反应"与"没说完就打断" |
| 打断(barge-in) | 唤醒词/VAD 检测到新指令 → 停止 TTS 与 LLM 生成 → 重置上下文指针 | 全双工:TTS 播放中 ASR 持续工作 |
| 多乘客 | 波束成形定向拾音 + 说话人分离(diarization);声纹识别区分司机/乘客,分别建会话与权限 | 司机语音优先响应;儿童模式限权 |
| 噪声适配 | 车型专属噪声场景(高速、开窗、空调最大档)采集,微调 ASR 声学模型 | 通用 ASR 车况表现差,必须专有化 |
| 车载术语 | 热词表(车辆功能词、路名、品牌)+ ASR 纠错映射 | "打开座椅通风"不会被识别为"打开座椅通风扇"类歧义 |
架构路线:级联为主,端到端可选
| 路线 | 方案 | 结论 |
|---|---|---|
| 路线 A:级联(推荐) | 流式 ASR(端侧模型,如 Nemotron Speech 类)→ 文本 → LLM Agent → TTS(Magpie 类) | 主流量产方案(理想/蔚来同路线):可控、工具调用稳、可调试、延迟可预测 |
| 路线 B:端到端语音模型 | 语音直接进 LLM(Qwen-Omni 类),文字作为旁路输出 | 体验自然、可带副语言信息(语气/情绪),但端侧资源重、工具调用与可控性弱、调试难;作为可选增强,不阻塞主线 |
- ASR 模型:本地常驻(<1GB,INT8),支持中英混说;车型专属微调数据 = 车噪环境 + 口音 + 车载术语(数据闭环模式见视觉感知章节)
- 全链路断网可用:本地 ASR → 本地 LLM → 本地 TTS
10.2 多模态(双轨架构:确定性检测器 + 按需 VLM)
关键原则:检测类任务(车外人/物靠近、车内儿童/宠物滞留)用轻量专用检测器(YOLO11/12 级,毫秒级、低功耗、确定性强),不用大模型;VLM 仅用于语义理解与确认。
| 任务 | 载体 | 说明 |
|---|---|---|
| 车内滞留检测(儿童/宠物/物品) | 专用检测器(YOLO 级) | NPU 常驻,安全关键功能必须确定性触发,不依赖 LLM 概率性输出 |
| 车外人/物靠近提醒 | 专用检测器(YOLO 级) | 周视摄像头 + 检测器,接近警戒区触发语音/灯光提醒 |
| 乘员识别/情绪/手势 | 检测器 + 轻量分类器 | 配合 VLM 按需增强 |
| 环境视觉问答("那家店营业到几点") | VLM(Qwen3.5 原生多模态 4B/9B / Gemma 4 vision) | 按需加载,配合检测器先定位再理解 |
| 滞留检测的语义确认 | VLM(可选增强) | 检测器触发 → VLM 二次确认(降低误报);VLM 超时/不可用则跳过,直接告警 |
- 两级确认:滞留告警 = 检测器连续 N 帧检出(确定触发)→ VLM 语义确认(降低误报)→ 声光告警 + App 通知;VLM 确认超时或不可用(断电、模型未加载)时不阻塞告警,直接按检测器结果触发
- 专有数据集是必需品:车内布局各车型差异大,通用数据集迁移效果差,必须车型专属数据(同视觉感知章节的数据策略)
- 摄像头数据仅在本地推理,不上云
10.3 安全机制
| 机制 | 实现 |
|---|---|
| 行车锁 | 车速 >阈值:禁止分心类多轮交互、长文本输出压缩为语音摘要 |
| 敏感操作二次确认 | 舒适类写操作执行后语音复述确认;危险操作(解锁/天窗/运动模式)强制执行前语音复述 + 明确同意 |
| 权限模型 | 工具级 ACL(司机/乘客/儿童模式),儿童模式禁用付费/隐私功能 |
| 护栏(Guardrail) | 输出过滤(违规内容)、输入注入防护、幻觉声明(不确定时明确"我不确定") |
| 隐私 | 摄像头/麦克风物理开关 + 软件级白名单出车 |
11. 性能指标与验证
11.1 端到端指标
| 指标 | 目标 | 验证方式 |
|---|---|---|
| 语音→首反馈延迟 | <1.5s(ASR+LLM首token+TTS首音) | 真机压测,50 分位 |
| ASR 流式首字延迟 | <200ms | 引擎基准 |
| ASR 字准率(车内噪声场景) | >95%(120km/h 风噪) | 车型专属语料回归 |
| 打断恢复时间 | <300ms(新指令可立即输入) | 实车长测 |
| LLM 首 token | <300ms | 引擎基准 |
| 解码吞吐 | >30 tokens/s | 高通 AI Hub 基准方法 |
| 工具调用准确率 | >95%(标准车控指令集) | 脚本化回归 |
| 断网全流程可用率 | 100%(本地能力) | 断网场景测试 |
| 误唤醒率 | <1次/小时 | 实车长测 |
| 敏感操作漏确认率 | 0 | 安全测试 |
| 内存峰值 | Agent 域 <15GB(融合 64GB 分区预算;AI Box 32GB 预留 17GB 余量)/ 模型权重驻留 <8GB | 长会话监控 |
| 模型热切换 | <30s,不中断会话 | OTA 演练 |
11.2 验证路径
- 实验室:引擎基准 + 模拟器(SIL)
- 台架:真实 SoC + 传感器接入(HIL)
- 实车:长测(驾驶场景、断网隧道、噪音环境)
12. 风险与落地节奏
12.1 风险清单
| 风险 | 等级 | 缓解 |
|---|---|---|
| 13B/30B MoE 模型端侧效果不及预期 | 高 | 首版锁定 7B,大模型作为旗舰增强(30B MoE 已有中科创达官宣案例);评估期双基座并行 |
| 微调语料不足导致车控/领域能力弱 | 高 | 合成数据 + 人工标注流水线前置启动 |
| QNN 对开源模型支持矩阵不全 | 中 | 选型阶段用 llama.cpp 并行验证;优先选 AI Hub 已有模型;滴水 AIOS 2.1 适配 8397/8797 可作参考 |
| 车规认证(功能安全/隐私合规)周期长 | 中 | 融合形态涉及 EE 变更,认证排期前置;Guardrail + 日志审计 |
| 断网时云端依赖功能体验落差 | 中 | 信息类任务本地缓存 + 降级话术模板 |
| 混载时 IVI 高负载影响推理 | 低 | 融合形态 VM 隔离 + 静态分区 + QoS(形态上已隔离) |
12.2 落地节奏(P0~P3 只是阶段代号)
| 阶段 | 周期 | 内容 | 交付 |
|---|---|---|---|
| P0 验证 | 1~2 月 | 三基座(Gemma4-12B / Qwen3.5-9B / Phi-4-14B)在 8397 开发环境跑 QNN + llama.cpp 基准(验证 QNN 对开源模型的支持矩阵;如可获取 Orin DevKit,同期跑 TensorRT Edge-LLM 对比);采集车载语料样本 | 引擎/基座/平台决策报告 |
| P1 MVP | 2~3 月 | 7B 模型 SFT(车控+工具调用)、Agent 框架(路由/ReAct/策略)、车控工具接入、云网关(天气/新闻) | 台架可演示 Agent |
| P2 增强 | 3~4 月 | 记忆系统、VLM 视觉能力、主动服务、Guardrail、性能调优至指标 | 通过 11.2 全部验证 |
| P3 量产 | 持续 | 微调数据闭环(OTA 用户反馈回流)、多车型适配、8797 全核融合扩展(30B MoE)、如选 NVIDIA 平台则切换 TensorRT Edge-LLM 引擎 | 量产发布 |
12.3 还没定的事
- 微调基座最终锁定:取决于第一阶段实测(Gemma4-12B vs Qwen3.5-9B vs Phi-4-14B;Qwen3.6-27B 仅云端/旗舰对照)
- 融合平台落地细节:8797 全核(高通线)还是 Thor(NVIDIA 线),取决于主机厂既有智驾方案与 EE 架构节奏;AI Box 仅作"不动 EE 架构"的过渡选项
- QNN 端侧 LLM 实际体验(内存带宽/工具链/量化支持):中科创达 30B MoE 已官宣,但公开基准有限,P0 实测后定
- 语音链路自研 vs 采购(Cerence/科大讯飞等):影响 ASR/TTS 模块边界
参考来源
- 高通骁龙座舱至尊版(Cockpit Elite / Ride Elite 官方页):https://www.qualcomm.com/automotive/products/elite
- 中科创达 RazorDCX Sylvania 规格(320 TOPS 稠密 / 272GB/s,CES 2026):https://www.thundersoft.com/thundersoft-new-gen-ai-domain-control-released-at-ces-2026/
- 中科创达滴水 AIOS 2.1 适配 8397/8797 + 30B MoE 端侧推理(2026-05 投资者关系):https://www.9fzt.com/detail/sz_300496_9_f7738f8b4b59d3a27eec931c5b9a26d0.html
- 神行者 8 搭载骁龙 8397(IT之家):https://m.ithome.com/html/934657.htm
- NVIDIA 端侧 Agent 指标口径(<500ms 首 token、>30 tok/s,行业通行定义):https://developer.nvidia.com/blog/how-to-build-in-vehicle-ai-agents-with-nvidia-from-cloud-to-car/
- NVIDIA TensorRT Edge-LLM(JetPack 7.1,备选引擎):https://developer.nvidia.com/blog/accelerating-llm-and-vlm-inference-for-automotive-and-robotics-with-nvidia-tensorrt-edge-llm/
- NVIDIA DRIVE Orin 官方规格(对照平台):https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-orin/
- ABI Research agentic AI 车辆预测(2025→2035):https://developer.nvidia.com/blog/how-to-build-in-vehicle-ai-agents-with-nvidia-from-cloud-to-car/
- 车载 AI 大模型安装量/渗透率(2026.2 知乎行业月报):https://zhuanlan.zhihu.com/p/2035663796484712331
- 吉利 200 TOPS AI Box 跑 7B(媒体报道):https://finance.sina.com.cn/(2026-04-26,原文复核时抓取失败,以官方/实测为准)
- 小米 YU7 Thor 700 TOPS:https://www.xiaomiev.com/pilot
本文链接:把 Agent 塞进舱驾融合平台:座舱端侧大模型全链路设计 - https://h89.cn/archives/690.html
版权声明:原创文章 遵循 CC 4.0 BY-SA 版权协议,转载请附上原文链接和本声明。