车载语音指令识别:从 44% 到 96% 的调优之路
背景
项目全景
数据集探索:Speech Commands v2
标签列表
V1~V3:试错过程
V1:随手跑(CPU,MFCC + 简单 CNN)
V2:换 GPU 加轮数
V3:SpecAugment + 残差网络(快速验证)
V4:根因发现——MFCC 丢帧
V5(最终方案):MelSpectrogram + 残差 CNN + Mixup
改进组合
训练曲线分析
代码架构拆解
为什么 Mel 比 MFCC 强?
评测结果(真实数据)
总体指标
每类准确率
混淆矩阵 Top 15 分析
推理延迟(RTX 4060, Batch=1)
模型偏置分析
部署管道
1. ONNX 导出
2. ONNX → DLC(SNPE 专有格式)
3. INT8 量化
4. 真机推理(adb)
踩坑大全
1. MFCC hop_length 的隐藏