标签 语音指令识别 下的文章

背景 项目全景 数据集探索:Speech Commands v2 标签列表 V1~V3:试错过程 V1:随手跑(CPU,MFCC + 简单 CNN) V2:换 GPU 加轮数 V3:SpecAugment + 残差网络(快速验证) V4:根因发现——MFCC 丢帧 V5(最终方案):MelSpectrogram + 残差 CNN + Mixup 改进组合 训练曲线分析 代码架构拆解 为什么 Mel 比 MFCC 强? 评测结果(真实数据) 总体指标 每类准确率 混淆矩阵 Top 15 分析 推理延迟(RTX 4060, Batch=1) 模型偏置分析 部署管道 1. ONNX 导出 2. ONNX → DLC(SNPE 专有格式) 3. INT8 量化 4. 真机推理(adb) 踩坑大全 1. MFCC hop_length 的隐藏

- 阅读剩余部分 -