小白用 TensorRT 给模型加速:ONNX 转 Engine 踩坑实录
TensorRT 是什么?为什么需要它?
一个意外:TensorRT 11.x 的 API 大改
准备环境:Windows 上装 TensorRT
核心概念:三层架构
精度模式对比
Step 1:ONNX 转 FP32 Engine(入门)
核心代码
推理时的坑:get_tensor_mode 参数类型
Step 2:GPU 推理和 CUDA 内存管理
Step 3:ModelOpt FP16 转换
ModelOpt 自动转换
效果对比
Step 4:多 batch 基准测试(GPU 到底快在哪?)
关键发现
这个结果说明了什么?
算子融合:TensorRT 的核心优化手段
文件说明与实践总结
踩坑记录
OptimizationProfile 忘记设置
get_tensor_mode 传入整数
FP16 Engine 比