标签 Engine 下的文章

TensorRT 是什么?为什么需要它? 一个意外:TensorRT 11.x 的 API 大改 准备环境:Windows 上装 TensorRT 核心概念:三层架构 精度模式对比 Step 1:ONNX 转 FP32 Engine(入门) 核心代码 推理时的坑:get_tensor_mode 参数类型 Step 2:GPU 推理和 CUDA 内存管理 Step 3:ModelOpt FP16 转换 ModelOpt 自动转换 效果对比 Step 4:多 batch 基准测试(GPU 到底快在哪?) 关键发现 这个结果说明了什么? 算子融合:TensorRT 的核心优化手段 文件说明与实践总结 踩坑记录 OptimizationProfile 忘记设置 get_tensor_mode 传入整数 FP16 Engine 比

- 阅读剩余部分 -