paddlepaddle TensorRT安装，TensorRT加速GPU预测-程序员宅基地

技术标签： paddlepaddle python 笔记 NLP实战项目 linux 深度学习

解决问题技巧

直接看官方文档

去相应的github搜索是不是之前有人遇到类似的问题

提issue

TensorRT版本的PaddlePaddle

在这里插入图片描述

下载链接：
https://paddleinference.paddlepaddle.org.cn/user_guides/download_lib.html

在线下载

wget https://paddle-inference-lib.bj.bcebos.com/2.2.2/python/Linux/GPU/x86-64_gcc8.2_avx_mkl_cuda10.1_cudnn7.6.5_trt6.0.1.5/paddlepaddle_gpu-2.2.2.post101-cp37-cp37m-linux_x86_64.whl

pip install paddlepaddle_gpu-2.2.2.post101-cp37-cp37m-linux_x86_64.whl

或者直接
pip install https://paddle-inference-lib.bj.bcebos.com/2.2.2/python/Linux/GPU/x86-64_gcc8.2_avx_mkl_cuda10.1_cudnn7.6.5_trt6.0.1.5/paddlepaddle_gpu-2.2.2.post101-cp37-cp37m-linux_x86_64.whl

gcc版本也需要匹配一致
gcc安装参考链接：https://blog.csdn.net/qq_15821487/article/details/122886625?spm=1001.2014.3001.5502

对应版本的TensorRT，cuda/cudnn也需要提取安装好

TensorRT是Nvidia公司出的能加速模型推理的框架，其实就是让你训练的模型在测试阶段的速度加快，比如你的模型测试一张图片的速度是50ms，那么用tensorRT加速的话，可能只需要10ms。当然具体能加速多少也不能保证，反正确实速度能提升不少。

注意，直接看对应的官方文档，是最有效，最准确的方式。

参考文章：
https://blog.csdn.net/feedinglife/article/details/120848119
https://zhuanlan.zhihu.com/p/88318324
https://tbr8.org/how-to-install-tensorrt-on-centos/
paddle官方文档：https://paddleinference.paddlepaddle.org.cn/product_introduction/inference_intro.html
在这里插入图片描述
TensorRT官方文档：
https://docs.nvidia.com/deeplearning/tensorrt/index.html
TensorRT官方github：
https://github.com/NVIDIA/TensorRT

安装步骤

下载

https://developer.nvidia.com/nvidia-tensorrt-download

离线下载

填个问卷，然后直接点击进来即可
在这里插入图片描述

在线下载不行

鼠标右键
在这里插入图片描述
1、

wget https://developer.download.nvidia.cn/compute/machine-learning/tensorrt/secure/6.0/GA_6.0.1.5/tars/TensorRT-6.0.1.5.CentOS-7.6.x86_64-gnu.cuda-10.1.cudnn7.6.tar.gz?bjNJHRorOM7wGWYqRC6WNq1Yc5t7qnfDjp0623k5RYOwiHURX7Wn4LGKTjbI_qGQxKPeyZW9uxElmQnnBibKtdNpFWRWcwcdmVKOiCqzXFdawKSqUWj6NlLAFOK8ipKe5XOG8QrgntKTRPsDtKVvlG-yL1BLkxj7KTcTCP5jmu3ezMgAisSZ4lGoNvONTME-wi3MnfXx0obnjy5iu_vmAg1sJohJnXwZ73Fxim-5p71edW_bSeKbzM9VPmU&t=eyJscyI6InJlZiIsImxzZCI6IlJFRi1kb2NzLm52aWRpYS5jb21cLyJ9

快速查找某个文件：

find / -name "TensorRT*"

2、

 tar xzvf TensorRT-6.0.1.5.CentOS-7.6.x86_64-gnu.cuda-10.1.cudnn7.6.tar.gz

3、下载完后，解压，接着 vi ~/.bashrc，添加如下内容
其中/home/andy/TensorRT替换成你自己实际的目录，cuda-9.0也是。

 vim ~/.bashrc

export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/opt/trt/TensorRT-6.0.1.5/lib:/usr/local/cuda-10.1/lib64

source ~/.bashrc

4、然后就是安装对应的python库，包括tensorRT，uff和graphsurgeon

cd /opt/trt/TensorRT-6.0.1.5/python
pip3 install tensorrt-6.0.1.5-cp37-none-linux_x86_64.whl

cd /opt/trt/TensorRT-6.0.1.5/uff
pip3 install uff-0.6.5-py2.py3-none-any.whl

cd /opt/trt/TensorRT-6.0.1.5/graphsurgeon
pip3 install graphsurgeon-0.4.1-py2.py3-none-any.whl

5、搞定后，进到python环境下，执行下import tensorrt，正常的话可以成功导入。

import tensorrt
tensorrt.__version__
'6.0.1.5

6、最后可以编译一下tensorRT提供的一些sample。进到tensorRT的sample目录下，执行make CUDA_INSTALL_DIR=/usr/local/cuda，完成后到tensorRT的bin目录下，可以看到已经生成了可执行的sample，执行./sample_mnist 就可以输出一副字符组成的数字图片，下面跟着mnist的预测结果。 ok整个安装搞定了。

cd /opt/trt/TensorRT-6.0.1.5/samples
make CUDA_INSTALL_DIR=/usr/local/cuda

cd /opt/trt/TensorRT-6.0.1.5/bin
./sample_mnist

7、查看版本号

find / -name NvInferVersion.h

在这里插入图片描述

运行时间比对

服务预测，webservice

纯cpu

在这里插入图片描述
服务端：

python  web_service.py

客户端：

python rpc_client.py

时间 :0.15128087997436523s

纯gpu

在这里插入图片描述
服务端：

python  web_service.py

客户端：

python rpc_client.py

时间加速明显 :
第一次运行加载：3s
后面每次：0.028s

gpu + tensorrt

时间发现没有提速 :
第一次运行加载：3s
后面每次：0.028s

解决方案

https://hub.fastgit.org/PaddlePaddle/Serving/blob/v0.7.0/doc/Serving_Configure_CN.md#python-pipeline
在这里插入图片描述

非服务预测，直接运行predict函数，每次重新加载到内存

纯cpu

python predict.py

时间：1.45s

cpu + enable_mkldnn

python predict.py  --enable_mkldnn=True

时间：1.45s 基本无变化

纯gpu

python predict.py  --device=gpu

时间：7.35 时间反而更长，时间花费在加载模型

gpu + tensorrt

python predict.py  --device=gpu --use_tensorrt=True

报错

Traceback (most recent call last):
  File "predict.py", line 282, in <module>
    args.cpu_threads, args.enable_mkldnn)
  File "predict.py", line 151, in __init__
    self.predictor = paddle.inference.create_predictor(config)
ValueError: (InvalidArgument) Pass trt_squeeze2_matmul_fuse_pass has not been registered.
  [Hint: Expected Has(pass_type) == true, but received Has(pass_type):0 != true:1.] (at /paddle/paddle/fluid/framework/ir/pass.h:240)

报错解决方案，需要安装特定版本的paddle带trt的paddle

报错2：

E0216 17:04:09.163729 30082 helper.h:111] Parameter check failed at: ../builder/Network.cpp::addInput::671, condition: isValidDims(dims, hasImplicitBatchDimension())

运行报错，查看日志
在这里插入图片描述

CRITICAL 2022-02-16 19:29:49,479 [operator.py:1315] [ernie|0] failed to init op: (InvalidArgument) Adding input reshape2_60.tmp_0 failed in TensorRT inference network. Please recheck your input.
  [Hint: input should not be null.] (at /paddle/paddle/fluid/inference/tensorrt/engine.cc:266)
Traceback (most recent call last):
  File "/data/mart/neural_search/venv/lib/python3.7/site-packages/paddle_serving_server/pipeline/operator.py", line 1308, in _run
    concurrency_idx)
  File "/data/mart/neural_search/venv/lib/python3.7/site-packages/paddle_serving_server/pipeline/local_service_handler.py", line 228, in get_client
    mkldnn_bf16_op_list=self._mkldnn_bf16_op_list)
  File "/data/mart/neural_search/venv/lib/python3.7/site-packages/paddle_serving_app/local_predict.py", line 235, in load_model_config
    self.predictor = paddle_infer.create_predictor(config)
ValueError: (InvalidArgument) Adding input reshape2_60.tmp_0 failed in TensorRT inference network. Please recheck your input.
  [Hint: input should not be null.] (at /paddle/paddle/fluid/inference/tensorrt/engine.cc:266)

本文链接：https://blog.csdn.net/qq_15821487/article/details/122952282

原作者删帖不实内容删帖广告或垃圾文章投诉

智能推荐

class和struct的区别-程序员宅基地

文章浏览阅读101次。4.class可以有⽆参的构造函数，struct不可以，必须是有参的构造函数，⽽且在有参的构造函数必须初始。2.Struct适⽤于作为经常使⽤的⼀些数据组合成的新类型，表示诸如点、矩形等主要⽤来存储数据的轻量。1.Class⽐较适合⼤的和复杂的数据，表现抽象和多级别的对象层次时。2.class允许继承、被继承，struct不允许，只能继承接⼝。3.Struct有性能优势，Class有⾯向对象的扩展优势。3.class可以初始化变量，struct不可以。1.class是引⽤类型，struct是值类型。

android使用json后闪退,应用闪退问题：从json信息的解析开始就会闪退-程序员宅基地

文章浏览阅读586次。想实现的功能是点击顶部按钮之后按关键字进行搜索，已经可以从服务器收到反馈的json信息，但从json信息的解析开始就会闪退，加载listview也不知道行不行public abstract class loadlistview{public ListView plv;public String js;public int listlength;public int listvisit;public..._rton转json为什么会闪退

如何使用wordnet词典，得到英文句子的同义句_get_synonyms wordnet-程序员宅基地

文章浏览阅读219次。如何使用wordnet词典，得到英文句子的同义句_get_synonyms wordnet

系统项目报表导出功能开发_积木报表多线程-程序员宅基地

文章浏览阅读521次。系统项目报表导出导出任务队列表 + 定时扫描 + 多线程_积木报表多线程

ajax 如何从服务器上获取数据？_ajax 获取http数据-程序员宅基地

文章浏览阅读1.1k次，点赞9次，收藏9次。使用AJAX技术的好处之一是它能够提供更好的用户体验，因为它允许在不重新加载整个页面的情况下更新网页的某一部分。另外，AJAX还使得开发人员能够创建更复杂、更动态的Web应用程序，因为它们可以在后台与服务器进行通信，而不需要打断用户的浏览体验。在Web开发中，AJAX（Asynchronous JavaScript and XML）是一种常用的技术，用于在不重新加载整个页面的情况下，从服务器获取数据并更新网页的某一部分。使用AJAX，你可以创建异步请求，从而提供更快的响应和更好的用户体验。_ajax 获取http数据

Linux图形终端与字符终端-程序员宅基地

文章浏览阅读2.8k次。登录退出、修改密码、关机重启_字符终端

随便推点

Python与Arduino绘制超声波雷达扫描_超声波扫描建模 python库-程序员宅基地

文章浏览阅读3.8k次，点赞3次，收藏51次。前段时间看到一位发烧友制作的超声波雷达扫描神器，用到了Arduino和Processing，可惜啊，我不会Processing更看不懂人家的程序，咋办呢？嘿嘿，所以我就换了个思路解决，因为我会一点Python啊，那就动手吧！在做这个案例之前先要搞明白一个问题：怎么将Arduino通过超声波检测到的距离反馈到Python端？这个嘛，我首先想到了串行通信接口。没错！就是串口。只要Arduino将数据发送给COM口，然后Python能从COM口读取到这个数据就可以啦！我先写了一个测试程序试了一下，OK！搞定_超声波扫描建模 python库

凯撒加密方法介绍及实例说明-程序员宅基地

文章浏览阅读4.2k次。端—端加密指信息由发送端自动加密，并且由TCP/IP进行数据包封装，然后作为不可阅读和不可识别的数据穿过互联网，当这些信息到达目的地，将被自动重组、解密，而成为可读的数据。不可逆加密算法的特征是加密过程中不需要使用密钥，输入明文后由系统直接经过加密算法处理成密文，这种加密后的数据是无法被解密的，只有重新输入明文，并再次经过同样不可逆的加密算法处理，得到相同的加密密文并被系统重新识别后，才能真正解密。2．使用时，加密者查找明文字母表中需要加密的消息中的每一个字母所在位置，并且写下密文字母表中对应的字母。_凯撒加密

工控协议--cip--协议解析基本记录_cip协议embedded_service_error-程序员宅基地

文章浏览阅读5.7k次。CIP报文解析常用到的几个字段：普通类型服务类型:[0x00], CIP对象:[0x02 Message Router], ioi segments:[XX]PCCC（带cmd和func）服务类型:[0x00], CIP对象:[0x02 Message Router], cmd:[0x101], fnc:[0x101]..._cip协议embedded_service_error

如何在vs2019及以后版本(如vs2022)上添加添加ActiveX控件中的MFC类_vs添加mfc库-程序员宅基地

文章浏览阅读2.4k次，点赞9次，收藏13次。有时候我们在MFC项目开发过程中，需要用到一些微软已经提供的功能，如VC++使用EXCEL功能，这时候我们就能直接通过VS2019到如EXCEL.EXE方式，生成对应的OLE头文件，然后直接使用功能，那么，我们上篇文章中介绍了vs2017及以前的版本如何来添加。但由于微软某些方面考虑，这种方式已被放弃。从上图中可以看出，这一功能，在从vs2017版本15.9开始，后续版本已经删除了此功能。那么我们如果仍需要此功能，我们如何在新版本中添加呢。_vs添加mfc库

frame_size (1536) was not respected for a non-last frame_frame_size (1024) was not respected for a non-last-程序员宅基地

文章浏览阅读785次。用ac3编码，执行编码函数时报错入如下：[ac3 @ 0x7fed7800f200] frame_size (1536) was not respected for anon-last frame (avcodec_encode_audio2)用ac3编码时每次送入编码器的音频采样数应该是1536个采样，不然就会报上述错误。这个数字并非刻意固定，而是跟ac3内部的编码算法原理相关。全网找不到，国内音视频之路还有很长的路，音视频人一起加油吧～......_frame_size (1024) was not respected for a non-last frame

Android移动应用开发入门_在安卓移动应用开发中要在活动类文件中声迷你一个复选框变量-程序员宅基地

文章浏览阅读230次，点赞2次，收藏2次。创建Android应用程序一个项目里面可以有很多模块，而每一个模块就对应了一个应用程序。项目结构介绍_在安卓移动应用开发中要在活动类文件中声迷你一个复选框变量