前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >NVIDIA-SMI has failed because it couldn“t communicate with the NVIDIA driver .

NVIDIA-SMI has failed because it couldn“t communicate with the NVIDIA driver .

作者头像
三更两点
发布2023-11-07 09:46:03
2680
发布2023-11-07 09:46:03
举报

报错

  1. 执行nvidia-smi报错
代码语言:javascript
复制
NVIDIA-SMI has failed because it couldn"t communicate with the NVIDIA driver .
Make  sure that the atest NVIDIA driver is installed and running.
  1. 运行使用gpu的docker容器时
代码语言:javascript
复制
NVIDIA Docker - initialization error: nvml error: driver not loaded

原因分析

  1. 大概率是因为重启后内核升级了 (起码我的问题是因为这样)。
  2. 驱动文件被删除

解决办法

  1. 查看显卡连接是否正常
代码语言:javascript
复制
$ sudo lshw -C display

应该会输出

  1. 查看已安装内核
代码语言:javascript
复制
$ dpkg --get-selections |grep linux-image
在这里插入图片描述
在这里插入图片描述
  1. 查看在使用内核
代码语言:javascript
复制
$ uname -a

如果本地有多核内核大概可能是因为内核升级导致驱动无法识别

  1. 查看本地之前安装的驱动版本
代码语言:javascript
复制
$ ls /usr/src | grep nvidia

输出:nvidia-515.105.01 (记住:515.105.01 这个版本号) 5… 此时只需要执行

代码语言:javascript
复制
$ sudo apt-get install dkms
$ sudo dkms install -m nvidia -v 515.105.01(515.105.01表示的是驱动版本号,上面查到的)
  1. 此时应该是解决了此问题
代码语言:javascript
复制
$ nvidia-smi

可以看到gpu的列表

在这里插入图片描述
在这里插入图片描述

防患于未然

1)命令行关闭系统自动更新,使用命令打开文件并编辑

代码语言:javascript
复制
$ sudo gedit /etc/apt/apt.conf.d/10periodic

将双引号中的“1”全部置“0”即可,修改后保存。

本文参与 腾讯云自媒体分享计划,分享自作者个人站点/博客。
原始发表:2023-11-06,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体分享计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 报错
  • 原因分析
  • 解决办法
  • 防患于未然
相关产品与服务
容器服务
腾讯云容器服务(Tencent Kubernetes Engine, TKE)基于原生 kubernetes 提供以容器为核心的、高度可扩展的高性能容器管理服务,覆盖 Serverless、边缘计算、分布式云等多种业务部署场景,业内首创单个集群兼容多种计算节点的容器资源管理模式。同时产品作为云原生 Finops 领先布道者,主导开源项目Crane,全面助力客户实现资源优化、成本控制。
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档