腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
2
回答
Tensorflow
GPU
利用率仅为60% (GTX 1070)
performance
、
machine-learning
、
neural-network
、
tensorflow
、
nvidia
我
的
GPU
利用率只有60% (+- 2-3%),没有大
的
下降。ECC ||==============i7 4770k),所以CPU性能不应该成为
瓶颈
。我使用
的
是Tensorflow和tf.TFRecordReader()
的
二进制文件格式#Uses t
浏览 0
提问于2016-10-23
得票数 9
回答已采纳
1
回答
Tensorflow CIFAR10示例:
GPU
未充分利用
tensorflow
、
gpu
我在一台安装了4x NVIDIA Titan X
的
机器上运行CIFAR10 ()
的
tensorflow示例。python cifar10_multi_
gpu
_train.py --num_gpus=4 然而,
GPU
的
使用率仅为25%。谁能解释一下
瓶颈
是什么以及我
如何
解决
它?输入管道和从CPU到
GPU
的
数据传输是否存在问题?
浏览 13
提问于2017-03-15
得票数 2
1
回答
如果没有分析工具,我
如何
优化程序
的
性能?
c++
、
performance
、
optimization
、
opengl
、
profiling
我目前正在研究一个OpenGl程序,我想提高它
的
性能。在功能强大
的
专用
GPU
上,性能还可以,但并不理想,但在集成图形(< 10 fps)上却是非常糟糕
的
。在一个正常
的
程序(基于CPU
的
程序,没有OpenGl或其他
GPU
)中,我会在程序上运行一个分析器(可能是内置于CLion中
的
),查看大部分时间花在哪里,然后为这些区域设计一个更好
的
算法,或者找到一种方法来减少该区域
的
调用量此外,程序运行时CPU使用率很低,但
浏览 0
提问于2019-06-07
得票数 8
1
回答
程序
如何
与显卡对话?
graphics
、
cpu
我听说
GPU
比CPU更擅长执行某些任务。我
的
问题是,程序是
如何
告诉显卡处理一些东西而不是CPU?程序直接与
GPU
对话吗?或者CPU决定给图形卡提供什么?如果CPU不得不告诉
GPU
每条指令都要处理,那么用
GPU
处理
的
好处似乎就会被否定。
浏览 0
提问于2015-04-14
得票数 4
回答已采纳
2
回答
keras不使用
gpu
,但tensorflow使用
gpu
python
、
tensorflow
、
keras
、
gpu
、
cpu
Keras没有使用我
的
GPU
,尽管tensorflow似乎可以很好地运行它。('/
gpu
:0'):结果是一样
的
。除了速度和明显
的
CPU使用率之外,我不知道
如何
判断Keras是否在使用
GPU
。 我还从tensorflow文档中运行了这个示例,在我
的
终端中,我可以清楚地看到它使用了
G
浏览 2
提问于2018-10-23
得票数 0
1
回答
Keras看到我
的
GPU
,但在训练神经网络时不使用它
python
、
tensorflow
、
keras
、
gpu
我
的
GPU
不被Keras/TensorFlow使用。为了使我
的
GPU
与tensorflow一起工作,我通过pip安装了tensorflow-
gpu
(我在Windows上使用Anaconda )print(tf.test.is_
gpu
_available为什么我认为
GPU
不能工作?-因为我
的
python内核使用CPU 99%,RAM 99%,有时
GPU
~7%,但大多数时候是0。我使用自定义<e
浏览 2
提问于2019-10-18
得票数 7
回答已采纳
1
回答
祈使与功能&理解冯·诺依曼
的
瓶颈
scala
、
functional-programming
、
immutability
、
imperative-programming
在
的
Coursera课程中,Martin讨论了命令式
编程
是
如何
受到von
瓶颈
的
约束
的
,因为它主要涉及可变
的
状态,因此也涉及赋值和取消引用。我很难理解使用不变
的
数据结构是
如何
帮助
解决
von
瓶
浏览 3
提问于2017-05-11
得票数 3
1
回答
如何
找到图形管道
的
瓶颈
c
、
optimization
、
opengl
、
3d
、
graphic
如何
找到图形化管道
的
瓶颈
。最近,我一直在使用一个程序在一个简单
的
场景中绘制大量
的
多边形,使用alpha混合(又称草场景)。我使用了两个程序,一个使用静态坐标,另一个使用旋转和平移。两者都以60 FPS运行,没有其他繁重
的
进程在运行。但当我同时使用它们(两个窗口,每个窗口都有相同数量
的
草和草位置)时,使用平移和旋转
的
窗口运行速度为10FPS,而另一个窗口
的
速度约为55FPS。我
的
问题是,为什么两个都在运行60 FPS,
浏览 0
提问于2011-05-26
得票数 1
回答已采纳
1
回答
Htop cpu条红色,100%内核时间
kernel
、
strace
、
htop
我发现了一些类似的话题,但没有找到有帮助
的
解决
方案。因为我有更多
的
信息要提供,所以我打开了这个问题。每当这个100%
的
红色CPU条发生时,训练就会卡住,
GPU
下降到0%。连线
的
事情是,这只发生在我使用
的
两台服务器上。它从来不会发生在我
的
个人电脑(不太强大)和从来没有发生在另一个强大
的
服务器。strace命令显
浏览 16
提问于2022-04-17
得票数 0
回答已采纳
1
回答
Tensorflow
GPU
-设备互连,流执行器与强度1边矩阵?
python
、
tensorflow
、
keras
我有一个带有4个Nvidia K80
GPU
的
盒子。我正在运行Tensorflow 2。/
gpu
_device.cc:1108] 0 1 2 3I tensorflow/c
浏览 2
提问于2020-06-14
得票数 1
回答已采纳
2
回答
如何
缓解OpenCL/CUDA中
的
主机+设备内存传输
瓶颈
memory
、
cuda
、
opencl
、
nvidia
如果我
的
算法被主机到设备和设备到主机
的
内存传输遇到
瓶颈
,唯一
的
解决
方案是不同
的
算法还是修改后
的
算法?
浏览 0
提问于2010-10-20
得票数 3
回答已采纳
1
回答
在DirectX 10/11中从图形处理器取回变换后
的
顶点
c++
、
vertex
、
directx-11
、
directx-10
、
vertex-shader
我正在开发
的
图形引擎开发了一个主要
的
瓶颈
,那就是顶点上
的
矩阵变换(几乎没有任何静态顶点)。到目前为止,我一直在用CPU转换顶点,并在每一帧更新顶点缓冲区(数据复制本身是一个小
瓶颈
,但到目前为止还可以处理)。所以我在想,如果我可以把网格缓冲区放在
GPU
中,我可以变换那里
的
顶点,并将转换后
的
顶点集返回到主内存中进行其他处理(后续处理需要比
GPU
着色器允许
的
更多
的
内部连接)。这可能会消除当前代码中
浏览 0
提问于2012-04-05
得票数 4
3
回答
GPU
未充分利用CNN培训
tensorflow
、
keras
但是训练过程对我来说似乎很慢,在检查了我在任务管理器中
的
GPU
性能之后,我觉得我
的
GPU
几乎没有被使用过。这是我
的
代码:这就是我
的
任务管理器在培训期间
的
样子:我已经安装了Tensor
浏览 0
提问于2018-04-18
得票数 0
回答已采纳
1
回答
TensorFlow:将单个示例出队是一个
瓶颈
吗?
python
、
machine-learning
、
tensorflow
、
computer-vision
、
deep-learning
当我创建我
的
批处理时,这会导致我
的
训练中
的
瓶颈
吗?使用dequeue_many是不是更好呢?当我之前训练我
的
模型时,我在TensorBoard上注意到并行阅读器队列总是满
的
-这是一个令人担忧
的
原因,还是入队操作应该比出队操作更快?一般来说,出队操作是否应该出队
的
示例数量与入队操作
的
读取器数量一样多?以下是我对队列
的
可视化: 我
的
猜测是,只要有一个min_after_dequeue参数确保队列中
浏览 16
提问于2017-02-08
得票数 0
回答已采纳
1
回答
单位纹理vs 2d阵列
c#
、
unity3d
我
的
问题是。哪个是最好
的
(速度和实用性
的
混合),存储在一个统一
的
纹理,还是一个简单
的
二维数组?
浏览 2
提问于2016-09-26
得票数 1
回答已采纳
1
回答
GPU
处理离散图像
的
优化技术
performance
、
opengl
、
image-processing
、
gpu
、
hpc
它们大多是直接
的
颜色映射,但偶尔也会出现模糊和其他卷积。挑战是,watch -n 0.1 nvidia-smi报告说,
GPU
的
利用率基本上是0% - 1%,周期性地上升到18%。我真的想从
GPU
中获得更多
的
价值(我希望
浏览 1
提问于2019-11-06
得票数 3
回答已采纳
4
回答
GPU
在处理更大计算方面的能力是否有限?
performance
、
parallel-processing
、
cuda
、
hardware
、
gpu
我写了一个内核来做一些3D热传输
的
模拟。我遇到
的
问题是,我
的
程序在8核Dell Studio XPS上并行运行
的
版本超过了我
的
GTS-240
GPU
。我尝试了很多方法,试图让它运行得更快,但我得出
的
结论是,只是计算本身太大了。计算大约有35个FLOP,我只需为模拟中
的
每个单元启动一个线程。尽管如此,我在
GPU
上每秒只能获得3340万个单元,在CPU上每秒只能获得4040万个单元。据我所知,
GPU
在这样
的</e
浏览 4
提问于2012-06-09
得票数 0
2
回答
是否有一个快速内存队列,我可以使用该交换项目,因为它达到了一定
的
规模?
c++
、
c
、
io
、
cuda
、
message-queue
当我使用具有更快nics
的
小型服务器来传输数据时,这种方法非常有效,但最近我一直在学习并将代码从Java转换为c/c++,并在
GPU
上运行它,这使得队列成为了一个大
瓶颈
。
瓶颈
显然是网络
IO
(廉价系统上
的
分析显示cpu使用率很高,旧
gpu
的
cpu使用率也很高,但是新
的
更快
的
cpu/
gpu
并没有得到充分
的
利用,网络
IO
稳定在300-400
浏览 6
提问于2012-05-12
得票数 15
回答已采纳
1
回答
通用
瓶颈
检测器(Linux服务器)
linux
、
performance-analysis
我搜索一个通用
的
硬件
瓶颈
检测器。然后,它应该报告
瓶颈
可能在哪里。所需特征:适用于linux服务器CPU数量
IO
性能..。 一个只显示cpu/
io
使用情况图
的
工具不能
解决
我
的
问题。问题是:与硬件相关
的
等待发生在哪里?
浏览 0
提问于2018-12-04
得票数 2
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
实时音视频
云点播
活动推荐
运营活动
广告
关闭
领券