腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
我在哪里可以找到Tensorflow是如何做
矩阵
乘法
的?
tensorflow
例如,我想做一个
矩阵
乘法
,在这个过程中,我使用了tensorflow中的tf.matmul操作。并且,我想在tf中
优化
矩阵
乘法
。但是,我不能到达
矩阵
乘法
是在tf_matmul中精确完成的。
浏览 20
提问于2019-02-19
得票数 0
2
回答
Clojure中的机器学习
clojure
、
machine-learning
、
numeric
、
symbolic-math
我们在Python中有theano和numpy来做符号和数值计算,
优化
了我们的机器学习计算(例如:
矩阵
乘法
和GPU使用)。在Clojure中有哪些相关的工具来做机器学习(或者至少像
矩阵
乘法
这样的事情)?
浏览 0
提问于2015-06-16
得票数 7
1
回答
Python中稀疏
矩阵
的
矩阵
乘法
python
、
multidimensional-array
、
matrix
、
numpy
我想将一个稀疏
矩阵
A与一个元素为0、-1或1的
矩阵
B相乘。为了降低
矩阵
乘法
的复杂度,我可以忽略那些为0的项,或者如果该项为1或subs,则继续添加没有
乘法
的列。如果它是-1。关于这一点的讨论如下: 有没有人知道他们是否针对这样的
矩阵
优化
了
矩阵
乘法
?或者你可以建议一些方法来加速这个过程,因为我有一个300000x1000的
矩阵
浏览 1
提问于2011-09-20
得票数 4
回答已采纳
1
回答
VideoCoreIV VC4CL (树莓派图形处理器)上的PyOpenCL性能问题
python
、
opencl
、
raspberry-pi3
、
gpgpu
、
pyopencl
我是OpenCL/PyOpenCL的新手,我想知道在我的硬件上,在Raspberry GPU (VideoCoreIV)上的OpenCL和Numpy (在CPU上)在向量和
矩阵
乘法
上的比较。
浏览 45
提问于2019-03-18
得票数 0
1
回答
python中多个
矩阵
的快速后续
乘法
python
、
performance
、
matrix
、
matrix-multiplication
我必须通过许多其他
矩阵
的有序
乘法
生成一个
矩阵
(物理学中的传播子)。每个
矩阵
的大小约为(30,30),所有实项(浮动),但不对称。要乘的
矩阵
数在1e3到1e5之间变化。每个
矩阵
与以前的
矩阵
只略有不同,但是它们不是可交换的(最后,我需要所有这些非交换
乘法
的乘积)。每个
矩阵
都是特定的时间切片,所以我知道如何独立地生成每个
矩阵
,无论它们在
乘法
序列中的哪个位置。Assuming内存的行/列的更好的尺
浏览 6
提问于2021-01-14
得票数 0
2
回答
乘0比Python中的任何其他
乘法
都快吗?
python
、
tensorflow
、
keras
我想通过屏蔽一些我知道在计算中不需要的值来
优化
Python中的
矩阵
乘法
(加权回归)。它们仍然存在,因为我不想改变
矩阵
的大小。
矩阵
是浮点数。 Python (keras/tensorflow?)以不同的方式处理这些
乘法
,并显著加快过程,或者它将花费类似的时间,使这种掩蔽毫无意义?
浏览 46
提问于2019-03-13
得票数 0
2
回答
用向量将
矩阵
的行相乘(低水平
优化
)?
c++
、
optimization
、
64-bit
、
intel-mkl
、
avx2
我正在
优化
一个函数,我想摆脱慢速循环。我在寻找一种更快的方法,把
矩阵
的每一行乘以一个向量。例如:我有一个
矩阵
,它有1024列和20行,还有一个长度为1024的向量。因此,我想要
矩阵
1024x20,其中每一行乘以向量。 我现在所做的是在
矩阵
行上的for循环中迭代,并使用逐元素执行当前
矩阵
行和向量的元素
乘法
。有什么办法可以改进吗?问题是复制,但对于具有可能的低级别
优化
的C++和MKL,而不是对于R。
浏览 6
提问于2017-09-23
得票数 2
1
回答
优化
矩阵
乘法
matrix-multiplication
稠密对称
矩阵
M (nxn) (实际上是一个逻辑
矩阵
,其中条目为0或1) 给定s,我想得到x= Sum(v1 * v2^T) .* E/s谢谢。
浏览 3
提问于2013-01-29
得票数 0
1
回答
AffineTransform是如何工作的?
java
、
swing
、
concatenation
、
transformation
在定义运算符时,
矩阵
的级联是如何有意义的?当我们处理二维时,为什么会有三维
矩阵
?我觉得问这个问题真的很愚蠢,但我对向量分析和代数很熟悉,但我缺乏这方面的任何信息。为什么不只是将变换或缩放
矩阵
相乘,然后作为运算符应用到坐标上呢? 我正试图在我已经可以用鼠标翻译的网格上做一个缩放鼠标功能,但是有两天我做不到。
浏览 1
提问于2014-09-09
得票数 0
1
回答
矩阵
乘法
优化
c++
、
eigen
我正在对相当大的
矩阵
执行一系列
矩阵
乘法
。运行所有这些操作需要很长时间,我需要我的程序在一个大循环中执行此操作。我想知道有没有人有什么办法来加速这个过程?我使用的是TMatrix内置的ROOT-cern类,但是执行
矩阵
运算的速度非常慢。我使用Eigen建立了一些对角
矩阵
,希望它能以更
优化
的方式处理
乘法
运算。可能是这样,但我看不出性能上的区别。
浏览 10
提问于2019-05-15
得票数 4
回答已采纳
1
回答
动态规划-最优断点
algorithm
、
dynamic
、
binary-tree
、
binary-search-tree
、
matrix-multiplication
我了解到,利用动态规划,
矩阵
链
乘法
问题可以用n^3次求解,而对于最优二叉树问题,我们也可以得到n^3次,但是我们可以将它
优化
到n^2,为什么呢?这是因为在
矩阵
乘法
问题中,链M(i,n)的最优断点可能大于链M(i+1,n)的最优断点。有人能帮我理解这一点吗?为什么在
矩阵
乘法
问题上是这样,而在最优二叉树问题中却不是这样呢? 谢谢
浏览 1
提问于2016-03-23
得票数 0
回答已采纳
1
回答
为什么GPU在处理深度学习时比CPUS更能发挥作用?
machine-learning
、
tensorflow
、
gpu
、
deep-learning
、
cpu
在大多数情况下,我在处理深度学习中的任何执行部分时都会碰到GPU。
浏览 6
提问于2017-03-04
得票数 1
回答已采纳
1
回答
MKL是否为主要订单
优化
cblas?
c
、
algorithm
、
matrix
、
blas
、
intel-mkl
我正在使用mkl cblas_dgemm,目前它与CblasRowMajor、CblasNoTrans、CblasNotrans一起用于我的
矩阵
。我很想知道,如果我链接到cblas_dgemm,那么切换
矩阵
的顺序是否会对mkl算法产生任何影响。mkl是否足够聪明,能够在幕后做一些我想做的事情来
优化
矩阵
乘法
?如果没有,用mkl执行
矩阵
乘法
的最佳方法是什么?
浏览 5
提问于2015-09-07
得票数 7
回答已采纳
1
回答
BLAS如何结合
矩阵
链
乘法
优化
language-agnostic
、
blas
BLAS (基本线性代数子程序)提供了许多其他编程语言,比如我使用的Matlab,它有快速的例程来做
矩阵
乘法
之类的事情。 例如,假设A是10×30
矩阵
,B是30×5
矩阵
,C是5×60
矩阵
。本文接着讨论了这种
乘法
的最优顺序的求解方法。我的问题是,这些
优化
程序中是否有在BLAS中使用过?如果没有,如果在Matlab这样的程序中明确定义
矩阵
乘法</e
浏览 7
提问于2016-05-12
得票数 4
5
回答
可以在运行时
优化
浮点乘以零吗?
c++
、
c
、
optimization
、
floating-point
、
multiplication
我正在写一个算法来求一个nxn
矩阵
的逆。让我们以3x3
矩阵
的具体情况为例。 当您手动反转
矩阵
时,通常会查找包含一个或多个零的行/列,以使行列式计算速度更快,因为它消除了您需要计算的项。由于编译器无法知道currentElement在编译时将为零,因此无法将其
优化
为类似于float term = 0;的值,因此将在运行时执行浮点
乘法
。我的问题是,这些零值是否会使浮点
乘法
更快,或者无论currentElement的值是多少,
乘法
都会花费相同的时间吗?如果没有在运行
浏览 2
提问于2013-03-05
得票数 3
回答已采纳
1
回答
不是线性代数的O(n^2)和O(n^3)算法的列表?
algorithm
、
linear-algebra
、
blas
我已经阅读了很多关于
矩阵
向量
乘法
( )和
矩阵
矩阵
乘法
(BLAS3)性能
优化
的文章。我想考虑这些
优化
是否/如何适用于O(n^2)和O(n^3)算法,这些算法不能清晰地简化为稠密或稀疏线性代数。
浏览 0
提问于2012-09-18
得票数 1
回答已采纳
2
回答
为什么用浮点
矩阵
乘法
执行浮点数比用int乘整数更快?
c++
、
numpy
、
matrix
、
eigen
、
avx
有两个int
矩阵
A和B,有超过1000行和10K列,我通常需要将它们转换为浮动
矩阵
以获得加速比(4x或更多)。 我想知道为什么会这样?我意识到在浮点
矩阵
乘法
中存在大量的
优化
和矢量化,如AVX等。为什么在
矩阵
代数库(如Numpy或Eigen )下面没有一个启发式的方法来捕捉这一点,并像浮点一样更快地执行整数
矩阵
乘法
?关于接受的答案:虽然@sascha的答案非常有用,但@chatz的答案是int乘
乘法
速度慢的实际原因,不管是否存在BLAS
浏览 11
提问于2017-07-28
得票数 26
回答已采纳
1
回答
cBlas性能+速度
c++
、
c
、
blas
我使用了cBLAS并做了一些速度测试,我对结果感到惊讶:#include <stdlib.h>#include <GL/glfw.h> matrizr[0] = (matriz1[0]*matriz2[0])+(matriz1[4]*matriz2[1]) +(matriz1[8]*matriz2[2]) +
浏览 2
提问于2013-09-16
得票数 3
回答已采纳
1
回答
C或GLSL中的乘积
矩阵
?
c
、
opengl
、
matrix
、
gpu
、
matrix-multiplication
我有一个OpenGL程序,它可以每秒完成相当多的
矩阵
乘法
。它们将是4x4
矩阵
和128个字节。我知道GPU通常更面向并行,并且可能会针对这类东西进行
优化
。让CPU执行
乘法
或我的GPU会更快吗?
浏览 2
提问于2015-10-12
得票数 3
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
实时音视频
云点播
活动推荐
运营活动
广告
关闭
领券