理论上,让我们假设我们要对3D同质(4x4)变换矩阵的每个不同组合(平移、旋转、缩放)的矩阵乘法进行硬编码,然后对这些(平移-旋转、平移-缩放、缩放-旋转)的每个可能的结果进行硬编码。假设我们像这样处理矩阵乘法,每个矩阵类型组合都有一个不同的函数,其中每个矩阵都有一个额外的变量( type ),并且使用的特定函数是在运行时确定的(使用函数指针数组)。如果我们应用这种矩阵乘法,理论上它会比基本
我正在比较blas和cublas,我得到了一些令人兴奋的结果。我使用的cpu是Intel(R) Xeon(R) CPU E5-2680 v2 at 2.8 GHz,我在越来越大的矩阵上运行与cblas_dgemm的矩阵乘法。时钟速度是0.71 GHz,我用cublasDgemm进行矩阵乘法。
我做了一次运行时分析,并表明对于大型矩阵操作,K40比K80更快,这与我所期望的差不多。我向您展示了K40比