具身智能新手名词表English

算子

Operator / Kernel进阶

神经网络里的基本计算单元,如矩阵乘、卷积、Softmax 及其硬件实现

算子是深度学习框架中最小的计算操作,例如矩阵乘法、卷积、归一化、Softmax。一个模型的前向计算就是一张由算子连成的计算图。kernel(核函数)指某个算子在具体硬件上的实现代码,比如在 GPU 上运行的 CUDA kernel。模型推理快不快,很大程度取决于这些 kernel 写得好不好,以及能否把多个小算子「融合」成一个 kernel 以减少显存读写。TensorRT、torch.compile 做的主要就是算子融合和挑选最快的 kernel;国产芯片适配模型时说的「算子支持」,指该硬件是否有对应实现。

例子FlashAttention 把注意力里的矩阵乘、Softmax、再乘值等多步融合进一个 CUDA kernel,显著减少显存访问,加快了长序列推理。

也叫
kernel、核函数、CUDA kernel
相关
CUDA、FlashAttention、TensorRT、torch.compile、昇腾 CANN、CUDA Graph
来源
PyTorch 文档:Custom C++ and CUDA Operators

在完整名词表里查看 →