官方文档英文
pytorch-operator-registration-2025
Operator Registration — PyTorch accelerator documentation
算子集合、Dispatch Key、注册方式、支持状态查询与故障排查段落;没有逐个核对全部注册 API 或后端实现。
用于核对框架层操作、后端 dispatch 与设备 kernel 实现的区别;文档称新加速器集成的一项基础工作是支持高性能算子。
打开原始来源一题一页 · 运行机制 · 也叫 operator、op
大模型的计算被拆成一个个基本动作:矩阵相乘、求和、归一化、注意力。每个动作叫一个算子,芯片上必须有对应实现才能跑。
此刻在看:静态解释,这一页的 5 个部分都是这一种。
主张依据 3 类:官方文档、本站实验、编辑解释。
核实状态:这一页没有需要核实的结论,所以这一维是空的。
表示此刻展示方式,不是准确性等级。
可多选,每种都有实际引用;「本站实验」需有记录。
附范围、时间及必要原因,不等于全页绝对正确。
这一页没有需要核实的结论,所以这一维是空的——不会因为它挂着论文就替它标一个「已核对」。
「矩阵相乘」就是一个算子,模型每过一层都要做好几次。芯片上没有它的实现,这个模型就跑不起来。
因为它是芯片和模型之间的最小单位。谈「某块国产芯片支持不支持某个模型」,具体到工程上,就是在问:这个模型用到的算子,这块芯片的软件层里有没有、快不快。
数量级可以自己量一下。本站第 3 级那个 KV 缓存脚本只有 2 层、维度 32,跑 40 个位置就要 6,507,520 次乘加(分母写在那一页,只数 Q/K/V 投影与注意力这四项)。真实模型是几十层、上千维,这些乘加全都要落到某个算子的实现上。
一种是真的没实现,跑起来直接报错说这个算子不支持。这种问题明确,补上就行。
另一种更麻烦:有实现,但很慢。模型能跑通,速度只有预期的几分之一。这时候你看不到任何报错,只能靠逐层测时间去找是哪个算子拖后腿。
pytorch-operator-registration-2025
算子集合、Dispatch Key、注册方式、支持状态查询与故障排查段落;没有逐个核对全部注册 API 或后端实现。
用于核对框架层操作、后端 dispatch 与设备 kernel 实现的区别;文档称新加速器集成的一项基础工作是支持高性能算子。
打开原始来源