Skip to content

GEMM, MoE & Quantization

20 ops, 251 workloads — Linear Algebra (GEMM) 18 · Quantization 2.

One table per op, one row per workload. Ratio is the baseline device time divided by ours in the same measurement regime, so green is faster than it, plain is level with it, red is slower. Times are in ms. How these numbers are taken.

Linear Algebra (GEMM)

GemmFp8Fwd

dtype=fp8e4m3

  • W1m=128n=7168k=2048scale_mode=block128ds-v3-decode-down-block128
  • W2m=128n=7168k=2048scale_mode=per_tensords-v3-decode-down-per-tensor
  • W3m=128n=2112k=7168scale_mode=block128ds-v3-decode-gate-up-block128
  • W5m=128n=2112k=7168scale_mode=per_tensords-v3-decode-gate-up-per-tensor
  • W6m=4096n=4096k=7168scale_mode=block128ds-v3-prefill-attn-proj-block128
  • W7m=4096n=7168k=2048scale_mode=block128ds-v3-prefill-down-block128
  • W8m=4096n=7168k=2048scale_mode=per_tensords-v3-prefill-down-per-tensor
  • W9m=4096n=2112k=7168scale_mode=block128ds-v3-prefill-gate-up-block128
  • W10m=4096n=2112k=7168scale_mode=per_tensords-v3-prefill-gate-up-per-tensor
  • W11m=1n=7168k=2048scale_mode=block128gemv-down-m1-block128
  • W12m=1n=7168k=2048scale_mode=per_tensorgemv-down-m1-per-tensor
  • W13m=4096n=7168k=16384scale_mode=block128k-dominant-7168x16384-block128
  • W14m=8n=7168k=2048scale_mode=per_tensorsmall-batch-down-m8-per-tensor
  • W15m=4096n=24576k=1536scale_mode=block128wide-n-24576-block128

bias: [N], bf16

dtype=fp8e4m3N=2112m=128n=2112k=7168scale_mode=per_tensor

  • W4ds-v3-decode-gate-up-per-tensor-bias
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W13.22×0.2166torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library ⓘ
0.6985
1.0308
···
W25.11×0.1100torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library ⓘ
0.5644
0.6743
···
W33.06×0.2300torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library ⓘ
0.7031
1.0401
···
W45.86×0.1308torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis ⓘ
0.7050
0.7047
0.7046
···
W55.30×0.1085torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library ⓘ
0.5749
0.7051
···
W64.53×1.3802torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library ⓘ
6.2960
6.2969
6.2966
···
W71.80×0.7394torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library ⓘ
1.3319
1.7572
1.7561
···
W81.92×0.5847torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library ⓘ
1.1205
1.2816
···
W93.39×0.9463torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library ⓘ
3.2060
4.0818
···
W104.57×0.6191torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library ⓘ
2.8299
3.2950
···
W114.63×0.2034torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis ⓘ
0.9085
0.9089
0.9083
···
W126.85×0.0968torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis ⓘ
0.6019
0.6010
0.6009
···
W133.34×6.8591torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis ⓘ
22.8992
22.9017
22.8991
···
W147.14×0.0963torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis ⓘ
0.6411
0.6416
0.6410
···
W152.34×2.2824torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library ⓘ
5.3496
5.3502
5.3505
···

AllGatherGemmFwd

  • W1dtype=bf16k=2048m=128n=7168trans_b=trueds-v3-decode-down@rank0
  • W2dtype=bf16k=2048m=128n=7168trans_b=trueds-v3-decode-down@rank1
  • W3dtype=bf16k=7168m=128n=2112trans_b=trueds-v3-decode-gate-up@rank0
  • W4dtype=bf16k=7168m=128n=2112trans_b=trueds-v3-decode-gate-up@rank1
  • W5dtype=bf16k=7168m=4096n=4096trans_b=trueds-v3-prefill-attn-proj@rank0
  • W6dtype=f16k=7168m=4096n=4096trans_b=trueds-v3-prefill-attn-proj@rank0
  • W7dtype=bf16k=7168m=4096n=4096trans_b=trueds-v3-prefill-attn-proj@rank1
  • W8dtype=f16k=7168m=4096n=4096trans_b=trueds-v3-prefill-attn-proj@rank1
  • W9dtype=bf16k=2048m=4096n=7168trans_b=trueds-v3-prefill-down@rank0
  • W10dtype=bf16k=2048m=4096n=7168trans_b=trueds-v3-prefill-down@rank1
  • W11dtype=bf16k=7168m=4096n=2112trans_b=trueds-v3-prefill-gate-up@rank0
  • W12dtype=bf16k=7168m=4096n=2112trans_b=trueds-v3-prefill-gate-up@rank1
  • W13dtype=bf16k=16384m=4096n=7168trans_b=truek-dominant-7168x16384@rank0
  • W14dtype=bf16k=16384m=4096n=7168trans_b=truek-dominant-7168x16384@rank1
  • W15dtype=bf16k=7168m=16n=4096trans_b=truemid-m16-attn@rank0
  • W16dtype=bf16k=7168m=16n=4096trans_b=truemid-m16-attn@rank1
  • W17dtype=bf16k=7168m=32n=4096trans_b=truemid-m32-attn@rank0
  • W18dtype=bf16k=7168m=32n=4096trans_b=truemid-m32-attn@rank1
  • W19dtype=bf16k=2048m=64n=7168trans_b=truemid-m64-down@rank0
  • W20dtype=bf16k=2048m=64n=7168trans_b=truemid-m64-down@rank1
  • W21dtype=bf16k=7168m=96n=2112trans_b=truemid-m96-gate-up@rank0
  • W22dtype=bf16k=7168m=96n=2112trans_b=truemid-m96-gate-up@rank1
  • W23dtype=bf16k=1024m=1024n=1024square-1k-nn@rank0
  • W24dtype=f16k=1024m=1024n=1024square-1k-nn@rank0
  • W25dtype=bf16k=1024m=1024n=1024square-1k-nn@rank1
  • W26dtype=f16k=1024m=1024n=1024square-1k-nn@rank1
  • W27dtype=bf16k=1536m=4096n=24576trans_b=truewide-n-24576@rank0
  • W28dtype=bf16k=1536m=4096n=24576trans_b=truewide-n-24576@rank1
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name ms TFLOP/s of ceiling by
W11.93×0.0975Torch-NPU semantic implementation0.1886···
W21.92×0.1021Torch-NPU semantic implementation0.1963···
W31.57×0.1379Torch-NPU semantic implementation0.2162···
W41.56×0.1420Torch-NPU semantic implementation0.2220···
W51.94×2.4007Torch-NPU semantic implementation4.6677···
W61.95×2.3924Torch-NPU semantic implementation4.6666···
W71.96×2.4015Torch-NPU semantic implementation4.7040···
W81.96×2.3937Torch-NPU semantic implementation4.6899···
W92.07×0.9513Torch-NPU semantic implementation1.9730···
W102.09×0.9426Torch-NPU semantic implementation1.9680···
W111.62×2.0751Torch-NPU semantic implementation3.3533···
W121.61×2.0659Torch-NPU semantic implementation3.3201···
W132.03×8.2814Torch-NPU semantic implementation16.7741···
W142.01×8.3184Torch-NPU semantic implementation16.7129···
W152.07×0.1389Torch-NPU semantic implementation0.2869···
W162.18×0.1323Torch-NPU semantic implementation0.2886···
W171.73×0.1512Torch-NPU semantic implementation0.2619···
W181.70×0.1560Torch-NPU semantic implementation0.2657···
W191.82×0.0902Torch-NPU semantic implementation0.1640···
W201.78×0.0895Torch-NPU semantic implementation0.1595···
W211.60×0.1393Torch-NPU semantic implementation0.2226···
W221.58×0.1368Torch-NPU semantic implementation0.2166···
W231.49×0.1123Torch-NPU semantic implementation0.1678···
W241.45×0.1251Torch-NPU semantic implementation0.1814···
W251.55×0.1027Torch-NPU semantic implementation0.1593···
W261.58×0.1032Torch-NPU semantic implementation0.1631···
W272.87×1.6191Torch-NPU semantic implementation4.6493···
W282.87×1.6142Torch-NPU semantic implementation4.6391···

GemmBiasReluFwd

  • W1dtype=bf16m=128n=7168k=2048ds-v3-decode-down
  • W2dtype=bf16m=128n=2112k=7168ds-v3-decode-gate-up
  • W3dtype=bf16m=4096n=4096k=7168ds-v3-prefill-attn-proj
  • W4dtype=f16m=4096n=4096k=7168ds-v3-prefill-attn-proj
  • W5dtype=bf16m=4096n=7168k=2048ds-v3-prefill-down
  • W6dtype=bf16m=4096n=2112k=7168ds-v3-prefill-gate-up
  • W7dtype=bf16m=4096n=7168k=16384k-dominant-7168x16384
  • W8dtype=bf16m=16n=4096k=7168mid-m16-attn
  • W9dtype=bf16m=32n=4096k=7168mid-m32-attn
  • W10dtype=bf16m=64n=7168k=2048mid-m64-down
  • W11dtype=bf16m=96n=2112k=7168mid-m96-gate-up
  • W12dtype=bf16m=1024n=1024k=1024trans_b=falsesquare-1k-nn
  • W13dtype=f16m=1024n=1024k=1024trans_b=falsesquare-1k-nn
  • W14dtype=bf16m=4096n=24576k=1536wide-n-24576
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W11.13×0.0757torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0855
0.0664
0.0643
···
W20.96×0.0813torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0783
0.0693
0.0660
···
W31.02×0.8664torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.8825
0.8825
0.8821
···
W41.00×0.8652torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.8552
0.8524
0.8545
···
W50.88×0.5421torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library
0.4699
0.4703
0.4703
···
W61.06×0.5220torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library
0.5449
0.5461
0.5451
···
W70.75×4.7685torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
3.5644
3.5620
3.5609
···
W80.99×0.1098torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library
0.1047
0.1046
0.1052
···
W91.02×0.1125torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library
0.1081
0.1085
0.1082
···
W101.11×0.0722torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0600
0.0599
0.0599
···
W111.05×0.0803torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0641
0.0640
0.0641
···
W121.04×0.0375torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0395
0.0272
0.0266
···
W130.89×0.0408torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0367
0.0248
0.0253
···
W140.94×1.6584torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
1.5746
1.5749
1.5733
···

GemmBiasGeluFwd

  • W1dtype=bf16m=128n=7168k=2048ds-v3-decode-down
  • W2dtype=bf16m=128n=2112k=7168ds-v3-decode-gate-up
  • W3dtype=bf16m=4096n=4096k=7168ds-v3-prefill-attn-proj
  • W4dtype=f16m=4096n=4096k=7168ds-v3-prefill-attn-proj
  • W5dtype=bf16m=4096n=7168k=2048ds-v3-prefill-down
  • W6dtype=bf16m=4096n=2112k=7168ds-v3-prefill-gate-up
  • W7dtype=bf16m=4096n=7168k=16384k-dominant-7168x16384
  • W8dtype=bf16m=16n=4096k=7168mid-m16-attn
  • W9dtype=bf16m=32n=4096k=7168mid-m32-attn
  • W10dtype=bf16m=64n=7168k=2048mid-m64-down
  • W11dtype=bf16m=96n=2112k=7168mid-m96-gate-up
  • W12dtype=bf16m=1024n=1024k=1024trans_b=falsesquare-1k-nn
  • W13dtype=f16m=1024n=1024k=1024trans_b=falsesquare-1k-nn
  • W14dtype=bf16m=4096n=24576k=1536wide-n-24576
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W10.99×0.0860torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0859
0.0660
0.0661
···
W20.97×0.0818torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0795
0.0685
0.0680
···
W30.98×0.9435torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library
0.9164
0.9164
0.9165
···
W40.96×0.9353torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library
0.8981
0.8942
0.8982
···
W50.81×0.6883torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library
0.5459
0.5459
0.5463
···
W61.01×0.5693torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.5640
0.5639
0.5640
···
W70.74×4.9324torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library
3.6449
3.6480
3.6484
···
W81.02×0.1134torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.1055
0.1057
0.1054
···
W91.01×0.1126torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library
0.1098
0.1092
0.1099
···
W100.94×0.0798torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0595
0.0594
0.0595
···
W110.93×0.0843torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0654
0.0650
0.0650
···
W120.86×0.0484torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0418
0.0302
0.0304
···
W130.84×0.0465torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0398
0.0300
0.0288
···
W140.77×2.0700torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
1.6100
1.6104
1.6074
···

GemmBiasFwd

  • W1dtype=bf16m=128n=7168k=2048ds-v3-decode-down
  • W2dtype=bf16m=128n=2112k=7168ds-v3-decode-gate-up
  • W3dtype=bf16m=4096n=4096k=7168ds-v3-prefill-attn-proj
  • W4dtype=f16m=4096n=4096k=7168ds-v3-prefill-attn-proj
  • W5dtype=bf16m=4096n=7168k=2048ds-v3-prefill-down
  • W6dtype=bf16m=4096n=2112k=7168ds-v3-prefill-gate-up
  • W7dtype=bf16m=4096n=7168k=16384k-dominant-7168x16384
  • W8dtype=bf16m=16n=4096k=7168mid-m16-attn
  • W9dtype=bf16m=32n=4096k=7168mid-m32-attn
  • W10dtype=bf16m=64n=7168k=2048mid-m64-down
  • W11dtype=bf16m=96n=2112k=7168mid-m96-gate-up
  • W12dtype=bf16m=1024n=1024k=1024trans_b=falsesquare-1k-nn
  • W13dtype=f16m=1024n=1024k=1024trans_b=falsesquare-1k-nn
  • W14dtype=bf16m=4096n=24576k=1536wide-n-24576
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W11.02×0.0789torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0810
0.0592
0.0633
···
W20.89×0.0824torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0709
0.0625
0.0656
···
W31.01×0.8590torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.8554
0.8548
0.8542
···
W41.00×0.8508torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.8489
0.8466
0.8485
···
W50.84×0.5411torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library
0.4534
0.4540
0.4540
···
W61.04×0.5171torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library
0.5327
0.5335
0.5331
···
W70.70×5.0534torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
3.5349
3.5321
3.5321
···
W80.99×0.1065torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0995
0.0995
0.0994
···
W91.03×0.1095torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.1074
0.1075
0.1074
···
W100.96×0.0712torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0568
0.0568
0.0568
···
W110.81×0.0865torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0628
0.0630
0.0625
···
W120.78×0.0381torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0290
0.0185
0.0236
···
W130.74×0.0386torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
0.0290
0.0184
0.0232
···
W140.73×1.6672torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis
1.2080
1.2071
1.2064
···

DualGemmFwd

  • W1dtype=bf16m=128n=7168k=2048trans_b=trueds-v3-decode-down
  • W2dtype=bf16m=128n=2112k=7168trans_b=trueds-v3-decode-gate-up
  • W3dtype=bf16m=4096n=4096k=7168trans_b=trueds-v3-prefill-attn-proj
  • W4dtype=f16m=4096n=4096k=7168trans_b=trueds-v3-prefill-attn-proj
  • W5dtype=bf16m=4096n=7168k=2048trans_b=trueds-v3-prefill-down
  • W6dtype=bf16m=4096n=2112k=7168trans_b=trueds-v3-prefill-gate-up
  • W7dtype=bf16m=4096n=7168k=16384trans_b=truek-dominant-7168x16384
  • W8dtype=bf16m=16n=4096k=7168trans_b=truemid-m16-attn
  • W9dtype=bf16m=32n=4096k=7168trans_b=truemid-m32-attn
  • W10dtype=bf16m=64n=7168k=2048trans_b=truemid-m64-down
  • W11dtype=bf16m=96n=2112k=7168trans_b=truemid-m96-gate-up
  • W12dtype=bf16m=1024n=1024k=1024square-1k-nn
  • W13dtype=f16m=1024n=1024k=1024square-1k-nn
  • W14dtype=bf16m=4096n=24576k=1536trans_b=truewide-n-24576
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W10.87×0.1237torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.1074
0.1046
···
W20.81×0.1401torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.1130
0.1110
···
W31.01×1.6120torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
1.6186
1.6170
···
W41.01×1.6231torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
1.6374
1.6320
···
W50.87×0.9234torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.8027
0.7984
···
W61.02×0.9414torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.9561
0.9766
···
W70.73×9.3761torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
6.8450
6.8978
···
W80.92×0.2335torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.2132
0.2140
···
W90.83×0.2385torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.1945
0.1943
···
W100.88×0.1128torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0985
0.0985
···
W110.76×0.1497torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.1120
0.1121
···
W120.73×0.0462torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0340
0.0315
···
W130.71×0.0473torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0338
0.0312
···
W140.78×2.5046torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
1.9526
1.9511
···

StridedBatchedGemmFwd

  • W1dtype=bf16b=64m=128n=128k=2048mha-decode-b64-pv
  • W2dtype=f16b=64m=128n=128k=2048mha-decode-b64-pv
  • W3dtype=bf16b=64m=128n=2048k=128mha-decode-b64-qk
  • W4dtype=f16b=64m=128n=2048k=128mha-decode-b64-qk
  • W5dtype=bf16b=128m=512n=512k=2048moe-prefill-b128
  • W6dtype=bf16b=8m=128n=128k=128small-b8-128
  • W7dtype=f16b=8m=128n=128k=128small-b8-128
  • W8dtype=bf16b=16m=512n=512k=512square-b16-512
  • W9dtype=f16b=16m=512n=512k=512square-b16-512
  • W10dtype=bf16b=32m=256n=256k=256square-b32-256
  • W11dtype=f16b=32m=256n=256k=256square-b32-256
  • W12dtype=bf16b=4m=4096n=4096k=4096square-b4-4k
  • W13dtype=bf16b=8m=1024n=1024k=1024square-b8-1k
  • W14dtype=f16b=8m=1024n=1024k=1024square-b8-1k
  • W15dtype=bf16b=8m=2048n=2048k=2048square-b8-2k
  • W16dtype=f16b=8m=2048n=2048k=2048square-b8-2k
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W10.73×0.1310torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.0950
0.0953
···
W20.75×0.1285torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0949
0.0948
···
W30.70×0.0885torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0605
0.0605
···
W40.69×0.0895torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0610
0.0610
···
W50.97×0.8046torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.7837
0.7840
···
W61.02×0.0100torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0103
0.00575
···
W71.08×0.00975torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0105
0.00575
···
W80.75×0.0498torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0370
0.0355
···
W90.77×0.0493torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0377
0.0360
···
W100.65×0.0275torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0177
0.0173
···
W110.65×0.0283torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0192
0.0168
···
W121.00×1.8698torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
1.8770
1.8784
···
W130.84×0.1096torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0915
0.0899
···
W140.83×0.1095torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0912
0.0907
···
W150.91×0.5674torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.5180
0.5174
···
W161.00×0.5647torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.5646
0.5653
···

GemmSplitKFwd

  • W1dtype=bf16m=128n=7168k=2048ds-v3-decode-down
  • W2dtype=bf16m=128n=2112k=7168ds-v3-decode-gate-up
  • W3dtype=bf16m=4096n=4096k=7168ds-v3-prefill-attn-proj
  • W4dtype=f16m=4096n=4096k=7168ds-v3-prefill-attn-proj
  • W5dtype=bf16m=4096n=7168k=2048ds-v3-prefill-down
  • W6dtype=bf16m=4096n=2112k=7168ds-v3-prefill-gate-up
  • W7dtype=bf16m=4096n=7168k=16384k-dominant-7168x16384
  • W8dtype=bf16m=16n=4096k=7168mid-m16-attn
  • W9dtype=bf16m=32n=4096k=7168mid-m32-attn
  • W10dtype=bf16m=64n=7168k=2048mid-m64-down
  • W11dtype=bf16m=96n=2112k=7168mid-m96-gate-up
  • W12dtype=bf16m=1024n=1024k=1024trans_b=falsesquare-1k-nn
  • W13dtype=f16m=1024n=1024k=1024trans_b=falsesquare-1k-nn
  • W14dtype=bf16m=4096n=24576k=1536wide-n-24576
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W10.81×0.0661torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0540
0.0525
···
W20.80×0.0775torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0620
0.0595
···
W31.01×0.8244torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.8304
0.8249
···
W41.00×0.8383torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.8454
0.8387
···
W50.85×0.4841torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.4113
0.4091
···
W61.05×0.4938torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.5186
0.5138
···
W70.72×4.8048torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
3.4614
3.4606
···
W80.85×0.1128torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.0953
0.0956
···
W90.90×0.1139torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.1006
0.1005
···
W100.81×0.0648torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0515
0.0515
···
W110.76×0.0772torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0565
0.0565
···
W120.62×0.0295torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0185
0.0168
···
W130.65×0.0280torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0182
0.0170
···
W140.78×1.2536torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.9785
0.9786
···

GemmFwd

  • W1dtype=bf16m=128n=7168k=2048ds-v3-decode-down
  • W2dtype=bf16m=128n=2112k=7168ds-v3-decode-gate-up
  • W3dtype=bf16m=4096n=4096k=7168ds-v3-prefill-attn-proj
  • W4dtype=f16m=4096n=4096k=7168ds-v3-prefill-attn-proj
  • W5dtype=bf16m=4096n=7168k=2048ds-v3-prefill-down
  • W6dtype=bf16m=4096n=2112k=7168ds-v3-prefill-gate-up
  • W7dtype=bf16m=4096n=7168k=16384k-dominant-7168x16384
  • W8dtype=bf16m=16n=4096k=7168mid-m16-attn
  • W9dtype=bf16m=32n=4096k=7168mid-m32-attn
  • W10dtype=bf16m=64n=7168k=2048mid-m64-down
  • W11dtype=bf16m=96n=2112k=7168mid-m96-gate-up
  • W12dtype=bf16m=1024n=1024k=1024trans_b=falsesquare-1k-nn
  • W13dtype=f16m=1024n=1024k=1024trans_b=falsesquare-1k-nn
  • W14dtype=bf16m=4096n=24576k=1536wide-n-24576
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W10.82×0.0670catlass-r252:r252_gemm open-source ⓘ
ops-nn-gemm:aclnnMm vendor library basis
tilelang-ascend tilelang-ascend ⓘ
torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library ⓘ
0.0565
0.0535
0.1031
0.0558
0.0545
0.0535
···
W20.83×0.0721catlass-r252:r252_gemm open-source ⓘ
ops-nn-gemm:aclnnMm vendor library
tilelang-ascend tilelang-ascend ⓘ
torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis ⓘ
0.0720
0.0575
0.1194
0.0600
0.0576
0.0574
···
W31.02×0.8204catlass-r252:r252_gemm open-source ⓘ
ops-nn-gemm:aclnnMm open-source ⓘ
tilelang-ascend tilelang-ascend ⓘ
torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis ⓘ
0.8364
0.8311
3.1139
0.8310
0.8294
0.8296
···
W41.00×0.8433catlass-r252:r252_gemm open-source ⓘ
ops-nn-gemm:aclnnMm open-source ⓘ
tilelang-ascend tilelang-ascend ⓘ
torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library ⓘ
0.8515
0.8383
3.1155
0.8377
0.8351
0.8379
···
W50.85×0.4728catlass-r252:r252_gemm open-source ⓘ basis
ops-nn-gemm:aclnnMm open-source ⓘ
tilelang-ascend tilelang-ascend ⓘ
torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library ⓘ
0.3954
0.4088
1.5580
0.4089
0.4088
0.4088
···
W60.92×0.4936catlass-r252:r252_gemm open-source ⓘ basis
ops-nn-gemm:aclnnMm open-source ⓘ
tilelang-ascend tilelang-ascend ⓘ
torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library ⓘ
0.4481
0.5140
1.9768
0.5122
0.5121
0.5132
···
W70.75×4.6385catlass-r252:r252_gemm open-source ⓘ
ops-nn-gemm:aclnnMm open-source ⓘ basis
tilelang-ascend tilelang-ascend ⓘ
torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library ⓘ
4.8831
3.4577
13.6544
3.4600
3.4590
3.4599
···
W80.92×0.1035catlass-r252:r252_gemm open-source ⓘ
ops-nn-gemm:aclnnMm vendor library
tilelang-ascend tilelang-ascend ⓘ
torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library ⓘ
0.1008
0.0943
0.1630
0.0940
0.0941
0.0943
···
W90.92×0.1128catlass-r252:r252_gemm open-source ⓘ
ops-nn-gemm:aclnnMm vendor library
tilelang-ascend tilelang-ascend ⓘ
torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis ⓘ
0.1106
0.1015
0.1772
0.1013
0.1015
0.1011
···
W100.80×0.0622catlass-r252:r252_gemm open-source ⓘ
ops-nn-gemm:aclnnMm vendor library basis
tilelang-ascend tilelang-ascend ⓘ
torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library ⓘ
0.0515
0.0489
0.0823
0.0490
0.0489
0.0490
···
W110.76×0.0747catlass-r252:r252_gemm open-source ⓘ
ops-nn-gemm:aclnnMm vendor library
tilelang-ascend tilelang-ascend ⓘ
torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library basis ⓘ
0.0705
0.0548
0.1030
0.0548
0.0545
0.0545
···
W120.63×0.0285catlass-r252:r252_gemm open-source ⓘ
ops-nn-gemm:aclnnMm vendor library basis
tilelang-ascend tilelang-ascend ⓘ
torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library
tilelang-mlir-ascend:example_gemm tilelang-mlir-ascend ⓘ eager · n=5 ⓘ
0.0187
0.0160
0.0173
0.0177
0.0168
0.0160
0.0449
···
W130.62×0.0293catlass:catlass_gemm_fp16 open-source ⓘ
catlass-r252:r252_gemm open-source ⓘ
ops-nn-gemm:aclnnMm vendor library basis
tilelang-ascend tilelang-ascend ⓘ
torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library
tilelang-mlir-ascend:example_gemm tilelang-mlir-ascend ⓘ eager · n=5 ⓘ
0.0192
0.0187
0.0164
0.0175
0.0182
0.0165
0.0165
0.0468
···
W140.78×1.2525catlass-r252:r252_gemm open-source ⓘ
ops-nn-gemm:aclnnMm open-source ⓘ basis
tilelang-ascend tilelang-ascend ⓘ
torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library ⓘ
1.0828
0.9759
4.0015
0.9764
0.9772
0.9774
···

GemmReduceScatterFwd

  • W1dtype=bf16k=2048m=128n=7168trans_b=trueds-v3-decode-down@rank0
  • W2dtype=bf16k=2048m=128n=7168trans_b=trueds-v3-decode-down@rank1
  • W3dtype=bf16k=7168m=128n=2112trans_b=trueds-v3-decode-gate-up@rank0
  • W4dtype=bf16k=7168m=128n=2112trans_b=trueds-v3-decode-gate-up@rank1
  • W5dtype=bf16k=7168m=4096n=4096trans_b=trueds-v3-prefill-attn-proj@rank0
  • W6dtype=f16k=7168m=4096n=4096trans_b=trueds-v3-prefill-attn-proj@rank0
  • W7dtype=bf16k=7168m=4096n=4096trans_b=trueds-v3-prefill-attn-proj@rank1
  • W8dtype=f16k=7168m=4096n=4096trans_b=trueds-v3-prefill-attn-proj@rank1
  • W9dtype=bf16k=2048m=4096n=7168trans_b=trueds-v3-prefill-down@rank0
  • W10dtype=bf16k=2048m=4096n=7168trans_b=trueds-v3-prefill-down@rank1
  • W11dtype=bf16k=7168m=4096n=2112trans_b=trueds-v3-prefill-gate-up@rank0
  • W12dtype=bf16k=7168m=4096n=2112trans_b=trueds-v3-prefill-gate-up@rank1
  • W13dtype=bf16k=16384m=4096n=7168trans_b=truek-dominant-7168x16384@rank0
  • W14dtype=bf16k=16384m=4096n=7168trans_b=truek-dominant-7168x16384@rank1
  • W15dtype=bf16k=7168m=16n=4096trans_b=truemid-m16-attn@rank0
  • W16dtype=bf16k=7168m=16n=4096trans_b=truemid-m16-attn@rank1
  • W17dtype=bf16k=7168m=32n=4096trans_b=truemid-m32-attn@rank0
  • W18dtype=bf16k=7168m=32n=4096trans_b=truemid-m32-attn@rank1
  • W19dtype=bf16k=2048m=64n=7168trans_b=truemid-m64-down@rank0
  • W20dtype=bf16k=2048m=64n=7168trans_b=truemid-m64-down@rank1
  • W21dtype=bf16k=7168m=96n=2112trans_b=truemid-m96-gate-up@rank0
  • W22dtype=bf16k=7168m=96n=2112trans_b=truemid-m96-gate-up@rank1
  • W23dtype=bf16k=1024m=1024n=1024square-1k-nn@rank0
  • W24dtype=f16k=1024m=1024n=1024square-1k-nn@rank0
  • W25dtype=bf16k=1024m=1024n=1024square-1k-nn@rank1
  • W26dtype=f16k=1024m=1024n=1024square-1k-nn@rank1
  • W27dtype=bf16k=1536m=4096n=24576trans_b=truewide-n-24576@rank0
  • W28dtype=bf16k=1536m=4096n=24576trans_b=truewide-n-24576@rank1
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name ms TFLOP/s of ceiling by
W10.87×0.4290Torch-NPU semantic implementation0.3713···
W20.87×0.4259Torch-NPU semantic implementation0.3686···
W30.60×0.3752Torch-NPU semantic implementation0.2235···
W40.59×0.3794Torch-NPU semantic implementation0.2254···
W50.38×17.6604Torch-NPU semantic implementation6.6771···
W60.38×17.6441Torch-NPU semantic implementation6.6766···
W70.38×17.6571Torch-NPU semantic implementation6.6735···
W80.38×17.6532Torch-NPU semantic implementation6.6738···
W90.69×11.3592Torch-NPU semantic implementation7.8670···
W100.69×11.3441Torch-NPU semantic implementation7.8548···
W110.40×9.0945Torch-NPU semantic implementation3.6114···
W120.40×9.0930Torch-NPU semantic implementation3.6069···
W130.26×73.3225Torch-NPU semantic implementation19.0761···
W140.26×73.2879Torch-NPU semantic implementation19.0469···
W151.35×0.2186Torch-NPU semantic implementation0.2949···
W161.35×0.2171Torch-NPU semantic implementation0.2930···
W171.19×0.2590Torch-NPU semantic implementation0.3079···
W181.20×0.2308Torch-NPU semantic implementation0.2770···
W191.01×0.2522Torch-NPU semantic implementation0.2542···
W201.01×0.2525Torch-NPU semantic implementation0.2549···
W210.67×0.3191Torch-NPU semantic implementation0.2137···
W220.67×0.3197Torch-NPU semantic implementation0.2127···
W230.96×0.3449Torch-NPU semantic implementation0.3295···
W240.96×0.3307Torch-NPU semantic implementation0.3171···
W250.96×0.3270Torch-NPU semantic implementation0.3137···
W260.95×0.3291Torch-NPU semantic implementation0.3135···
W270.80×31.9567Torch-NPU semantic implementation25.6279···
W280.80×31.9584Torch-NPU semantic implementation25.6348···

GroupedGemmFwd

batch_sum=4096batch_count=16n=4096k=4096

  • W1dtype=f16transpose_b=falsenn-batch16-m4096-n4096-k4096
  • W2dtype=bf16nt-batch16-m4096-n4096-k4096
  • W3dtype=f16nt-batch16-m4096-n4096-k4096
  • W4dtype=f16transpose_a=truetranspose_b=falsetn-batch16-m4096-n4096-k4096
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W10.63×1.1623catlass-r252:r252_gmm open-source ⓘ basis
torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library ⓘ
0.7312
1.0529
1.4347
1.0926
···
W20.63×1.1694catlass-r252:r252_gmm open-source ⓘ basis
torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library ⓘ
0.7260
0.9878
1.3709
1.0328
···
W30.63×1.1579catlass-r252:r252_gmm open-source ⓘ basis
torch_compile_aclgraph torch_compile
torch_compile_ge torch_compile
torch_npu eager vendor library ⓘ
0.7200
0.9752
1.3673
1.0191
···
W40.68×2.2741torch_compile_aclgraph torch_compile basis
torch_compile_ge torch_compile
torch_npu eager vendor library ⓘ
1.5355
0.7739
1.5376
···

GemmSparse2to4Fwd

  • W1dtype=bf16m=128n=7168k=2048trans_b=trueds-v3-decode-down
  • W2dtype=bf16m=128n=2112k=7168trans_b=trueds-v3-decode-gate-up
  • W3dtype=bf16m=4096n=4096k=7168trans_b=trueds-v3-prefill-attn-proj
  • W4dtype=f16m=4096n=4096k=7168trans_b=trueds-v3-prefill-attn-proj
  • W5dtype=bf16m=4096n=7168k=2048trans_b=trueds-v3-prefill-down
  • W6dtype=bf16m=4096n=2112k=7168trans_b=trueds-v3-prefill-gate-up
  • W7dtype=bf16m=4096n=7168k=16384trans_b=truek-dominant-7168x16384
  • W8dtype=bf16m=16n=4096k=7168trans_b=truemid-m16-attn
  • W9dtype=bf16m=32n=4096k=7168trans_b=truemid-m32-attn
  • W10dtype=bf16m=64n=7168k=2048trans_b=truemid-m64-down
  • W11dtype=bf16m=96n=2112k=7168trans_b=truemid-m96-gate-up
  • W12dtype=bf16m=1024n=1024k=1024square-1k-nn
  • W13dtype=f16m=1024n=1024k=1024square-1k-nn
  • W14dtype=bf16m=4096n=24576k=1536trans_b=truewide-n-24576
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W10.63×0.3563torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.2205
0.1933
···
W20.28×1.1927torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.3330
0.2950
···
W30.23×36.0448torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
8.2523
8.2260
···
W40.23×36.0423torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
8.2621
8.2255
···
W50.32×9.3550torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
2.9786
2.9536
···
W60.19×35.7067torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
6.9085
6.8755
···
W70.29×85.3295torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
24.6160
24.6036
···
W81.10×0.2732torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.2747
0.2744
···
W90.68×0.4065torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.2626
0.2627
···
W100.85×0.2097torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.1509
0.1507
···
W110.30×0.9061torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.2606
0.2607
···
W120.24×1.1515torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.2747
0.2502
···
W130.24×1.1559torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.2767
0.2505
···
W140.69×7.7070torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
5.3418
5.3405
···

GemmInt8Fwd

  • W1dtype=bf16m=128n=7168k=2048trans_b=trueds-v3-decode-down
  • W2dtype=bf16m=128n=2112k=7168trans_b=trueds-v3-decode-gate-up
  • W3dtype=bf16m=4096n=4096k=7168trans_b=trueds-v3-prefill-attn-proj
  • W4dtype=f16m=4096n=4096k=7168trans_b=trueds-v3-prefill-attn-proj
  • W5dtype=bf16m=4096n=7168k=2048trans_b=trueds-v3-prefill-down
  • W6dtype=bf16m=4096n=2112k=7168trans_b=trueds-v3-prefill-gate-up
  • W7dtype=bf16m=4096n=7168k=16384trans_b=truek-dominant-7168x16384
  • W8dtype=bf16m=16n=4096k=7168trans_b=truemid-m16-attn
  • W9dtype=bf16m=32n=4096k=7168trans_b=truemid-m32-attn
  • W10dtype=bf16m=64n=7168k=2048trans_b=truemid-m64-down
  • W11dtype=bf16m=96n=2112k=7168trans_b=truemid-m96-gate-up
  • W12dtype=bf16m=1024n=1024k=1024square-1k-nn
  • W13dtype=f16m=1024n=1024k=1024square-1k-nn
  • W14dtype=bf16m=4096n=24576k=1536trans_b=truewide-n-24576
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W10.48×0.3344torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.1593
0.1214
···
W20.42×0.3334torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.1396
0.1123
···
W30.19×15.8272torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
3.0452
3.0318
···
W40.19×15.8409torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
3.0438
3.0275
···
W50.19×8.6520torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
1.6146
1.6729
···
W60.21×8.1717torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
1.7127
1.7018
···
W70.21×61.1816torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
12.8299
12.7981
···
W81.19×0.1844torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.2042
0.2045
···
W90.93×0.1983torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.1700
0.1706
···
W100.69×0.1903torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.1036
0.1036
···
W110.51×0.2854torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.1284
0.1281
···
W120.33×0.2530torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0828
0.0646
···
W130.32×0.2500torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0805
0.0648
···
W140.24×22.5699torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
5.3871
5.3886
···

GemmA16W8Fwd

  • W1dtype=bf16m=128n=7168k=2048trans_b=trueds-v3-decode-down
  • W2dtype=bf16m=128n=2112k=7168trans_b=trueds-v3-decode-gate-up
  • W3dtype=bf16m=4096n=4096k=7168trans_b=trueds-v3-prefill-attn-proj
  • W4dtype=f16m=4096n=4096k=7168trans_b=trueds-v3-prefill-attn-proj
  • W5dtype=bf16m=4096n=7168k=2048trans_b=trueds-v3-prefill-down
  • W6dtype=bf16m=4096n=2112k=7168trans_b=trueds-v3-prefill-gate-up
  • W7dtype=bf16m=4096n=7168k=16384trans_b=truek-dominant-7168x16384
  • W8dtype=bf16m=16n=4096k=7168trans_b=truemid-m16-attn
  • W9dtype=bf16m=32n=4096k=7168trans_b=truemid-m32-attn
  • W10dtype=bf16m=64n=7168k=2048trans_b=truemid-m64-down
  • W11dtype=bf16m=96n=2112k=7168trans_b=truemid-m96-gate-up
  • W12dtype=bf16m=1024n=1024k=1024square-1k-nn
  • W13dtype=f16m=1024n=1024k=1024square-1k-nn
  • W14dtype=bf16m=4096n=24576k=1536trans_b=truewide-n-24576
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W10.22×0.6624torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.1521
0.1268
···
W20.24×0.5459torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.1315
0.1159
···
W30.18×16.7480torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
3.0372
3.0380
···
W40.19×16.3590torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
3.0372
3.0412
···
W50.17×8.9730torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
1.5276
1.7535
···
W60.20×8.4763torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
1.7203
1.7145
···
W70.17×75.0704torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
12.8368
12.7846
···
W80.26×0.8434torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.2011
0.2010
···
W90.21×0.8475torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.1680
0.1681
···
W100.24×0.5192torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.1019
0.1017
···
W110.25×0.4860torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.1172
0.1174
···
W120.28×0.2704torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0725
0.0649
···
W130.31×0.2389torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0730
0.0654
···
W140.21×23.1819torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
4.7480
4.7484
···

GemmEpilogueSwiGLUFwd

  • W1dtype=bf16m=128n=7168k=2048trans_b=trueds-v3-decode-down
  • W2dtype=bf16m=128n=2112k=7168trans_b=trueds-v3-decode-gate-up
  • W3dtype=bf16m=4096n=4096k=7168trans_b=trueds-v3-prefill-attn-proj
  • W4dtype=f16m=4096n=4096k=7168trans_b=trueds-v3-prefill-attn-proj
  • W5dtype=bf16m=4096n=7168k=2048trans_b=trueds-v3-prefill-down
  • W6dtype=bf16m=4096n=2112k=7168trans_b=trueds-v3-prefill-gate-up
  • W7dtype=bf16m=4096n=7168k=16384trans_b=truek-dominant-7168x16384
  • W8dtype=bf16m=16n=4096k=7168trans_b=truemid-m16-attn
  • W9dtype=bf16m=32n=4096k=7168trans_b=truemid-m32-attn
  • W10dtype=bf16m=64n=7168k=2048trans_b=truemid-m64-down
  • W11dtype=bf16m=96n=2112k=7168trans_b=truemid-m96-gate-up
  • W12dtype=bf16m=1024n=1024k=1024square-1k-nn
  • W13dtype=f16m=1024n=1024k=1024square-1k-nn
  • W14dtype=bf16m=4096n=24576k=1536trans_b=truewide-n-24576
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W10.18×1.5390torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.2765
0.2531
···
W20.19×1.5446torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.2980
0.2884
···
W30.10×63.5631torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
6.0729
6.1739
···
W40.10×63.5561torch_npu eager vendor library basis6.1647···
W50.11×33.2796torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
3.7622
3.8369
···
W60.12×26.1990torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
3.1896
3.2142
···
W70.10×263.9803torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
26.0779
26.0617
···
W80.56×1.0939torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.5913
0.5920
···
W90.49×1.2266torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.6012
0.6020
···
W100.28×0.8626torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.2235
0.2234
···
W110.19×1.3798torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
0.2585
0.2587
···
W120.22×0.5600torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.1236
0.1163
···
W130.22×0.5586torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.1222
0.1135
···
W140.13×79.9905torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
10.8063
10.8057
···

GemmBlockScaledFwd

  • W1dtype=bf16m=128n=7168k=2048trans_b=trueds-v3-decode-down
  • W2dtype=bf16m=128n=2112k=7168trans_b=trueds-v3-decode-gate-up
  • W3dtype=bf16m=4096n=4096k=7168trans_b=trueds-v3-prefill-attn-proj
  • W4dtype=f16m=4096n=4096k=7168trans_b=trueds-v3-prefill-attn-proj
  • W5dtype=bf16m=4096n=7168k=2048trans_b=trueds-v3-prefill-down
  • W6dtype=bf16m=4096n=2112k=7168trans_b=trueds-v3-prefill-gate-up
  • W7dtype=bf16m=4096n=7168k=16384trans_b=truek-dominant-7168x16384
  • W8dtype=bf16m=16n=4096k=7168trans_b=truemid-m16-attn
  • W9dtype=bf16m=32n=4096k=7168trans_b=truemid-m32-attn
  • W10dtype=bf16m=64n=7168k=2048trans_b=truemid-m64-down
  • W11dtype=bf16m=96n=2112k=7168trans_b=truemid-m96-gate-up
  • W12dtype=bf16m=1024n=1024k=1024square-1k-nn
  • W13dtype=f16m=1024n=1024k=1024square-1k-nn
  • W14dtype=bf16m=4096n=24576k=1536trans_b=truewide-n-24576
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W10.15×102.2184torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
15.2870
15.5379
···
W20.14×114.7999torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
16.4260
16.6836
···
W30.01×5356.4300torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
62.4492
63.5335
···
W40.01×5356.4076torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
62.3709
63.4989
···
W50.01×2714.5082torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
24.6761
24.9730
···
W60.02×3046.2231torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
46.3914
47.2873
···
W70.01×21732.5278torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
203.1527
203.2515
···
W80.51×60.2694torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
30.8980
30.8871
···
W90.39×79.6118torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
31.0940
31.0756
···
W100.25×60.7450torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
15.3833
15.3793
···
W110.18×91.0631torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
16.4288
16.4565
···
W120.05×50.3330torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
2.6625
2.7111
···
W130.05×50.3204torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
2.6656
2.6984
···
W140.01×6907.4176torch_compile_aclgraph torch_compile basis
torch_npu eager vendor library
49.5547
49.6379
···

GemmW4A16Fwd

Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name ms TFLOP/s of ceiling by

MoeGroupedGemmFwd

Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name ms TFLOP/s of ceiling by

Quantization

FP8QuantFwd

input_tensor: [batch, seq_len_kv, kv_group, index_dim]

batch=1kv_group=1

  • W1dtype=f32seq_len_kv=4096index_dim=128kv-index-4k-d128
  • W2dtype=bf16seq_len_kv=8192index_dim=64kv-index-8k-d64
  • W3dtype=f16seq_len_kv=8192index_dim=64kv-index-8k-d64
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W112.05×0.0220torch_npu eager vendor library basis ⓘ0.2650···
W211.60×0.0248torch_npu eager vendor library basis ⓘ0.2870···
W312.60×0.0222torch_npu eager vendor library basis ⓘ0.2802···

DequantizeFwd

input_tensor: [batch, seq_len_kv, kv_group, index_dim]

batch=1kv_group=1

  • W1dtype=f32seq_len_kv=4096index_dim=128kv-index-4k-d128
  • W2dtype=bf16seq_len_kv=8192index_dim=64kv-index-8k-d64
  • W3dtype=f16seq_len_kv=8192index_dim=64kv-index-8k-d64
Workload Ratio Device time Alternatives Throughput SOL Bound
alt / ours ms name · tier ms TFLOP/s of ceiling by
W10.99×0.0175torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0203
0.0152
···
W21.55×0.0163torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0253
0.0173
···
W31.73×0.0168torch_compile_aclgraph torch_compile
torch_npu eager vendor library basis
0.0261
0.0173
···