Benchmark Atlas

亚洲模型实验室 · arXiv 论文

Fine-grained Quantization Accumulator

复现 DeepSeek-V3 Figure 7:并排展示局部 scale 如何隔离 outlier,以及低精度 MMA 如何按固定间隔提升到 CUDA Core 做 FP32 累加。

deepseekfp8quantizationoutlieraccumulation
Local scaling blocks with periodic FP32 promotion复现 DeepSeek-V3 Figure 7:并排展示局部 scale 如何隔离 outlier,以及低精度 MMA 如何按固定间隔提升到 CUDA Core 做 FP32 累加。 示意数据,仅复现信息结构,不代表最新榜单结果。 Local scaling blocks with periodic FP32 promotionDeepSeek-V3 Technical Report · Figure 7 / PDF p.16DEMO DATAFINE-GRAINED QUANTIZATIONPERIODIC HIGH-PRECISION ACCUMULATIONactivation · 1 × 128 tiless00s01s02s03s10s11s12s13s20s21s22s23weight · 128 × 128 blocksscale 1.1scale 1.2scale 1.3scale 2.1scale 2.2scale 2.3scale 3.1scale 3.2scale 3.3low-precision MMA sequenceM1M2M3M4FP32registerM5M6M7M8FP32registerM9M10M11M12FP32registerpromotion interval N₍C₎ = 128 elementslocal scales contain outliers; scheduled FP32 promotion limits long accumulation error
Illustrative demo data · renderer: quantizationAccumulator

Information grammar

它如何组织信息

activation 1×128 tile scales + weight 128×128 block scales + low-precision MMA 批次 + 固定间隔 FP32 promotion 时间轴

Visual system
VS-83 DeepSeek local-scale accumulation instrument
Component ID
deepseek-fine-grained-quantization

Use when

适用判断

适合说明量化误差控制由空间分组和时间累加两部分共同完成;必须保留两种分组形状与 promotion 间隔。

Figure-level evidence

Figure 7 · PDF p.16

Activation 按 1×128 tile、weight 按 128×128 block 独立缩放,并每 128 个 MMA 元素提升到 FP32 累加。

Verified
2026-07-13
Paper source
DeepSeek-V3 Technical Report

Structured data

可替换的数据模型

示意数据,仅复现信息结构,不代表最新榜单结果。

{
  "groups": [
    [
      "M1",
      "M2",
      "M3",
      "M4"
    ],
    [
      "M5",
      "M6",
      "M7",
      "M8"
    ],
    [
      "M9",
      "M10",
      "M11",
      "M12"
    ]
  ]
}

Related components

同一图表家族的其他语法