不收录
同一结构,重新上色
标签、颜色和文件格式变化,不会创造新的认知能力。
Benchmark visualization, refined.
Benchmark Atlas 把模型发布、独立榜单和研究论文里的高价值图表,重构成来源可追溯、数据可替换、SVG 可导出的组件。每一项都必须回答一个问题:它提供了什么此前没有的信息结构?
01 · The principle
传统素材库按图片数量增长,Benchmark Atlas 按“可复用信息语法”增长。同一柱图换成另一个厂商、模型或配色,仍然只是一种组件。
不收录
标签、颜色和文件格式变化,不会创造新的认知能力。
收录
例如容量溢出后的 token 去向、loss 到 benchmark 的迁移链、精度域转换闭环。
02 · A working system
组件不是论文截图的描摹,而是一条有约束的产品流水线。来源、结构化数据、renderer、可访问 SVG 与机器校验共同构成一个可维护单元。
Live, not flattened
组件保留数据、图表语法和 renderer 之间的联系,因此可以检索、修改、放大检查并导出自包含 SVG,而不是停留在静态参考图。
Stable contract
id稳定检索入口grammar信息结构定义renderer纯 SVG 渲染函数visualSystem独立视觉语言Open by default
const chart = BenchmarkAtlas.get(
'hunyuan-recycle-routing'
);
BenchmarkAtlas.render(chart);
BenchmarkAtlas.query({
query: 'FP8'
});
03 · Evidence, built in
所有亚洲模型实验室组件都携带机器可读 evidence:论文 Figure、PDF 页码、核验日期和视觉证据摘要。下面四项来自 v0.6.0 的逐页核验。
01
Hunyuan-Large · Figure 2 · PDF p.6
传统 top-k 会丢弃溢出的 Token D;recycle routing 保留 token 身份,把它二次分配给仍有容量的 Expert 4。组件强调的是状态转移,而不是普通流程图。
查看论文来源 ↗02
Seed1.5-VL · Figure 3 · PDF p.14
第一段关系描述 token 增长如何降低 OCR 与 grounding loss;第二段关系把各子类 loss 映射到相关 benchmark。六个分面组成“训练量 → 代理指标 → 下游指标”的校准链。
查看论文来源 ↗03
DeepSeek-V3 · Figure 6 · PDF p.15
Fprop、Dgrad 与 Wgrad 使用 FP8 GEMM;激活边界保留 BF16;累加、master weight 和 optimizer state 留在 FP32。每条边都显式记录转换协议。
查看论文来源 ↗04
DeepSeek-V3 · Figure 7 · PDF p.16
局部 tile/block scale 隔离 outlier,周期性 FP32 promotion 限制长距离累加误差。它不是又一张矩阵,而是“空间分组 + 时间累加”的双机制仪表。
查看论文来源 ↗04 · Quality gates
ID、grammar、renderer、visual system 不允许重复。
组件元数据必须与注册来源、HTTPS 链接和 evidence 对齐。
每个输出都有 title、description 和明确的示意数据披露。
桌面交互和 390px 移动端都不能溢出或产生页面错误。
详情页中的当前渲染结果可以直接下载为自包含 SVG。
颜色、标签、厂商名和图片格式变化不会增加组件计数。