Benchmark Atlas

分布与不确定性 · 厂商发布

Reliability Calibration

比较模型自信度与真实正确率,直接呈现过度自信或保守区间。

calibrationreliabilityconfidence
Confidence vs observed accuracy 比较模型自信度与真实正确率,直接呈现过度自信或保守区间。 示意数据,仅复现信息结构,不代表最新榜单结果。 Confidence vs observed accuracy OpenAI / ChatGPT DEMO DATA perfect calibration0020204040606080801001001427436278reported confidence →
Illustrative demo data · renderer: reliability

Information grammar

它如何组织信息

校准柱 + 对角完美线 + ECE 缺口

Visual system
VS-24 Reliability pink grid
Component ID
openai-reliability

Use when

适用判断

适合选择性回答、路由和风险控制;分箱方案必须稳定。

Source lineage

OpenAI / ChatGPT

高留白、单一强调色、compute 与 reliability 叙事

Open formal source ↗

Structured data

可替换的数据模型

示意数据,仅复现信息结构,不代表最新榜单结果。

{
  "bins": [
    {
      "confidence": 10,
      "accuracy": 14
    },
    {
      "confidence": 30,
      "accuracy": 27
    },
    {
      "confidence": 50,
      "accuracy": 43
    },
    {
      "confidence": 70,
      "accuracy": 62
    },
    {
      "confidence": 90,
      "accuracy": 78
    }
  ]
}

Related components

同一图表家族的其他语法