- Capability 与 performance 是两套证据,不互相替代。
- 结果只在一个确定的 campaign 内比较。
- 缺失不是 0;撤回、未运行、不支持和结果不可得是不同状态。
- 建模层、重构和求解引擎原生能力分别记录。
- 自动抓取只能进入 candidate 区,人工核验后才进入
data/atlas.json。
| 实体 | 当前表示 | 关键键 |
|---|---|---|
problem_class |
problemClasses[] |
id、数学形式、变量、凸性、保证、格式、指标 |
benchmark_collection |
benchmarks[] |
id、kind、tier、覆盖、治理、许可 |
benchmark_version |
benchmark 的 version 与 campaign 的 snapshot |
release/tag/hash/date |
instance_set |
campaign 的 instanceSet、instanceCount、sourceHash |
固定子集与 snapshot |
solver_product |
solvers[] |
产品、厂商、许可、接口、部署 |
solver_release |
solver 的 release |
{solver_id}@{release} |
solver_configuration |
campaign protocol + per-row release | 参数、线程、随机模式应随新 campaign 扩充 |
capability_claim |
生成的 capability_claims.jsonl |
release、class、code、guarantee、source、verifiedAt |
campaign |
campaigns[] |
protocol、environment、instance set、metrics、source |
environment |
campaign 的 environment |
hardware、accelerator、threads、memory、limits |
run_observation |
run_observations.jsonl |
campaign、solver release、status、metric values |
derived_aggregate |
页面仅在单 campaign 内即时派生 | 必须通过 comparison guardrail |
source / evidence |
记录中的 source / evidence |
title、URL、publisher、kind、verifiedAt |
| Code | 语义 |
|---|---|
G |
原生,并可在相应模型假设与容差下给全局证书 |
L |
局部解或驻点 |
H |
启发式 / anytime 能力 |
R |
通过重构、前端或配套引擎支持 |
B |
Beta / Preview |
— |
官方资料明确不支持 |
? |
尚无可靠公开证据 |
一个 code 不能代替 scope、guarantee、note 和 source。
solved
feasible
timeout
memory_limit
error
invalid_solution
unsupported
not_run
unavailable
unavailable 必须有原因,例如 publication suppressed 或厂商撤回。它不得携带 solved: 0、shiftedGmean: 0 等伪数值。
一个可比较集合必须同时满足:
same campaign_id
same problem_class_id
same instance_set_hash
same environment_hash
same tolerances
same checker
以下操作由测试阻止:跨 campaign 排名、跨赛道总分、不同硬件/容差/checker 的结果合并,以及把缺失填 0。
impact_tier只表达历史地位、标准采用、机构治理、论文/厂商采用和维护年限。evidence_readiness R0–R3只表达实例、协议、版本、checker、日志和环境是否足够复核。
目录默认排序为:tier A→B→C → impact signal 数 → 覆盖广度 → verifiedAt,不计算总分。