Explore ArkGraph and select the steps to run.
The paper’s claims are available in Research claims.
0 / 13 claims verified
the rest still being verified
Experiment plan ready; no runs yet.
0/102 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
method: Student · dataset: AIME24 | 22.6% | — | Not assessed |
method: Student · dataset: AIME24 | 60% | — | Not assessed |
method: Student · dataset: AIME25 | 20.83% | — | Not assessed |
method: Student · dataset: AIME25 | 33.33% | — | Not assessed |
method: Student · dataset: AMC23 | 60.16% | — | Not assessed |
method: Student · dataset: AMC23 | 92.5% | — | Not assessed |
method: Student · dataset: MATH500 | 67.4% | — | Not assessed |
method: Student · dataset: MATH500 | 72.6% | — | Not assessed |
method: Student · dataset: Average | 42.75% | — | Not assessed |
method: Student · dataset: Average | 64.61% | — | Not assessed |
method: Teacher · dataset: AIME24 | 57.4% | — | Not assessed |
method: Teacher · dataset: AIME24 | 76.67% | — | Not assessed |
Experiment plan ready; no runs yet.
0/12 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
operation: Discounted temporal credit | 609.85 milliseconds per step | — | Not assessed |
operation: Discounted temporal credit | 0.063 megabytes | — | Not assessed |
operation: Bounded advantage shaping | 0.42 milliseconds per step | — | Not assessed |
operation: Bounded advantage shaping | 0.125 megabytes | — | Not assessed |
operation: Verifier-reward mixing | 0.04 milliseconds per step | — | Not assessed |
operation: Verifier-reward mixing | 0.188 megabytes | — | Not assessed |
operation: Total additional overhead | 610.32 milliseconds per step | — | Not assessed |
operation: Total additional overhead | 0.375 megabytes | — | Not assessed |
operation: Vanilla OPD update (reference) | 573,669 milliseconds per step | — | Not assessed |
operation: Vanilla OPD update (reference) | 81,254.4 megabytes | — | Not assessed |
| 0.1064% | — | Not assessed | |
| 0.0005% | — | Not assessed |
Experiment plan ready; no runs yet.
0/65 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
method: Student · dataset: AIME24 | 22.6% | — | Not assessed |
method: Student · dataset: AIME25 | 20.83% | — | Not assessed |
method: Student · dataset: AMC23 | 60.16% | — | Not assessed |
method: Student · dataset: MATH500 | 67.4% | — | Not assessed |
method: Student · dataset: HumanEval+ | 75.61% | — | Not assessed |
method: Student · dataset: MBPP+ | 61.9% | — | Not assessed |
method: Student · dataset: LiveCodeBench v6 | 17.14% | — | Not assessed |
method: Student · dataset: TotalAvg | 47.15% | — | Not assessed |
method: Teacher · dataset: AIME24 | 57.4% | — | Not assessed |
method: Teacher · dataset: AIME25 | 51.67% | — | Not assessed |
method: Teacher · dataset: AMC23 | 93.52% | — | Not assessed |
method: Teacher · dataset: MATH500 | 69.8% | — | Not assessed |
Experiment plan ready; no runs yet.
0/102 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
method: Student · dataset: AIME24 | 11.77% | — | Not assessed |
method: Student · dataset: AIME24 | 46.67% | — | Not assessed |
method: Student · dataset: AIME25 | 8.33% | — | Not assessed |
method: Student · dataset: AIME25 | 20% | — | Not assessed |
method: Student · dataset: AMC23 | 39.84% | — | Not assessed |
method: Student · dataset: AMC23 | 90% | — | Not assessed |
method: Student · dataset: MATH500 | 59.2% | — | Not assessed |
method: Student · dataset: MATH500 | 72.8% | — | Not assessed |
method: Student · dataset: Average | 29.79% | — | Not assessed |
method: Student · dataset: Average | 57.37% | — | Not assessed |
method: Teacher · dataset: AIME24 | 57.4% | — | Not assessed |
method: Teacher · dataset: AIME24 | 76.67% | — | Not assessed |
Experiment plan ready; no runs yet.
0/19 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
dataset: AIME24 | 56.46% | — | Not assessed |
dataset: AIME25 | 50.83% | — | Not assessed |
dataset: AIME24 and AIME25 | 53.65% | — | Not assessed |
dataset: AIME24 | 58.29% | — | Not assessed |
dataset: AIME25 | 53.08% | — | Not assessed |
dataset: AIME24 and AIME25 | 55.69% | — | Not assessed |
| 2.04 percentage points | — | Not assessed | |
dataset: AIME24 | 58.81% | — | Not assessed |
dataset: AIME25 | 52.67% | — | Not assessed |
dataset: AIME24 and AIME25 | 55.74% | — | Not assessed |
| 2.09 percentage points | — | Not assessed | |
dataset: AIME24 | 57.55% | — | Not assessed |
The four gamma conditions require regenerated training trajectories, but the paper provides no numeric curve targets or safe complete categorical rule.
The exact illustrated response is retained in the ablation objective as qualitative source context; no scalar target is invented.
The full training package retains these curve claims as source context, but automatic verification cannot safely bind them.
The exact illustrated response is retained in the ablation objective as qualitative source context; no scalar target is invented.
This is protocol context rather than an independently testable result. Its reported settings are carried into each applicable training/evaluation objective, with missing revisions, seeds, stopping schedule, dtype, and multi-domain sampling ratio left explicit.
This is method definition and algebraic context rather than an independently reported empirical result. Its equations are operational prerequisites for the planned reconstruction packages; hand checks cannot substitute for the represented empirical comparisons.
The claim is a theorem under a stated moment assumption, not an empirical measurement. The fixed proof can be assessed mathematically; numerical examples would not reproduce it.
This is a stated scope limitation and future-work boundary, not an empirical result requiring a reproduction package.