Explore ArkGraph and select the steps to run.
The paper’s claims are available in Research claims.
0 / 20 claims verified
the rest still being verified
Experiment plan ready; no runs yet.
0/48 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
dataset: MATH-500 · configuration: GDPO (base) · generationLengthTokens: 128 | 31.2% | — | Not assessed |
dataset: MATH-500 · configuration: GDPO (base) · generationLengthTokens: 256 | 35.4% | — | Not assessed |
dataset: MATH-500 · configuration: GDPO (base) · generationLengthTokens: 512 | 40% | — | Not assessed |
dataset: MATH-500 · configuration: GDPO (base) · generationLengthTokens: average | 35.5% | — | Not assessed |
dataset: Countdown · configuration: GDPO (base) · generationLengthTokens: 128 | 53.5% | — | Not assessed |
dataset: Countdown · configuration: GDPO (base) · generationLengthTokens: 256 | 62.9% | — | Not assessed |
dataset: Countdown · configuration: GDPO (base) · generationLengthTokens: 512 | 65.2% | — | Not assessed |
dataset: Countdown · configuration: GDPO (base) · generationLengthTokens: average | 60.6% | — | Not assessed |
dataset: MATH-500 · configuration: GDPO+IM d=0.5 w=10 · generationLengthTokens: 128 | 32.8% | — | Not assessed |
dataset: MATH-500 · configuration: GDPO+IM d=0.5 w=10 · generationLengthTokens: 256 | 38.6% | — | Not assessed |
dataset: MATH-500 · configuration: GDPO+IM d=0.5 w=10 · generationLengthTokens: 512 | 40.4% | — | Not assessed |
dataset: MATH-500 · configuration: GDPO+IM d=0.5 w=10 · generationLengthTokens: average | 37.3% | — | Not assessed |
Experiment plan ready; no runs yet.
0/24 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: SPG · dataset: MATH-500 | 0.1719 gradient-norm units | — | Not assessed |
model: SPG · dataset: MATH-500 | 0.0798 gradient-norm units | — | Not assessed |
model: SPG · dataset: MATH-500 | 0.46 ratio | — | Not assessed |
model: SPG+IM · dataset: MATH-500 | 0.1707 gradient-norm units | — | Not assessed |
model: SPG+IM · dataset: MATH-500 | 0.0634 gradient-norm units | — | Not assessed |
model: SPG+IM · dataset: MATH-500 | 0.37 ratio | — | Not assessed |
model: GDPO · dataset: MATH-500 | 0.0357 gradient-norm units | — | Not assessed |
model: GDPO · dataset: MATH-500 | 0.0174 gradient-norm units | — | Not assessed |
model: GDPO · dataset: MATH-500 | 0.49 ratio | — | Not assessed |
model: GDPO+IM · dataset: MATH-500 | 0.0414 gradient-norm units | — | Not assessed |
model: GDPO+IM · dataset: MATH-500 | 0.0172 gradient-norm units | — | Not assessed |
model: GDPO+IM · dataset: MATH-500 | 0.42 ratio | — | Not assessed |
Experiment plan ready; no runs yet.
0/8 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
run: SPG · period: before step 2800 · dataset: MATH-500 | 0.0052 KL divergence | — | Not assessed |
run: SPG · period: before step 2800 · dataset: MATH-500 | 0.0078 KL divergence | — | Not assessed |
run: SPG · period: steps 2800–5000 · dataset: MATH-500 | 0.0357 KL divergence | — | Not assessed |
run: SPG · period: steps 2800–5000 · dataset: MATH-500 | 0.0365 KL divergence | — | Not assessed |
run: SPG+IM · period: before step 2800 · dataset: MATH-500 | 0.0058 KL divergence | — | Not assessed |
run: SPG+IM · period: before step 2800 · dataset: MATH-500 | 0.0089 KL divergence | — | Not assessed |
run: SPG+IM · period: steps 2800–5000 · dataset: MATH-500 | 0.0221 KL divergence | — | Not assessed |
run: SPG+IM · period: steps 2800–5000 · dataset: MATH-500 | 0.0292 KL divergence | — | Not assessed |
Experiment plan ready; no runs yet.
0/36 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: LLaDA-8B-Instruct · dataset: GSM8K · generationLengthTokens: 128 | 68.7% | — | Not assessed |
model: LLaDA-8B-Instruct · dataset: GSM8K · generationLengthTokens: 256 | 76.7% | — | Not assessed |
model: LLaDA-8B-Instruct · dataset: GSM8K · generationLengthTokens: 512 | 78.2% | — | Not assessed |
model: D1 · dataset: GSM8K · generationLengthTokens: 128 | 72.2% | — | Not assessed |
model: D1 · dataset: GSM8K · generationLengthTokens: 256 | 80.6% | — | Not assessed |
model: D1 · dataset: GSM8K · generationLengthTokens: 512 | 81.3% | — | Not assessed |
model: WD1 · dataset: GSM8K · generationLengthTokens: 128 | 74.6% | — | Not assessed |
model: WD1 · dataset: GSM8K · generationLengthTokens: 256 | 80.8% | — | Not assessed |
model: WD1 · dataset: GSM8K · generationLengthTokens: 512 | 83% | — | Not assessed |
model: ESPO · dataset: GSM8K · generationLengthTokens: 128 | 75.3% | — | Not assessed |
model: ESPO · dataset: GSM8K · generationLengthTokens: 256 | 79.9% | — | Not assessed |
model: ESPO · dataset: GSM8K · generationLengthTokens: 512 | 81% | — | Not assessed |
Experiment plan ready; no runs yet.
0/37 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: SPG · dataset: MATH-500 · generationLengthTokens: 128 | 34.6% | — | Not assessed |
model: SPG · dataset: MATH-500 · generationLengthTokens: 256 | 39.6% | — | Not assessed |
model: SPG · dataset: MATH-500 · generationLengthTokens: 512 | 42.6% | — | Not assessed |
model: SPG · dataset: Countdown · generationLengthTokens: 128 | 68.8% | — | Not assessed |
model: SPG · dataset: Countdown · generationLengthTokens: 256 | 70.7% | — | Not assessed |
model: SPG · dataset: Countdown · generationLengthTokens: 512 | 70.3% | — | Not assessed |
model: SPG+IM · dataset: MATH-500 · generationLengthTokens: 128 | 34.6% | — | Not assessed |
model: SPG+IM · dataset: MATH-500 · generationLengthTokens: 256 | 40.4% | — | Not assessed |
model: SPG+IM · dataset: MATH-500 · generationLengthTokens: 512 | 45.2% | — | Not assessed |
model: SPG+IM · dataset: Countdown · generationLengthTokens: 128 | 81.6% | — | Not assessed |
model: SPG+IM · dataset: Countdown · generationLengthTokens: 256 | 81.6% | — | Not assessed |
model: SPG+IM · dataset: Countdown · generationLengthTokens: 512 | 80.9% | — | Not assessed |
Experiment plan ready; no runs yet.
0/36 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: LLaDA-8B-Instruct · dataset: Countdown · generationLengthTokens: 128 | 20.7% | — | Not assessed |
model: LLaDA-8B-Instruct · dataset: Countdown · generationLengthTokens: 256 | 19.5% | — | Not assessed |
model: LLaDA-8B-Instruct · dataset: Countdown · generationLengthTokens: 512 | 16% | — | Not assessed |
model: D1 · dataset: Countdown · generationLengthTokens: 128 | 30.9% | — | Not assessed |
model: D1 · dataset: Countdown · generationLengthTokens: 256 | 30.9% | — | Not assessed |
model: D1 · dataset: Countdown · generationLengthTokens: 512 | 34.4% | — | Not assessed |
model: WD1 · dataset: Countdown · generationLengthTokens: 128 | 48.8% | — | Not assessed |
model: WD1 · dataset: Countdown · generationLengthTokens: 256 | 51.2% | — | Not assessed |
model: WD1 · dataset: Countdown · generationLengthTokens: 512 | 50.8% | — | Not assessed |
model: ESPO · dataset: Countdown · generationLengthTokens: 128 | 74.2% | — | Not assessed |
model: ESPO · dataset: Countdown · generationLengthTokens: 256 | 72.6% | — | Not assessed |
model: ESPO · dataset: Countdown · generationLengthTokens: 512 | 75.3% | — | Not assessed |
Experiment plan ready; no runs yet.
0/12 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: SPG (full) · dataset: MATH-500 · generationLengthTokens: 128 | 34% | — | Not assessed |
model: SPG (full) · dataset: MATH-500 · generationLengthTokens: 256 | 38% | — | Not assessed |
model: SPG (full) · dataset: MATH-500 · generationLengthTokens: 512 | 41.4% | — | Not assessed |
model: SPG (full)+IM · dataset: MATH-500 · generationLengthTokens: 128 | 34.2% | — | Not assessed |
model: SPG (full)+IM · dataset: MATH-500 · generationLengthTokens: 256 | 41% | — | Not assessed |
model: SPG (full)+IM · dataset: MATH-500 · generationLengthTokens: 512 | 42% | — | Not assessed |
model: SPG (full) · dataset: GSM8K · generationLengthTokens: 128 | 75.1% | — | Not assessed |
model: SPG (full) · dataset: GSM8K · generationLengthTokens: 256 | 81.9% | — | Not assessed |
model: SPG (full) · dataset: GSM8K · generationLengthTokens: 512 | 83.6% | — | Not assessed |
model: SPG (full)+IM · dataset: GSM8K · generationLengthTokens: 128 | 77.4% | — | Not assessed |
model: SPG (full)+IM · dataset: GSM8K · generationLengthTokens: 256 | 82% | — | Not assessed |
model: SPG (full)+IM · dataset: GSM8K · generationLengthTokens: 512 | 83.9% | — | Not assessed |
Experiment plan ready; no runs yet.
0/18 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
dataset: MATH-500 · variant: base · sharpnessD: 0.5 · hostFramework: GDPO | 35.5% | — | Not assessed |
dataset: MATH-500 · variant: IM · sharpnessD: 0.5 · hostFramework: GDPO | 37.3% | — | Not assessed |
dataset: MATH-500 · variant: IW · sharpnessD: 0.5 · hostFramework: GDPO | 37.2% | — | Not assessed |
dataset: Countdown · variant: base · sharpnessD: 0.5 · hostFramework: GDPO | 60.6% | — | Not assessed |
dataset: Countdown · variant: IM · sharpnessD: 0.5 · hostFramework: GDPO | 61.3% | — | Not assessed |
dataset: Countdown · variant: IW · sharpnessD: 0.5 · hostFramework: GDPO | 62.4% | — | Not assessed |
dataset: MATH-500 · variant: base · sharpnessD: 1.5 · hostFramework: GDPO | 35.5% | — | Not assessed |
dataset: MATH-500 · variant: IM · sharpnessD: 1.5 · hostFramework: GDPO | 37% | — | Not assessed |
dataset: MATH-500 · variant: IW · sharpnessD: 1.5 · hostFramework: GDPO | 37.1% | — | Not assessed |
dataset: Countdown · variant: base · sharpnessD: 1.5 · hostFramework: GDPO | 60.6% | — | Not assessed |
dataset: Countdown · variant: IM · sharpnessD: 1.5 · hostFramework: GDPO | 63.3% | — | Not assessed |
dataset: Countdown · variant: IW · sharpnessD: 1.5 · hostFramework: GDPO | 63% | — | Not assessed |
Experiment plan ready; no runs yet.
0/36 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: LLaDA-8B-Instruct · dataset: MATH-500 · generationLengthTokens: 128 | 26% | — | Not assessed |
model: LLaDA-8B-Instruct · dataset: MATH-500 · generationLengthTokens: 256 | 32.4% | — | Not assessed |
model: LLaDA-8B-Instruct · dataset: MATH-500 · generationLengthTokens: 512 | 36.2% | — | Not assessed |
model: D1 · dataset: MATH-500 · generationLengthTokens: 128 | 31.4% | — | Not assessed |
model: D1 · dataset: MATH-500 · generationLengthTokens: 256 | 36% | — | Not assessed |
model: D1 · dataset: MATH-500 · generationLengthTokens: 512 | 39.4% | — | Not assessed |
model: WD1 · dataset: MATH-500 · generationLengthTokens: 128 | 31% | — | Not assessed |
model: WD1 · dataset: MATH-500 · generationLengthTokens: 256 | 34.4% | — | Not assessed |
model: WD1 · dataset: MATH-500 · generationLengthTokens: 512 | 39% | — | Not assessed |
model: ESPO · dataset: MATH-500 · generationLengthTokens: 128 | 35.2% | — | Not assessed |
model: ESPO · dataset: MATH-500 · generationLengthTokens: 256 | 37.8% | — | Not assessed |
model: ESPO · dataset: MATH-500 · generationLengthTokens: 512 | 37.6% | — | Not assessed |
The abstract averages are derived summaries of the represented Table 1 host/dataset cells, not an additional scientific run; recomputation must use fresh observed cells if those packages execute.
0/3 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
hostFramework: ESPO | 2.01% | — | Not assessed |
hostFramework: GDPO | 8.68% | — | Not assessed |
hostFramework: SPG | 5.77% | — | Not assessed |
Experiment plan ready; no runs yet.
0/36 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: LLaDA-8B-Instruct · dataset: Sudoku · generationLengthTokens: 128 | 11.7% | — | Not assessed |
model: LLaDA-8B-Instruct · dataset: Sudoku · generationLengthTokens: 256 | 6.7% | — | Not assessed |
model: LLaDA-8B-Instruct · dataset: Sudoku · generationLengthTokens: 512 | 5.5% | — | Not assessed |
model: D1 · dataset: Sudoku · generationLengthTokens: 128 | 7.2% | — | Not assessed |
model: D1 · dataset: Sudoku · generationLengthTokens: 256 | 32.5% | — | Not assessed |
model: D1 · dataset: Sudoku · generationLengthTokens: 512 | 29.3% | — | Not assessed |
model: WD1 · dataset: Sudoku · generationLengthTokens: 128 | 33.1% | — | Not assessed |
model: WD1 · dataset: Sudoku · generationLengthTokens: 256 | 33.1% | — | Not assessed |
model: WD1 · dataset: Sudoku · generationLengthTokens: 512 | 24.5% | — | Not assessed |
model: ESPO · dataset: Sudoku · generationLengthTokens: 128 | 91.2% | — | Not assessed |
model: ESPO · dataset: Sudoku · generationLengthTokens: 256 | 84.8% | — | Not assessed |
model: ESPO · dataset: Sudoku · generationLengthTokens: 512 | 80.1% | — | Not assessed |
Experiment plan ready; no runs yet.
0/20 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: SPG · dataset: MATH-500 | -2.2864 ELBO units | — | Not assessed |
model: SPG · dataset: MATH-500 | 0.947 ELBO units | — | Not assessed |
model: SPG+IM · dataset: MATH-500 | -2.2146 ELBO units | — | Not assessed |
model: SPG+IM · dataset: MATH-500 | 0.9085 ELBO units | — | Not assessed |
model: GDPO · dataset: MATH-500 | -2.1095 ELBO units | — | Not assessed |
model: GDPO · dataset: MATH-500 | 1.1245 ELBO units | — | Not assessed |
model: GDPO+IM · dataset: MATH-500 | -2.0731 ELBO units | — | Not assessed |
model: GDPO+IM · dataset: MATH-500 | 0.9236 ELBO units | — | Not assessed |
model: SPG · dataset: Countdown | -1.8889 ELBO units | — | Not assessed |
model: SPG · dataset: Countdown | 1.3627 ELBO units | — | Not assessed |
model: SPG+IM · dataset: Countdown | -1.6249 ELBO units | — | Not assessed |
model: SPG+IM · dataset: Countdown | 1.0596 ELBO units | — | Not assessed |
Experiment plan ready; no runs yet.
0/36 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: SPG · dataset: GSM8K · generationLengthTokens: 128 | 78.5% | — | Not assessed |
model: SPG · dataset: GSM8K · generationLengthTokens: 256 | 84.9% | — | Not assessed |
model: SPG · dataset: GSM8K · generationLengthTokens: 512 | 84.2% | — | Not assessed |
model: SPG · dataset: MATH-500 · generationLengthTokens: 128 | 34.6% | — | Not assessed |
model: SPG · dataset: MATH-500 · generationLengthTokens: 256 | 39.6% | — | Not assessed |
model: SPG · dataset: MATH-500 · generationLengthTokens: 512 | 42.6% | — | Not assessed |
model: SPG · dataset: Countdown · generationLengthTokens: 128 | 68.8% | — | Not assessed |
model: SPG · dataset: Countdown · generationLengthTokens: 256 | 70.7% | — | Not assessed |
model: SPG · dataset: Countdown · generationLengthTokens: 512 | 70.3% | — | Not assessed |
model: SPG · dataset: Sudoku · generationLengthTokens: 128 | 82.9% | — | Not assessed |
model: SPG · dataset: Sudoku · generationLengthTokens: 256 | 94% | — | Not assessed |
model: SPG · dataset: Sudoku · generationLengthTokens: 512 | 93.1% | — | Not assessed |
A candidate three-arm package is retained, but the fixed source does not identify Figure 3(a)'s dataset or host framework; choosing by visual/numeric similarity would not bind the paper comparison.
The complete paper-bound package remains in the catalog, but it requires regenerating one or more 8B RL-trained scientific states and cannot be admitted under the current one-L4 cumulative budget/runtime resources.
The complete paper-bound package remains in the catalog, but it requires regenerating one or more 8B RL-trained scientific states and cannot be admitted under the current one-L4 cumulative budget/runtime resources.
Four separately selectable experiment-rerun packages test the qualitative ordering on the declared 500 completions per dataset. Exact numeric curve matching is unavailable because the source gives no coordinates and does not identify the original completion checkpoint; this limitation is retained locally.
The complete paper-bound package remains in the catalog, but it requires regenerating one or more 8B RL-trained scientific states and cannot be admitted under the current one-L4 cumulative budget/runtime resources.
Method/setup context is exercised as a bound condition of the empirical packages; it is not an independent empirical result.
This is an explicit limitation/future-work statement. The only reported empirical countercheck, the single-token-reveal ablation, remains a separate catalog package.