浏览 ArkGraph,选择本次要执行的步骤。
论文中的结论可在「研究结论」中查看。
0 / 20 条结论已通过验证
其余仍在验证中
实验方案已生成,还没有运行记录
已评估 0/48 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
dataset: MATH-500 · configuration: GDPO (base) · generationLengthTokens: 128 | 31.2% | — | 尚未评估 |
dataset: MATH-500 · configuration: GDPO (base) · generationLengthTokens: 256 | 35.4% | — | 尚未评估 |
dataset: MATH-500 · configuration: GDPO (base) · generationLengthTokens: 512 | 40% | — | 尚未评估 |
dataset: MATH-500 · configuration: GDPO (base) · generationLengthTokens: average | 35.5% | — | 尚未评估 |
dataset: Countdown · configuration: GDPO (base) · generationLengthTokens: 128 | 53.5% | — | 尚未评估 |
dataset: Countdown · configuration: GDPO (base) · generationLengthTokens: 256 | 62.9% | — | 尚未评估 |
dataset: Countdown · configuration: GDPO (base) · generationLengthTokens: 512 | 65.2% | — | 尚未评估 |
dataset: Countdown · configuration: GDPO (base) · generationLengthTokens: average | 60.6% | — | 尚未评估 |
dataset: MATH-500 · configuration: GDPO+IM d=0.5 w=10 · generationLengthTokens: 128 | 32.8% | — | 尚未评估 |
dataset: MATH-500 · configuration: GDPO+IM d=0.5 w=10 · generationLengthTokens: 256 | 38.6% | — | 尚未评估 |
dataset: MATH-500 · configuration: GDPO+IM d=0.5 w=10 · generationLengthTokens: 512 | 40.4% | — | 尚未评估 |
dataset: MATH-500 · configuration: GDPO+IM d=0.5 w=10 · generationLengthTokens: average | 37.3% | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/24 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
model: SPG · dataset: MATH-500 | 0.1719 gradient-norm units | — | 尚未评估 |
model: SPG · dataset: MATH-500 | 0.0798 gradient-norm units | — | 尚未评估 |
model: SPG · dataset: MATH-500 | 0.46 ratio | — | 尚未评估 |
model: SPG+IM · dataset: MATH-500 | 0.1707 gradient-norm units | — | 尚未评估 |
model: SPG+IM · dataset: MATH-500 | 0.0634 gradient-norm units | — | 尚未评估 |
model: SPG+IM · dataset: MATH-500 | 0.37 ratio | — | 尚未评估 |
model: GDPO · dataset: MATH-500 | 0.0357 gradient-norm units | — | 尚未评估 |
model: GDPO · dataset: MATH-500 | 0.0174 gradient-norm units | — | 尚未评估 |
model: GDPO · dataset: MATH-500 | 0.49 ratio | — | 尚未评估 |
model: GDPO+IM · dataset: MATH-500 | 0.0414 gradient-norm units | — | 尚未评估 |
model: GDPO+IM · dataset: MATH-500 | 0.0172 gradient-norm units | — | 尚未评估 |
model: GDPO+IM · dataset: MATH-500 | 0.42 ratio | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/8 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
run: SPG · period: before step 2800 · dataset: MATH-500 | 0.0052 KL divergence | — | 尚未评估 |
run: SPG · period: before step 2800 · dataset: MATH-500 | 0.0078 KL divergence | — | 尚未评估 |
run: SPG · period: steps 2800–5000 · dataset: MATH-500 | 0.0357 KL divergence | — | 尚未评估 |
run: SPG · period: steps 2800–5000 · dataset: MATH-500 | 0.0365 KL divergence | — | 尚未评估 |
run: SPG+IM · period: before step 2800 · dataset: MATH-500 | 0.0058 KL divergence | — | 尚未评估 |
run: SPG+IM · period: before step 2800 · dataset: MATH-500 | 0.0089 KL divergence | — | 尚未评估 |
run: SPG+IM · period: steps 2800–5000 · dataset: MATH-500 | 0.0221 KL divergence | — | 尚未评估 |
run: SPG+IM · period: steps 2800–5000 · dataset: MATH-500 | 0.0292 KL divergence | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/36 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
model: LLaDA-8B-Instruct · dataset: GSM8K · generationLengthTokens: 128 | 68.7% | — | 尚未评估 |
model: LLaDA-8B-Instruct · dataset: GSM8K · generationLengthTokens: 256 | 76.7% | — | 尚未评估 |
model: LLaDA-8B-Instruct · dataset: GSM8K · generationLengthTokens: 512 | 78.2% | — | 尚未评估 |
model: D1 · dataset: GSM8K · generationLengthTokens: 128 | 72.2% | — | 尚未评估 |
model: D1 · dataset: GSM8K · generationLengthTokens: 256 | 80.6% | — | 尚未评估 |
model: D1 · dataset: GSM8K · generationLengthTokens: 512 | 81.3% | — | 尚未评估 |
model: WD1 · dataset: GSM8K · generationLengthTokens: 128 | 74.6% | — | 尚未评估 |
model: WD1 · dataset: GSM8K · generationLengthTokens: 256 | 80.8% | — | 尚未评估 |
model: WD1 · dataset: GSM8K · generationLengthTokens: 512 | 83% | — | 尚未评估 |
model: ESPO · dataset: GSM8K · generationLengthTokens: 128 | 75.3% | — | 尚未评估 |
model: ESPO · dataset: GSM8K · generationLengthTokens: 256 | 79.9% | — | 尚未评估 |
model: ESPO · dataset: GSM8K · generationLengthTokens: 512 | 81% | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/37 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
model: SPG · dataset: MATH-500 · generationLengthTokens: 128 | 34.6% | — | 尚未评估 |
model: SPG · dataset: MATH-500 · generationLengthTokens: 256 | 39.6% | — | 尚未评估 |
model: SPG · dataset: MATH-500 · generationLengthTokens: 512 | 42.6% | — | 尚未评估 |
model: SPG · dataset: Countdown · generationLengthTokens: 128 | 68.8% | — | 尚未评估 |
model: SPG · dataset: Countdown · generationLengthTokens: 256 | 70.7% | — | 尚未评估 |
model: SPG · dataset: Countdown · generationLengthTokens: 512 | 70.3% | — | 尚未评估 |
model: SPG+IM · dataset: MATH-500 · generationLengthTokens: 128 | 34.6% | — | 尚未评估 |
model: SPG+IM · dataset: MATH-500 · generationLengthTokens: 256 | 40.4% | — | 尚未评估 |
model: SPG+IM · dataset: MATH-500 · generationLengthTokens: 512 | 45.2% | — | 尚未评估 |
model: SPG+IM · dataset: Countdown · generationLengthTokens: 128 | 81.6% | — | 尚未评估 |
model: SPG+IM · dataset: Countdown · generationLengthTokens: 256 | 81.6% | — | 尚未评估 |
model: SPG+IM · dataset: Countdown · generationLengthTokens: 512 | 80.9% | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/36 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
model: LLaDA-8B-Instruct · dataset: Countdown · generationLengthTokens: 128 | 20.7% | — | 尚未评估 |
model: LLaDA-8B-Instruct · dataset: Countdown · generationLengthTokens: 256 | 19.5% | — | 尚未评估 |
model: LLaDA-8B-Instruct · dataset: Countdown · generationLengthTokens: 512 | 16% | — | 尚未评估 |
model: D1 · dataset: Countdown · generationLengthTokens: 128 | 30.9% | — | 尚未评估 |
model: D1 · dataset: Countdown · generationLengthTokens: 256 | 30.9% | — | 尚未评估 |
model: D1 · dataset: Countdown · generationLengthTokens: 512 | 34.4% | — | 尚未评估 |
model: WD1 · dataset: Countdown · generationLengthTokens: 128 | 48.8% | — | 尚未评估 |
model: WD1 · dataset: Countdown · generationLengthTokens: 256 | 51.2% | — | 尚未评估 |
model: WD1 · dataset: Countdown · generationLengthTokens: 512 | 50.8% | — | 尚未评估 |
model: ESPO · dataset: Countdown · generationLengthTokens: 128 | 74.2% | — | 尚未评估 |
model: ESPO · dataset: Countdown · generationLengthTokens: 256 | 72.6% | — | 尚未评估 |
model: ESPO · dataset: Countdown · generationLengthTokens: 512 | 75.3% | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/12 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
model: SPG (full) · dataset: MATH-500 · generationLengthTokens: 128 | 34% | — | 尚未评估 |
model: SPG (full) · dataset: MATH-500 · generationLengthTokens: 256 | 38% | — | 尚未评估 |
model: SPG (full) · dataset: MATH-500 · generationLengthTokens: 512 | 41.4% | — | 尚未评估 |
model: SPG (full)+IM · dataset: MATH-500 · generationLengthTokens: 128 | 34.2% | — | 尚未评估 |
model: SPG (full)+IM · dataset: MATH-500 · generationLengthTokens: 256 | 41% | — | 尚未评估 |
model: SPG (full)+IM · dataset: MATH-500 · generationLengthTokens: 512 | 42% | — | 尚未评估 |
model: SPG (full) · dataset: GSM8K · generationLengthTokens: 128 | 75.1% | — | 尚未评估 |
model: SPG (full) · dataset: GSM8K · generationLengthTokens: 256 | 81.9% | — | 尚未评估 |
model: SPG (full) · dataset: GSM8K · generationLengthTokens: 512 | 83.6% | — | 尚未评估 |
model: SPG (full)+IM · dataset: GSM8K · generationLengthTokens: 128 | 77.4% | — | 尚未评估 |
model: SPG (full)+IM · dataset: GSM8K · generationLengthTokens: 256 | 82% | — | 尚未评估 |
model: SPG (full)+IM · dataset: GSM8K · generationLengthTokens: 512 | 83.9% | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/18 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
dataset: MATH-500 · variant: base · sharpnessD: 0.5 · hostFramework: GDPO | 35.5% | — | 尚未评估 |
dataset: MATH-500 · variant: IM · sharpnessD: 0.5 · hostFramework: GDPO | 37.3% | — | 尚未评估 |
dataset: MATH-500 · variant: IW · sharpnessD: 0.5 · hostFramework: GDPO | 37.2% | — | 尚未评估 |
dataset: Countdown · variant: base · sharpnessD: 0.5 · hostFramework: GDPO | 60.6% | — | 尚未评估 |
dataset: Countdown · variant: IM · sharpnessD: 0.5 · hostFramework: GDPO | 61.3% | — | 尚未评估 |
dataset: Countdown · variant: IW · sharpnessD: 0.5 · hostFramework: GDPO | 62.4% | — | 尚未评估 |
dataset: MATH-500 · variant: base · sharpnessD: 1.5 · hostFramework: GDPO | 35.5% | — | 尚未评估 |
dataset: MATH-500 · variant: IM · sharpnessD: 1.5 · hostFramework: GDPO | 37% | — | 尚未评估 |
dataset: MATH-500 · variant: IW · sharpnessD: 1.5 · hostFramework: GDPO | 37.1% | — | 尚未评估 |
dataset: Countdown · variant: base · sharpnessD: 1.5 · hostFramework: GDPO | 60.6% | — | 尚未评估 |
dataset: Countdown · variant: IM · sharpnessD: 1.5 · hostFramework: GDPO | 63.3% | — | 尚未评估 |
dataset: Countdown · variant: IW · sharpnessD: 1.5 · hostFramework: GDPO | 63% | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/36 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
model: LLaDA-8B-Instruct · dataset: MATH-500 · generationLengthTokens: 128 | 26% | — | 尚未评估 |
model: LLaDA-8B-Instruct · dataset: MATH-500 · generationLengthTokens: 256 | 32.4% | — | 尚未评估 |
model: LLaDA-8B-Instruct · dataset: MATH-500 · generationLengthTokens: 512 | 36.2% | — | 尚未评估 |
model: D1 · dataset: MATH-500 · generationLengthTokens: 128 | 31.4% | — | 尚未评估 |
model: D1 · dataset: MATH-500 · generationLengthTokens: 256 | 36% | — | 尚未评估 |
model: D1 · dataset: MATH-500 · generationLengthTokens: 512 | 39.4% | — | 尚未评估 |
model: WD1 · dataset: MATH-500 · generationLengthTokens: 128 | 31% | — | 尚未评估 |
model: WD1 · dataset: MATH-500 · generationLengthTokens: 256 | 34.4% | — | 尚未评估 |
model: WD1 · dataset: MATH-500 · generationLengthTokens: 512 | 39% | — | 尚未评估 |
model: ESPO · dataset: MATH-500 · generationLengthTokens: 128 | 35.2% | — | 尚未评估 |
model: ESPO · dataset: MATH-500 · generationLengthTokens: 256 | 37.8% | — | 尚未评估 |
model: ESPO · dataset: MATH-500 · generationLengthTokens: 512 | 37.6% | — | 尚未评估 |
The abstract averages are derived summaries of the represented Table 1 host/dataset cells, not an additional scientific run; recomputation must use fresh observed cells if those packages execute.
已评估 0/3 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
hostFramework: ESPO | 2.01% | — | 尚未评估 |
hostFramework: GDPO | 8.68% | — | 尚未评估 |
hostFramework: SPG | 5.77% | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/36 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
model: LLaDA-8B-Instruct · dataset: Sudoku · generationLengthTokens: 128 | 11.7% | — | 尚未评估 |
model: LLaDA-8B-Instruct · dataset: Sudoku · generationLengthTokens: 256 | 6.7% | — | 尚未评估 |
model: LLaDA-8B-Instruct · dataset: Sudoku · generationLengthTokens: 512 | 5.5% | — | 尚未评估 |
model: D1 · dataset: Sudoku · generationLengthTokens: 128 | 7.2% | — | 尚未评估 |
model: D1 · dataset: Sudoku · generationLengthTokens: 256 | 32.5% | — | 尚未评估 |
model: D1 · dataset: Sudoku · generationLengthTokens: 512 | 29.3% | — | 尚未评估 |
model: WD1 · dataset: Sudoku · generationLengthTokens: 128 | 33.1% | — | 尚未评估 |
model: WD1 · dataset: Sudoku · generationLengthTokens: 256 | 33.1% | — | 尚未评估 |
model: WD1 · dataset: Sudoku · generationLengthTokens: 512 | 24.5% | — | 尚未评估 |
model: ESPO · dataset: Sudoku · generationLengthTokens: 128 | 91.2% | — | 尚未评估 |
model: ESPO · dataset: Sudoku · generationLengthTokens: 256 | 84.8% | — | 尚未评估 |
model: ESPO · dataset: Sudoku · generationLengthTokens: 512 | 80.1% | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/20 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
model: SPG · dataset: MATH-500 | -2.2864 ELBO units | — | 尚未评估 |
model: SPG · dataset: MATH-500 | 0.947 ELBO units | — | 尚未评估 |
model: SPG+IM · dataset: MATH-500 | -2.2146 ELBO units | — | 尚未评估 |
model: SPG+IM · dataset: MATH-500 | 0.9085 ELBO units | — | 尚未评估 |
model: GDPO · dataset: MATH-500 | -2.1095 ELBO units | — | 尚未评估 |
model: GDPO · dataset: MATH-500 | 1.1245 ELBO units | — | 尚未评估 |
model: GDPO+IM · dataset: MATH-500 | -2.0731 ELBO units | — | 尚未评估 |
model: GDPO+IM · dataset: MATH-500 | 0.9236 ELBO units | — | 尚未评估 |
model: SPG · dataset: Countdown | -1.8889 ELBO units | — | 尚未评估 |
model: SPG · dataset: Countdown | 1.3627 ELBO units | — | 尚未评估 |
model: SPG+IM · dataset: Countdown | -1.6249 ELBO units | — | 尚未评估 |
model: SPG+IM · dataset: Countdown | 1.0596 ELBO units | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/36 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
model: SPG · dataset: GSM8K · generationLengthTokens: 128 | 78.5% | — | 尚未评估 |
model: SPG · dataset: GSM8K · generationLengthTokens: 256 | 84.9% | — | 尚未评估 |
model: SPG · dataset: GSM8K · generationLengthTokens: 512 | 84.2% | — | 尚未评估 |
model: SPG · dataset: MATH-500 · generationLengthTokens: 128 | 34.6% | — | 尚未评估 |
model: SPG · dataset: MATH-500 · generationLengthTokens: 256 | 39.6% | — | 尚未评估 |
model: SPG · dataset: MATH-500 · generationLengthTokens: 512 | 42.6% | — | 尚未评估 |
model: SPG · dataset: Countdown · generationLengthTokens: 128 | 68.8% | — | 尚未评估 |
model: SPG · dataset: Countdown · generationLengthTokens: 256 | 70.7% | — | 尚未评估 |
model: SPG · dataset: Countdown · generationLengthTokens: 512 | 70.3% | — | 尚未评估 |
model: SPG · dataset: Sudoku · generationLengthTokens: 128 | 82.9% | — | 尚未评估 |
model: SPG · dataset: Sudoku · generationLengthTokens: 256 | 94% | — | 尚未评估 |
model: SPG · dataset: Sudoku · generationLengthTokens: 512 | 93.1% | — | 尚未评估 |
A candidate three-arm package is retained, but the fixed source does not identify Figure 3(a)'s dataset or host framework; choosing by visual/numeric similarity would not bind the paper comparison.
The complete paper-bound package remains in the catalog, but it requires regenerating one or more 8B RL-trained scientific states and cannot be admitted under the current one-L4 cumulative budget/runtime resources.
The complete paper-bound package remains in the catalog, but it requires regenerating one or more 8B RL-trained scientific states and cannot be admitted under the current one-L4 cumulative budget/runtime resources.
Four separately selectable experiment-rerun packages test the qualitative ordering on the declared 500 completions per dataset. Exact numeric curve matching is unavailable because the source gives no coordinates and does not identify the original completion checkpoint; this limitation is retained locally.
The complete paper-bound package remains in the catalog, but it requires regenerating one or more 8B RL-trained scientific states and cannot be admitted under the current one-L4 cumulative budget/runtime resources.
Method/setup context is exercised as a bound condition of the empirical packages; it is not an independent empirical result.
This is an explicit limitation/future-work statement. The only reported empirical countercheck, the single-token-reveal ablation, remains a separate catalog package.