浏览 ArkGraph,选择本次要执行的步骤。
论文中的结论可在「研究结论」中查看。
0 / 26 条结论已通过验证
其余仍在验证中
实验方案已生成,还没有运行记录
已评估 0/2 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
dataset: GPQA-Diamond · posttraining: Math SFT · basePretrainingTokensTrillions: 4.5 | 36.3% | — | 尚未评估 |
dataset: GPQA-Diamond · posttraining: Math SFT · basePretrainingTokensTrillions: 4.9 | 29.8% | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/16 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
model: olmo3-7b · evaluation: flipped-answer | 0.25 dimensionless | — | 尚未评估 |
model: olmo3-7b · evaluation: repetitive-answer | 0.15 dimensionless | — | 尚未评估 |
model: olmo3-7b · evaluation: successive-answer | 0.21 dimensionless | — | 尚未评估 |
model: olmo3-7b · evaluation: truthy-answer | 0.25 dimensionless | — | 尚未评估 |
model: olmo3-32b · evaluation: flipped-answer | 0.37 dimensionless | — | 尚未评估 |
model: olmo3-32b · evaluation: repetitive-answer | 0.58 dimensionless | — | 尚未评估 |
model: olmo3-32b · evaluation: successive-answer | 0.29 dimensionless | — | 尚未评估 |
model: olmo3-32b · evaluation: truthy-answer | 0.5 dimensionless | — | 尚未评估 |
model: apertus-8b · evaluation: flipped-answer | 0.26 dimensionless | — | 尚未评估 |
model: apertus-8b · evaluation: repetitive-answer | 0.47 dimensionless | — | 尚未评估 |
model: apertus-8b · evaluation: successive-answer | 0.25 dimensionless | — | 尚未评估 |
model: apertus-8b · evaluation: truthy-answer | 0.15 dimensionless | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/199 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
| 0.35 dimensionless | — | 尚未评估 | |
| 0.56 dimensionless | — | 尚未评估 | |
| 0.4 dimensionless | — | 尚未评估 | |
layer: 39 · dataset: successive-arithmetic-plus1 · complexityMetric: RankMe (activation) · selectedExtremum: rho-plus | 0.62 dimensionless | — | 尚未评估 |
layer: 14 · dataset: successive-arithmetic-plus1 · complexityMetric: RankMe (activation) · selectedExtremum: rho-minus | -0.46 dimensionless | — | 尚未评估 |
layer: 11 · dataset: successive-letters · complexityMetric: RankMe (activation) · selectedExtremum: rho-plus | 0.28 dimensionless | — | 尚未评估 |
layer: 25 · dataset: successive-letters · complexityMetric: RankMe (activation) · selectedExtremum: rho-minus | -0.3 dimensionless | — | 尚未评估 |
layer: 40 · dataset: successive-even-plus2 · complexityMetric: RankMe (activation) · selectedExtremum: rho-plus | 0.65 dimensionless | — | 尚未评估 |
layer: 22 · dataset: successive-even-plus2 · complexityMetric: RankMe (activation) · selectedExtremum: rho-minus | -0.67 dimensionless | — | 尚未评估 |
layer: 5 · dataset: successive-number-words · complexityMetric: RankMe (activation) · selectedExtremum: rho-plus | 0.29 dimensionless | — | 尚未评估 |
layer: 16 · dataset: successive-number-words · complexityMetric: RankMe (activation) · selectedExtremum: rho-minus | -0.52 dimensionless | — | 尚未评估 |
layer: 3 · dataset: repetitive-letter-counting · complexityMetric: RankMe (activation) · selectedExtremum: rho-plus | 0.23 dimensionless | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/10 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
evaluation: flipped-answer · checkpointPretrainingTokensTrillions: 4.5 | 0.19 probability difference | — | 尚未评估 |
evaluation: flipped-answer · checkpointPretrainingTokensTrillions: 4.9 | 0.1 probability difference | — | 尚未评估 |
evaluation: repetitive-answer · checkpointPretrainingTokensTrillions: 4.5 | 0.29 probability difference | — | 尚未评估 |
evaluation: repetitive-answer · checkpointPretrainingTokensTrillions: 4.9 | 0.26 probability difference | — | 尚未评估 |
evaluation: successive-answer · checkpointPretrainingTokensTrillions: 4.5 | 0.72 probability difference | — | 尚未评估 |
evaluation: successive-answer · checkpointPretrainingTokensTrillions: 4.9 | -0.29 probability difference | — | 尚未评估 |
evaluation: truthy-answer · checkpointPretrainingTokensTrillions: 4.5 | 0.3 probability difference | — | 尚未评估 |
evaluation: truthy-answer · checkpointPretrainingTokensTrillions: 4.9 | 0.14 probability difference | — | 尚未评估 |
evaluation: intuitive-answer · checkpointPretrainingTokensTrillions: 4.5 | 0.39 probability difference | — | 尚未评估 |
evaluation: intuitive-answer · checkpointPretrainingTokensTrillions: 4.9 | 0.15 probability difference | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/2 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
posttraining: General post-training · basePretrainingTokensTrillions: 4.5 | 53% | — | 尚未评估 |
posttraining: General post-training · basePretrainingTokensTrillions: 4.9 | 21% | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/28 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
dataset1: flipped-sst2 · dataset2: flipped-imdb | 0.43 dimensionless | — | 尚未评估 |
dataset1: flipped-sst2 · dataset2: flipped-rotten-tomatoes | 0.61 dimensionless | — | 尚未评估 |
dataset1: flipped-sst2 · dataset2: flipped-poem-sentiment | 0.28 dimensionless | — | 尚未评估 |
dataset1: flipped-sst2 · dataset2: flipped-yahoo-health-computers | -0.29 dimensionless | — | 尚未评估 |
dataset1: flipped-sst2 · dataset2: flipped-yahoo-business-science | -0.13 dimensionless | — | 尚未评估 |
dataset1: flipped-sst2 · dataset2: flipped-emotion-joy-sadness | 0.26 dimensionless | — | 尚未评估 |
dataset1: flipped-sst2 · dataset2: flipped-emotion-anger-joy | 0.24 dimensionless | — | 尚未评估 |
dataset1: flipped-imdb · dataset2: flipped-rotten-tomatoes | 0.5 dimensionless | — | 尚未评估 |
dataset1: flipped-imdb · dataset2: flipped-poem-sentiment | 0.31 dimensionless | — | 尚未评估 |
dataset1: flipped-imdb · dataset2: flipped-yahoo-health-computers | -0.07 dimensionless | — | 尚未评估 |
dataset1: flipped-imdb · dataset2: flipped-yahoo-business-science | -0.09 dimensionless | — | 尚未评估 |
dataset1: flipped-imdb · dataset2: flipped-emotion-joy-sadness | 0.18 dimensionless | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/3 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
model: OLMo3-32B · dataset: Arithmetic (+1) · pretrainingTokensTrillions: 2.17 | 81% | — | 尚未评估 |
model: OLMo3-32B · dataset: Arithmetic (+1) · pretrainingTokensTrillions: 2.19 | 0% | — | 尚未评估 |
model: OLMo3-32B · dataset: Arithmetic (+1) · pretrainingTokensTrillions: 2.21 | 81.7% | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/3 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
| 90% | — | 尚未评估 | |
| 20% | — | 尚未评估 | |
| 95% | — | 尚未评估 |
实验方案已生成,还没有运行记录
已评估 0/15 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
dataset1: flipped-sst2 · dataset2: sst2-paraphrase-1 | 0.96 dimensionless | — | 尚未评估 |
dataset1: flipped-sst2 · dataset2: sst2-paraphrase-2 | 0.96 dimensionless | — | 尚未评估 |
dataset1: flipped-sst2 · dataset2: flipped-imdb | 0.43 dimensionless | — | 尚未评估 |
dataset1: flipped-sst2 · dataset2: imdb-paraphrase-1 | 0.35 dimensionless | — | 尚未评估 |
dataset1: flipped-sst2 · dataset2: imdb-paraphrase-2 | 0.35 dimensionless | — | 尚未评估 |
dataset1: sst2-paraphrase-1 · dataset2: sst2-paraphrase-2 | 1 dimensionless | — | 尚未评估 |
dataset1: sst2-paraphrase-1 · dataset2: flipped-imdb | 0.34 dimensionless | — | 尚未评估 |
dataset1: sst2-paraphrase-1 · dataset2: imdb-paraphrase-1 | 0.37 dimensionless | — | 尚未评估 |
dataset1: sst2-paraphrase-1 · dataset2: imdb-paraphrase-2 | 0.37 dimensionless | — | 尚未评估 |
dataset1: sst2-paraphrase-2 · dataset2: flipped-imdb | 0.36 dimensionless | — | 尚未评估 |
dataset1: sst2-paraphrase-2 · dataset2: imdb-paraphrase-1 | 0.37 dimensionless | — | 尚未评估 |
dataset1: sst2-paraphrase-2 · dataset2: imdb-paraphrase-2 | 0.37 dimensionless | — | 尚未评估 |
The proposed observation comparison is retained, but a deterministic decision rule is unresolved.
The proposed observation comparison is retained, but a deterministic decision rule is unresolved.
The proposed observation comparison is retained, but a deterministic decision rule is unresolved.
The proposed observation comparison is retained, but a deterministic decision rule is unresolved.
The proposed observation comparison is retained, but a deterministic decision rule is unresolved.
The proposed observation comparison is retained, but a deterministic decision rule is unresolved.
The proposed observation comparison is retained, but a deterministic decision rule is unresolved.
The proposed observation comparison is retained, but a deterministic decision rule is unresolved.
The proposed observation comparison is retained, but a deterministic decision rule is unresolved.
The proposed observation comparison is retained, but a deterministic decision rule is unresolved.
The proposed observation comparison is retained, but a deterministic decision rule is unresolved.
The proposed observation comparison is retained, but a deterministic decision rule is unresolved.
A concrete full method and source observation comparisons remain cataloged. measurements=[] for observation-only packages; source observation IDs are never numeric references. This limits automatic verification, not scientific importance or source validity.
A concrete full method and source observation comparisons remain cataloged. measurements=[] for observation-only packages; source observation IDs are never numeric references. This limits automatic verification, not scientific importance or source validity.
Contextual applicability boundary of Figure14, not an independently reported failure: only preliminary answer+1 short continuation is demonstrated. Preserve it in data-selection-control objective; broader suite/fresh-pretraining efficacy is not claimed or verified.
A concrete full method and source observation comparisons remain cataloged. measurements=[] for observation-only packages; source observation IDs are never numeric references. This limits automatic verification, not scientific importance or source validity.
A concrete full method and source observation comparisons remain cataloged. measurements=[] for observation-only packages; source observation IDs are never numeric references. This limits automatic verification, not scientific importance or source validity.