Explore ArkGraph and select the steps to run.
The paper’s claims are available in Research claims.
0 / 13 claims verified
the rest still being verified
Experiment plan ready; no runs yet.
0/24 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: 47B classic · split: validation + test | 68.5% | — | Not assessed |
model: 63B classic · split: validation + test | 71% | — | Not assessed |
model: 67B SST · split: validation + test | 75% | — | Not assessed |
model: 47B classic · split: test | 58.44% | — | Not assessed |
model: 63B classic · split: test | 59.39% | — | Not assessed |
model: 67B SST · split: test | 60.54% | — | Not assessed |
model: 47B classic | 56.56% | — | Not assessed |
model: 63B classic | 55.04% | — | Not assessed |
model: 67B SST | 58.38% | — | Not assessed |
model: 47B classic · split: full test | 33.06% | — | Not assessed |
model: 63B classic · split: full test | 33.14% | — | Not assessed |
model: 67B SST · split: full test | 34.36% | — | Not assessed |
Experiment plan ready; no runs yet.
0/12 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: 67B SST · checkpoint: final · training_tokens_billion: 390.54 | 1.59 loss | — | Not assessed |
model: 47B classic · checkpoint: final · training_tokens_billion: 443.16 | 1.6006 loss | — | Not assessed |
model: 63B classic · checkpoint: final · training_tokens_billion: 334.62 | 1.5921 loss | — | Not assessed |
model: 67B SST · comparison: 47B classic | -0.0106 loss | — | Not assessed |
model: 67B SST · comparison: 63B classic | -0.0021 loss | — | Not assessed |
model: 63B classic · comparison: 47B classic | -0.0085 loss | — | Not assessed |
model: 47B classic | 443.16 billion tokens | — | Not assessed |
model: 63B classic | 334.62 billion tokens | — | Not assessed |
model: 47B classic | 1 fraction of 47B reference | — | Not assessed |
model: 63B classic · qualifier: approximately | 1 fraction of 47B reference | — | Not assessed |
model: 67B SST · qualifier: approximately · includes_source_stage: true | 1 fraction of 47B reference | — | Not assessed |
model: 47B classic · qualifier: approximately | 5,168,360,000,000,000,000,000 FLOPs | — | Not assessed |
Experiment plan ready; no runs yet.
0/18 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: GPT-6 Astra | 106.43 ratio | — | Not assessed |
model: GPT-6 Astra | 14.64 ratio | — | Not assessed |
model: GPT-6 Astra | 74.6% | — | Not assessed |
model: GPT-6 Astra Pro | 63.15 ratio | — | Not assessed |
model: GPT-6 Astra Pro | 14.01 ratio | — | Not assessed |
model: GPT-6 Astra Pro | 73.8% | — | Not assessed |
model: Claude Fable 5 | 63.38 ratio | — | Not assessed |
model: Claude Fable 5 | 16.29 ratio | — | Not assessed |
model: Claude Fable 5 | 76.7% | — | Not assessed |
model: Claude Sonnet 5 | 59.88 ratio | — | Not assessed |
model: Claude Sonnet 5 | 12.12 ratio | — | Not assessed |
model: Claude Sonnet 5 | 70.8% | — | Not assessed |
Experiment plan ready; no runs yet.
0/18 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: 67B SST · component: Prefiller only | 1.12 billion parameters per token | — | Not assessed |
model: 67B SST · components: Prefiller + Decoder | 2.155 billion parameters per token | — | Not assessed |
model: 47B classic | 1.477 billion parameters per token | — | Not assessed |
model: 63B classic | 2.016 billion parameters per token | — | Not assessed |
model: 67B SST · decode_weight_percent: 25 · prefill_weight_percent: 75 | 0.933 fraction of 47B classic | — | Not assessed |
model: 47B classic · decode_weight_percent: 25 · prefill_weight_percent: 75 | 1 fraction of 47B classic | — | Not assessed |
model: 63B classic · decode_weight_percent: 25 · prefill_weight_percent: 75 | 1.365 fraction of 47B classic | — | Not assessed |
model: 63B classic · comparison: 47B classic · prefill_decode_mix: 75:25 | 36.5% | — | Not assessed |
model: 67B SST · comparison: 47B classic · prefill_decode_mix: 75:25 | 6.7% | — | Not assessed |
model: 67B SST · comparison: 63B classic · prefill_decode_mix: 75:25 | 31.6% | — | Not assessed |
models: 67B SST and 47B classic · decode_weight_percent: 34.5 | 65.5% | — | Not assessed |
models: 67B SST and 63B classic · decode_weight_percent: 86.6 | 13.4% | — | Not assessed |
Experiment plan ready; no runs yet.
0/8 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: 47B classic · qualifier: approximately | 3.8875 billion FLOPs per token | — | Not assessed |
model: 63B classic · qualifier: approximately | 5.1485 billion FLOPs per token | — | Not assessed |
model: source · qualifier: approximately | 3.0873 billion FLOPs per token | — | Not assessed |
model: 67B SST · qualifier: approximately | 5.4107 billion FLOPs per token | — | Not assessed |
qualifier: approximation | 3 factor | — | Not assessed |
| 4,096 tokens | — | Not assessed | |
| 512 tokens | — | Not assessed | |
| 128,896 rows | — | Not assessed |
Experiment plan ready; no runs yet.
0/21 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: source | 33.819 billion parameters | — | Not assessed |
model: 67B SST | 66.959 billion parameters | — | Not assessed |
model: 47B classic | 46.727 billion parameters | — | Not assessed |
model: 63B classic | 62.691 billion parameters | — | Not assessed |
model: source | 18 layers | — | Not assessed |
model: 67B SST | 18 layers | — | Not assessed |
model: 67B SST | 18 layers | — | Not assessed |
model: 47B classic | 20 layers | — | Not assessed |
model: 63B classic | 22 layers | — | Not assessed |
model: source | 2,304 dimensions | — | Not assessed |
model: 67B SST | 2,304 dimensions | — | Not assessed |
model: 47B classic | 2,560 dimensions | — | Not assessed |
Experiment plan ready; no runs yet.
0/2 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
| 167.98 billion cumulative training tokens | — | Not assessed | |
| 0.301 fraction of B_ref | — | Not assessed |
Experiment plan ready; no runs yet.
0/37 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: GPT-6 Astra | 356.199 billion tokens | — | Not assessed |
model: GPT-6 Astra | 2,232.435 billion tokens | — | Not assessed |
model: GPT-6 Astra | 24.323 billion tokens | — | Not assessed |
model: GPT-6 Astra | 3.56 million USD | — | Not assessed |
model: GPT-6 Astra | 1.2135 million USD | — | Not assessed |
model: GPT-6 Astra Pro | 45.611 billion tokens | — | Not assessed |
model: GPT-6 Astra Pro | 159.946 billion tokens | — | Not assessed |
model: GPT-6 Astra Pro | 3.255 billion tokens | — | Not assessed |
model: GPT-6 Astra Pro | 0.4554 million USD | — | Not assessed |
model: GPT-6 Astra Pro | 0.1613 million USD | — | Not assessed |
model: Claude Fable 5 | 159.115 billion tokens | — | Not assessed |
model: Claude Fable 5 | 460.103 billion tokens | — | Not assessed |
Experiment plan ready; no runs yet.
0/4 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
models: GPT-6 Astra and GPT-6 Astra Pro | 17 days | — | Not assessed |
model: Gemini 3.8 Flash | 19 days | — | Not assessed |
models: Claude Fable 5, Claude Sonnet 5, and Gemini 3.7 Flash | 30 days | — | Not assessed |
model: Claude Fable 5 | 10 days | — | Not assessed |
Experiment plan ready; no runs yet.
0/26 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
models: source and each SST tower | 4,608 dimensions | — | Not assessed |
model: 47B classic | 5,120 dimensions | — | Not assessed |
model: 63B classic | 5,632 dimensions | — | Not assessed |
models: source and each SST tower | 576 dimensions | — | Not assessed |
models: source and each SST tower | 576 dimensions | — | Not assessed |
model: 47B classic | 640 dimensions | — | Not assessed |
model: 47B classic | 640 dimensions | — | Not assessed |
model: 63B classic | 704 dimensions | — | Not assessed |
model: 63B classic | 704 dimensions | — | Not assessed |
models: source, SST, 47B classic, 63B classic | 128 dimensions | — | Not assessed |
models: source, SST, 47B classic, 63B classic | 64 dimensions | — | Not assessed |
models: source, SST, 47B classic, 63B classic | 128 dimensions | — | Not assessed |
Experiment plan ready; no runs yet.
0/20 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: source stage of SST | 167.98 billion tokens | — | Not assessed |
model: 67B SST continuation | 222.55 billion tokens | — | Not assessed |
model: 67B SST | 390.54 billion tokens | — | Not assessed |
| 13,350 updates | — | Not assessed | |
| 17,687 updates | — | Not assessed | |
| 31,037 updates | — | Not assessed | |
gpu_type: NVIDIA H800 | 128 GPUs | — | Not assessed |
| 4,096 tokens | — | Not assessed | |
| 3,072 sequences | — | Not assessed | |
models: source, 67B SST, and 63B classic | 12,582,912 tokens | — | Not assessed |
model: 47B classic | 14,680,064 tokens | — | Not assessed |
| 6 steps | — | Not assessed |
The GSM8K and HumanEval directions have an explicit evaluation decision rule but require the same unavailable 47B and 63B final checkpoints and evaluator definitions.
This is a limitation on inference from the represented experiments, not an independent reported outcome. No unreported connectivity ablation, scaling law, causal decomposition, or serving-speed result is fabricated.