Explore ArkGraph and select the steps to run.
The paper’s claims are available in Research claims.
0 / 25 claims verified
the rest still being verified
Experiment plan ready; no runs yet.
0/111 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
kBpd: 1 · vBpd: 4 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 5 | 17.35 perplexity | — | Not assessed |
kBpd: 2 · vBpd: 3 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 5 | 38.84 perplexity | — | Not assessed |
kBpd: 3 · vBpd: 2 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 5 | 732.1 perplexity | — | Not assessed |
kBpd: 1 · vBpd: 5 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 6 | 15.79 perplexity | — | Not assessed |
kBpd: 2 · vBpd: 4 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 6 | 17.88 perplexity | — | Not assessed |
kBpd: 3 · vBpd: 3 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 6 | 19.17 perplexity | — | Not assessed |
kBpd: 4 · vBpd: 2 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 6 | 550.4 perplexity | — | Not assessed |
kBpd: 1 · vBpd: 6 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 7 | 15.21 perplexity | — | Not assessed |
kBpd: 2 · vBpd: 5 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 7 | 15.48 perplexity | — | Not assessed |
kBpd: 3 · vBpd: 4 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 7 | 6.69 perplexity | — | Not assessed |
kBpd: 4 · vBpd: 3 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 7 | 17.26 perplexity | — | Not assessed |
kBpd: 5 · vBpd: 2 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 7 | 505.7 perplexity | — | Not assessed |
Experiment plan ready; no runs yet.
0/4 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
| 2.5 fold | — | Not assessed | |
| 5.9 fold | — | Not assessed | |
model: LLaMA-3.1-8B | 7.72 perplexity | — | Not assessed |
model: LLaMA-3.1-8B | 4.03 perplexity | — | Not assessed |
Experiment plan ready; no runs yet.
0/8 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
method: KIVI · headDimension: 128 | 1 bits per dimension | — | Not assessed |
method: KVQuant · headDimension: 128 | 0.16 bits per dimension | — | Not assessed |
method: GEAR · headDimension: 128 | 1 bits per dimension | — | Not assessed |
method: TurboQuant · headDimension: 128 | 0 bits per dimension | — | Not assessed |
method: SVDq · headDimension: 128 | 0 bits per dimension | — | Not assessed |
method: KQ-SVD · headDimension: 128 | 0 bits per dimension | — | Not assessed |
method: KV-COBRA · headDimension: 128 | 0 bits per dimension | — | Not assessed |
contextLength: 32768 · residualTokens: 128 | 0.07 bits per dimension | — | Not assessed |
Experiment plan ready; no runs yet.
0/24 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
bitWidth: 2 · queryHeads: 32 · retainedRank: 16 · headDimension: 128 · sequenceLength: 32000 | 1.83 fold | — | Not assessed |
bitWidth: 4 · queryHeads: 32 · retainedRank: 16 · headDimension: 128 · sequenceLength: 32000 | 1.84 fold | — | Not assessed |
bitWidth: 2 · queryHeads: 32 · retainedRank: 32 · headDimension: 128 · sequenceLength: 32000 | 1.77 fold | — | Not assessed |
bitWidth: 4 · queryHeads: 32 · retainedRank: 32 · headDimension: 128 · sequenceLength: 32000 | 1.73 fold | — | Not assessed |
bitWidth: 2 · queryHeads: 32 · retainedRank: 64 · headDimension: 128 · sequenceLength: 32000 | 1.4 fold | — | Not assessed |
bitWidth: 4 · queryHeads: 32 · retainedRank: 64 · headDimension: 128 · sequenceLength: 32000 | 1.31 fold | — | Not assessed |
bitWidth: 2 · queryHeads: 32 · retainedRank: 128 · headDimension: 128 · sequenceLength: 32000 | 0.44 fold | — | Not assessed |
bitWidth: 4 · queryHeads: 32 · retainedRank: 128 · headDimension: 128 · sequenceLength: 32000 | 0.32 fold | — | Not assessed |
bitWidth: 2 · queryHeads: 32 · retainedRank: 16 · headDimension: 128 · sequenceLength: 64000 | 1.79 fold | — | Not assessed |
bitWidth: 4 · queryHeads: 32 · retainedRank: 16 · headDimension: 128 · sequenceLength: 64000 | 1.85 fold | — | Not assessed |
bitWidth: 2 · queryHeads: 32 · retainedRank: 32 · headDimension: 128 · sequenceLength: 64000 | 1.82 fold | — | Not assessed |
bitWidth: 4 · queryHeads: 32 · retainedRank: 32 · headDimension: 128 · sequenceLength: 64000 | 1.74 fold | — | Not assessed |
Experiment plan ready; no runs yet.
0/45 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · objective: MSE · datasetOrTask: mean(Wikitext-2, PTB, C4) | 31.17 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · objective: KL · datasetOrTask: mean(Wikitext-2, PTB, C4) | 37.31 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: Mistral-7B-v0.3 · objective: MSE · datasetOrTask: mean(Wikitext-2, PTB, C4) | 36.5 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: Mistral-7B-v0.3 · objective: KL · datasetOrTask: mean(Wikitext-2, PTB, C4) | 36.24 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: Qwen2.5-7B-Instruct · objective: MSE · datasetOrTask: mean(Wikitext-2, PTB, C4) | 16.33 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: Qwen2.5-7B-Instruct · objective: KL · datasetOrTask: mean(Wikitext-2, PTB, C4) | 17.17 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · objective: MSE · datasetOrTask: mean(five tasks) | 48.8% | — | Not assessed |
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · objective: KL · datasetOrTask: mean(five tasks) | 48.5% | — | Not assessed |
bpd: 0.5 · side: K-only · model: Mistral-7B-v0.3 · objective: MSE · datasetOrTask: mean(five tasks) | 53.4% | — | Not assessed |
bpd: 0.5 · side: K-only · model: Mistral-7B-v0.3 · objective: KL · datasetOrTask: mean(five tasks) | 52.5% | — | Not assessed |
bpd: 0.5 · side: K-only · model: Qwen2.5-7B-Instruct · objective: MSE · datasetOrTask: mean(five tasks) | 48.7% | — | Not assessed |
bpd: 0.5 · side: K-only · model: Qwen2.5-7B-Instruct · objective: KL · datasetOrTask: mean(five tasks) | 48.5% | — | Not assessed |
Experiment plan ready; no runs yet.
0/96 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · objective: MSE · datasetOrTask: Wikitext-2 | 16.29 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · objective: KL · datasetOrTask: Wikitext-2 | 17.6 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: Mistral-7B-v0.3 · objective: MSE · datasetOrTask: Wikitext-2 | 9.05 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: Mistral-7B-v0.3 · objective: KL · datasetOrTask: Wikitext-2 | 8.08 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: Qwen2.5-7B-Instruct · objective: MSE · datasetOrTask: Wikitext-2 | 10.06 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: Qwen2.5-7B-Instruct · objective: KL · datasetOrTask: Wikitext-2 | 10.37 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · objective: MSE · datasetOrTask: PTB | 30.75 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · objective: KL · datasetOrTask: PTB | 34.74 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: Mistral-7B-v0.3 · objective: MSE · datasetOrTask: PTB | 81.88 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: Mistral-7B-v0.3 · objective: KL · datasetOrTask: PTB | 86.2 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: Qwen2.5-7B-Instruct · objective: MSE · datasetOrTask: PTB | 19.5 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: Qwen2.5-7B-Instruct · objective: KL · datasetOrTask: PTB | 20.37 perplexity | — | Not assessed |
Experiment plan ready; no runs yet.
0/8 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
heads: 256 · model: LLaMA-3.1-8B | 100 fold | — | Not assessed |
| 1,000 fold | — | Not assessed | |
| 16 dimensions | — | Not assessed | |
| 100 dimensions | — | Not assessed | |
| 2 bits | — | Not assessed | |
| 5 bits | — | Not assessed | |
| 2 fold | — | Not assessed | |
| 8 fold | — | Not assessed |
Experiment plan ready; no runs yet.
0/111 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
kBpd: 1 · vBpd: 4 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 5 | 8.64 F1 | — | Not assessed |
kBpd: 2 · vBpd: 3 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 5 | 6.75 F1 | — | Not assessed |
kBpd: 3 · vBpd: 2 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 5 | 3.25 F1 | — | Not assessed |
kBpd: 1 · vBpd: 5 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 6 | 9.86 F1 | — | Not assessed |
kBpd: 2 · vBpd: 4 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 6 | 8.31 F1 | — | Not assessed |
kBpd: 3 · vBpd: 3 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 6 | 9.71 F1 | — | Not assessed |
kBpd: 4 · vBpd: 2 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 6 | 3.73 F1 | — | Not assessed |
kBpd: 1 · vBpd: 6 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 7 | 8.08 F1 | — | Not assessed |
kBpd: 2 · vBpd: 5 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 7 | 8.89 F1 | — | Not assessed |
kBpd: 3 · vBpd: 4 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 7 | 13.59 F1 | — | Not assessed |
kBpd: 4 · vBpd: 3 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 7 | 8.98 F1 | — | Not assessed |
kBpd: 5 · vBpd: 2 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 7 | 3.66 F1 | — | Not assessed |
Experiment plan ready; no runs yet.
0/96 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
bpd: 1 · side: K-only · model: LLaMA-3.1-8B · objective: MSE · datasetOrTask: Wikitext-2 | 16.45 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-8B · objective: KL · datasetOrTask: Wikitext-2 | 13.27 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: Mistral-7B-v0.3 · objective: MSE · datasetOrTask: Wikitext-2 | 7.47 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: Mistral-7B-v0.3 · objective: KL · datasetOrTask: Wikitext-2 | 5.65 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: Qwen2.5-7B-Instruct · objective: MSE · datasetOrTask: Wikitext-2 | 8.14 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: Qwen2.5-7B-Instruct · objective: KL · datasetOrTask: Wikitext-2 | 8.17 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-8B · objective: MSE · datasetOrTask: PTB | 25.01 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-8B · objective: KL · datasetOrTask: PTB | 21.12 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: Mistral-7B-v0.3 · objective: MSE · datasetOrTask: PTB | 59.38 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: Mistral-7B-v0.3 · objective: KL · datasetOrTask: PTB | 32.86 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: Qwen2.5-7B-Instruct · objective: MSE · datasetOrTask: PTB | 14.79 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: Qwen2.5-7B-Instruct · objective: KL · datasetOrTask: PTB | 15.07 perplexity | — | Not assessed |
Experiment plan ready; no runs yet.
0/68 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
bpd: 16 · side: K-only · model: LLaMA-3.1-70B · method: FP16 | 5.38 perplexity | — | Not assessed |
bpd: 16 · side: K-only · model: LLaMA-3.1-70B · method: FP16 | 60.4% | — | Not assessed |
bpd: 16 · side: K-only · model: LLaMA-3.1-70B · method: FP16 | 14.3 F1 | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-70B · method: KV-COBRA_KL | 6.97 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-70B · method: KV-COBRA_KL | 58.4% | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-70B · method: KV-COBRA_KL | 13.5 F1 | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-70B · method: KV-COBRA_MSE | 9.5 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-70B · method: KV-COBRA_MSE | 58.5% | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-70B · method: KV-COBRA_MSE | 10.5 F1 | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-70B · method: KQ-SVD | 9.79 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-70B · method: KQ-SVD | 57% | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-70B · method: KQ-SVD | 11.2 F1 | — | Not assessed |
Experiment plan ready; no runs yet.
0/90 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
task: NarrativeQA · model: LLaMA-3.1-8B · method: KV-COBRA_KL · totalBpd: 5 | 1 bits per dimension | — | Not assessed |
task: NarrativeQA · model: LLaMA-3.1-8B · method: KV-COBRA_KL · totalBpd: 5 | 4 bits per dimension | — | Not assessed |
task: NarrativeQA · model: LLaMA-3.1-8B · method: KV-COBRA_KL · totalBpd: 6 | 1 bits per dimension | — | Not assessed |
task: NarrativeQA · model: LLaMA-3.1-8B · method: KV-COBRA_KL · totalBpd: 6 | 5 bits per dimension | — | Not assessed |
task: NarrativeQA · model: LLaMA-3.1-8B · method: KV-COBRA_KL · totalBpd: 7 | 1 bits per dimension | — | Not assessed |
task: NarrativeQA · model: LLaMA-3.1-8B · method: KV-COBRA_KL · totalBpd: 7 | 6 bits per dimension | — | Not assessed |
task: NarrativeQA · model: Mistral-7B-v0.3 · method: KV-COBRA_KL · totalBpd: 5 | 1 bits per dimension | — | Not assessed |
task: NarrativeQA · model: Mistral-7B-v0.3 · method: KV-COBRA_KL · totalBpd: 5 | 4 bits per dimension | — | Not assessed |
task: NarrativeQA · model: Mistral-7B-v0.3 · method: KV-COBRA_KL · totalBpd: 6 | 2 bits per dimension | — | Not assessed |
task: NarrativeQA · model: Mistral-7B-v0.3 · method: KV-COBRA_KL · totalBpd: 6 | 4 bits per dimension | — | Not assessed |
task: NarrativeQA · model: Mistral-7B-v0.3 · method: KV-COBRA_KL · totalBpd: 7 | 3 bits per dimension | — | Not assessed |
task: NarrativeQA · model: Mistral-7B-v0.3 · method: KV-COBRA_KL · totalBpd: 7 | 4 bits per dimension | — | Not assessed |
Experiment plan ready; no runs yet.
0/4 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
| 5 rounds | — | Not assessed | |
| 1% | — | Not assessed | |
scope: paper wording: across all three 7–8B models | 200 milliseconds | — | Not assessed |
rankStep: 2 · headDimension: 128 | 32 candidates | — | Not assessed |
Experiment plan ready; no runs yet.
0/4 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
| 0.46 ratio | — | Not assessed | |
side: V | 128 dimensions | — | Not assessed |
| 4 bits per dimension | — | Not assessed | |
| 5 bits per dimension | — | Not assessed |
Experiment plan ready; no runs yet.
0/49 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
bpd: 1 · side: K-only · model: LLaMA-3.1-8B · method: KV-COBRA_KL · calibration: reference n=32 WikiText-2 | 10.8 F1 | — | Not assessed |
bpd: 1 · side: K-only · model: Mistral-7B-v0.3 · method: KV-COBRA_KL · calibration: reference n=32 WikiText-2 | 10.6 F1 | — | Not assessed |
bpd: 1 · side: K-only · model: Qwen2.5-7B-Instruct · method: KV-COBRA_KL · calibration: reference n=32 WikiText-2 | 9.4 F1 | — | Not assessed |
calibration: disjoint WikiText-2 draw | 0.992 correlation | — | Not assessed |
calibration: disjoint WikiText-2 draw | 1 correlation | — | Not assessed |
calibration: disjoint WikiText-2 draw | 97% | — | Not assessed |
calibration: disjoint WikiText-2 draw | 100% | — | Not assessed |
calibration: disjoint WikiText-2 draw | 0.45 dimensions | — | Not assessed |
calibration: disjoint WikiText-2 draw | 1.17 dimensions | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-8B · method: KV-COBRA_KL · calibration: disjoint WikiText-2 draw | 9.6 F1 | — | Not assessed |
bpd: 1 · side: K-only · model: Mistral-7B-v0.3 · method: KV-COBRA_KL · calibration: disjoint WikiText-2 draw | 10 F1 | — | Not assessed |
bpd: 1 · side: K-only · model: Qwen2.5-7B-Instruct · method: KV-COBRA_KL · calibration: disjoint WikiText-2 draw | 9.4 F1 | — | Not assessed |
Experiment plan ready; no runs yet.
0/18 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · objective: MSE · contextLength: 4096 | 20.9% | — | Not assessed |
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · objective: KL · contextLength: 4096 | 44.3% | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-8B · objective: MSE · contextLength: 4096 | 67.1% | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-8B · objective: KL · contextLength: 4096 | 76% | — | Not assessed |
bpd: 2 · side: K-only · model: LLaMA-3.1-8B · objective: KL · contextLength: 4096 | 92.5% | — | Not assessed |
model: LLaMA-3.1-8B · configuration: FP16 · contextLength: 4096 | 93.5% | — | Not assessed |
bpd: 0.5 · side: K-only · model: Mistral-7B-v0.3 · objective: MSE · contextLength: 4096 | 36.7% | — | Not assessed |
bpd: 0.5 · side: K-only · model: Mistral-7B-v0.3 · objective: KL · contextLength: 4096 | 52% | — | Not assessed |
bpd: 1 · side: K-only · model: Mistral-7B-v0.3 · objective: MSE · contextLength: 4096 | 69.1% | — | Not assessed |
bpd: 1 · side: K-only · model: Mistral-7B-v0.3 · objective: KL · contextLength: 4096 | 79.3% | — | Not assessed |
bpd: 2 · side: K-only · model: Mistral-7B-v0.3 · objective: KL · contextLength: 4096 | 90.6% | — | Not assessed |
model: Mistral-7B-v0.3 · configuration: FP16 · contextLength: 4096 | 91.3% | — | Not assessed |
Experiment plan ready; no runs yet.
0/111 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
kBpd: 1 · vBpd: 4 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 5 · contextLength: 4096 | 67.33% | — | Not assessed |
kBpd: 2 · vBpd: 3 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 5 · contextLength: 4096 | 87.61% | — | Not assessed |
kBpd: 3 · vBpd: 2 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 5 · contextLength: 4096 | 92.07% | — | Not assessed |
kBpd: 1 · vBpd: 5 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 6 · contextLength: 4096 | 68.65% | — | Not assessed |
kBpd: 2 · vBpd: 4 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 6 · contextLength: 4096 | 88.33% | — | Not assessed |
kBpd: 3 · vBpd: 3 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 6 · contextLength: 4096 | 93.71% | — | Not assessed |
kBpd: 4 · vBpd: 2 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 6 · contextLength: 4096 | 93.11% | — | Not assessed |
kBpd: 1 · vBpd: 6 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 7 · contextLength: 4096 | 68.6% | — | Not assessed |
kBpd: 2 · vBpd: 5 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 7 · contextLength: 4096 | 88.24% | — | Not assessed |
kBpd: 3 · vBpd: 4 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 7 · contextLength: 4096 | 93.72% | — | Not assessed |
kBpd: 4 · vBpd: 3 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 7 · contextLength: 4096 | 93.88% | — | Not assessed |
kBpd: 5 · vBpd: 2 · model: LLaMA-3.1-8B · sides: K+V · method: KV-COBRA_MSE · totalBpd: 7 · contextLength: 4096 | 93.43% | — | Not assessed |
Experiment plan ready; no runs yet.
0/2 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
| 0.51% | — | Not assessed | |
bpd: 0.5 | 9.06% | — | Not assessed |
Experiment plan ready; no runs yet.
0/20 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
models: all three 7–8B models · bitWidth: 4 · aggregation: median across heads | 1 ratio | — | Not assessed |
models: all three 7–8B models · bitWidth: 4 | 31% | — | Not assessed |
models: all three 7–8B models · bitWidth: 3 · aggregation: median across heads | 1.1 ratio | — | Not assessed |
models: all three 7–8B models · bitWidth: 3 | 33% | — | Not assessed |
models: all three 7–8B models · bitWidth: 2 · aggregation: median across heads | 1.7 ratio | — | Not assessed |
models: all three 7–8B models · bitWidth: 2 | 41% | — | Not assessed |
models: all three 7–8B models · bitWidth: 1 · aggregation: median across heads | 6.9 ratio | — | Not assessed |
models: all three 7–8B models · bitWidth: 1 | 36% | — | Not assessed |
bpd: 16 · side: K-only · model: LLaMA-3.1-8B · configuration: FP16 | 5.71 perplexity | — | Not assessed |
bpd: 16 · side: K-only · model: Mistral-7B-v0.3 · configuration: FP16 | 4.77 perplexity | — | Not assessed |
bpd: 16 · side: K-only · model: Qwen2.5-7B-Instruct · configuration: FP16 | 6.07 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-8B · configuration: water-filling + Bennett estimate (shipped) | 16.33 perplexity | — | Not assessed |
Experiment plan ready; no runs yet.
0/55 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · solver: damped proportional update | 15.56 perplexity | — | Not assessed |
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · solver: exact DP over Bennett surrogate | 17.02 perplexity | — | Not assessed |
bpd: 0.5 · model: LLaMA-3.1-8B | 25 fold | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-8B · solver: damped proportional update | 15.55 perplexity | — | Not assessed |
bpd: 1 · side: K-only · model: LLaMA-3.1-8B · solver: exact DP over Bennett surrogate | 15.71 perplexity | — | Not assessed |
bpd: 1 · model: LLaMA-3.1-8B | 40 fold | — | Not assessed |
bpd: 2 · side: K-only · model: LLaMA-3.1-8B · solver: damped proportional update | 6.78 perplexity | — | Not assessed |
bpd: 2 · side: K-only · model: LLaMA-3.1-8B · solver: exact DP over Bennett surrogate | 7.38 perplexity | — | Not assessed |
bpd: 2 · model: LLaMA-3.1-8B | 49 fold | — | Not assessed |
bpd: 3 · side: K-only · model: LLaMA-3.1-8B · solver: damped proportional update | 5.98 perplexity | — | Not assessed |
bpd: 3 · side: K-only · model: LLaMA-3.1-8B · solver: exact DP over Bennett surrogate | 5.93 perplexity | — | Not assessed |
bpd: 3 · model: LLaMA-3.1-8B | 50 fold | — | Not assessed |
Experiment plan ready; no runs yet.
0/4 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
| 0.3 excess kurtosis | — | Not assessed | |
| 0.2 excess kurtosis | — | Not assessed | |
| 1.1 excess kurtosis | — | Not assessed | |
| 2.5 sigma | — | Not assessed |
A paired pre/post-RoPE package directly tests the source’s directional rule. Figure A6 has no reliable numeric targets, so raw paired PPL and the direction matrix require manual assessment and cannot be auto-verified from a fabricated scalar.
This is a negative scope statement derived from the primitive-only evidence in c14: the paper reports no end-to-end latency result.
This limitation is source context for c02 and c09 rather than a separate empirical outcome; the Gaussianity and finite-rate checks are represented there.
This is a limitation on refresh-during-generation, which the paper explicitly does not study; static calibration robustness is separately represented by c16.
This is a stated scope limitation, not an independently reported experiment; no token eviction or entropy-coding result is claimed.