来源:paper:PDF pp. 7–8, Figure 4, Table 3, and main-comparison paragraph
这条 Claim 暂无已发布的不可变 Assessment。
这条 Claim 暂无关联执行。
已评估 0/45 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · objective: MSE · datasetOrTask: mean(Wikitext-2, PTB, C4) | 31.17 perplexity | — | 尚未评估 |
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · objective: KL · datasetOrTask: mean(Wikitext-2, PTB, C4) | 37.31 perplexity | — | 尚未评估 |
bpd: 0.5 · side: K-only · model: Mistral-7B-v0.3 · objective: MSE · datasetOrTask: mean(Wikitext-2, PTB, C4) | 36.5 perplexity | — | 尚未评估 |
bpd: 0.5 · side: K-only · model: Mistral-7B-v0.3 · objective: KL · datasetOrTask: mean(Wikitext-2, PTB, C4) | 36.24 perplexity | — | 尚未评估 |
bpd: 0.5 · side: K-only · model: Qwen2.5-7B-Instruct · objective: MSE · datasetOrTask: mean(Wikitext-2, PTB, C4) | 16.33 perplexity | — | 尚未评估 |
bpd: 0.5 · side: K-only · model: Qwen2.5-7B-Instruct · objective: KL · datasetOrTask: mean(Wikitext-2, PTB, C4) | 17.17 perplexity | — | 尚未评估 |
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · objective: MSE · datasetOrTask: mean(five tasks) | 48.8% | — | 尚未评估 |
bpd: 0.5 · side: K-only · model: LLaMA-3.1-8B · objective: KL · datasetOrTask: mean(five tasks) | 48.5% | — | 尚未评估 |
bpd: 0.5 · side: K-only · model: Mistral-7B-v0.3 · objective: MSE · datasetOrTask: mean(five tasks) | 53.4% | — | 尚未评估 |
bpd: 0.5 · side: K-only · model: Mistral-7B-v0.3 · objective: KL · datasetOrTask: mean(five tasks) | 52.5% | — | 尚未评估 |
bpd: 0.5 · side: K-only · model: Qwen2.5-7B-Instruct · objective: MSE · datasetOrTask: mean(five tasks) | 48.7% | — | 尚未评估 |
bpd: 0.5 · side: K-only · model: Qwen2.5-7B-Instruct · objective: KL · datasetOrTask: mean(five tasks) | 48.5% | — | 尚未评估 |