正在加载页面…
Generalization correlations across datasets are usually modest, so the same checkpoint need not generalize consistently across tasks. Larger OLMo3 has higher mean correlations in every reported evaluation; larger Apertus increases flipped/truthy correlations but decreases repetitive/successive correlations. The source describes the overall trend as greater universality in larger models. · CiteArk