正在加载页面…
The fact-grounding gap is small in aggregate but heterogeneous on 2WikiMultihopQA: extraction failures are rare for comparison questions and substantially more frequent for multi-step questions; domain-specific predictor retraining is accurate but still does not make re-retrieval beneficial. · CiteArk