正在加载页面…
CIGAsk trains a multi-turn GRPO policy with an outcome reward, per-clarification Counterfactual Information Gain computed by a frozen reference model, and a terminal Asymmetric Ambiguity Bonus keyed to the gold ambiguity label. · CiteArk