来源:paper:p7-b74
这条 Claim 暂无已发布的不可变 Assessment。
这条 Claim 暂无关联执行。
已评估 0/8 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
model: Grok 4.1 Fast · method: Vanilla ReAct (Yao et al., 2023b) · benchmark: MultiChallenge | 68.07% | — | 尚未评估 |
model: Grok 4.1 Fast · method: MemoryBank (Zhong et al., 2024) · benchmark: MultiChallenge | 84.94% | — | 尚未评估 |
model: Grok 4.1 Fast · method: RAP (Kagaya et al., 2024) · benchmark: MultiChallenge | 80.12% | — | 尚未评估 |
model: Grok 4.1 Fast · method: ExpeL (Zhao et al., 2024) · benchmark: MultiChallenge | 84.94% | — | 尚未评估 |
model: Grok 4.1 Fast · method: AutoGuide (Fu et al., 2024) · benchmark: MultiChallenge | 80.72% | — | 尚未评估 |
model: Grok 4.1 Fast · method: AWM (Wang et al., 2025b) · benchmark: MultiChallenge | 83.73% | — | 尚未评估 |
model: Grok 4.1 Fast · method: KnowAgent (Zhu et al., 2025) · benchmark: MultiChallenge | 83.13% | — | 尚未评估 |
model: Grok 4.1 Fast · method: Procedural Graph (Ours) · benchmark: MultiChallenge | 86.75% | — | 尚未评估 |