本次复现积分预估
预计消耗
549
最大预留
1683
预计算力时长
约 210 分钟
实际消耗 0 积分,扣除 0 积分;算力运行约 0 分钟,模型 Token 0。
另观测到失败尝试使用算力约 14 分钟、模型 Token 7142207;该部分未产出可导入结果,不计入积分。
论文中的结论可在「研究结论」中查看。
0 / 4 条结论已通过验证
其余仍在验证中
实验方案已生成,还没有运行记录
已评估 0/3 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
trials: 5 · dataset: HotPotQA · metric_scope: task success rate · test_tasks_per_trial: 100 | 22 percentage_points | — | 尚未评估 |
trials: 5 · dataset: ChartQAPro · metric_scope: task success rate · test_tasks_per_trial: 100 | 26 percentage_points | — | 尚未评估 |
trials: 5 · dataset: Mind2Web · metric_scope: task success rate · test_tasks_per_trial: 100 | 27 percentage_points | — | 尚未评估 |
所需输入不可用 · 等待所需代码、数据或输入补齐后继续。
实验方案已生成,还没有运行记录
已评估 0/3 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
split: held-in · method: ProFA · dataset: HotPotQA · value_scope: test set of constructed Who & When Pro dataset · accuracy_level: agent | 0.85 fraction | — | 尚未评估 |
split: held-out Algorithm-Generated · method: ProFA · dataset: Who & When · failure_logs: 184 · accuracy_level: step | 0.53 fraction | — | 尚未评估 |
split: held-out Hand-Crafted · method: ProFA · dataset: Who & When · failure_logs: 184 · accuracy_level: step | 0.2 fraction | — | 尚未评估 |
实验执行出错 · 不会自动重试,需要人工决定后续处理。
The claim is supported by plotted curves without machine-readable scalar values, and direct evaluation requires the unavailable datasets, model assets, external agent services, and exact implementation details.
This is an explicit limitation note, not an independent empirical measurement requiring reproduction.