论文中的结论可在「研究结论」中查看。
0 / 14 条结论已通过验证
其余仍在验证中
No experiment has been scheduled for this empirical claim; feasibility remains to be established.
已评估 0/9 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
defense: No-guard · benchmark: SkillSafetyBench | 93.3 percentage_points | — | 尚未评估 |
defense: No-guard · benchmark: WildClawBench | 38 percentage_points | — | 尚未评估 |
defense: AcceptEdits · benchmark: WildClawBench | 41 percentage_points | — | 尚未评估 |
defense: AcceptEdits + allowlist · benchmark: SkillSafetyBench | 64.3 percentage_points | — | 尚未评估 |
defense: AcceptEdits + allowlist · benchmark: WildClawBench | 45 percentage_points | — | 尚未评估 |
defense: System prompt · benchmark: SkillSafetyBench | 83.3 percentage_points | — | 尚未评估 |
defense: System prompt · benchmark: WildClawBench | 43 percentage_points | — | 尚未评估 |
defense: SkillSonar (ours) · benchmark: SkillSafetyBench | 52.9 percentage_points | — | 尚未评估 |
defense: SkillSonar (ours) · benchmark: WildClawBench | 54 percentage_points | — | 尚未评估 |
No experiment has been scheduled for this empirical claim; feasibility remains to be established.
已评估 0/15 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
model: GLM-5 · defense: No-guard | 0.815 score | — | 尚未评估 |
model: Claude Haiku 4.5 · defense: No-guard | 0.827 score | — | 尚未评估 |
model: GPT-5.4 · defense: No-guard | 0.793 score | — | 尚未评估 |
model: GLM-5 · defense: System prompt | 0.833 score | — | 尚未评估 |
model: Claude Haiku 4.5 · defense: System prompt | 0.788 score | — | 尚未评估 |
model: GPT-5.4 · defense: System prompt | 0.836 score | — | 尚未评估 |
model: GLM-5 · defense: AcceptEdits | 0.796 score | — | 尚未评估 |
model: Claude Haiku 4.5 · defense: AcceptEdits | 0.813 score | — | 尚未评估 |
model: GPT-5.4 · defense: AcceptEdits | 0.74 score | — | 尚未评估 |
model: GLM-5 · defense: AcceptEdits + allowlist | 0.792 score | — | 尚未评估 |
model: Claude Haiku 4.5 · defense: AcceptEdits + allowlist | 0.819 score | — | 尚未评估 |
model: GPT-5.4 · defense: AcceptEdits + allowlist | 0.764 score | — | 尚未评估 |
No experiment has been scheduled for this empirical claim; feasibility remains to be established.
已评估 0/18 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
split: id_test · defense: No Guard · risk_family: Resource & Reliability | 61.3 percentage_points | — | 尚未评估 |
split: id_test · defense: SkillSonar · risk_family: Resource & Reliability | 11.3 percentage_points | — | 尚未评估 |
split: id_test · risk_family: Resource & Reliability | 50 percentage_points | — | 尚未评估 |
split: id_test · defense: No Guard · risk_family: Execution Safety | 48.6 percentage_points | — | 尚未评估 |
split: id_test · defense: SkillSonar · risk_family: Execution Safety | 5.7 percentage_points | — | 尚未评估 |
split: id_test · risk_family: Execution Safety | 42.9 percentage_points | — | 尚未评估 |
split: id_test · defense: No Guard · risk_family: Specification Integrity | 41.2 percentage_points | — | 尚未评估 |
split: id_test · defense: SkillSonar · risk_family: Specification Integrity | 5.9 percentage_points | — | 尚未评估 |
split: id_test · risk_family: Specification Integrity | 35.3 percentage_points | — | 尚未评估 |
split: id_test · defense: No Guard · risk_family: Operational Side Effects | 36.7 percentage_points | — | 尚未评估 |
split: id_test · defense: SkillSonar · risk_family: Operational Side Effects | 18.3 percentage_points | — | 尚未评估 |
split: id_test · risk_family: Operational Side Effects | 18.3 percentage_points | — | 尚未评估 |
No experiment has been scheduled for this empirical claim; feasibility remains to be established.
已评估 0/12 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
split: id_test · configuration: Flattened prompt | 0.353 fraction | — | 尚未评估 |
split: ood_test · configuration: Flattened prompt | 0.437 fraction | — | 尚未评估 |
split: id_test · configuration: SkillSonar | 0.104 fraction | — | 尚未评估 |
split: ood_test · configuration: SkillSonar | 0.109 fraction | — | 尚未评估 |
split: id_test · configuration: Flattened prompt | 0.655 score | — | 尚未评估 |
split: ood_test · configuration: Flattened prompt | 0.672 score | — | 尚未评估 |
split: id_test · configuration: SkillSonar | 0.815 score | — | 尚未评估 |
split: ood_test · configuration: SkillSonar | 0.789 score | — | 尚未评估 |
configuration: Flattened prompt | 0.748 score | — | 尚未评估 |
configuration: SkillSonar | 0.763 score | — | 尚未评估 |
configuration: Flattened prompt | 239 thousands_of_tokens | — | 尚未评估 |
configuration: SkillSonar | 188 thousands_of_tokens | — | 尚未评估 |
No experiment has been scheduled for this empirical claim; feasibility remains to be established.
已评估 0/10 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
split: id_test · defense: AgentSpec | 0.294 fraction | — | 尚未评估 |
split: ood_test · defense: AgentSpec | 0.576 fraction | — | 尚未评估 |
split: id_test · defense: AgentSpec | 0.581 score | — | 尚未评估 |
defense: AgentSpec | 0.642 score | — | 尚未评估 |
split: id_test · defense: TS-Guard | 0.412 fraction | — | 尚未评估 |
split: ood_test · defense: TS-Guard | 0.492 fraction | — | 尚未评估 |
defense: TS-Guard | 0.703 score | — | 尚未评估 |
split: id_test · defense: No-guard | 0.477 fraction | — | 尚未评估 |
split: id_test · defense: No-guard | 0.829 score | — | 尚未评估 |
defense: No-guard | 0.757 score | — | 尚未评估 |
No experiment has been scheduled for this empirical claim; feasibility remains to be established.
已评估 0/6 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
stage: Data construction | 88 percentage_points | — | 尚未评估 |
stage: Data construction | 100 percentage_points | — | 尚未评估 |
stage: Data construction | 94 percentage_points | — | 尚未评估 |
stage: Final evaluation | 96 percentage_points | — | 尚未评估 |
stage: Final evaluation | 100 percentage_points | — | 尚未评估 |
stage: Final evaluation | 98 percentage_points | — | 尚未评估 |
No experiment has been scheduled for this empirical claim; feasibility remains to be established.
已评估 0/21 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
defense: No Guard · risk_family: Capability Control | 55 percentage_points | — | 尚未评估 |
defense: SkillSonar · risk_family: Capability Control | 26.7 percentage_points | — | 尚未评估 |
risk_family: Capability Control | -28.3 percentage_points | — | 尚未评估 |
defense: No Guard · risk_family: Specification Integrity | 53.3 percentage_points | — | 尚未评估 |
defense: SkillSonar · risk_family: Specification Integrity | 43.3 percentage_points | — | 尚未评估 |
risk_family: Specification Integrity | -10 percentage_points | — | 尚未评估 |
defense: No Guard · risk_family: Resource & Reliability | 45 percentage_points | — | 尚未评估 |
defense: SkillSonar · risk_family: Resource & Reliability | 26.7 percentage_points | — | 尚未评估 |
risk_family: Resource & Reliability | -18.3 percentage_points | — | 尚未评估 |
defense: No Guard · risk_family: Privacy & Data Flow | 43.3 percentage_points | — | 尚未评估 |
defense: SkillSonar · risk_family: Privacy & Data Flow | 8.3 percentage_points | — | 尚未评估 |
risk_family: Privacy & Data Flow | -35 percentage_points | — | 尚未评估 |
No experiment has been scheduled for this empirical claim; feasibility remains to be established.
已评估 0/7 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
split: id_test · source_model: GLM-5 · target_model: Kimi-K2.6 | 0.199 fraction | — | 尚未评估 |
split: ood_test · source_model: GLM-5 · target_model: Kimi-K2.6 | 0.161 fraction | — | 尚未评估 |
split: id_test · source_model: Kimi-K2.6 · target_model: GLM-5 | 0.112 fraction | — | 尚未评估 |
split: id_test · source_model: Kimi-K2.6 · target_model: Claude Haiku 4.5 | 0.059 fraction | — | 尚未评估 |
split: id_test · source_model: Kimi-K2.6 · target_model: GPT-5.4 | 0.019 fraction | — | 尚未评估 |
split: id_test · source_model: GLM-5 · target_model: Kimi-K2.6 | 0.799 score | — | 尚未评估 |
split: ood_test · source_model: GLM-5 · target_model: Kimi-K2.6 | 0.799 score | — | 尚未评估 |
No experiment has been scheduled for this empirical claim; feasibility remains to be established.
已评估 0/30 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
model: GLM-5 · split: id_test · defense: No-guard · environment: OpenClaw | 0.596 fraction | — | 尚未评估 |
model: GLM-5 · split: ood_test · defense: No-guard · environment: OpenClaw | 0.621 fraction | — | 尚未评估 |
model: GLM-5 · split: id_test · defense: No-guard · environment: OpenClaw | 0.893 score | — | 尚未评估 |
model: GLM-5 · split: ood_test · defense: No-guard · environment: OpenClaw | 0.92 score | — | 尚未评估 |
model: GLM-5 · defense: No-guard · environment: OpenClaw | 102,398 tokens | — | 尚未评估 |
model: GLM-5 · split: id_test · defense: System prompt · environment: OpenClaw | 0.577 fraction | — | 尚未评估 |
model: GLM-5 · split: ood_test · defense: System prompt · environment: OpenClaw | 0.453 fraction | — | 尚未评估 |
model: GLM-5 · split: id_test · defense: System prompt · environment: OpenClaw | 0.807 score | — | 尚未评估 |
model: GLM-5 · split: ood_test · defense: System prompt · environment: OpenClaw | 0.835 score | — | 尚未评估 |
model: GLM-5 · defense: System prompt · environment: OpenClaw | 93,352 tokens | — | 尚未评估 |
model: GLM-5 · split: id_test · defense: SkillSonar (ours) · environment: OpenClaw | 0.245 fraction | — | 尚未评估 |
model: GLM-5 · split: ood_test · defense: SkillSonar (ours) · environment: OpenClaw | 0.232 fraction | — | 尚未评估 |
No experiment has been scheduled for this empirical claim; feasibility remains to be established.
已评估 0/6 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
split: id_test · configuration: No explicit invocation | 0.4 fraction | — | 尚未评估 |
split: ood_test · configuration: No explicit invocation | 0.582 fraction | — | 尚未评估 |
split: id_test · configuration: Explicit invocation | 0.104 fraction | — | 尚未评估 |
split: ood_test · configuration: Explicit invocation | 0.109 fraction | — | 尚未评估 |
configuration: No explicit invocation | 0.756 score | — | 尚未评估 |
configuration: Explicit invocation | 0.767 score | — | 尚未评估 |
No experiment has been scheduled for this empirical claim; feasibility remains to be established.
已评估 0/2 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
iteration: 1 | 0.3 fraction | — | 尚未评估 |
iteration: 9 | 0.078 fraction | — | 尚未评估 |
No experiment has been scheduled for this empirical claim; feasibility remains to be established.
已评估 0/50 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
model: Claude Haiku 4.5 · split: id_test · defense: No-guard | 0.481 fraction | — | 尚未评估 |
model: Claude Haiku 4.5 · split: ood_test · defense: No-guard | 0.707 fraction | — | 尚未评估 |
model: Claude Haiku 4.5 · split: id_test · defense: No-guard | 0.764 score | — | 尚未评估 |
model: Claude Haiku 4.5 · split: ood_test · defense: No-guard | 0.737 score | — | 尚未评估 |
model: Claude Haiku 4.5 · defense: No-guard | 179,918 tokens | — | 尚未评估 |
model: Claude Haiku 4.5 · split: id_test · defense: System prompt | 0.451 fraction | — | 尚未评估 |
model: Claude Haiku 4.5 · split: ood_test · defense: System prompt | 0.508 fraction | — | 尚未评估 |
model: Claude Haiku 4.5 · split: id_test · defense: System prompt | 0.661 score | — | 尚未评估 |
model: Claude Haiku 4.5 · split: ood_test · defense: System prompt | 0.662 score | — | 尚未评估 |
model: Claude Haiku 4.5 · defense: System prompt | 160,672 tokens | — | 尚未评估 |
model: Claude Haiku 4.5 · split: id_test · defense: AcceptEdits | 0.118 fraction | — | 尚未评估 |
model: Claude Haiku 4.5 · split: ood_test · defense: AcceptEdits | 0.051 fraction | — | 尚未评估 |
No experiment has been scheduled for this empirical claim; feasibility remains to be established.
已评估 0/25 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
split: id_test · defense: No-guard | 0.482 fraction | — | 尚未评估 |
split: ood_test · defense: No-guard | 0.606 fraction | — | 尚未评估 |
split: id_test · defense: No-guard | 0.811 score | — | 尚未评估 |
split: ood_test · defense: No-guard | 0.839 score | — | 尚未评估 |
defense: No-guard | 179.3 thousands_of_tokens | — | 尚未评估 |
split: id_test · defense: System prompt | 0.414 fraction | — | 尚未评估 |
split: ood_test · defense: System prompt | 0.489 fraction | — | 尚未评估 |
split: id_test · defense: System prompt | 0.783 score | — | 尚未评估 |
split: ood_test · defense: System prompt | 0.807 score | — | 尚未评估 |
defense: System prompt | 175.6 thousands_of_tokens | — | 尚未评估 |
split: id_test · defense: AcceptEdits | 0.122 fraction | — | 尚未评估 |
split: ood_test · defense: AcceptEdits | 0.073 fraction | — | 尚未评估 |
No experiment has been scheduled for this empirical claim; feasibility remains to be established.
已评估 0/8 项
保留同一结论下的完整结果组。已有评估排在前面;单项判断不替代整组结论。展开行查看条件、来源与历次证据。
| 指标与条件 | 论文报告 | 最近可用实测 | 证据判断 |
|---|---|---|---|
split: train | 95 count | — | 尚未评估 |
split: train | 46.1 percentage_points | — | 尚未评估 |
split: id_test | 52 count | — | 尚未评估 |
split: id_test | 25.2 percentage_points | — | 尚未评估 |
split: ood_test | 59 count | — | 尚未评估 |
split: ood_test | 28.6 percentage_points | — | 尚未评估 |
split: total | 206 count | — | 尚未评估 |
split: total | 100 percentage_points | — | 尚未评估 |