Source: source-paper:Table 5, page 10
No immutable Assessment has been published for this Claim yet.
No execution has been linked to this Claim yet.
0/15 assessed
The complete result group stays with its claim. Assessed rows come first; their judgments do not replace the whole-claim conclusion. Expand a row for conditions, sources, and evidence history.
| Metric and conditions | Reported | Latest observation | Evidence judgment |
|---|---|---|---|
model: GLM-5 · defense: No-guard | 0.815 score | — | Not assessed |
model: Claude Haiku 4.5 · defense: No-guard | 0.827 score | — | Not assessed |
model: GPT-5.4 · defense: No-guard | 0.793 score | — | Not assessed |
model: GLM-5 · defense: System prompt | 0.833 score | — | Not assessed |
model: Claude Haiku 4.5 · defense: System prompt | 0.788 score | — | Not assessed |
model: GPT-5.4 · defense: System prompt | 0.836 score | — | Not assessed |
model: GLM-5 · defense: AcceptEdits | 0.796 score | — | Not assessed |
model: Claude Haiku 4.5 · defense: AcceptEdits | 0.813 score | — | Not assessed |
model: GPT-5.4 · defense: AcceptEdits | 0.74 score | — | Not assessed |
model: GLM-5 · defense: AcceptEdits + allowlist | 0.792 score | — | Not assessed |
model: Claude Haiku 4.5 · defense: AcceptEdits + allowlist | 0.819 score | — | Not assessed |
model: GPT-5.4 · defense: AcceptEdits + allowlist | 0.764 score | — | Not assessed |