BENCHMARK 結果
783 條 ATR 規則的公開實測結果
每一個 benchmark 都附上原始資料來源、可重現的方法論、以及執行的 ATR 版本。沒有 cherry-picking。
所有 precision / FP 數字皆為單一語料庫的 Layer 1 量測,不是全引擎宣稱。Benign-gate 誤報採 lane 化統計:65,000 個 benign 樣本上 enforce lane 約 0.24%、hunt lane(預設)約 9%。沒有單一的全引擎 FP 數字。
Garak(NVIDIA 越獄語料庫)
NVIDIA garak 是業界領先的開源 LLM red-teaming 框架。我們用 ATR v2.1.2 對 garak 完整語料庫做對抗式 prompt 偵測測試。
召回率
97.2%
樣本數
650 個樣本
層級
僅 Regex(無 LLM 二次判讀)
ATR 版本
v2.1.2
重現指令
pnpm bench:garak (in agent-threat-rules repo)SKILL.md(PanGuard 野外語料庫)
ClawHub、OpenClaw、Skills.sh 的 AI agent skill,498 個樣本,人工標記。一半惡意,一半合法。用來驗證 ATR 抓得到威脅而不會誤報過多。
召回率
100%
精確率
97%
誤報率
0.2%
樣本數
498 個樣本
數字口徑
Precision / FP 為此語料庫的 Layer 1(確定性規則)量測,非全引擎數字。實務誤報採 lane 化:65,000 個 benign 樣本上 enforce lane 約 0.24%、hunt lane(預設)約 9%。
重現指令
pnpm bench:skill (in agent-threat-rules repo)PINT(自建 PINT 格式語料庫)
自建的 850 樣本 PINT 格式語料庫,由 deepset prompt-injections 資料集加上 Lakera Gandalf 組成。這不是 Lakera 官方 PINT benchmark,也不歸屬於任何第三方。比 Garak/SKILL.md 召回率低,因為語料庫混入了 SIEM 風格的偵測模式——PanGuard Migrator 的 Sigma 轉換能補上這個缺口。
召回率
65.41%
精確率(PINT 格式語料庫,自建)
100%
樣本數
850 個樣本
層級
Layer 1 — 僅 regex
數字口徑
Precision / FP 為此語料庫的 Layer 1(確定性規則)量測,非全引擎數字。實務誤報採 lane 化:65,000 個 benign 樣本上 enforce lane 約 0.24%、hunt lane(預設)約 9%。
重現指令
pnpm bench:pint (in agent-threat-rules repo)Wild Scan(完整生態系稽核)
對 ClawHub、OpenClaw、Skills.sh 上每一個能爬到的 AI agent skill 做實測。不是策展過的 benchmark——是真實作者上架的生產級 skill。結果:96,096 個被掃描的 skill 中 1,302 個被標記,人工複審後 552 個確認為惡意程式。
掃描 skill 數
96,096
被標記
1,302
確認惡意
552
三重威脅套件
249
Postinstall 腳本
122
重現指令
scripts/wild-scan.ts (in panguard-ai monorepo)HackAPrompt 叢集探勘
ATR 對 HackAPrompt EMNLP 2023 競賽語料庫(4,780 個確定性樣本)的實測。結果:69.6% recall,0 個新誤報。數字誠實,低於閉源 ML 偵測器的宣稱。方法論與規則更新公開於工程部落格。
HackAPrompt 召回率
69.6%
基線召回率
28.6%
樣本數
4,780 個確定性樣本
新增誤報
0
重現指令
pnpm bench:hackaprompt想要在你的語料庫上跑 ATR 並公開結果?歡迎發 PR 到 Agent-Threat-Rule/agent-threat-rules。我們把你的 benchmark 加入本頁,完整署名。
審稿:Adam Lin · 最後審查 2026-05-12