这篇论文提出了一个正确且被低估的问题,给出了一份在方法学自觉上罕见的实验记录,但其核心科学主张的证据链存在一处结构性断裂,且论文的方法与该主张在因果上并不相连。
三条主线:
以下逐节展开讨论。
1. 问题设定:CD 与 PD 的区分
论文将不安全指令二分为:
- 内容危险(Content Danger, CD):不安全性显现于文本表面。例如"点燃窗帘"。现有文本审核模型的目标域。
- 物理危险(Physical Danger, PD):字面无害,仅在物理因果中成立。例如"微波炉加热鸡蛋"“将金属叉子放入微波炉”。
#mermaid-svg-PuteY7gPjJmYTHJD{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-PuteY7gPjJmYTHJD .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-PuteY7gPjJmYTHJD .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-PuteY7gPjJmYTHJD .error-icon{fill:#552222;}#mermaid-svg-PuteY7gPjJmYTHJD .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-PuteY7gPjJmYTHJD .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-PuteY7gPjJmYTHJD .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-PuteY7gPjJmYTHJD .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-PuteY7gPjJmYTHJD .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-PuteY7gPjJmYTHJD .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-PuteY7gPjJmYTHJD .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-PuteY7gPjJmYTHJD .marker{fill:#333333;stroke:#333333;}#mermaid-svg-PuteY7gPjJmYTHJD .marker.cross{stroke:#333333;}#mermaid-svg-PuteY7gPjJmYTHJD svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-PuteY7gPjJmYTHJD p{margin:0;}#mermaid-svg-PuteY7gPjJmYTHJD .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-PuteY7gPjJmYTHJD .cluster-label text{fill:#333;}#mermaid-svg-PuteY7gPjJmYTHJD .cluster-label span{color:#333;}#mermaid-svg-PuteY7gPjJmYTHJD .cluster-label span p{background-color:transparent;}#mermaid-svg-PuteY7gPjJmYTHJD .label text,#mermaid-svg-PuteY7gPjJmYTHJD span{fill:#333;color:#333;}#mermaid-svg-PuteY7gPjJmYTHJD .node rect,#mermaid-svg-PuteY7gPjJmYTHJD .node circle,#mermaid-svg-PuteY7gPjJmYTHJD .node ellipse,#mermaid-svg-PuteY7gPjJmYTHJD .node polygon,#mermaid-svg-PuteY7gPjJmYTHJD .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-PuteY7gPjJmYTHJD .rough-node .label text,#mermaid-svg-PuteY7gPjJmYTHJD .node .label text,#mermaid-svg-PuteY7gPjJmYTHJD .image-shape .label,#mermaid-svg-PuteY7gPjJmYTHJD .icon-shape .label{text-anchor:middle;}#mermaid-svg-PuteY7gPjJmYTHJD .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-PuteY7gPjJmYTHJD .rough-node .label,#mermaid-svg-PuteY7gPjJmYTHJD .node .label,#mermaid-svg-PuteY7gPjJmYTHJD .image-shape .label,#mermaid-svg-PuteY7gPjJmYTHJD .icon-shape .label{text-align:center;}#mermaid-svg-PuteY7gPjJmYTHJD .node.clickable{cursor:pointer;}#mermaid-svg-PuteY7gPjJmYTHJD .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-PuteY7gPjJmYTHJD .arrowheadPath{fill:#333333;}#mermaid-svg-PuteY7gPjJmYTHJD .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-PuteY7gPjJmYTHJD .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-PuteY7gPjJmYTHJD .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-PuteY7gPjJmYTHJD .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-PuteY7gPjJmYTHJD .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-PuteY7gPjJmYTHJD .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-PuteY7gPjJmYTHJD .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-PuteY7gPjJmYTHJD .cluster text{fill:#333;}#mermaid-svg-PuteY7gPjJmYTHJD .cluster span{color:#333;}#mermaid-svg-PuteY7gPjJmYTHJD div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-PuteY7gPjJmYTHJD .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-PuteY7gPjJmYTHJD rect.text{fill:none;stroke-width:0;}#mermaid-svg-PuteY7gPjJmYTHJD .icon-shape,#mermaid-svg-PuteY7gPjJmYTHJD .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-PuteY7gPjJmYTHJD .icon-shape p,#mermaid-svg-PuteY7gPjJmYTHJD .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-PuteY7gPjJmYTHJD .icon-shape .label rect,#mermaid-svg-PuteY7gPjJmYTHJD .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-PuteY7gPjJmYTHJD .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-PuteY7gPjJmYTHJD .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-PuteY7gPjJmYTHJD :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}
词面显现
物理因果
自然语言指令
危险来源
内容危险 CD『点燃窗帘』
物理危险 PD『微波炉加热鸡蛋』
文本护栏策略违规线索匹配
物理监控需因果/常识须在执行前判定
执行前安全决策
论文的中心主张是:CD 与 PD 在 LLM 隐状态中构成两个可分的信号,而非同一"不安全方向"上的强弱之别。 全文价值系于此。因此本文的复核也以此为轴。
2. 数学核心一:两个方向与两种角度
2.1 定义
在第 LLL 层取末位 token 隐状态 hL(x)∈Rdh_L(x)\\in\\mathbb{R}^dhL(x)∈Rd,按安全 / 内容危险 / 物理危险三类计类均值:
μsafe=1∣S∣∑i∈ShL(xi),μCD=1∣E∣∑i∈EhL(xi),μPD=1∣I∣∑i∈IhL(xi)
\\mu_{\\text{safe}}=\\frac{1}{|S|}\\sum_{i\\in S}h_L(x_i),\\quad
\\mu_{\\text{CD}}=\\frac{1}{|E|}\\sum_{i\\in E}h_L(x_i),\\quad
\\mu_{\\text{PD}}=\\frac{1}{|I|}\\sum_{i\\in I}h_L(x_i)
μsafe=∣S∣1i∈S∑hL(xi),μCD=∣E∣1i∈E∑hL(xi),μPD=∣I∣1i∈I∑hL(xi)
危险方向定义为相对安全类的位移:
uCDD=μCD−μsafe,uPDD=μPD−μsafe
u_{\\text{CDD}}=\\mu_{\\text{CD}}-\\mu_{\\text{safe}},\\qquad
u_{\\text{PDD}}=\\mu_{\\text{PD}}-\\mu_{\\text{safe}}
uCDD=μCD−μsafe,uPDD=μPD−μsafe
论文报告两个角度量:
均值差角度 θmd\\theta_{\\text{md}}θmd,纯几何、不拟合分类器:
θmd=arccos⟨uCDD, uPDD⟩∥uCDD∥ ∥uPDD∥
\\theta_{\\text{md}}=\\arccos\\frac{\\langle u_{\\text{CDD}},\\,u_{\\text{PDD}}\\rangle}{\\|u_{\\text{CDD}}\\|\\,\\|u_{\\text{PDD}}\\|}
θmd=arccos∥uCDD∥∥uPDD∥⟨uCDD,uPDD⟩
探针权重角度 θpw\\theta_{\\text{pw}}θpw:分别训练 safe-vs-CD 与 safe-vs-PD 两个 L2 正则 logistic 探针,取权重向量夹角。
实测(Table 1):
| 选中层 ℓ⋆\\ell^\\starℓ⋆ | 27/36 | 20/28 | 26/48 | 41/64 |
| θpw\\theta_{\\text{pw}}θpw (°) | 75.9 | 74.2 | 71.6 | 71.9 |
| θmd\\theta_{\\text{md}}θmd (°) | 49.1 | 54.6 | 63.2 | 67.7 |
2.2 θpw>θmd\\theta_{\\text{pw}}>\\theta_{\\text{md}}θpw>θmd 是白化的系统性后果,而非可分性增强的证据
论文以一句"判别式训练在各向异性协方差下会旋转权重"带过。该陈述本身正确,但未指出其偏置方向是系统性的,且恰好指向论文所需的结论。
在共享协方差 Σ\\SigmaΣ 的高斯设定下(LDA,亦即正确设定的 logistic 回归的渐近解),最优判别方向为
w∝Σ−1(μ1−μ0)
w \\propto \\Sigma^{-1}(\\mu_1-\\mu_0)
w∝Σ−1(μ1−μ0)
故 wCD∝Σ−1uCDDw_{\\text{CD}}\\propto \\Sigma^{-1}u_{\\text{CDD}}wCD∝Σ−1uCDD、wPD∝Σ−1uPDDw_{\\text{PD}}\\propto \\Sigma^{-1}u_{\\text{PDD}}wPD∝Σ−1uPDD,于是
cosθpw=uCDD⊤Σ−2uPDDuCDD⊤Σ−2uCDD uPDD⊤Σ−2uPDD
\\cos\\theta_{\\text{pw}}
=\\frac{u_{\\text{CDD}}^{\\top}\\Sigma^{-2}u_{\\text{PDD}}}
{\\sqrt{u_{\\text{CDD}}^{\\top}\\Sigma^{-2}u_{\\text{CDD}}}\\;\\sqrt{u_{\\text{PDD}}^{\\top}\\Sigma^{-2}u_{\\text{PDD}}}}
cosθpw=uCDD⊤Σ−2uCDDuPDD⊤Σ−2uPDDuCDD⊤Σ−2uPDD
即 θpw\\theta_{\\text{pw}}θpw 并非欧氏夹角,而是 Σ−2\\Sigma^{-2}Σ−2 度量下的夹角。
对 Σ\\SigmaΣ 作谱分解 Σ=∑iλieiei⊤\\Sigma=\\sum_i\\lambda_i e_ie_i^{\\top}Σ=∑iλieiei⊤,则 Σ−2\\Sigma^{-2}Σ−2 对第 iii 主轴的权重为 λi−2\\lambda_i^{-2}λi−2。LLM 隐状态的谱具有极端各向异性——少数 outlier dimension 承载绝大部分方差。因此:
主方差轴(λ1\\lambda_1λ1 最大)在 Σ−2\\Sigma^{-2}Σ−2 度量下被压缩得最剧烈。
而 uCDDu_{\\text{CDD}}uCDD 与 uPDDu_{\\text{PDD}}uPDD 的共享分量——若确实存在一个"通用不安全方向"——最可能落在主方差轴上,因为它是被两类共同激发、能量最大的方向。白化按 λ1−2\\lambda_1^{-2}λ1−2 将其削除,低方差残差被相对放大,夹角随之张开。
推论:49.1° 至 75.9° 的 26.8° 增量,不构成"判别空间中更可分"的证据;它是白化系统性移除共享高方差分量的几何签名。而该共享分量正是论文试图证明其不存在的对象。
论文以对自身最有利的度量作为主指标,将更保守的 θmd\\theta_{\\text{md}}θmd 置于次行。
补充一处值得注意的模式:θpw−θmd\\theta_{\\text{pw}}-\\theta_{\\text{md}}θpw−θmd 的差值随规模单调收缩(26.8° → 19.6° → 8.4° → 4.2°)。即白化引入的角度虚高在 3B 上最大——而 3B 恰为全文唯一完成正式零假设检验的模型。
2.3 跨规模角度不可比
θpw\\theta_{\\text{pw}}θpw 单调下降(75.9→71.9),θmd\\theta_{\\text{md}}θmd 单调上升(49.1→67.7),两指标趋势相反,论文未作调和,仅表述为"角度模式一致"。
更实质的问题在于论文 §5.1 的自陈:7B/14B/32B 的零假设检验未完成。
零假设的均值是 ddd 与 NNN 的函数。训练样本量固定于 480 量级,而隐维度自 3B 的 2048 增至 32B 的 5120。在 d≫Nd\\gg Nd≫N 的过参数化区间,两个在不相交子集上拟合的最大间隔解,其夹角的零假设均值随 d/Nd/Nd/N 单调趋近 90°(高维随机向量近似正交)。
因此:3B 的 75.9° 相对其 60.35° 的 null 显著;14B 的 71.6° 相对其自身(未测量、但必然更高的)null 可能不显著。 在缺失各自 null 的前提下,跨规模角度序列不可解读。
3. 数学核心二:零假设检验,及其衰减校正
3.1 论文的构造
为排除高维拟合的偶然性,作者在 3B 第 27 层将 300 个 unsafe 样本随机划分为 113 / 187 两组(与真实 CD/PD 规模严格匹配),各自对同一批 300 个 safe 训练 logistic 探针,记录权重夹角,重复 200 次构成 null 分布,统计量
z=θobs−μnullσnull
z=\\frac{\\theta_{\\text{obs}}-\\mu_{\\text{null}}}{\\sigma_{\\text{null}}}
z=σnullθobs−μnull
结果:θobs=76.33°\\theta_{\\text{obs}}=76.33°θobs=76.33°,μnull=60.35°\\mu_{\\text{null}}=60.35°μnull=60.35°,σnull=1.58°\\sigma_{\\text{null}}=1.58°σnull=1.58°,z=10.09z=10.09z=10.09,p<0.0001p<0.0001p<0.0001,200 次随机划分无一达到观测值。
该 null 的设计是正确的,且在 probing 文献中罕见——它匹配了样本量、优化器、正则强度与 safe 基线。这一点应予明确肯定。
3.2 null 均值本身携带的信息
先提一个问题:若随机划分的两半在总体意义上目标完全相同(随机划分保证两半的 CD:PD 期望比例一致),两个探针的夹角为何不趋近 0°,而是 60.35°?
原因在于 d≫Nd\\gg Nd≫N 下,每个拟合权重向量中有相当比例是估计噪声。
形式化。设
w^A=sA+nA,w^B=sB+nB
\\hat w_A = s_A + n_A,\\qquad \\hat w_B = s_B + n_B
w^A=sA+nA,w^B=sB+nB
其中 sss 为总体探针方向,nnn 为有限样本估计噪声,满足 E⟨s,n⟩=0\\mathbb{E}\\langle s,n\\rangle=0E⟨s,n⟩=0,且不相交子集上的噪声近似不相关 E⟨nA,nB⟩≈0\\mathbb{E}\\langle n_A,n_B\\rangle\\approx 0E⟨nA,nB⟩≈0。定义信号能量占比
ρ=∥s∥2∥s∥2+∥n∥2
\\rho=\\frac{\\|s\\|^2}{\\|s\\|^2+\\|n\\|^2}
ρ=∥s∥2+∥n∥2∥s∥2
Null 情形(sA=sB=ss_A=s_B=ssA=sB=s):
cosθnull=⟨s,s⟩∥w^A∥∥w^B∥=∥s∥2∥s∥2+∥n∥2=ρ
\\cos\\theta_{\\text{null}}=\\frac{\\langle s,s\\rangle}{\\|\\hat w_A\\|\\|\\hat w_B\\|}=\\frac{\\|s\\|^2}{\\|s\\|^2+\\|n\\|^2}=\\rho
cosθnull=∥w^A∥∥w^B∥⟨s,s⟩=∥s∥2+∥n∥2∥s∥2=ρ
代入 θnull=60.35°\\theta_{\\text{null}}=60.35°θnull=60.35°:
ρ=cos60.35°=0.495
\\boxed{\\rho=\\cos 60.35°=0.495}
ρ=cos60.35°=0.495
即每个探针权重向量中仅约 49.5% 的能量可复现,另 50.5% 为估计噪声。 这是 null 实验最具信息量的副产品,论文未加计算。
3.3 衰减校正
真实情形(sA=sCDs_A=s_{\\text{CD}}sA=sCD,sB=sPDs_B=s_{\\text{PD}}sB=sPD,真实夹角余弦 c⋆c^\\starc⋆)。在信号能量与噪声能量跨探针近似相等的假设下——null 采用 113/187 划分正是为保证这一条件——有
cosθobs=⟨sCD,sPD⟩∥w^CD∥∥w^PD∥=c⋆⋅ρ
\\cos\\theta_{\\text{obs}}=\\frac{\\langle s_{\\text{CD}},s_{\\text{PD}}\\rangle}{\\|\\hat w_{\\text{CD}}\\|\\|\\hat w_{\\text{PD}}\\|}=c^\\star\\cdot\\rho
cosθobs=∥w^CD∥∥w^PD∥⟨sCD,sPD⟩=c⋆⋅ρ
此即经典的衰减校正(correction for attenuation)。反解:
c⋆=cosθobsρ=cos76.33°cos60.35°=0.23630.4947=0.4777
c^\\star=\\frac{\\cos\\theta_{\\text{obs}}}{\\rho}=\\frac{\\cos 76.33°}{\\cos 60.35°}=\\frac{0.2363}{0.4947}=0.4777
c⋆=ρcosθobs=cos60.35°cos76.33°=0.49470.2363=0.4777
θ⋆=arccos(0.4777)≈61.5°
\\boxed{\\theta^\\star=\\arccos(0.4777)\\approx 61.5°}
θ⋆=arccos(0.4777)≈61.5°
去噪后,CD 与 PD 探针方向的真实夹角约 61.5°,而非摘要中的 76.33°。
需补充偏置方向的说明:两个探针共用同一批 300 个 safe 样本,其共享噪声分量 mmm 在两向量中近似相同,行为上等同于信号。将其分离:
cosθobs=c⋆ρs+ρm,ρs+ρm=ρ
\\cos\\theta_{\\text{obs}}=c^\\star\\rho_s+\\rho_m,\\qquad \\rho_s+\\rho_m=\\rho
cosθobs=c⋆ρs+ρm,ρs+ρm=ρ
由 ρm>0\\rho_m>0ρm>0 可知真实 c⋆<0.478c^\\star<0.478c⋆<0.478,即 θ⋆>61.5°\\theta^\\star>61.5°θ⋆>61.5°。故 61.5° 是一个下界。
3.4 本节的公允结论
必须明确:衰减校正削去了标题数字的 15°,但未推翻结论。 cos61.5°=0.478\\cos 61.5°=0.478cos61.5°=0.478 意味着两方向存在约 48% 的方向重叠——既非同一概念(应趋近 0°),亦非正交(90°)。论文结论中"separable rather than strictly orthogonal"的表述是准确的。
问题在于:摘要与标题继承的是 76.33°,而非这一准确表述。
4. 数学核心三:PRISM 探针
4.1 模型
p(y=1∣x)=σ (w⊤hL(x)+b),y^=1 [p(y=1∣x)≥τ],τ=0.5
p(y=1\\mid x)=\\sigma\\!\\left(w^{\\top}h_L(x)+b\\right),\\qquad
\\hat y=\\mathbb{1}\\!\\left[p(y=1\\mid x)\\ge\\tau\\right],\\quad \\tau=0.5
p(y=1∣x)=σ(w⊤hL(x)+b),y^=1[p(y=1∣x)≥τ],τ=0.5
冻结 LLM,取选定层末位 token 隐状态,标准化,一个逻辑回归。无微调,无额外网络。
4.2 目标函数的一处必须纠正的错误
Algorithm 1 第 7 行写作:
(w,b)←argminw,b 1N∑i=1NBCE (σ(w⊤h~i+b), yi)+1C∥w∥22
(w,b)\\leftarrow\\arg\\min_{w,b}\\ \\frac{1}{N}\\sum_{i=1}^{N}\\mathrm{BCE}\\!\\left(\\sigma(w^{\\top}\\tilde h_i+b),\\,y_i\\right)+\\frac{1}{C}\\|w\\|_2^2
(w,b)←argw,bmin N1i=1∑NBCE(σ(w⊤h~i+b),yi)+C1∥w∥22
而 §4.2 声明实现为 LogisticRegression(max_iter=2000, C=1.0)。两者不一致。
scikit-learn 的 L2 logistic 实际最小化:
minw,c 12w⊤w+C∑i=1Nlog (exp (−yi(Xi⊤w+c))+1)
\\min_{w,c}\\ \\frac{1}{2}w^{\\top}w+C\\sum_{i=1}^{N}\\log\\!\\left(\\exp\\!\\left(-y_i(X_i^{\\top}w+c)\\right)+1\\right)
w,cmin 21w⊤w+Ci=1∑Nlog(exp(−yi(Xi⊤w+c))+1)
损失项为求和而非平均,且 CCC 乘在数据项上。两侧同除 CNCNCN 化为论文形式:
minw,c 1N∑i=1Nlog(⋯ )+12CN∥w∥22
\\min_{w,c}\\ \\frac{1}{N}\\sum_{i=1}^{N}\\log(\\cdots)+\\frac{1}{2CN}\\|w\\|_2^2
w,cmin N1i=1∑Nlog(⋯)+2CN1∥w∥22
正则系数为 12CN\\dfrac{1}{2CN}2CN1,而非 1C\\dfrac{1}{C}C1,相差 2N2N2N 倍。
代入 C=1.0C=1.0C=1.0、N≈480N\\approx480N≈480(600 样本的 5 折训练集):
λ=12×1.0×480≈1.04×10−3
\\lambda=\\frac{1}{2\\times 1.0\\times 480}\\approx 1.04\\times 10^{-3}
λ=2×1.0×4801≈1.04×10−3
论文的写法暗示 λ=1\\lambda=1λ=1。实际正则强度弱约三个数量级。
该差异的实质影响:d=2048≫N=480d=2048 \\gg N=480d=2048≫N=480,数据几乎必然线性可分。在可分且弱正则的极限下,logistic 回归的解方向收敛至最大间隔(hard-margin SVM)方向(Soudry et al. 的隐式偏置结果)。因此 PRISM 实为一个近似最大间隔分类器,其方向由少数边界支持向量决定。
这直接影响第 3 节角度分析的解释:θpw\\theta_{\\text{pw}}θpw 度量的并非正则化判别方向之间的夹角,而是 d≫Nd\\gg Nd≫N 下两个最大间隔解之间的夹角——正是零空间几何主导、噪声占据约半数能量(§3.2 已算出 ρ≈0.495\\rho\\approx0.495ρ≈0.495)的那个 regime。作者引入 null 的判断是对的;但其对自身拟合对象的描述不准确。
4.3 层选择的乐观偏差量级
Algorithm 1 第 5 行以训练集 5 折 CV 准确率选层;§4.2 坦承这"是选中层估计,而非完全嵌套的层选择协议"。
坦承之外,量级需要算出:
- 每层 5 折准确率的折间标准差 ≈2.4\\approx 2.4≈2.4 pp(Table 2 的 ±\\pm±std)
- 均值标准误 SE=2.4/5≈1.07\\mathrm{SE}=2.4/\\sqrt{5}\\approx 1.07SE=2.4/5≈1.07 pp
- 3B 候选 36 层,但 Figure 7 显示层间准确率为光滑曲线、高度相关,有效独立候选数 keffk_{\\text{eff}}keff 约 3–8
- Gumbel 近似:E[maxk]≈2lnk⋅σ\\mathbb{E}[\\max_k]\\approx\\sqrt{2\\ln k}\\cdot\\sigmaE[maxk]≈2lnk⋅σ
| 3 | 1.48σ | 1.59 pp |
| 5 | 1.79σ | 1.93 pp |
| 8 | 2.04σ | 2.19 pp |
层选择的乐观偏差量级为 1.5–2 pp。
而论文报告的跨规模准确率区间为 86.2%–87.7%,全距 1.5 pp。
3B 至 32B 的全部"scaling 差异"完全落于层选择噪声之内。
此结论双向成立:它使"PRISM 跨规模稳定"不可证伪,同时也使任何"更大模型更优"的解读失去依据。准确的表述应为:在选中层协议下,规模不影响可测的操作点。
5. 实验数据的独立复核
5.1 复核方法
论文核心指标之间存在硬性恒等式约束。以 SafeAgentBench(300 safe / 113 CD / 187 PD)为例:
TP=rCD⋅113+rPD⋅187,FP=FPR⋅300
\\mathrm{TP}=r_{\\text{CD}}\\cdot 113+r_{\\text{PD}}\\cdot 187,\\qquad
\\mathrm{FP}=\\mathrm{FPR}\\cdot 300
TP=rCD⋅113+rPD⋅187,FP=FPR⋅300
Acc=TP+(300−FP)600,F1=2TP2TP+FP+FN
\\mathrm{Acc}=\\frac{\\mathrm{TP}+(300-\\mathrm{FP})}{600},\\qquad
F_1=\\frac{2\\mathrm{TP}}{2\\mathrm{TP}+\\mathrm{FP}+\\mathrm{FN}}
Acc=600TP+(300−FP),F1=2TP+FP+FN2TP
任一表格中 Acc、F1F_1F1、CD det、PD det、FPR 五项若非同源计算,必然违反该约束。以下按此逐表检验。
5.2 主表:全部自洽
| SafeAgentBench 3B | 86.15 | 86.2 | 0.8613 | 0.861 | ✅ |
| SafeAgentBench 7B | 87.01 | 87.0 | 0.8710 | 0.871 | ✅ |
| SafeAgentBench 14B | 87.13 | 87.2 | 0.8697 | 0.870 | ✅ |
| SafeAgentBench 32B | 87.67 | 87.7 | 0.8763 | 0.876 | ✅ |
| SafeText | 92.42 | 92.4 | 0.9245 | 0.924 | ✅ |
| EARBench | 82.90 | 82.9 | 0.8281 | 0.828 | ✅ |
| PSB-1K | 99.60 | 99.6 | 0.9960 | 0.996 | ✅ |
全部在舍入误差内一致。 McNemar 统计量亦复核通过:χ2=1.94⇒p=0.1636\\chi^2=1.94\\Rightarrow p=0.1636χ2=1.94⇒p=0.1636(报 0.1637);χ2=0.56⇒p≈0.454\\chi^2=0.56\\Rightarrow p\\approx0.454χ2=0.56⇒p≈0.454(报 0.4557,差异源于连续性修正的实现差别)。
这一结论具有独立价值:它确认主实验为真实运行,从而使下一小节的异常更具指示性。
5.3 Table 5:三行违反恒等式约束
Table 5(跨模型 PSB-1K 操作点)仅给出 Acc / PD det / FPR,无 F1F_1F1 可交叉验证。但恒等式仍然成立:1000 safe + 1000 PD,pair-wise GroupKFold 在 1000 个等大分组下每折恰为 400 例,折均准确率必然等于整体准确率。故
Acc=1000⋅rPD+1000⋅(1−FPR)2000
\\mathrm{Acc}=\\frac{1000\\cdot r_{\\text{PD}}+1000\\cdot(1-\\mathrm{FPR})}{2000}
Acc=20001000⋅rPD+1000⋅(1−FPR)
须精确成立。复核结果:
| Qwen2.5-3B | 99.9 | 0.7 | 999 | 993 | 99.60 | 99.6 | ✅ 0.00 |
| Qwen2.5-7B | 99.7 | 1.0 | 997 | 990 | 99.35 | 99.4 | ✅ −0.05 |
| Qwen2.5-14B | 99.6 | 1.2 | 996 | 988 | 99.20 | 99.3 | ❌ −0.10 |
| Qwen2.5-32B | 99.4 | 1.4 | 994 | 986 | 99.00 | 99.2 | ❌ −0.20 |
| Phi-3.5-mini | 99.0 | 1.8 | 990 | 982 | 98.60 | 98.8 | ❌ −0.20 |
| SmolLM2-1.7B | 98.2 | 3.2 | 982 | 968 | 97.50 | 97.5 | ✅ 0.00 |
三行违反约束,偏差相当于 2–4 个样本。
孤立来看可归因于舍入。但与以下三项线索并置后,该解释的说服力下降:
本文不就此下结论,但认为这是作者应被询问且可一句话澄清的问题:Table 5 的非-3B 行是否为完整重跑?在修订版中补充原始混淆矩阵即可解决。
5.4 延迟表:跨规模列不可解读,且分布形态异常
Table 7 中 PRISM 的延迟为 7B/14B/32B = 56.8 / 146.1 / 103.4 ms——32B 快于 14B。judge 列同样为 116.8 / 309.1 / 191.9 ms,14B 慢于 32B。单次前向传播与单次生成均不可能呈现此序,除非不同规模在不同硬件上测量。论文确已声明"不固定 GPU 与软件栈",故跨规模列不可解读;同规模内的约 2× 比值尚可接受。
另有一处分布异常:7B 的 PRISM 为 mean 56.8 < median 61.3,14B 为 146.1 < 156.9,judge 的 14B/32B 亦呈 mean < median。延迟数据通常右偏(长尾偏慢),此处系统性左偏,符合测量漂移(GPU 时钟 boost 或热降频)的特征,表明 580 个计时样本并非在稳态下采集。
5.5 Llama Guard 基线退化为常数分类器
Table 2 末行:Llama Guard 3-1B 在 SafeAgentBench 上 CD 检出 0.0%、PD 检出 0.0%、FPR 0.0%,即对全部 600 条指令输出 safe——包括 113 条含显式危险词的内容危险样本。PSB-1K 上同为 50.0% 准确率 / 0.0 检出 / 0.0 FPR。
一个在其主场任务(显式内容危险)上 113 例全漏的模型,最可能的解释并非"taxonomy 不匹配",而是 chat template 或输出解析异常——Llama Guard 对 prompt 格式高度敏感,模板不合规时默认输出 safe。
论文将其表述为一项科学发现(“内容护栏无法感知物理危险”)。一个退化为常数输出的 baseline 不能支撑任何结论。 该项应重跑或自主表撤下。
6. 证据链评估:五处断裂
#mermaid-svg-kNqcRWhzXMzT4Ujm{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-kNqcRWhzXMzT4Ujm .error-icon{fill:#552222;}#mermaid-svg-kNqcRWhzXMzT4Ujm .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-kNqcRWhzXMzT4Ujm .marker{fill:#333333;stroke:#333333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .marker.cross{stroke:#333333;}#mermaid-svg-kNqcRWhzXMzT4Ujm svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-kNqcRWhzXMzT4Ujm p{margin:0;}#mermaid-svg-kNqcRWhzXMzT4Ujm .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .cluster-label text{fill:#333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .cluster-label span{color:#333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .cluster-label span p{background-color:transparent;}#mermaid-svg-kNqcRWhzXMzT4Ujm .label text,#mermaid-svg-kNqcRWhzXMzT4Ujm span{fill:#333;color:#333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .node rect,#mermaid-svg-kNqcRWhzXMzT4Ujm .node circle,#mermaid-svg-kNqcRWhzXMzT4Ujm .node ellipse,#mermaid-svg-kNqcRWhzXMzT4Ujm .node polygon,#mermaid-svg-kNqcRWhzXMzT4Ujm .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-kNqcRWhzXMzT4Ujm .rough-node .label text,#mermaid-svg-kNqcRWhzXMzT4Ujm .node .label text,#mermaid-svg-kNqcRWhzXMzT4Ujm .image-shape .label,#mermaid-svg-kNqcRWhzXMzT4Ujm .icon-shape .label{text-anchor:middle;}#mermaid-svg-kNqcRWhzXMzT4Ujm .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-kNqcRWhzXMzT4Ujm .rough-node .label,#mermaid-svg-kNqcRWhzXMzT4Ujm .node .label,#mermaid-svg-kNqcRWhzXMzT4Ujm .image-shape .label,#mermaid-svg-kNqcRWhzXMzT4Ujm .icon-shape .label{text-align:center;}#mermaid-svg-kNqcRWhzXMzT4Ujm .node.clickable{cursor:pointer;}#mermaid-svg-kNqcRWhzXMzT4Ujm .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .arrowheadPath{fill:#333333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-kNqcRWhzXMzT4Ujm .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-kNqcRWhzXMzT4Ujm .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-kNqcRWhzXMzT4Ujm .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-kNqcRWhzXMzT4Ujm .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-kNqcRWhzXMzT4Ujm .cluster text{fill:#333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .cluster span{color:#333;}#mermaid-svg-kNqcRWhzXMzT4Ujm div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-kNqcRWhzXMzT4Ujm .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-kNqcRWhzXMzT4Ujm rect.text{fill:none;stroke-width:0;}#mermaid-svg-kNqcRWhzXMzT4Ujm .icon-shape,#mermaid-svg-kNqcRWhzXMzT4Ujm .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-kNqcRWhzXMzT4Ujm .icon-shape p,#mermaid-svg-kNqcRWhzXMzT4Ujm .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-kNqcRWhzXMzT4Ujm .icon-shape .label rect,#mermaid-svg-kNqcRWhzXMzT4Ujm .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-kNqcRWhzXMzT4Ujm .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-kNqcRWhzXMzT4Ujm .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-kNqcRWhzXMzT4Ujm :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}
断裂 6.1
§3.3
断裂 6.2
断裂 6.3
断裂 6.4
断裂 6.5
主张:CD 与 PD 在隐状态中是两个可分信号
证据 1:θpw = 76.33°显著高于随机切分 null
证据 2:PSB-1K 上PRISM 99.6% / judge 64.4%
证据 3:跨数据集复现SafeText / EARBench
方法:PRISM 探针
CD/PD 划分由词表规则定义null 控制噪声,不控制该混杂
衰减校正后 → 61.5° 下界
缺 family-level 留出模板泄漏未排除
全部为同分布 5 折 CV无零样本迁移证据
Figure 2:CDD/PDD 平面错误率为完整探针的近两倍
匹配 FPR 下 McNemar 不显著
6.1 混杂未控制:CD/PD 划分本身即一条词表规则
论文 §5.1 明确记载:SafeAgentBench 的 unsafe 划分由"确定性的 25 关键词子串规则"生成,切分为 113 CD / 187 PD,并承认泄漏(drop 出现于 12 条 safe 与 29 条 CD,break 出现于 1 条 safe 与 34 条 CD)。
由此可得如下推理链:
- CD 标签 ≡\\equiv≡ 含特定关键词
- 故 safe-vs-CD 探针在定义上部分是一个关键词检测器
- PD 标签 ≡\\equiv≡ 不含该关键词集
- 故两探针方向不同,由标签生成过程所保证,而非模型表示的性质
随机切分 null 在原理上无法控制这一混杂:随机划分的两半含有同分布的关键词混合,故 null 仅度量估计噪声,不度量"标签由词表定义"这一因素。
正确的对照应为:以一条与安全性无关的词表规则执行同规模(113/187)划分——例如按是否含 kitchen/bedroom 切分——并重算 θpw\\theta_{\\text{pw}}θpw。若该"语义无关但词面有别"的划分同样给出约 76°,则 CDD/PDD 主张退化为"隐状态编码表层词汇特征",属既有共识。
这是决定本文成色的单一关键实验。缺失该对照,第 3 节的结论不成立。
6.2 泄漏未排除:PSB-1K 缺 family-level 留出
PSB-1K 的构造意图值得肯定:1000 对最小对比样本,覆盖 10 个家用风险族(微波炉金属接触、微波炉压力加热、烤面包机导电物接触、通电设备接液、地面液体、加热面接触、明火邻近、食品接触污染、清洁用品与食品容器接触、放置接触伤害),并刻意剔除 danger / harm / burn / shock / poison 等直接危险词。
但结果为:3B 模型冻结隐状态 + 线性探针 = 99.6% 准确率、AUC 1.000、FPR 0.7%;SmolLM2-1.7B 亦达 97.5%。
若该结果确实度量"物理因果推理",则意味着一个 1.7B 模型的中间层经一次线性读出即将家用物理常识解决至 97.5%——此结论远比论文的主张更为强烈。更节俭的解释是:
10 个模板族 × 最小对比对构成一个低秩、高度结构化的数据集;线性探针拟合的是模板指纹而非物理因果。
论文采用 pair-wise GroupKFold 确保对内样本不跨折,这防止了 pair 泄漏,但未防止 family 泄漏:同一风险族的模板同时出现于训练折与测试折。
所需对照为 leave-one-risk-family-out(LORO)交叉验证:10 折,每折留出一整个风险族作测试。若 LORO 下仍达 95%+,则为真实信号,PSB-1K 构成扎实贡献;若降至 70% 量级,则 99.6% 属模板记忆。
一项旁证:同一数据上 LLM judge 仅 64.4% 准确率(96.5% 召回 / 67.8% FPR)。judge 能够识别危险(召回 96.5%),其低准确率源于过度拒绝。一个具备推理能力的模型在"需要推理"的数据上被线性探针以 35 个百分点超越,该模式更符合"探针捕获了 judge 无须依赖的表层结构"。
6.3 泛化证据缺失:全部为同分布交叉验证
此项论文已自陈,措辞坦率:将结果读作"匹配机制下的跨数据集复现"而非零样本迁移。
具体而言,SafeAgentBench、SafeText、EARBench、PSB-1K 均为 fold-internal 5 折 CV,探针在每个数据集上重新训练。因此:
- PRISM:有监督 + 同分布
- LLM judge:零样本
以见过同分布标签的判别器与零样本模型比较 FPR,其胜出为设计所决定,不构成能力证据。
唯一具决定性的实验其材料全部现成:在 SafeAgentBench 上训练 PRISM,零样本测试 PSB-1K(及反向)。论文未包含。
其缺失的可能原因可以推测:SafeAgentBench 的 unsafe 训练信号中有 113 条为关键词驱动的 CD,而 PSB-1K 刻意剔除全部关键词,跨分布迁移大概率显著退化。但该数字才是本文的真实泛化成绩。
6.4 归因断裂:表示分析与方法在因果上不相连
论文称 PRISM “直接将 CD/PD 结构操作化”。但 §4.2 随即承认:PRISM 训练于完整隐状态之上,并非手工构造的 CDD/PDD 标量规则。
那么 CDD/PDD 分析对 PRISM 的实际贡献为何?论文自身 Figure 2 的数据:
| 仅 CDD(1D 阈值) | 163 | 27.2% |
| 仅 PDD(1D 阈值) | 159 | 26.5% |
| CDD+PDD 组合(2D 边界) | 148 | 24.7% |
| PRISM(完整隐状态) | ≈83 | 13.8% |
两点推论:
即:删去第 3 节,PRISM 无需任何修改,性能不变。 §3 是动机而非机制,论文将其表述为后者。
剥离表示分析后,PRISM ≡\\equiv≡ 冻结 LLM 隐状态上的线性探针(Alain & Bengio, 2016)。简单方法有效本身是优点,但方法新颖性的主张不成立。
6.5 统计断裂:匹配 FPR 下无显著差异,且不显著 ≠\\neq= 等价
论文 §5.6 报告:在匹配 FPR 的操作点上做配对 McNemar 检验,物理危险子集 χ2=1.94, p=0.1637\\chi^2=1.94,\\ p=0.1637χ2=1.94, p=0.1637;全部 600 例 χ2=0.56, p=0.4557\\chi^2=0.56,\\ p=0.4557χ2=0.56, p=0.4557。两者均不拒绝准确率相等。
即:将 judge 的阈值与 PRISM 拉至同一操作点后,PRISM 相对同规模 judge 无可检出的准确率优势。
摘要中"judge 过度拒绝,FPR 24.7–39.0%"因此是一个阈值假象:judge 以贪心解码输出 SAFE/UNSAFE,仅有单一操作点;PRISM 拥有完整 ROC。以曲线比较单点,是自由度差异而非能力差异。
同时须对该不显著结论加以限定,因为论文亦将其过度解读为"统计上相当"。不显著不等于等价。 反解 McNemar 的功效:设不一致对总数 nd=b+cn_d=b+cnd=b+c,
χ2=(b−c)2b+c ⟹ ∣b−c∣=χ2nd
\\chi^2=\\frac{(b-c)^2}{b+c}\\ \\Longrightarrow\\ |b-c|=\\sqrt{\\chi^2 n_d}
χ2=b+c(b−c)2 ⟹ ∣b−c∣=χ2nd
以 χ2=0.56\\chi^2=0.56χ2=0.56、nd≈130n_d\\approx130nd≈130(两者准确率同处 86–87%,量级合理)估计:∣b−c∣≈8.5|b-c|\\approx 8.5∣b−c∣≈8.5,约合 1.4 pp。而 α=0.05\\alpha=0.05α=0.05 下最小可检出差为 1.96nd≈22.31.96\\sqrt{n_d}\\approx 22.31.96nd≈22.3,约合 3.7 pp。
该检验仅能排除大于约 3.7 pp 的差异。主张"相当"需要预设等价边界的 TOST 检验,而非一个不显著的 ppp 值。
7. 评估效度:平衡基准与真实类先验之间的断层
本节讨论一个不针对本文、而针对整个具身安全评估协议的问题。它决定了论文所报操作点的可解释性。
7.1 类先验漂移使报告的操作点失去意义
全部基准均为平衡集:SafeAgentBench 300/300,PSB-1K 1000/1000,即 πtrain=0.5\\pi_{\\text{train}}=0.5πtrain=0.5。而具身指令流中危险指令的真实占比远低于此。逻辑回归估计的是 ptrain(y=1∣x)p_{\\text{train}}(y=1\\mid x)ptrain(y=1∣x),非目标分布下的后验。二者关系为
logit ptest=logit ptrain+lnπtest/(1−πtest)πtrain/(1−πtrain)
\\mathrm{logit}\\,p_{\\text{test}}=\\mathrm{logit}\\,p_{\\text{train}}
+\\ln\\frac{\\pi_{\\text{test}}/(1-\\pi_{\\text{test}})}{\\pi_{\\text{train}}/(1-\\pi_{\\text{train}})}
logitptest=logitptrain+lnπtrain/(1−πtrain)πtest/(1−πtest)
取 πtrain=0.5\\pi_{\\text{train}}=0.5πtrain=0.5、πtest=0.001\\pi_{\\text{test}}=0.001πtest=0.001,修正项为 ln0.0010.999=−6.91\\ln\\frac{0.001}{0.999}=-6.91ln0.9990.001=−6.91 nats。
即在类先验漂移三个数量级的条件下,τ=0.5\\tau=0.5τ=0.5 这一默认阈值对应的实际决策规则偏移了近 7 个 logit 单位。 论文以 τ=0.5\\tau=0.5τ=0.5 报告全部主结果而未讨论其依据,这使得所有 FPR / 召回数对仅在 50/50 假设下有效。
顺带指出正确的阈值来源。设误拦一条安全指令的代价为 cFPc_{\\text{FP}}cFP、放过一条危险指令的代价为 cFNc_{\\text{FN}}cFN,则拦截当且仅当 cFN p>cFP(1−p)c_{\\text{FN}}\\,p>c_{\\text{FP}}(1-p)cFNp>cFP(1−p),即
w⊤h~+b>lncFPcFN+lnπtest1−πtest
\\boxed{\\;w^{\\top}\\tilde h+b>\\ln\\frac{c_{\\text{FP}}}{c_{\\text{FN}}}+\\ln\\frac{\\pi_{\\text{test}}}{1-\\pi_{\\text{test}}}\\;}
w⊤h~+b>lncFNcFP+ln1−πtestπtest
阈值由代价比与类先验共同决定,0.50.50.5 只在 cFP=cFNc_{\\text{FP}}=c_{\\text{FN}}cFP=cFN 且 π=0.5\\pi=0.5π=0.5 时成立。
7.2 精确率对基准率的敏感性
精确率是类先验的函数:
Precision=πrπr+(1−π)f
\\mathrm{Precision}=\\frac{\\pi r}{\\pi r+(1-\\pi)f}
Precision=πr+(1−π)fπr
(π\\piπ 为危险指令基准率,rrr 为召回,fff 为 FPR)。代入论文各操作点:
| PRISM @ SafeAgentBench-3B | 86.0% | 13.7% | 41.1% | 5.96% | 0.62% |
| PRISM @ PSB-1K-3B | 99.9% | 0.7% | 94.1% | 59.0% | 12.5% |
| Qwen2.5-3B judge @ PSB-1K | 96.5% | 67.8% | 13.7% | 1.42% | 0.14% |
关键读数在最后一列:
- 全文最优操作点(PSB-1K,FPR 0.7%)在 π=0.1%\\pi=0.1\\%π=0.1% 下精确率 12.5%——每一次正确拦截伴随约 7 次误拦。
- 主基准操作点(FPR 13.7%)精确率 0.62%——每一次正确拦截伴随约 137 次误拦。
- LLM judge 为 0.14%。
反解所需 FPR:
f=π(1−P)P(1−π)
f=\\frac{\\pi(1-P)}{P(1-\\pi)}
f=P(1−π)π(1−P)
在 π=0.1%\\pi=0.1\\%π=0.1% 下,50% 精确率需 f≈0.10%f\\approx 0.10\\%f≈0.10%;90% 精确率需 f≈0.011%f\\approx 0.011\\%f≈0.011%——较论文最优结果尚低两个半数量级。
7.3 级联结构的上限
论文 Figure 4 描绘了两级结构(PRISM 一线过滤,不确定样本升级至 LLM judge),但未提供任何级联的端到端评估。补算如下。
AND 逻辑(两级均判危险方拦截),并作错误独立的乐观假设:
rcascade=0.999×0.965=96.4%,fcascade=0.007×0.678=0.475%
r_{\\text{cascade}}=0.999\\times 0.965=96.4\\%,\\qquad
f_{\\text{cascade}}=0.007\\times 0.678=0.475\\%
rcascade=0.999×0.965=96.4%,fcascade=0.007×0.678=0.475%
π=0.1%\\pi=0.1\\%π=0.1% 下:
P=0.001×0.9640.001×0.964+0.999×0.00475=16.9%
P=\\frac{0.001\\times 0.964}{0.001\\times 0.964+0.999\\times 0.00475}=\\mathbf{16.9\\%}
P=0.001×0.964+0.999×0.004750.001×0.964=16.9%
自 12.5% 提升至 16.9%,代价为 3.5 pp 召回与一次额外 judge 调用。 级联未能解决基准率问题,因为一线探针已构成瓶颈。且错误独立假设偏乐观——两级会被同一批异常指令同时误导,实际 fcascade>0.475%f_{\\text{cascade}}>0.475\\%fcascade>0.475%。
7.4 对评估协议的推论
上述算术不是对本文的针对性批评,而是对该领域评估惯例的推论:
全部具身安全基准采用 50/50 平衡集,全部论文报告平衡集上的准确率 / F1F_1F1 / FPR,而无人报告目标类先验下的精确率。后者是决定该分类器可否承担自动决策的量。
一个可操作的建议:该方向的论文应默认附报 precision @ 若干候选基准率(例如 π∈{10%,1%,0.1%}\\pi\\in\\{10\\%,1\\%,0.1\\%\\}π∈{10%,1%,0.1%})的敏感性表,其成本为零,信息量远高于再增加一个平衡集上的 F1F_1F1。
8. 平衡评价:本文的方法学贡献
上文批评集中,因此须明确本文做对的部分——其中数项优于该方向的多数工作:
① 方法学诚实度罕见。 论文主动披露:SafeAgentBench 关键词划分存在泄漏(并给出具体词与计数);跨数据集为"匹配机制复现"而非零样本迁移;大模型 null 未完成;层选择非嵌套协议;延迟为"受控本地对比"而非硬件通用主张;以及对自身不利的 McNemar 不显著结果。上述每一项作者均可隐去而不被察觉。 在该领域,这种自律稀缺到应被单独记录。
本文的相应批评是:摘要与结论未继承正文的诚实度。 全部限定词位于 §5.1 与 §5.6,而摘要呈现的是"86.2–87.7% 准确率 vs judge 24.7–39.0% FPR"。
② 随机切分 null 是正确的方法学示范。 多数 probing 与 representation engineering 工作报告一个余弦相似度或角度即作结论,从不追问"在给定维度与样本量下随机基线是多少"。本文做了,且做得规范(匹配样本量、优化器、正则、safe 基线)。该动作本身值得该方向整体采纳——§3.3 的衰减校正也只有在存在 null 的前提下才可导出。
③ 坚持 FPR 与召回同报。 论文反复强调仅看 unsafe 召回会使 judge 显得优于其在正常家务任务上的实际行为。该判断正确,且与该领域长期以准确率与召回自证的惯例相悖。
④ PSB-1K 的构造思路正确。 剔除直接危险词、构造最小对比对,以强制方法识别物理后果而非策略词面——这是该领域缺失的 benchmark design 方向。问题在执行(模板族泄漏、缺 LORO 对照),不在思路。
9. 结论
本文对该论文的定位是:一个正确的问题,一份诚实的实验记录,一组超出其证据支撑的结论。
其价值在于:首次将"具身物理安全 ≠\\neq= 文本内容安全"这一区分转化为可测量的对象,并提出了构造思路正确的对比基准 PSB-1K。其方法学自觉——尤其是随机切分 null 与坚持同报 FPR——应被该方向整体采纳。
其结论不宜直接接受,因为:核心角度证据经衰减校正后自 76.33° 降至 61.5° 下界(§3.3);CD/PD 划分由词表规则定义而 null 在原理上无法控制该混杂(§6.1);PSB-1K 的 99.6% 存在未排除的模板泄漏(§6.2);全文无任何零样本泛化证据(§6.3);其表示分析与其方法在因果上不相连(§6.4);而在匹配 FPR 下,其相对同规模 LLM judge 的优势被自身的 McNemar 检验判为不显著(§6.5)。
最后提出一个本文认为该方向真正的开放问题:
在目标类先验为 10−310^{-3}10−3 量级时,任何 FPR 高于 10−310^{-3}10−3 的安全闸门,其精确率必低于 50%。这意味着当前全部报告操作点在其目标分布下均不支持自动决策。那么"执行前安全判定"的正确形式化,究竟是二分类问题,还是风险估计与不确定性传递问题?
当前该领域优化的是前者的指标,而基准率算术指向后者。
网硕互联帮助中心






评论前必须登录!
注册