云计算百科
云计算领域专业知识百科平台

当“话没毛病、动作要命”:一篇把具身安全从文本安全里拆出来的论文,值不值得信?

这篇论文提出了一个正确且被低估的问题,给出了一份在方法学自觉上罕见的实验记录,但其核心科学主张的证据链存在一处结构性断裂,且论文的方法与该主张在因果上并不相连。

三条主线:

  • 问题成立。"点燃窗帘"与"把鸡蛋放进微波炉"是两类不安全:前者写在词面,后者写在物理因果。文本护栏只覆盖前者。随着 LLM 进入具身规划器承担任务分解,这个 gap 正在放大。
  • 核心证据弱于其呈现。CD/PD 方向"可分"的角度证据中,经衰减校正后至少有 15° 属于估计噪声的虚高;更关键的是,其 CD/PD 划分由一条关键词子串规则生成,而论文设计的随机切分零假设检验在原理上无法控制这一混杂。
  • 方法与主张脱节。剥离表示分析后,PRISM 即为冻结隐状态上的线性探针(Alain & Bengio, 2016)。论文自身的 Figure 2 数据显示,CDD/PDD 二维平面的错误率是完整探针的近两倍——即该方法的性能并不来自其所宣称的表示结构。
  • 以下逐节展开讨论。


    1. 问题设定:CD 与 PD 的区分

    论文将不安全指令二分为:

    • 内容危险(Content Danger, CD):不安全性显现于文本表面。例如"点燃窗帘"。现有文本审核模型的目标域。
    • 物理危险(Physical Danger, PD):字面无害,仅在物理因果中成立。例如"微波炉加热鸡蛋"“将金属叉子放入微波炉”。

    #mermaid-svg-PuteY7gPjJmYTHJD{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-PuteY7gPjJmYTHJD .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-PuteY7gPjJmYTHJD .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-PuteY7gPjJmYTHJD .error-icon{fill:#552222;}#mermaid-svg-PuteY7gPjJmYTHJD .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-PuteY7gPjJmYTHJD .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-PuteY7gPjJmYTHJD .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-PuteY7gPjJmYTHJD .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-PuteY7gPjJmYTHJD .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-PuteY7gPjJmYTHJD .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-PuteY7gPjJmYTHJD .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-PuteY7gPjJmYTHJD .marker{fill:#333333;stroke:#333333;}#mermaid-svg-PuteY7gPjJmYTHJD .marker.cross{stroke:#333333;}#mermaid-svg-PuteY7gPjJmYTHJD svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-PuteY7gPjJmYTHJD p{margin:0;}#mermaid-svg-PuteY7gPjJmYTHJD .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-PuteY7gPjJmYTHJD .cluster-label text{fill:#333;}#mermaid-svg-PuteY7gPjJmYTHJD .cluster-label span{color:#333;}#mermaid-svg-PuteY7gPjJmYTHJD .cluster-label span p{background-color:transparent;}#mermaid-svg-PuteY7gPjJmYTHJD .label text,#mermaid-svg-PuteY7gPjJmYTHJD span{fill:#333;color:#333;}#mermaid-svg-PuteY7gPjJmYTHJD .node rect,#mermaid-svg-PuteY7gPjJmYTHJD .node circle,#mermaid-svg-PuteY7gPjJmYTHJD .node ellipse,#mermaid-svg-PuteY7gPjJmYTHJD .node polygon,#mermaid-svg-PuteY7gPjJmYTHJD .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-PuteY7gPjJmYTHJD .rough-node .label text,#mermaid-svg-PuteY7gPjJmYTHJD .node .label text,#mermaid-svg-PuteY7gPjJmYTHJD .image-shape .label,#mermaid-svg-PuteY7gPjJmYTHJD .icon-shape .label{text-anchor:middle;}#mermaid-svg-PuteY7gPjJmYTHJD .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-PuteY7gPjJmYTHJD .rough-node .label,#mermaid-svg-PuteY7gPjJmYTHJD .node .label,#mermaid-svg-PuteY7gPjJmYTHJD .image-shape .label,#mermaid-svg-PuteY7gPjJmYTHJD .icon-shape .label{text-align:center;}#mermaid-svg-PuteY7gPjJmYTHJD .node.clickable{cursor:pointer;}#mermaid-svg-PuteY7gPjJmYTHJD .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-PuteY7gPjJmYTHJD .arrowheadPath{fill:#333333;}#mermaid-svg-PuteY7gPjJmYTHJD .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-PuteY7gPjJmYTHJD .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-PuteY7gPjJmYTHJD .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-PuteY7gPjJmYTHJD .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-PuteY7gPjJmYTHJD .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-PuteY7gPjJmYTHJD .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-PuteY7gPjJmYTHJD .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-PuteY7gPjJmYTHJD .cluster text{fill:#333;}#mermaid-svg-PuteY7gPjJmYTHJD .cluster span{color:#333;}#mermaid-svg-PuteY7gPjJmYTHJD div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-PuteY7gPjJmYTHJD .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-PuteY7gPjJmYTHJD rect.text{fill:none;stroke-width:0;}#mermaid-svg-PuteY7gPjJmYTHJD .icon-shape,#mermaid-svg-PuteY7gPjJmYTHJD .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-PuteY7gPjJmYTHJD .icon-shape p,#mermaid-svg-PuteY7gPjJmYTHJD .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-PuteY7gPjJmYTHJD .icon-shape .label rect,#mermaid-svg-PuteY7gPjJmYTHJD .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-PuteY7gPjJmYTHJD .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-PuteY7gPjJmYTHJD .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-PuteY7gPjJmYTHJD :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}

    词面显现

    物理因果

    自然语言指令

    危险来源

    内容危险 CD『点燃窗帘』

    物理危险 PD『微波炉加热鸡蛋』

    文本护栏策略违规线索匹配

    物理监控需因果/常识须在执行前判定

    执行前安全决策

    论文的中心主张是:CD 与 PD 在 LLM 隐状态中构成两个可分的信号,而非同一"不安全方向"上的强弱之别。 全文价值系于此。因此本文的复核也以此为轴。


    2. 数学核心一:两个方向与两种角度

    2.1 定义

    在第 LLL 层取末位 token 隐状态 hL(x)∈Rdh_L(x)\\in\\mathbb{R}^dhL(x)Rd,按安全 / 内容危险 / 物理危险三类计类均值:

    μsafe=1∣S∣∑i∈ShL(xi),μCD=1∣E∣∑i∈EhL(xi),μPD=1∣I∣∑i∈IhL(xi)
    \\mu_{\\text{safe}}=\\frac{1}{|S|}\\sum_{i\\in S}h_L(x_i),\\quad
    \\mu_{\\text{CD}}=\\frac{1}{|E|}\\sum_{i\\in E}h_L(x_i),\\quad
    \\mu_{\\text{PD}}=\\frac{1}{|I|}\\sum_{i\\in I}h_L(x_i)
    μsafe=S1iShL(xi),μCD=E1iEhL(xi),μPD=I1iIhL(xi)

    危险方向定义为相对安全类的位移:

    uCDD=μCD−μsafe,uPDD=μPD−μsafe
    u_{\\text{CDD}}=\\mu_{\\text{CD}}-\\mu_{\\text{safe}},\\qquad
    u_{\\text{PDD}}=\\mu_{\\text{PD}}-\\mu_{\\text{safe}}
    uCDD=μCDμsafe,uPDD=μPDμsafe

    论文报告两个角度量:

    均值差角度 θmd\\theta_{\\text{md}}θmd,纯几何、不拟合分类器:

    θmd=arccos⁡⟨uCDD, uPDD⟩∥uCDD∥ ∥uPDD∥
    \\theta_{\\text{md}}=\\arccos\\frac{\\langle u_{\\text{CDD}},\\,u_{\\text{PDD}}\\rangle}{\\|u_{\\text{CDD}}\\|\\,\\|u_{\\text{PDD}}\\|}
    θmd=arccosuCDDuPDDuCDD,uPDD

    探针权重角度 θpw\\theta_{\\text{pw}}θpw:分别训练 safe-vs-CD 与 safe-vs-PD 两个 L2 正则 logistic 探针,取权重向量夹角。

    实测(Table 1):

    3B7B14B32B
    选中层 ℓ⋆\\ell^\\star 27/36 20/28 26/48 41/64
    θpw\\theta_{\\text{pw}}θpw (°) 75.9 74.2 71.6 71.9
    θmd\\theta_{\\text{md}}θmd (°) 49.1 54.6 63.2 67.7

    2.2 θpw>θmd\\theta_{\\text{pw}}>\\theta_{\\text{md}}θpw>θmd 是白化的系统性后果,而非可分性增强的证据

    论文以一句"判别式训练在各向异性协方差下会旋转权重"带过。该陈述本身正确,但未指出其偏置方向是系统性的,且恰好指向论文所需的结论。

    在共享协方差 Σ\\SigmaΣ 的高斯设定下(LDA,亦即正确设定的 logistic 回归的渐近解),最优判别方向为

    w∝Σ−1(μ1−μ0)
    w \\propto \\Sigma^{-1}(\\mu_1-\\mu_0)
    wΣ1(μ1μ0)

    wCD∝Σ−1uCDDw_{\\text{CD}}\\propto \\Sigma^{-1}u_{\\text{CDD}}wCDΣ1uCDDwPD∝Σ−1uPDDw_{\\text{PD}}\\propto \\Sigma^{-1}u_{\\text{PDD}}wPDΣ1uPDD,于是

    cos⁡θpw=uCDD⊤Σ−2uPDDuCDD⊤Σ−2uCDD  uPDD⊤Σ−2uPDD
    \\cos\\theta_{\\text{pw}}
    =\\frac{u_{\\text{CDD}}^{\\top}\\Sigma^{-2}u_{\\text{PDD}}}
    {\\sqrt{u_{\\text{CDD}}^{\\top}\\Sigma^{-2}u_{\\text{CDD}}}\\;\\sqrt{u_{\\text{PDD}}^{\\top}\\Sigma^{-2}u_{\\text{PDD}}}}
    cosθpw=uCDDΣ2uCDDuPDDΣ2uPDDuCDDΣ2uPDD

    θpw\\theta_{\\text{pw}}θpw 并非欧氏夹角,而是 Σ−2\\Sigma^{-2}Σ2 度量下的夹角。

    Σ\\SigmaΣ 作谱分解 Σ=∑iλieiei⊤\\Sigma=\\sum_i\\lambda_i e_ie_i^{\\top}Σ=iλieiei,则 Σ−2\\Sigma^{-2}Σ2 对第 iii 主轴的权重为 λi−2\\lambda_i^{-2}λi2。LLM 隐状态的谱具有极端各向异性——少数 outlier dimension 承载绝大部分方差。因此:

    主方差轴(λ1\\lambda_1λ1 最大)在 Σ−2\\Sigma^{-2}Σ2 度量下被压缩得最剧烈。

    uCDDu_{\\text{CDD}}uCDDuPDDu_{\\text{PDD}}uPDD 的共享分量——若确实存在一个"通用不安全方向"——最可能落在主方差轴上,因为它是被两类共同激发、能量最大的方向。白化按 λ1−2\\lambda_1^{-2}λ12 将其削除,低方差残差被相对放大,夹角随之张开。

    推论:49.1° 至 75.9° 的 26.8° 增量,不构成"判别空间中更可分"的证据;它是白化系统性移除共享高方差分量的几何签名。而该共享分量正是论文试图证明其不存在的对象。

    论文以对自身最有利的度量作为主指标,将更保守的 θmd\\theta_{\\text{md}}θmd 置于次行。

    补充一处值得注意的模式:θpw−θmd\\theta_{\\text{pw}}-\\theta_{\\text{md}}θpwθmd 的差值随规模单调收缩(26.8° → 19.6° → 8.4° → 4.2°)。即白化引入的角度虚高在 3B 上最大——而 3B 恰为全文唯一完成正式零假设检验的模型。

    2.3 跨规模角度不可比

    θpw\\theta_{\\text{pw}}θpw 单调下降(75.9→71.9),θmd\\theta_{\\text{md}}θmd 单调上升(49.1→67.7),两指标趋势相反,论文未作调和,仅表述为"角度模式一致"。

    更实质的问题在于论文 §5.1 的自陈:7B/14B/32B 的零假设检验未完成。

    零假设的均值是 dddNNN 的函数。训练样本量固定于 480 量级,而隐维度自 3B 的 2048 增至 32B 的 5120。在 d≫Nd\\gg NdN 的过参数化区间,两个在不相交子集上拟合的最大间隔解,其夹角的零假设均值随 d/Nd/Nd/N 单调趋近 90°(高维随机向量近似正交)。

    因此:3B 的 75.9° 相对其 60.35° 的 null 显著;14B 的 71.6° 相对其自身(未测量、但必然更高的)null 可能不显著。 在缺失各自 null 的前提下,跨规模角度序列不可解读。


    3. 数学核心二:零假设检验,及其衰减校正

    3.1 论文的构造

    为排除高维拟合的偶然性,作者在 3B 第 27 层将 300 个 unsafe 样本随机划分为 113 / 187 两组(与真实 CD/PD 规模严格匹配),各自对同一批 300 个 safe 训练 logistic 探针,记录权重夹角,重复 200 次构成 null 分布,统计量

    z=θobs−μnullσnull
    z=\\frac{\\theta_{\\text{obs}}-\\mu_{\\text{null}}}{\\sigma_{\\text{null}}}
    z=σnullθobsμnull

    结果:θobs=76.33°\\theta_{\\text{obs}}=76.33°θobs=76.33°μnull=60.35°\\mu_{\\text{null}}=60.35°μnull=60.35°σnull=1.58°\\sigma_{\\text{null}}=1.58°σnull=1.58°z=10.09z=10.09z=10.09p<0.0001p<0.0001p<0.0001,200 次随机划分无一达到观测值。

    该 null 的设计是正确的,且在 probing 文献中罕见——它匹配了样本量、优化器、正则强度与 safe 基线。这一点应予明确肯定。

    3.2 null 均值本身携带的信息

    先提一个问题:若随机划分的两半在总体意义上目标完全相同(随机划分保证两半的 CD:PD 期望比例一致),两个探针的夹角为何不趋近 0°,而是 60.35°?

    原因在于 d≫Nd\\gg NdN 下,每个拟合权重向量中有相当比例是估计噪声。

    形式化。设

    w^A=sA+nA,w^B=sB+nB
    \\hat w_A = s_A + n_A,\\qquad \\hat w_B = s_B + n_B
    w^A=sA+nA,w^B=sB+nB

    其中 sss 为总体探针方向,nnn 为有限样本估计噪声,满足 E⟨s,n⟩=0\\mathbb{E}\\langle s,n\\rangle=0Es,n=0,且不相交子集上的噪声近似不相关 E⟨nA,nB⟩≈0\\mathbb{E}\\langle n_A,n_B\\rangle\\approx 0EnA,nB0。定义信号能量占比

    ρ=∥s∥2∥s∥2+∥n∥2
    \\rho=\\frac{\\|s\\|^2}{\\|s\\|^2+\\|n\\|^2}
    ρ=s2+n2s2

    Null 情形(sA=sB=ss_A=s_B=ssA=sB=s):

    cos⁡θnull=⟨s,s⟩∥w^A∥∥w^B∥=∥s∥2∥s∥2+∥n∥2=ρ
    \\cos\\theta_{\\text{null}}=\\frac{\\langle s,s\\rangle}{\\|\\hat w_A\\|\\|\\hat w_B\\|}=\\frac{\\|s\\|^2}{\\|s\\|^2+\\|n\\|^2}=\\rho
    cosθnull=w^A∥∥w^Bs,s=s2+n2s2=ρ

    代入 θnull=60.35°\\theta_{\\text{null}}=60.35°θnull=60.35°

    ρ=cos⁡60.35°=0.495
    \\boxed{\\rho=\\cos 60.35°=0.495}
    ρ=cos60.35°=0.495

    即每个探针权重向量中仅约 49.5% 的能量可复现,另 50.5% 为估计噪声。 这是 null 实验最具信息量的副产品,论文未加计算。

    3.3 衰减校正

    真实情形(sA=sCDs_A=s_{\\text{CD}}sA=sCDsB=sPDs_B=s_{\\text{PD}}sB=sPD,真实夹角余弦 c⋆c^\\starc)。在信号能量与噪声能量跨探针近似相等的假设下——null 采用 113/187 划分正是为保证这一条件——有

    cos⁡θobs=⟨sCD,sPD⟩∥w^CD∥∥w^PD∥=c⋆⋅ρ
    \\cos\\theta_{\\text{obs}}=\\frac{\\langle s_{\\text{CD}},s_{\\text{PD}}\\rangle}{\\|\\hat w_{\\text{CD}}\\|\\|\\hat w_{\\text{PD}}\\|}=c^\\star\\cdot\\rho
    cosθobs=w^CD∥∥w^PDsCD,sPD=cρ

    此即经典的衰减校正(correction for attenuation)。反解:

    c⋆=cos⁡θobsρ=cos⁡76.33°cos⁡60.35°=0.23630.4947=0.4777
    c^\\star=\\frac{\\cos\\theta_{\\text{obs}}}{\\rho}=\\frac{\\cos 76.33°}{\\cos 60.35°}=\\frac{0.2363}{0.4947}=0.4777
    c=ρcosθobs=cos60.35°cos76.33°=0.49470.2363=0.4777

    θ⋆=arccos⁡(0.4777)≈61.5°
    \\boxed{\\theta^\\star=\\arccos(0.4777)\\approx 61.5°}
    θ=arccos(0.4777)61.5°

    去噪后,CD 与 PD 探针方向的真实夹角约 61.5°,而非摘要中的 76.33°。

    需补充偏置方向的说明:两个探针共用同一批 300 个 safe 样本,其共享噪声分量 mmm 在两向量中近似相同,行为上等同于信号。将其分离:

    cos⁡θobs=c⋆ρs+ρm,ρs+ρm=ρ
    \\cos\\theta_{\\text{obs}}=c^\\star\\rho_s+\\rho_m,\\qquad \\rho_s+\\rho_m=\\rho
    cosθobs=cρs+ρm,ρs+ρm=ρ

    ρm>0\\rho_m>0ρm>0 可知真实 c⋆<0.478c^\\star<0.478c<0.478,即 θ⋆>61.5°\\theta^\\star>61.5°θ>61.5°。故 61.5° 是一个下界。

    3.4 本节的公允结论

    必须明确:衰减校正削去了标题数字的 15°,但未推翻结论。 cos⁡61.5°=0.478\\cos 61.5°=0.478cos61.5°=0.478 意味着两方向存在约 48% 的方向重叠——既非同一概念(应趋近 0°),亦非正交(90°)。论文结论中"separable rather than strictly orthogonal"的表述是准确的。

    问题在于:摘要与标题继承的是 76.33°,而非这一准确表述。


    4. 数学核心三:PRISM 探针

    4.1 模型

    p(y=1∣x)=σ ⁣(w⊤hL(x)+b),y^=1 ⁣[p(y=1∣x)≥τ],τ=0.5
    p(y=1\\mid x)=\\sigma\\!\\left(w^{\\top}h_L(x)+b\\right),\\qquad
    \\hat y=\\mathbb{1}\\!\\left[p(y=1\\mid x)\\ge\\tau\\right],\\quad \\tau=0.5
    p(y=1x)=σ(whL(x)+b),y^=1[p(y=1x)τ],τ=0.5

    冻结 LLM,取选定层末位 token 隐状态,标准化,一个逻辑回归。无微调,无额外网络。

    4.2 目标函数的一处必须纠正的错误

    Algorithm 1 第 7 行写作:

    (w,b)←arg⁡min⁡w,b 1N∑i=1NBCE ⁣(σ(w⊤h~i+b), yi)+1C∥w∥22
    (w,b)\\leftarrow\\arg\\min_{w,b}\\ \\frac{1}{N}\\sum_{i=1}^{N}\\mathrm{BCE}\\!\\left(\\sigma(w^{\\top}\\tilde h_i+b),\\,y_i\\right)+\\frac{1}{C}\\|w\\|_2^2
    (w,b)argw,bmin N1i=1NBCE(σ(wh~i+b),yi)+C1w22

    而 §4.2 声明实现为 LogisticRegression(max_iter=2000, C=1.0)。两者不一致。

    scikit-learn 的 L2 logistic 实际最小化:

    min⁡w,c 12w⊤w+C∑i=1Nlog⁡ ⁣(exp⁡ ⁣(−yi(Xi⊤w+c))+1)
    \\min_{w,c}\\ \\frac{1}{2}w^{\\top}w+C\\sum_{i=1}^{N}\\log\\!\\left(\\exp\\!\\left(-y_i(X_i^{\\top}w+c)\\right)+1\\right)
    w,cmin 21ww+Ci=1Nlog(exp(yi(Xiw+c))+1)

    损失项为求和而非平均,且 CCC 乘在数据项上。两侧同除 CNCNCN 化为论文形式:

    min⁡w,c 1N∑i=1Nlog⁡(⋯ )+12CN∥w∥22
    \\min_{w,c}\\ \\frac{1}{N}\\sum_{i=1}^{N}\\log(\\cdots)+\\frac{1}{2CN}\\|w\\|_2^2
    w,cmin N1i=1Nlog()+2CN1w22

    正则系数为 12CN\\dfrac{1}{2CN}2CN1,而非 1C\\dfrac{1}{C}C1,相差 2N2N2N 倍。

    代入 C=1.0C=1.0C=1.0N≈480N\\approx480N480(600 样本的 5 折训练集):

    λ=12×1.0×480≈1.04×10−3
    \\lambda=\\frac{1}{2\\times 1.0\\times 480}\\approx 1.04\\times 10^{-3}
    λ=2×1.0×48011.04×103

    论文的写法暗示 λ=1\\lambda=1λ=1。实际正则强度弱约三个数量级。

    该差异的实质影响:d=2048≫N=480d=2048 \\gg N=480d=2048N=480,数据几乎必然线性可分。在可分且弱正则的极限下,logistic 回归的解方向收敛至最大间隔(hard-margin SVM)方向(Soudry et al. 的隐式偏置结果)。因此 PRISM 实为一个近似最大间隔分类器,其方向由少数边界支持向量决定。

    这直接影响第 3 节角度分析的解释:θpw\\theta_{\\text{pw}}θpw 度量的并非正则化判别方向之间的夹角,而是 d≫Nd\\gg NdN 下两个最大间隔解之间的夹角——正是零空间几何主导、噪声占据约半数能量(§3.2 已算出 ρ≈0.495\\rho\\approx0.495ρ0.495)的那个 regime。作者引入 null 的判断是对的;但其对自身拟合对象的描述不准确。

    4.3 层选择的乐观偏差量级

    Algorithm 1 第 5 行以训练集 5 折 CV 准确率选层;§4.2 坦承这"是选中层估计,而非完全嵌套的层选择协议"。

    坦承之外,量级需要算出:

    • 每层 5 折准确率的折间标准差 ≈2.4\\approx 2.42.4 pp(Table 2 的 ±\\pm±std)
    • 均值标准误 SE=2.4/5≈1.07\\mathrm{SE}=2.4/\\sqrt{5}\\approx 1.07SE=2.4/51.07 pp
    • 3B 候选 36 层,但 Figure 7 显示层间准确率为光滑曲线、高度相关,有效独立候选数 keffk_{\\text{eff}}keff 约 3–8
    • Gumbel 近似:E[max⁡k]≈2ln⁡k⋅σ\\mathbb{E}[\\max_k]\\approx\\sqrt{2\\ln k}\\cdot\\sigmaE[maxk]2lnkσ
    keffk_{\\text{eff}}keffE[max⁡]\\mathbb{E}[\\max]E[max]偏差
    3 1.48σ 1.59 pp
    5 1.79σ 1.93 pp
    8 2.04σ 2.19 pp

    层选择的乐观偏差量级为 1.5–2 pp。

    而论文报告的跨规模准确率区间为 86.2%–87.7%,全距 1.5 pp。

    3B 至 32B 的全部"scaling 差异"完全落于层选择噪声之内。

    此结论双向成立:它使"PRISM 跨规模稳定"不可证伪,同时也使任何"更大模型更优"的解读失去依据。准确的表述应为:在选中层协议下,规模不影响可测的操作点。


    5. 实验数据的独立复核

    5.1 复核方法

    论文核心指标之间存在硬性恒等式约束。以 SafeAgentBench(300 safe / 113 CD / 187 PD)为例:

    TP=rCD⋅113+rPD⋅187,FP=FPR⋅300
    \\mathrm{TP}=r_{\\text{CD}}\\cdot 113+r_{\\text{PD}}\\cdot 187,\\qquad
    \\mathrm{FP}=\\mathrm{FPR}\\cdot 300
    TP=rCD113+rPD187,FP=FPR300

    Acc=TP+(300−FP)600,F1=2TP2TP+FP+FN
    \\mathrm{Acc}=\\frac{\\mathrm{TP}+(300-\\mathrm{FP})}{600},\\qquad
    F_1=\\frac{2\\mathrm{TP}}{2\\mathrm{TP}+\\mathrm{FP}+\\mathrm{FN}}
    Acc=600TP+(300FP),F1=2TP+FP+FN2TP

    任一表格中 Acc、F1F_1F1、CD det、PD det、FPR 五项若非同源计算,必然违反该约束。以下按此逐表检验。

    5.2 主表:全部自洽

    表复核 Acc报告 Acc复核 F1F_1F1报告 F1F_1F1判定
    SafeAgentBench 3B 86.15 86.2 0.8613 0.861
    SafeAgentBench 7B 87.01 87.0 0.8710 0.871
    SafeAgentBench 14B 87.13 87.2 0.8697 0.870
    SafeAgentBench 32B 87.67 87.7 0.8763 0.876
    SafeText 92.42 92.4 0.9245 0.924
    EARBench 82.90 82.9 0.8281 0.828
    PSB-1K 99.60 99.6 0.9960 0.996

    全部在舍入误差内一致。 McNemar 统计量亦复核通过:χ2=1.94⇒p=0.1636\\chi^2=1.94\\Rightarrow p=0.1636χ2=1.94p=0.1636(报 0.1637);χ2=0.56⇒p≈0.454\\chi^2=0.56\\Rightarrow p\\approx0.454χ2=0.56p0.454(报 0.4557,差异源于连续性修正的实现差别)。

    这一结论具有独立价值:它确认主实验为真实运行,从而使下一小节的异常更具指示性。

    5.3 Table 5:三行违反恒等式约束

    Table 5(跨模型 PSB-1K 操作点)仅给出 Acc / PD det / FPR,无 F1F_1F1 可交叉验证。但恒等式仍然成立:1000 safe + 1000 PD,pair-wise GroupKFold 在 1000 个等大分组下每折恰为 400 例,折均准确率必然等于整体准确率。故

    Acc=1000⋅rPD+1000⋅(1−FPR)2000
    \\mathrm{Acc}=\\frac{1000\\cdot r_{\\text{PD}}+1000\\cdot(1-\\mathrm{FPR})}{2000}
    Acc=20001000rPD+1000(1FPR)

    须精确成立。复核结果:

    BackbonePD detFPRTPTN恒等式 Acc报告 Acc偏差
    Qwen2.5-3B 99.9 0.7 999 993 99.60 99.6 ✅ 0.00
    Qwen2.5-7B 99.7 1.0 997 990 99.35 99.4 ✅ −0.05
    Qwen2.5-14B 99.6 1.2 996 988 99.20 99.3 ❌ −0.10
    Qwen2.5-32B 99.4 1.4 994 986 99.00 99.2 ❌ −0.20
    Phi-3.5-mini 99.0 1.8 990 982 98.60 98.8 ❌ −0.20
    SmolLM2-1.7B 98.2 3.2 982 968 97.50 97.5 ✅ 0.00

    三行违反约束,偏差相当于 2–4 个样本。

    孤立来看可归因于舍入。但与以下三项线索并置后,该解释的说服力下降:

  • 同表 judge 的 FPR 序列为 67.8 / 70.0 / 73.0 / 76.0 / 68.0 / 90.0——除 3B 行外全部为整数值(在 1000 个 safe 样本上分别恰为 700、730、760、680、900)。
  • 3B 行与 Table 4 逐值吻合,属真实运行;其余各行无法交叉验证。
  • 论文自陈 7B/14B/32B 的 null 检验未完成。
  • Table 5 中 PRISM 准确率随规模单调下降(99.6→99.2),与全文他处"跨规模稳定"的叙事方向相反,且未作解释。单调、近似等差、无机制解释的序列,符合插值特征而非测量特征。
  • 本文不就此下结论,但认为这是作者应被询问且可一句话澄清的问题:Table 5 的非-3B 行是否为完整重跑?在修订版中补充原始混淆矩阵即可解决。

    5.4 延迟表:跨规模列不可解读,且分布形态异常

    Table 7 中 PRISM 的延迟为 7B/14B/32B = 56.8 / 146.1 / 103.4 ms——32B 快于 14B。judge 列同样为 116.8 / 309.1 / 191.9 ms,14B 慢于 32B。单次前向传播与单次生成均不可能呈现此序,除非不同规模在不同硬件上测量。论文确已声明"不固定 GPU 与软件栈",故跨规模列不可解读;同规模内的约 2× 比值尚可接受。

    另有一处分布异常:7B 的 PRISM 为 mean 56.8 < median 61.3,14B 为 146.1 < 156.9,judge 的 14B/32B 亦呈 mean < median。延迟数据通常右偏(长尾偏慢),此处系统性左偏,符合测量漂移(GPU 时钟 boost 或热降频)的特征,表明 580 个计时样本并非在稳态下采集。

    5.5 Llama Guard 基线退化为常数分类器

    Table 2 末行:Llama Guard 3-1B 在 SafeAgentBench 上 CD 检出 0.0%、PD 检出 0.0%、FPR 0.0%,即对全部 600 条指令输出 safe——包括 113 条含显式危险词的内容危险样本。PSB-1K 上同为 50.0% 准确率 / 0.0 检出 / 0.0 FPR。

    一个在其主场任务(显式内容危险)上 113 例全漏的模型,最可能的解释并非"taxonomy 不匹配",而是 chat template 或输出解析异常——Llama Guard 对 prompt 格式高度敏感,模板不合规时默认输出 safe。

    论文将其表述为一项科学发现(“内容护栏无法感知物理危险”)。一个退化为常数输出的 baseline 不能支撑任何结论。 该项应重跑或自主表撤下。


    6. 证据链评估:五处断裂

    #mermaid-svg-kNqcRWhzXMzT4Ujm{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-kNqcRWhzXMzT4Ujm .error-icon{fill:#552222;}#mermaid-svg-kNqcRWhzXMzT4Ujm .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-kNqcRWhzXMzT4Ujm .marker{fill:#333333;stroke:#333333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .marker.cross{stroke:#333333;}#mermaid-svg-kNqcRWhzXMzT4Ujm svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-kNqcRWhzXMzT4Ujm p{margin:0;}#mermaid-svg-kNqcRWhzXMzT4Ujm .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .cluster-label text{fill:#333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .cluster-label span{color:#333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .cluster-label span p{background-color:transparent;}#mermaid-svg-kNqcRWhzXMzT4Ujm .label text,#mermaid-svg-kNqcRWhzXMzT4Ujm span{fill:#333;color:#333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .node rect,#mermaid-svg-kNqcRWhzXMzT4Ujm .node circle,#mermaid-svg-kNqcRWhzXMzT4Ujm .node ellipse,#mermaid-svg-kNqcRWhzXMzT4Ujm .node polygon,#mermaid-svg-kNqcRWhzXMzT4Ujm .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-kNqcRWhzXMzT4Ujm .rough-node .label text,#mermaid-svg-kNqcRWhzXMzT4Ujm .node .label text,#mermaid-svg-kNqcRWhzXMzT4Ujm .image-shape .label,#mermaid-svg-kNqcRWhzXMzT4Ujm .icon-shape .label{text-anchor:middle;}#mermaid-svg-kNqcRWhzXMzT4Ujm .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-kNqcRWhzXMzT4Ujm .rough-node .label,#mermaid-svg-kNqcRWhzXMzT4Ujm .node .label,#mermaid-svg-kNqcRWhzXMzT4Ujm .image-shape .label,#mermaid-svg-kNqcRWhzXMzT4Ujm .icon-shape .label{text-align:center;}#mermaid-svg-kNqcRWhzXMzT4Ujm .node.clickable{cursor:pointer;}#mermaid-svg-kNqcRWhzXMzT4Ujm .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .arrowheadPath{fill:#333333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-kNqcRWhzXMzT4Ujm .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-kNqcRWhzXMzT4Ujm .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-kNqcRWhzXMzT4Ujm .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-kNqcRWhzXMzT4Ujm .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-kNqcRWhzXMzT4Ujm .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-kNqcRWhzXMzT4Ujm .cluster text{fill:#333;}#mermaid-svg-kNqcRWhzXMzT4Ujm .cluster span{color:#333;}#mermaid-svg-kNqcRWhzXMzT4Ujm div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-kNqcRWhzXMzT4Ujm .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-kNqcRWhzXMzT4Ujm rect.text{fill:none;stroke-width:0;}#mermaid-svg-kNqcRWhzXMzT4Ujm .icon-shape,#mermaid-svg-kNqcRWhzXMzT4Ujm .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-kNqcRWhzXMzT4Ujm .icon-shape p,#mermaid-svg-kNqcRWhzXMzT4Ujm .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-kNqcRWhzXMzT4Ujm .icon-shape .label rect,#mermaid-svg-kNqcRWhzXMzT4Ujm .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-kNqcRWhzXMzT4Ujm .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-kNqcRWhzXMzT4Ujm .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-kNqcRWhzXMzT4Ujm :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}

    断裂 6.1

    §3.3

    断裂 6.2

    断裂 6.3

    断裂 6.4

    断裂 6.5

    主张:CD 与 PD 在隐状态中是两个可分信号

    证据 1:θpw = 76.33°显著高于随机切分 null

    证据 2:PSB-1K 上PRISM 99.6% / judge 64.4%

    证据 3:跨数据集复现SafeText / EARBench

    方法:PRISM 探针

    CD/PD 划分由词表规则定义null 控制噪声,不控制该混杂

    衰减校正后 → 61.5° 下界

    缺 family-level 留出模板泄漏未排除

    全部为同分布 5 折 CV无零样本迁移证据

    Figure 2:CDD/PDD 平面错误率为完整探针的近两倍

    匹配 FPR 下 McNemar 不显著

    6.1 混杂未控制:CD/PD 划分本身即一条词表规则

    论文 §5.1 明确记载:SafeAgentBench 的 unsafe 划分由"确定性的 25 关键词子串规则"生成,切分为 113 CD / 187 PD,并承认泄漏(drop 出现于 12 条 safe 与 29 条 CD,break 出现于 1 条 safe 与 34 条 CD)。

    由此可得如下推理链:

    • CD 标签 ≡\\equiv 含特定关键词
    • 故 safe-vs-CD 探针在定义上部分是一个关键词检测器
    • PD 标签 ≡\\equiv 不含该关键词集
    • 故两探针方向不同,由标签生成过程所保证,而非模型表示的性质

    随机切分 null 在原理上无法控制这一混杂:随机划分的两半含有同分布的关键词混合,故 null 仅度量估计噪声,不度量"标签由词表定义"这一因素。

    正确的对照应为:以一条与安全性无关的词表规则执行同规模(113/187)划分——例如按是否含 kitchen/bedroom 切分——并重算 θpw\\theta_{\\text{pw}}θpw。若该"语义无关但词面有别"的划分同样给出约 76°,则 CDD/PDD 主张退化为"隐状态编码表层词汇特征",属既有共识。

    这是决定本文成色的单一关键实验。缺失该对照,第 3 节的结论不成立。

    6.2 泄漏未排除:PSB-1K 缺 family-level 留出

    PSB-1K 的构造意图值得肯定:1000 对最小对比样本,覆盖 10 个家用风险族(微波炉金属接触、微波炉压力加热、烤面包机导电物接触、通电设备接液、地面液体、加热面接触、明火邻近、食品接触污染、清洁用品与食品容器接触、放置接触伤害),并刻意剔除 danger / harm / burn / shock / poison 等直接危险词。

    但结果为:3B 模型冻结隐状态 + 线性探针 = 99.6% 准确率、AUC 1.000、FPR 0.7%;SmolLM2-1.7B 亦达 97.5%。

    若该结果确实度量"物理因果推理",则意味着一个 1.7B 模型的中间层经一次线性读出即将家用物理常识解决至 97.5%——此结论远比论文的主张更为强烈。更节俭的解释是:

    10 个模板族 × 最小对比对构成一个低秩、高度结构化的数据集;线性探针拟合的是模板指纹而非物理因果。

    论文采用 pair-wise GroupKFold 确保对内样本不跨折,这防止了 pair 泄漏,但未防止 family 泄漏:同一风险族的模板同时出现于训练折与测试折。

    所需对照为 leave-one-risk-family-out(LORO)交叉验证:10 折,每折留出一整个风险族作测试。若 LORO 下仍达 95%+,则为真实信号,PSB-1K 构成扎实贡献;若降至 70% 量级,则 99.6% 属模板记忆。

    一项旁证:同一数据上 LLM judge 仅 64.4% 准确率(96.5% 召回 / 67.8% FPR)。judge 能够识别危险(召回 96.5%),其低准确率源于过度拒绝。一个具备推理能力的模型在"需要推理"的数据上被线性探针以 35 个百分点超越,该模式更符合"探针捕获了 judge 无须依赖的表层结构"。

    6.3 泛化证据缺失:全部为同分布交叉验证

    此项论文已自陈,措辞坦率:将结果读作"匹配机制下的跨数据集复现"而非零样本迁移。

    具体而言,SafeAgentBench、SafeText、EARBench、PSB-1K 均为 fold-internal 5 折 CV,探针在每个数据集上重新训练。因此:

    • PRISM:有监督 + 同分布
    • LLM judge:零样本

    以见过同分布标签的判别器与零样本模型比较 FPR,其胜出为设计所决定,不构成能力证据。

    唯一具决定性的实验其材料全部现成:在 SafeAgentBench 上训练 PRISM,零样本测试 PSB-1K(及反向)。论文未包含。

    其缺失的可能原因可以推测:SafeAgentBench 的 unsafe 训练信号中有 113 条为关键词驱动的 CD,而 PSB-1K 刻意剔除全部关键词,跨分布迁移大概率显著退化。但该数字才是本文的真实泛化成绩。

    6.4 归因断裂:表示分析与方法在因果上不相连

    论文称 PRISM “直接将 CD/PD 结构操作化”。但 §4.2 随即承认:PRISM 训练于完整隐状态之上,并非手工构造的 CDD/PDD 标量规则。

    那么 CDD/PDD 分析对 PRISM 的实际贡献为何?论文自身 Figure 2 的数据:

    决策边界600 例中错分错误率
    仅 CDD(1D 阈值) 163 27.2%
    仅 PDD(1D 阈值) 159 26.5%
    CDD+PDD 组合(2D 边界) 148 24.7%
    PRISM(完整隐状态) ≈83 13.8%

    两点推论:

  • 二维组合相对一维仅减少 11–15 个错误(约 2 pp)。 若 CD 与 PD 确为两个近乎独立的信号,二维边界应显著优于一维。观测不支持。
  • 投影至 CDD/PDD 平面后,错误率为完整探针的近两倍(24.7% vs 13.8%)。 PRISM 的判别能力并不来源于这两个方向。
  • 即:删去第 3 节,PRISM 无需任何修改,性能不变。 §3 是动机而非机制,论文将其表述为后者。

    剥离表示分析后,PRISM ≡\\equiv 冻结 LLM 隐状态上的线性探针(Alain & Bengio, 2016)。简单方法有效本身是优点,但方法新颖性的主张不成立。

    6.5 统计断裂:匹配 FPR 下无显著差异,且不显著 ≠\\neq= 等价

    论文 §5.6 报告:在匹配 FPR 的操作点上做配对 McNemar 检验,物理危险子集 χ2=1.94, p=0.1637\\chi^2=1.94,\\ p=0.1637χ2=1.94, p=0.1637;全部 600 例 χ2=0.56, p=0.4557\\chi^2=0.56,\\ p=0.4557χ2=0.56, p=0.4557。两者均不拒绝准确率相等。

    即:将 judge 的阈值与 PRISM 拉至同一操作点后,PRISM 相对同规模 judge 无可检出的准确率优势。

    摘要中"judge 过度拒绝,FPR 24.7–39.0%"因此是一个阈值假象:judge 以贪心解码输出 SAFE/UNSAFE,仅有单一操作点;PRISM 拥有完整 ROC。以曲线比较单点,是自由度差异而非能力差异。

    同时须对该不显著结论加以限定,因为论文亦将其过度解读为"统计上相当"。不显著不等于等价。 反解 McNemar 的功效:设不一致对总数 nd=b+cn_d=b+cnd=b+c

    χ2=(b−c)2b+c ⟹ ∣b−c∣=χ2nd
    \\chi^2=\\frac{(b-c)^2}{b+c}\\ \\Longrightarrow\\ |b-c|=\\sqrt{\\chi^2 n_d}
    χ2=b+c(bc)2  bc=χ2nd

    χ2=0.56\\chi^2=0.56χ2=0.56nd≈130n_d\\approx130nd130(两者准确率同处 86–87%,量级合理)估计:∣b−c∣≈8.5|b-c|\\approx 8.5bc8.5,约合 1.4 pp。而 α=0.05\\alpha=0.05α=0.05 下最小可检出差为 1.96nd≈22.31.96\\sqrt{n_d}\\approx 22.31.96nd22.3,约合 3.7 pp。

    该检验仅能排除大于约 3.7 pp 的差异。主张"相当"需要预设等价边界的 TOST 检验,而非一个不显著的 ppp 值。


    7. 评估效度:平衡基准与真实类先验之间的断层

    本节讨论一个不针对本文、而针对整个具身安全评估协议的问题。它决定了论文所报操作点的可解释性。

    7.1 类先验漂移使报告的操作点失去意义

    全部基准均为平衡集:SafeAgentBench 300/300,PSB-1K 1000/1000,即 πtrain=0.5\\pi_{\\text{train}}=0.5πtrain=0.5。而具身指令流中危险指令的真实占比远低于此。逻辑回归估计的是 ptrain(y=1∣x)p_{\\text{train}}(y=1\\mid x)ptrain(y=1x),非目标分布下的后验。二者关系为

    logit ptest=logit ptrain+ln⁡πtest/(1−πtest)πtrain/(1−πtrain)
    \\mathrm{logit}\\,p_{\\text{test}}=\\mathrm{logit}\\,p_{\\text{train}}
    +\\ln\\frac{\\pi_{\\text{test}}/(1-\\pi_{\\text{test}})}{\\pi_{\\text{train}}/(1-\\pi_{\\text{train}})}
    logitptest=logitptrain+lnπtrain/(1πtrain)πtest/(1πtest)

    πtrain=0.5\\pi_{\\text{train}}=0.5πtrain=0.5πtest=0.001\\pi_{\\text{test}}=0.001πtest=0.001,修正项为 ln⁡0.0010.999=−6.91\\ln\\frac{0.001}{0.999}=-6.91ln0.9990.001=6.91 nats。

    即在类先验漂移三个数量级的条件下,τ=0.5\\tau=0.5τ=0.5 这一默认阈值对应的实际决策规则偏移了近 7 个 logit 单位。 论文以 τ=0.5\\tau=0.5τ=0.5 报告全部主结果而未讨论其依据,这使得所有 FPR / 召回数对仅在 50/50 假设下有效。

    顺带指出正确的阈值来源。设误拦一条安全指令的代价为 cFPc_{\\text{FP}}cFP、放过一条危险指令的代价为 cFNc_{\\text{FN}}cFN,则拦截当且仅当 cFN p>cFP(1−p)c_{\\text{FN}}\\,p>c_{\\text{FP}}(1-p)cFNp>cFP(1p),即

      w⊤h~+b>ln⁡cFPcFN+ln⁡πtest1−πtest  
    \\boxed{\\;w^{\\top}\\tilde h+b>\\ln\\frac{c_{\\text{FP}}}{c_{\\text{FN}}}+\\ln\\frac{\\pi_{\\text{test}}}{1-\\pi_{\\text{test}}}\\;}
    wh~+b>lncFNcFP+ln1πtestπtest

    阈值由代价比与类先验共同决定,0.50.50.5 只在 cFP=cFNc_{\\text{FP}}=c_{\\text{FN}}cFP=cFNπ=0.5\\pi=0.5π=0.5 时成立。

    7.2 精确率对基准率的敏感性

    精确率是类先验的函数:

    Precision=πrπr+(1−π)f
    \\mathrm{Precision}=\\frac{\\pi r}{\\pi r+(1-\\pi)f}
    Precision=πr+(1π)fπr

    π\\piπ 为危险指令基准率,rrr 为召回,fff 为 FPR)。代入论文各操作点:

    操作点召回FPRπ=10%\\pi=10\\%π=10%π=1%\\pi=1\\%π=1%π=0.1%\\pi=0.1\\%π=0.1%
    PRISM @ SafeAgentBench-3B 86.0% 13.7% 41.1% 5.96% 0.62%
    PRISM @ PSB-1K-3B 99.9% 0.7% 94.1% 59.0% 12.5%
    Qwen2.5-3B judge @ PSB-1K 96.5% 67.8% 13.7% 1.42% 0.14%

    关键读数在最后一列:

    • 全文最优操作点(PSB-1K,FPR 0.7%)在 π=0.1%\\pi=0.1\\%π=0.1% 下精确率 12.5%——每一次正确拦截伴随约 7 次误拦。
    • 主基准操作点(FPR 13.7%)精确率 0.62%——每一次正确拦截伴随约 137 次误拦。
    • LLM judge 为 0.14%。

    反解所需 FPR:

    f=π(1−P)P(1−π)
    f=\\frac{\\pi(1-P)}{P(1-\\pi)}
    f=P(1π)π(1P)

    π=0.1%\\pi=0.1\\%π=0.1% 下,50% 精确率需 f≈0.10%f\\approx 0.10\\%f0.10%;90% 精确率需 f≈0.011%f\\approx 0.011\\%f0.011%——较论文最优结果尚低两个半数量级。

    7.3 级联结构的上限

    论文 Figure 4 描绘了两级结构(PRISM 一线过滤,不确定样本升级至 LLM judge),但未提供任何级联的端到端评估。补算如下。

    AND 逻辑(两级均判危险方拦截),并作错误独立的乐观假设:

    rcascade=0.999×0.965=96.4%,fcascade=0.007×0.678=0.475%
    r_{\\text{cascade}}=0.999\\times 0.965=96.4\\%,\\qquad
    f_{\\text{cascade}}=0.007\\times 0.678=0.475\\%
    rcascade=0.999×0.965=96.4%,fcascade=0.007×0.678=0.475%

    π=0.1%\\pi=0.1\\%π=0.1% 下:

    P=0.001×0.9640.001×0.964+0.999×0.00475=16.9%
    P=\\frac{0.001\\times 0.964}{0.001\\times 0.964+0.999\\times 0.00475}=\\mathbf{16.9\\%}
    P=0.001×0.964+0.999×0.004750.001×0.964=16.9%

    自 12.5% 提升至 16.9%,代价为 3.5 pp 召回与一次额外 judge 调用。 级联未能解决基准率问题,因为一线探针已构成瓶颈。且错误独立假设偏乐观——两级会被同一批异常指令同时误导,实际 fcascade>0.475%f_{\\text{cascade}}>0.475\\%fcascade>0.475%

    7.4 对评估协议的推论

    上述算术不是对本文的针对性批评,而是对该领域评估惯例的推论:

    全部具身安全基准采用 50/50 平衡集,全部论文报告平衡集上的准确率 / F1F_1F1 / FPR,而无人报告目标类先验下的精确率。后者是决定该分类器可否承担自动决策的量。

    一个可操作的建议:该方向的论文应默认附报 precision @ 若干候选基准率(例如 π∈{10%,1%,0.1%}\\pi\\in\\{10\\%,1\\%,0.1\\%\\}π{10%,1%,0.1%})的敏感性表,其成本为零,信息量远高于再增加一个平衡集上的 F1F_1F1


    8. 平衡评价:本文的方法学贡献

    上文批评集中,因此须明确本文做对的部分——其中数项优于该方向的多数工作:

    ① 方法学诚实度罕见。 论文主动披露:SafeAgentBench 关键词划分存在泄漏(并给出具体词与计数);跨数据集为"匹配机制复现"而非零样本迁移;大模型 null 未完成;层选择非嵌套协议;延迟为"受控本地对比"而非硬件通用主张;以及对自身不利的 McNemar 不显著结果。上述每一项作者均可隐去而不被察觉。 在该领域,这种自律稀缺到应被单独记录。

    本文的相应批评是:摘要与结论未继承正文的诚实度。 全部限定词位于 §5.1 与 §5.6,而摘要呈现的是"86.2–87.7% 准确率 vs judge 24.7–39.0% FPR"。

    ② 随机切分 null 是正确的方法学示范。 多数 probing 与 representation engineering 工作报告一个余弦相似度或角度即作结论,从不追问"在给定维度与样本量下随机基线是多少"。本文做了,且做得规范(匹配样本量、优化器、正则、safe 基线)。该动作本身值得该方向整体采纳——§3.3 的衰减校正也只有在存在 null 的前提下才可导出。

    ③ 坚持 FPR 与召回同报。 论文反复强调仅看 unsafe 召回会使 judge 显得优于其在正常家务任务上的实际行为。该判断正确,且与该领域长期以准确率与召回自证的惯例相悖。

    ④ PSB-1K 的构造思路正确。 剔除直接危险词、构造最小对比对,以强制方法识别物理后果而非策略词面——这是该领域缺失的 benchmark design 方向。问题在执行(模板族泄漏、缺 LORO 对照),不在思路。


    9. 结论

    本文对该论文的定位是:一个正确的问题,一份诚实的实验记录,一组超出其证据支撑的结论。

    其价值在于:首次将"具身物理安全 ≠\\neq= 文本内容安全"这一区分转化为可测量的对象,并提出了构造思路正确的对比基准 PSB-1K。其方法学自觉——尤其是随机切分 null 与坚持同报 FPR——应被该方向整体采纳。

    其结论不宜直接接受,因为:核心角度证据经衰减校正后自 76.33° 降至 61.5° 下界(§3.3);CD/PD 划分由词表规则定义而 null 在原理上无法控制该混杂(§6.1);PSB-1K 的 99.6% 存在未排除的模板泄漏(§6.2);全文无任何零样本泛化证据(§6.3);其表示分析与其方法在因果上不相连(§6.4);而在匹配 FPR 下,其相对同规模 LLM judge 的优势被自身的 McNemar 检验判为不显著(§6.5)。

    最后提出一个本文认为该方向真正的开放问题:

    在目标类先验为 10−310^{-3}103 量级时,任何 FPR 高于 10−310^{-3}103 的安全闸门,其精确率必低于 50%。这意味着当前全部报告操作点在其目标分布下均不支持自动决策。那么"执行前安全判定"的正确形式化,究竟是二分类问题,还是风险估计与不确定性传递问题?

    当前该领域优化的是前者的指标,而基准率算术指向后者。

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » 当“话没毛病、动作要命”:一篇把具身安全从文本安全里拆出来的论文,值不值得信?
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!