[论文笔记]Interpreting and Evaluating Neural Network Robustness

mac2026-08-10  7

研究背景

相比于广泛研究的神经网络对抗攻防方法,神经网络的鲁棒性很少有研究人员进行解释,因此需要一种手段对其进行解释并提供度量方法。

本文贡献

本文提出了一种可视化loss的方法对对抗攻击和防御及模型鲁棒性进行解释。本文提出了一种度量神经网络鲁棒性的指标,并通过实验证明这种量化指标优于分类准确率这一评判指标。

主要方法

1、Loss可视化

loss是与输入x和神经网络参数 θ \theta θ相关的数据,但二者的维度过高,因此,需要将loss在2D空间可视化,由以下公式给出可视化规则: 其中,F为使用的Loss函数,如交叉熵等;o为原点,代表原始图片, α \alpha α β \beta β代表两个单位向量,即可视化空间的基向量;i、j为可视化空间中的某点。该方法为在input空间中寻找对应的loss。

(1)决策面可视化

传统的交叉熵函数不能体现神经网络的决策面,因此本文作者提出一种新方法: 其中,Z(x)是网络logit输出,即过softmax前的一层;t为正确类别。该公式最大的意义即为当S(x)=0时x恰好处在决策面上。

(2)实验结果与分析

在可视化loss时,本文作者针对四种噪声进行了实验,分别对应四种 β \beta β。而四个实验中的 α \alpha α则是一样的。四种噪声分别为随机噪声、Untargeted FGSM、Targeted FGSM和C&W。 箭头代表跨越决策面的距离,越红代表S(x)越高。可以看出随机噪声需要变得较大才能使神经网络分类错误,而三种攻击则仅需很小的噪声即可。作者给出解释,认为神经网络的输入空间自然存在对抗样本。即使分类正确率很高,但在输入样本周围很小范围内便会出现能使网络分类错误的样本。 作者在MNIST和Cifar10上进行了该方法,分别对Vanilla模型和对抗训练后的鲁棒模型进行实验,结果如下: M N I S T 结 果 MNIST结果 MNIST C i f a r 10 结 果 Cifar10结果 Cifar10 同一模型的两张图片(如(a)(b))分别代表在随机噪声和对抗噪声下可视化的结果。可见,Vanilla模型在收到很小的干扰后S(x)急剧下降成负值,代表分类错误,而对抗训练后便有了很大的噪声冗余空间。因此,作者认为鲁棒性的体现为在输入周围有一个平坦的决策面(即S(x)不要随着输入微小改变而发生较大变化)

2、鲁棒性量化指标

通过上述可视化方法,可以发现鲁棒模型在输入空间的原点周围不会产生太大的预测结果差异。因此,作者认为,度量网络在噪声图片和原始图片的预测结果上的差异便能给出网络鲁棒性的量化结果 ψ ( x ) \psi \left( x\right) ψ(x)。 其中,set为一个噪声集合, D K L D_{KL} DKL为KL散度度量,P(x)为模型预测输出。

P(x)存在的问题

上述指标中P(x)存在一个问题,即当模型参数等比例增长时,其预测结果不会发生变化,但是P(x)会有极大改变,作者称之为model re-parameterization。因此作者提出了P(x)的新计算方法来修正这一问题,整体思路为归一化。 其中F(x)是logit层输出。这样操作后,整体F(x)取值范围便缩小至[0,2],这样便规避了上述问题。

实验结果

这里仅分析最有价值的鲁棒性指标部分。表中列举了三种防御方法,在MNIST和CIFAR10中均出现了FGSM与PGD防御性能好但CW接近0的情况,而作者的 ψ ( x ) \psi \left( x\right) ψ(x)却没有倒置情况出现。由此,作者认为分类正确率并不能表明模型鲁棒性。

最新回复(0)