CJ/HERESEARCH INTO REALITYEN

03 / ALOA · 机器学习安全

模型记住了什么?

面向双塔神经网络的成员推断。问题是记录是否参与了训练,而不是如何重建记录。

交互讲解01 / 05
用户输入物品输入

用户与物品通过不同的塔生成嵌入表示。

当前观察用户与物品嵌入
区分两种输入,两个塔
示意演示 · 非实测坐标或在线模型

理解完整方法。

01

用户与物品输入分别转为嵌入。

02

合成查询使用目标响应训练影子模型。

03

用户特征扰动揭示响应行为。

04

影子模型衍生特征支持成员分类。

准确理解结果。

表 6 报告 Combined 准确率 97.87%、Dummy 准确率 95.07%,IN:OUT 比例分别为 4:1 与 1:10,评估人群不同。表 7 的 99.65% 是已知训练成员被预测为 IN 的比例,并非一般成员/非成员准确率。

查看完整论文与讨论
图示的含义与范围

位置、脉冲与嵌入变化均为概念示意,不是实测坐标或经验 ROC 曲线。成员推断关注训练参与情况,不表示记录重建。MMD 分布比较也不应被解读为成员概率。

继续探索

想法的下一步。