跳到正文
10月9日周五
  1. arXiv 隐私论文41

    Nullify:面向 LLM 遗忘的免训练零空间激活引导方法

    Nullify 是一种免训练、非破坏性的激活引导方法,用于大语言模型遗忘:它在推理时用引导向量把隐私相关激活从记忆答案上引开,同时满足零空间约束,使保留查询的激活基本不受影响。在 TOFU 和 MUSE 上的评估显示,Nullify 的遗忘质量达到或超过已有基线,并近乎无损地保持模型效用。由于完全不做权重更新,它可作为即插即用的推理时干预框架。

  2. arXiv 隐私论文31

    Gated Memory:面向对话式 AI 的准入控制记忆形成框架

    Gated Memory 在对话与存储之间加入两个决策检查点:准入闸门在抽取前结合完整话语上下文评估每条候选事实,条件化富化阶段则依据实体范围分类法与隐私约束对已准入事实进行落地。该方法在 LoCoMo-10 基准上相较检索与生成完全相同的强基线,LLM 评判准确率相对提升 2.6%,表明记忆形成质量是可测量的记忆性能约束。

10月8日周四
  1. arXiv 隐私论文60

    SBW:面向 LLM 智能体的抗改写、抗伪造语义行为水印

    论文提出语义行为水印(SBW),在历史条件下对语义动作簇而非精确动作符号嵌入水印,并用带密钥的抗碰撞分箱替代公开簇分箱。在五个智能体模型(3B-14B,四家厂商)和三个编码器上,ToolBench 改写场景下簇级检测率为 0.49-0.66,精确符号方案仅 0.05-0.17;ALFWorld 上为 0.92-0.97 对 0.00-0.01。

    推荐理由:论文提出面向 LLM 智能体的语义行为水印,在改写场景下检测率显著高于精确符号方案,并指出链式重放仍未被覆盖。

  2. arXiv 隐私论文17

    面向物质使用障碍患者对话生成的多目标对齐小语言模型框架

    研究提出一个面向物质使用障碍(SUD)患者对话生成的多目标对齐小语言模型框架,分认知成分检测与认知成分对齐对话生成两阶段,结合知识蒸馏、人类标注偏好优化与注意力引导奖励塑形。在 BERTScore、ROUGE、METEOR、BLEU 及 LLM-as-judge 命中指标上,认知信息微调在认知实现与对齐上优于通用指令微调基线和心理健康领域专用小语言模型,开放式认知成分提升尤为明显。

  3. arXiv 隐私论文12

    CoMoE:在消费级 GPU 上实现通信高效的 MoE 推理

    CoMoE 是一个面向消费级 GPU 的通信高效 MoE 推理系统,通过以主机为中心的路由解决 PCIe 带宽受限且无 P2P 支持的通信瓶颈。它用主机支持的 token 多播消除出站冗余,并用主机暂存缓冲的细粒度 token 级聚合替代全局同步。在 RTX 5090 上吞吐最高提升 1.46 倍,接近支持 NVLink 的 A800,硬件成本仅为其 23.4%。

  4. arXiv 隐私论文20

    AURA:面向戒烟的先发式智能可穿戴设备设计研究

    研究团队提出 AURA——一个基于市售可穿戴设备的智能手表-手机生态系统,用于在复吸发生前主动检测并干预烟瘾。通过对 10 名多族裔亚洲吸烟者与戒烟者的半结构化共创设计访谈,研究识别出习惯、情绪与社会三个维度的烟瘾预测因素,以及社会问责、个性化支持、奖励和即时分心等用户偏好的干预策略。参与者还强调信任、隐私、个性化与非评判式交互的重要性。