Nullify:面向 LLM 遗忘的免训练零空间激活引导方法
Nullify 是一种免训练、非破坏性的激活引导方法,用于大语言模型遗忘:它在推理时用引导向量把隐私相关激活从记忆答案上引开,同时满足零空间约束,使保留查询的激活基本不受影响。在 TOFU 和 MUSE 上的评估显示,Nullify 的遗忘质量达到或超过已有基线,并近乎无损地保持模型效用。由于完全不做权重更新,它可作为即插即用的推理时干预框架。
Nullify 是一种免训练、非破坏性的激活引导方法,用于大语言模型遗忘:它在推理时用引导向量把隐私相关激活从记忆答案上引开,同时满足零空间约束,使保留查询的激活基本不受影响。在 TOFU 和 MUSE 上的评估显示,Nullify 的遗忘质量达到或超过已有基线,并近乎无损地保持模型效用。由于完全不做权重更新,它可作为即插即用的推理时干预框架。
Gated Memory 在对话与存储之间加入两个决策检查点:准入闸门在抽取前结合完整话语上下文评估每条候选事实,条件化富化阶段则依据实体范围分类法与隐私约束对已准入事实进行落地。该方法在 LoCoMo-10 基准上相较检索与生成完全相同的强基线,LLM 评判准确率相对提升 2.6%,表明记忆形成质量是可测量的记忆性能约束。
Fed-GRPO 是一个联邦 GRPO 训练框架,让大语言模型在不共享原始数据的前提下协作进行推理训练,并利用 GRPO 训练中自然产生的奖励统计作为零成本信号来指导聚合、本地训练与通信。
研究者提出面向图像比特流细粒度理解(IBFU)的基础模型 BFG,由比特流语义编码器 BSeE 与细粒度语义生成器 FSeG 组成,无需将图像完整解码到像素域即可完成分类与语义描述生成,从而减少处理流程中的视觉暴露。
论文提出语义行为水印(SBW),在历史条件下对语义动作簇而非精确动作符号嵌入水印,并用带密钥的抗碰撞分箱替代公开簇分箱。在五个智能体模型(3B-14B,四家厂商)和三个编码器上,ToolBench 改写场景下簇级检测率为 0.49-0.66,精确符号方案仅 0.05-0.17;ALFWorld 上为 0.92-0.97 对 0.00-0.01。
推荐理由:论文提出面向 LLM 智能体的语义行为水印,在改写场景下检测率显著高于精确符号方案,并指出链式重放仍未被覆盖。
研究提出一个面向物质使用障碍(SUD)患者对话生成的多目标对齐小语言模型框架,分认知成分检测与认知成分对齐对话生成两阶段,结合知识蒸馏、人类标注偏好优化与注意力引导奖励塑形。在 BERTScore、ROUGE、METEOR、BLEU 及 LLM-as-judge 命中指标上,认知信息微调在认知实现与对齐上优于通用指令微调基线和心理健康领域专用小语言模型,开放式认知成分提升尤为明显。
CoMoE 是一个面向消费级 GPU 的通信高效 MoE 推理系统,通过以主机为中心的路由解决 PCIe 带宽受限且无 P2P 支持的通信瓶颈。它用主机支持的 token 多播消除出站冗余,并用主机暂存缓冲的细粒度 token 级聚合替代全局同步。在 RTX 5090 上吞吐最高提升 1.46 倍,接近支持 NVLink 的 A800,硬件成本仅为其 23.4%。
研究团队提出 AURA——一个基于市售可穿戴设备的智能手表-手机生态系统,用于在复吸发生前主动检测并干预烟瘾。通过对 10 名多族裔亚洲吸烟者与戒烟者的半结构化共创设计访谈,研究识别出习惯、情绪与社会三个维度的烟瘾预测因素,以及社会问责、个性化支持、奖励和即时分心等用户偏好的干预策略。参与者还强调信任、隐私、个性化与非评判式交互的重要性。
研究者提出开源可扩展框架 Open-MMUnlearning,通过共享接口和结构化配置整合目标模型准备、多模态数据处理、遗忘与评测,覆盖隐私、安全、版权三类共五个基准、四个模型家族的八个 MLLM 和十二种遗忘方法。