arXiv 隐私论文· Pengxin Guo·· 3 天前AI 评分31
Fed-GRPO:奖励信号驱动的联邦群组相对策略优化
Fed-GRPO: Reward-Signal-Driven Federated Group Relative Policy Optimization
AI 导读
Fed-GRPO 是一个联邦 GRPO 训练框架,让大语言模型在不共享原始数据的前提下协作进行推理训练,并利用 GRPO 训练中自然产生的奖励统计作为零成本信号来指导聚合、本地训练与通信。
来源:arXiv 隐私论文 · arxiv.org