跳到正文
arXiv 隐私论文· Pengxin Guo·· 3 天前AI 评分31

Fed-GRPO:奖励信号驱动的联邦群组相对策略优化

Fed-GRPO: Reward-Signal-Driven Federated Group Relative Policy Optimization

AI 导读

Fed-GRPO 是一个联邦 GRPO 训练框架,让大语言模型在不共享原始数据的前提下协作进行推理训练,并利用 GRPO 训练中自然产生的奖励统计作为零成本信号来指导聚合、本地训练与通信。

来源:arXiv 隐私论文 · arxiv.org