上云资讯 - 来上云吧，企业上云一站式服务

2025-04-05 16:38:38 392人关注

DeepSeek 与清华联合研究:创新奖励模型推理方法，提升可扩展性

近日，DeepSeek 和清华的研究者发布新论文，探讨了奖励模型的推理时 Scaling 方法，让 DeepSeek R2似乎更近一步。目前，强化学习在大语言模型的大规模后训练阶段广泛应用，但面临为大语言模型获取准确奖励信号的挑战。