9月4日消息,近日,星尘智能基座模型团队发布能异步执行的在线强化学习框架SmoothRL(Online Reinforcement Learning During Asynchronous Execution)。该框架针对的是大模型异步推理成为真实部署常态后,online RL 应从哪些动作里学习的问题。技术报告已在星尘智能官网发布。 SmoothRL要解决的问题,由异步推理与online RL ...