Group Sequence Policy Optimization, a sequence-level RL algorithm for long sequence generation
| Name | Categories | Topics | References | Credibility | CreateDate | UpdateDate | Title | RelatedNotes | NavigationOrder | Eleventy | TemplateEngineOverride | Created |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 20260723_copy_less_ground_more_evidence_aware_rl | paper_analysis | reasoning, reinforce_learning, reward_modeling, context_engineering, llm | pku, alibaba_group, gear, gspo, ruler_benchmark | 100 | Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning | 20260703_self_evolving_world_models_llm_agent_planning, 20260719_searchos_v1_open_domain_information_seeking_agent_collaboration | [object Object] | [object Object] | md |