| 20260428_rubrics_as_rewards | paper_analysis | reinforce_learning, llm, reasoning, reward_modeling | scale_ai | 95 | | | Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains | | [object Object] | [object Object] | md | |
| 20260520_amr_sd_token_level_credit_assignment | paper_analysis | reinforce_learning, reasoning, llm, reward_modeling, self_evolving_agents | grpo, dapo, meituan, sciknoweval | 100 | | | AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment | rl_long_horizon_reasoning_llm_expressiveness, skillos_learning_skill_curation_self_evolving_agents | [object Object] | [object Object] | md | |
| 20260524_vector_policy_optimization_vpo | paper_analysis | reinforce_learning, llm, test_time_scaling, reasoning, reward_modeling | mit, grpo | 100 | | | Vector Policy Optimization: Training for Diversity Improves Test-Time Search | | [object Object] | [object Object] | md | |
| 20260626_progress_advantage_llm_agents | paper_analysis | reinforce_learning, reward_modeling, test_time_scaling, agent_architecture, llm, reasoning | university_of_wisconsin_madison, argonne_national_laboratory | 100 | | | Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents | rl_long_horizon_reasoning_llm_expressiveness, vector_policy_optimization_vpo, trace_unified_rollout_budget_allocation_agentic_rl | [object Object] | [object Object] | md | |
| 20260714_rubrics_as_rewards_reinforcement_learning_beyond_verifiable_domains | paper_analysis | reinforce_learning, reward_modeling, llm, reasoning, evaluation | scale_ai | 100 | | | Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains | | [object Object] | [object Object] | md | |
| 20260723_copy_less_ground_more_evidence_aware_rl | paper_analysis | reasoning, reinforce_learning, reward_modeling, context_engineering, llm | pku, alibaba_group, gear, gspo, ruler_benchmark | 100 | | | Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning | 20260703_self_evolving_world_models_llm_agent_planning, 20260719_searchos_v1_open_domain_information_seeking_agent_collaboration | [object Object] | [object Object] | md | |