Reward model design, RLHF, and reward signal engineering for reinforcement learning

表格 6 results
NameCategoriesTopicsReferencesCredibilityCreateDateUpdateDateTitleRelatedNotesNavigationOrderEleventyTemplateEngineOverrideCreated
20260428_rubrics_as_rewardspaper_analysisreinforce_learning, llm, reasoning, reward_modelingscale_ai95Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains[object Object][object Object]md
20260520_amr_sd_token_level_credit_assignmentpaper_analysisreinforce_learning, reasoning, llm, reward_modeling, self_evolving_agentsgrpo, dapo, meituan, sciknoweval100AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignmentrl_long_horizon_reasoning_llm_expressiveness, skillos_learning_skill_curation_self_evolving_agents[object Object][object Object]md
20260524_vector_policy_optimization_vpopaper_analysisreinforce_learning, llm, test_time_scaling, reasoning, reward_modelingmit, grpo100Vector Policy Optimization: Training for Diversity Improves Test-Time Search[object Object][object Object]md
20260626_progress_advantage_llm_agentspaper_analysisreinforce_learning, reward_modeling, test_time_scaling, agent_architecture, llm, reasoninguniversity_of_wisconsin_madison, argonne_national_laboratory100Neglected Free Lunch from Post-training: Progress Advantage for LLM Agentsrl_long_horizon_reasoning_llm_expressiveness, vector_policy_optimization_vpo, trace_unified_rollout_budget_allocation_agentic_rl[object Object][object Object]md
20260714_rubrics_as_rewards_reinforcement_learning_beyond_verifiable_domainspaper_analysisreinforce_learning, reward_modeling, llm, reasoning, evaluationscale_ai100Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains[object Object][object Object]md
20260723_copy_less_ground_more_evidence_aware_rlpaper_analysisreasoning, reinforce_learning, reward_modeling, context_engineering, llmpku, alibaba_group, gear, gspo, ruler_benchmark100Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning20260703_self_evolving_world_models_llm_agent_planning, 20260719_searchos_v1_open_domain_information_seeking_agent_collaboration[object Object][object Object]md
Powered by Forestry.md