Dynamic Advantage Policy Optimization, a reinforcement learning algorithm for LLMs
| Name | Categories | Topics | References | Credibility | CreateDate | UpdateDate | Title | RelatedNotes | NavigationOrder | Eleventy | TemplateEngineOverride | Created |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 20260422_multimodal_agent_long_term_memory | paper_analysis | agent_architecture, multimodal, memory_mechanism, long_term_memory, video_understanding | m3_bench, bytedance_seed, dapo | 100 | Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory | HippoRAG: Neurobiologically Inspired Long-Term Memory | [object Object] | [object Object] | md | |||
| 20260520_amr_sd_token_level_credit_assignment | paper_analysis | reinforce_learning, reasoning, llm, reward_modeling, self_evolving_agents | grpo, dapo, meituan, sciknoweval | 100 | AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment | rl_long_horizon_reasoning_llm_expressiveness, skillos_learning_skill_curation_self_evolving_agents | [object Object] | [object Object] | md |