tau-squared-bench successor benchmark with policy-adherent tool-use agents
| Name | Categories | Topics | References | Credibility | CreateDate | UpdateDate | Title | RelatedNotes | NavigationOrder | Eleventy | TemplateEngineOverride | Created |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 20260701_severa_verified_synthesis_self_evolving_agents | paper_analysis | agent_architecture, self_evolving_agents, reinforce_learning, reasoning, agent_security | university_of_illinois_urbana_champaign, grpo, tau_squared_bench | 100 | SEVerA: Verified Synthesis of Self-Evolving Agents | skillos_learning_skill_curation_self_evolving_agents, muse_autoskill_self_evolving_skill_memory, trace_unified_rollout_budget_agentic_rl, amr_sd_token_level_credit_assignment, agent_memory_characterization_system_implications | [object Object] | [object Object] | md |