SWE-Bench-Verified: A benchmark for evaluating AI systems on real-world software engineering tasks
表格 2 results
| Name | Categories | Topics | References | Credibility | CreateDate | UpdateDate | Title | RelatedNotes | NavigationOrder | Eleventy | TemplateEngineOverride | Created |
|---|
| 20260504_reasoningbank_scaling_agent_self_evolving_reasoning_memory | paper_analysis | self_evolving_agents, reasoning_memory, test_time_scaling, agent_architecture, memory_mechanism | google_cloud_ai_research, webarena, mind2web, swebench_verified | 100 | | | ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory | Self-Evolving Agents: A Survey | [object Object] | [object Object] | md | |
| 20260609_socratic_swe_self_evolving_coding_agents_trace_derived_skills | paper_analysis | self_evolving_agents, memory_mechanism, skill_curation, reinforce_learning, reasoning | sjtu, swebench_verified, terminalbench_2, grpo, skillos | 100 | | | Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills | skillos_learning_skill_curation_self_evolving_agents, skillopt_executive_strategy_self_evolving_agent_skills, aflow_automating_agentic_workflow_generation, scaling_harness_agentic_ai, meme_multi_entity_evolving_memory_evaluation | [object Object] | [object Object] | md | |