SWE-bench benchmark for evaluating language models on software engineering tasks
| Name | Categories | Topics | References | Credibility | CreateDate | UpdateDate | Title | RelatedNotes | NavigationOrder | Eleventy | TemplateEngineOverride | Created |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 20260716_immersion_in_github_universe_scaling_coding_agents_mastery | paper_analysis | multi_agent_systems, software_engineering, coding_agents, self_evolving_agents, data_scaling | renmin_university, bytedance_seed, swe_bench | 100 | Immersion in the GitHub Universe: Scaling Coding Agents to Mastery | 20260710_loger_long_context_geometric_reconstruction, 20260708_solving_million_step_llm_zero_errors | [object Object] | [object Object] | md |