Software Engineering

Papers filed under cs.SE on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

1,321 to 1,380 of 1,389

  1. Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring

    Indraneil Paul, Goran Glavaš, Iryna Gurevych

    cs.SEcs.LGarXiv:2605.00754v42026
  2. PaperFit: Vision-in-the-Loop Typesetting Optimization for Scientific Documents

    Bihui Yu, Xinglong Xu, Junjie Jiang +6

    cs.AIcs.SEarXiv:2605.10341v12026
  3. SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering

    Qingnan Ren, Shun Zou, Shiting Huang +11

    cs.SEcs.AIarXiv:2605.17526v12026
  4. ACL-Verbatim: hallucination-free question answering for research

    Gábor Recski, Szilveszter Tóth, Nadia Verdha +2

    cs.CLcs.AIcs.SEarXiv:2605.21102v12026
  5. A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation

    Shide Zhou, Kailong Wang, Ling Shi +1

    cs.SEcs.AIarXiv:2607.04784v12026
  6. Graphectory Viewer: A Tool for Process-Centric Analysis of Agentic Software Trajectories

    Charlie Jyu, Shuyang Liu, Reyhaneh Jabbarvand

    cs.SEcs.AIarXiv:2608.17195v12026
  7. TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation

    Zhibo Zhang, Zhen Ouyang, Ling Shi +1

    cs.AIcs.SEarXiv:2608.17588v12026
  8. Beyond FLOPs: Energy-Aware Knowledge Distillation for Sustainable LLMs on Code-Related Task

    Enrique Barba Roque, Luís Cruz, Annibale Panichella

    cs.SEcs.AIarXiv:2608.17515v12026
  9. Diffusion Templates: A Unified Plugin Framework for Controllable Diffusion

    Zhongjie Duan, Hong Zhang, Yingda Chen

    cs.LGcs.AIcs.CVarXiv:2604.24351v12026
  10. From Runnable to Shippable: Multi-Agent Test-Driven Development for Generating Full-Stack Web Applications from Requirements

    Yuxuan Wan, Tingshuo Liang, Jiakai Xu +3

    cs.SEarXiv:2605.17242v12026
  11. Invariant Pretraining for Robust Code Representations

    Yifeng He, Yundi Xu, Christopher Castro Gaw Gonzalo +2

    cs.LGcs.AIcs.SEarXiv:2608.15412v12026
  12. Agent Lightning v1.0: Towards Harnessed Agentic RL

    Zhiyuan He, Siwei Zhang, Zhiwen Zhou +7

    cs.AIcs.SEarXiv:2608.17528v12026
  13. LLM Agents Can See Code Repositories

    Dongjian Ma, Silin Chen, Yufei Yang +3

    cs.SEarXiv:2606.14061v42026
  14. Code2LoRA: Hypernetwork-Generated Adapters for Code Language Models under Software Evolution

    Liliana Hotsko, Yinxi Li, Yuntian Deng +1

    cs.SEcs.AIcs.CLarXiv:2606.06492v12026
  15. DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch

    Jiale Zhao, Guoxin Chen, Fanzhe Meng +4

    cs.SEarXiv:2606.10728v22026
  16. CEO-Bench: Can Agents Play the Long Game?

    Haozhe Chen, Karthik Narasimhan, Zhuang Liu

    cs.AIcs.CLcs.SEarXiv:2606.18543v22026
  17. SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces

    Qi Hu, Yifeng Tang, Qinghua Wang +7

    cs.SEcs.CRarXiv:2606.01317v12026
  18. Software Engineering for AI-driven Building Operation

    Philipp Zech, Sascha Hammes, Johannes Weninger +2

    cs.SEcs.AIarXiv:2608.16237v12026
  19. Towards Risk-free AI Agent Deployment

    Yintong Huo, Rangeet Pan, Abhik Roychoudhury

    cs.SEcs.AIarXiv:2608.16411v12026
  20. Revisiting the Performance of Generative Artificial Intelligence on Introductory Object-Oriented Programming Assessments: Insights from 2026

    Marina Lepp, Joosep Kaimre

    cs.SEcs.AIcs.PFarXiv:2608.16318v12026
  21. Kozuchi Agent: A Language-Agnostic Open-Weight Agent for Software Repair

    Mehdi Bahrami, Kosaku Kimura, Satoshi Munakata +24

    cs.SEcs.AIcs.ETarXiv:2608.15579v12026
  22. The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks

    Bardia Mohammadi, Lars Klein, Aman Chadha +2

    cs.SEcs.LGarXiv:2608.16630v12026
  23. TDD-Agent: Test-Driven Reasoning for Code Generation

    Hongyue Yu, Kefan Li, Jiakun Li +4

    cs.SEcs.AIarXiv:2608.16742v12026
  24. SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents

    Bingchen Zhao, Dhruv Srikanth, Yuxiang Wu +1

    cs.SEcs.AIcs.CLarXiv:2605.21384v12026
  25. Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills

    Chuan Xiao, Zhengbo Jiao, Shaobo Wang +5

    cs.SEcs.AIarXiv:2606.07412v12026
  26. OpenComputer: Verifiable Software Worlds for Computer-Use Agents

    Jinbiao Wei, Qianran Ma, Yilun Zhao +4

    cs.AIcs.SEarXiv:2605.19769v12026
  27. Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows

    Chenxin Li, Zhengyang Tang, Mingxin Huang +8

    cs.SEcs.AIarXiv:2604.28139v22026
  28. SWE-Explore: Benchmarking How Coding Agents Explore Repositories

    Shaoqiu Zhang, Yuhang Wang, Jialiang Liang +8

    cs.SEcs.CLarXiv:2606.07297v12026
  29. LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures

    Yunfei Zhang, Boyu Feng, Changhua Pei +14

    cs.AIcs.SEarXiv:2608.15242v12026
  30. CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents

    Zhongming Yu, Hengjia Yu, Boqin Yuan +12

    cs.SEarXiv:2607.25431v12026
  31. SWE-Touch: Benchmarking Coding Agents When Users Touch the Code

    Yuqiao Tan, Jinxiang Meng, Fangyu Lei +4

    cs.SEcs.AIcs.CLarXiv:2608.02499v12026
  32. AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

    Priyam Sahoo, Gaurav Mittal, Xiaomin Li +4

    cs.SEcs.AIarXiv:2605.12925v32026
  33. How Much Static Structure Do Code Agents Need? A Study of Deterministic Anchoring

    Zhihao Lin, Mingyi Zhou, Yizhuo Yang +1

    cs.SEarXiv:2606.26979v22026
  34. RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue

    Zhihao Lin, Mingyi Zhou, Zhensu Sun +4

    cs.SEarXiv:2607.01213v12026
  35. Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution

    Haotian Lin, Silin Chen, Xiaodong Gu +8

    cs.SEarXiv:2607.11111v12026
  36. From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality

    Suzhen Zhong, Shayan Noei, Bram Adams +1

    cs.SEarXiv:2607.13196v12026
  37. When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents

    Kaiyue Yang, Yuyan Bu, Jingwei Yi +5

    cs.SEcs.AIcs.CLarXiv:2606.20023v22026
  38. To Run or Not to Run: Analyzing the Cost-Effectiveness of Code Execution in LLM-Based Program Repair

    Zhihao Lin, Junhua Zhu, Mingyi Zhou +5

    cs.SEarXiv:2606.26978v12026
  39. Teaching LLMs a Low-Resource Language: Enhancing Code Completion in Pharo

    Kilian Kier, Alessandro Giagnorio, Omar AbedelKader +5

    cs.SEarXiv:2607.04939v12026
  40. Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation

    Julia Belikova, Rauf Parchiev, Evgeny Egorov +4

    cs.AIcs.CLcs.SEarXiv:2606.23127v12026
  41. TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents

    Shoufa Chen, Luyuan Wang, Xuan Yang +7

    cs.SEcs.AIarXiv:2606.28480v12026
  42. Dockerless: Environment-Free Program Verifier for Coding Agents

    Wenhao Zeng, Yuling Shi, Xiaodong Gu +10

    cs.SEcs.AIarXiv:2606.28436v12026
  43. Building to the Test: Coding Agents Deliver What You Check, Not What You Requested

    Yanuo Ma, Ben Kereopa-Yorke, Ben Schultz

    cs.SEcs.AIarXiv:2606.28430v12026
  44. Does ISO-Grounded NFR Specification Improve LLM Code Generation? A Comparison of Rich and Structured Interventions against a Natural-Language Baseline

    Joào Pedro Monteiro Pereira, Vinicius Cardoso Garcia

    cs.SEcs.AIcs.LGarXiv:2608.13742v12026
  45. Ontology-Grounded Project Memory for Coding Agents

    James Adam

    cs.AIcs.SEarXiv:2608.13662v12026
  46. Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

    Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen +35

    cs.CLcs.SEarXiv:2607.20911v12026
  47. StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents

    Yan Yang, Xiangru Jian, Ziyang Luo +7

    cs.SEcs.CVarXiv:2607.22798v12026
  48. SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch

    Yihao Chen, Shi Chang, Feng Lin +4

    cs.SEcs.CLarXiv:2607.27167v12026
  49. MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis

    Yihao Chen, Shi Chang, Khaled Chawa +4

    cs.SEcs.CLcs.LGarXiv:2607.27146v12026
  50. UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation

    Grace Man Chen, Litao Guo, Yifan Wu +5

    cs.SEcs.AIcs.CVarXiv:2607.06306v12026
  51. NexForge: Scaling Agent Capabilities through Requirement-Driven Task Synthesis for LLMs

    Jiarong Zhao, Zhikai Lei, Zhiheng Xi +5

    cs.SEcs.AIcs.LGarXiv:2607.14186v62026
  52. JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models

    Haoran Sun, Wentao Zhang, Junyang Hua +18

    cs.DCcs.AIcs.SEarXiv:2607.16074v12026
  53. In the Driver's Seat: A Multi-Company Study on the Reality of Autonomous Driving System Testing

    Qunying Song, Yuan Gao, Johannes Betz +3

    cs.SEarXiv:2607.15820v12026
  54. DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines

    Runming He, Zhen Hao Wong, Hao Liang +4

    cs.SEcs.AIarXiv:2607.16617v22026
  55. Engineering Signals of Human-AI Collaboration in the Agentic Coding Era: A Longitudinal Analysis of 33,228 Pull Requests from vLLM and SGLang with Implications for Biomedical AI Agents and Bioinformatics Pipeline Developmen

    Jiada Li, Xuesong Ye, Olamide Olowoniyi

    cs.SEcs.AIcs.ETarXiv:2608.13884v12026
  56. To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing

    Amir M. Ebrahimi, Mohammed Mehedi Hasan, Aaditya Bhatia +2

    cs.SEcs.AIcs.LGarXiv:2607.28887v12026
  57. Characterizing the Quality Profile of AI-Generated C++ in Production

    Michael Tran, Fred Lewis, Kun Yang +5

    cs.SEcs.AIarXiv:2608.06640v12026
  58. Fine-Tuning Qwen3-27B for C-to-Rust Code Translation: A Three-Stage Curriculum of Pretraining, Debugging-Aware SFT, and Task-Specific SFT

    Pu Zhao, Changdi Yang, Yixiao Chen +4

    cs.SEcs.AIcs.ETarXiv:2608.13681v12026
  59. DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds

    Kishanthan Thangarajah, Boyuan Chen, Ahmed E. Hassan

    cs.SEarXiv:2608.06113v12026
  60. Building AI-Intensive Software with AI: Early Results and a Cautionary Tale on Measuring Development Cost

    Victor Barros de Miranda Neves, Kiev Santos da Gama, Vinicius Cardoso Garcia

    cs.SEcs.AIcs.LGarXiv:2608.13730v12026