Software Engineering
Papers filed under cs.SE on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
1,321 to 1,380 of 1,389
Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring
Indraneil Paul, Goran Glavaš, Iryna Gurevych
cs.SEcs.LGarXiv:2605.00754v42026PaperFit: Vision-in-the-Loop Typesetting Optimization for Scientific Documents
Bihui Yu, Xinglong Xu, Junjie Jiang +6
cs.AIcs.SEarXiv:2605.10341v12026SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering
Qingnan Ren, Shun Zou, Shiting Huang +11
cs.SEcs.AIarXiv:2605.17526v12026ACL-Verbatim: hallucination-free question answering for research
Gábor Recski, Szilveszter Tóth, Nadia Verdha +2
cs.CLcs.AIcs.SEarXiv:2605.21102v12026A Temporal Reasoning Benchmarking Framework for LRMs via Difficulty-controlled and Dynamic Test Generation
Shide Zhou, Kailong Wang, Ling Shi +1
cs.SEcs.AIarXiv:2607.04784v12026Graphectory Viewer: A Tool for Process-Centric Analysis of Agentic Software Trajectories
Charlie Jyu, Shuyang Liu, Reyhaneh Jabbarvand
cs.SEcs.AIarXiv:2608.17195v12026TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation
Zhibo Zhang, Zhen Ouyang, Ling Shi +1
cs.AIcs.SEarXiv:2608.17588v12026Beyond FLOPs: Energy-Aware Knowledge Distillation for Sustainable LLMs on Code-Related Task
Enrique Barba Roque, Luís Cruz, Annibale Panichella
cs.SEcs.AIarXiv:2608.17515v12026Diffusion Templates: A Unified Plugin Framework for Controllable Diffusion
Zhongjie Duan, Hong Zhang, Yingda Chen
cs.LGcs.AIcs.CVarXiv:2604.24351v12026From Runnable to Shippable: Multi-Agent Test-Driven Development for Generating Full-Stack Web Applications from Requirements
Yuxuan Wan, Tingshuo Liang, Jiakai Xu +3
cs.SEarXiv:2605.17242v12026Invariant Pretraining for Robust Code Representations
Yifeng He, Yundi Xu, Christopher Castro Gaw Gonzalo +2
cs.LGcs.AIcs.SEarXiv:2608.15412v12026Agent Lightning v1.0: Towards Harnessed Agentic RL
Zhiyuan He, Siwei Zhang, Zhiwen Zhou +7
cs.AIcs.SEarXiv:2608.17528v12026LLM Agents Can See Code Repositories
Dongjian Ma, Silin Chen, Yufei Yang +3
cs.SEarXiv:2606.14061v42026Code2LoRA: Hypernetwork-Generated Adapters for Code Language Models under Software Evolution
Liliana Hotsko, Yinxi Li, Yuntian Deng +1
cs.SEcs.AIcs.CLarXiv:2606.06492v12026DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch
Jiale Zhao, Guoxin Chen, Fanzhe Meng +4
cs.SEarXiv:2606.10728v22026CEO-Bench: Can Agents Play the Long Game?
Haozhe Chen, Karthik Narasimhan, Zhuang Liu
cs.AIcs.CLcs.SEarXiv:2606.18543v22026SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces
Qi Hu, Yifeng Tang, Qinghua Wang +7
cs.SEcs.CRarXiv:2606.01317v12026Software Engineering for AI-driven Building Operation
Philipp Zech, Sascha Hammes, Johannes Weninger +2
cs.SEcs.AIarXiv:2608.16237v12026Towards Risk-free AI Agent Deployment
Yintong Huo, Rangeet Pan, Abhik Roychoudhury
cs.SEcs.AIarXiv:2608.16411v12026Revisiting the Performance of Generative Artificial Intelligence on Introductory Object-Oriented Programming Assessments: Insights from 2026
Marina Lepp, Joosep Kaimre
cs.SEcs.AIcs.PFarXiv:2608.16318v12026Kozuchi Agent: A Language-Agnostic Open-Weight Agent for Software Repair
Mehdi Bahrami, Kosaku Kimura, Satoshi Munakata +24
cs.SEcs.AIcs.ETarXiv:2608.15579v12026The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks
Bardia Mohammadi, Lars Klein, Aman Chadha +2
cs.SEcs.LGarXiv:2608.16630v12026TDD-Agent: Test-Driven Reasoning for Code Generation
Hongyue Yu, Kefan Li, Jiakun Li +4
cs.SEcs.AIarXiv:2608.16742v12026SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents
Bingchen Zhao, Dhruv Srikanth, Yuxiang Wu +1
cs.SEcs.AIcs.CLarXiv:2605.21384v12026Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills
Chuan Xiao, Zhengbo Jiao, Shaobo Wang +5
cs.SEcs.AIarXiv:2606.07412v12026OpenComputer: Verifiable Software Worlds for Computer-Use Agents
Jinbiao Wei, Qianran Ma, Yilun Zhao +4
cs.AIcs.SEarXiv:2605.19769v12026Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows
Chenxin Li, Zhengyang Tang, Mingxin Huang +8
cs.SEcs.AIarXiv:2604.28139v22026SWE-Explore: Benchmarking How Coding Agents Explore Repositories
Shaoqiu Zhang, Yuhang Wang, Jialiang Liang +8
cs.SEcs.CLarXiv:2606.07297v12026LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures
Yunfei Zhang, Boyu Feng, Changhua Pei +14
cs.AIcs.SEarXiv:2608.15242v12026CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents
Zhongming Yu, Hengjia Yu, Boqin Yuan +12
cs.SEarXiv:2607.25431v12026SWE-Touch: Benchmarking Coding Agents When Users Touch the Code
Yuqiao Tan, Jinxiang Meng, Fangyu Lei +4
cs.SEcs.AIcs.CLarXiv:2608.02499v12026AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation
Priyam Sahoo, Gaurav Mittal, Xiaomin Li +4
cs.SEcs.AIarXiv:2605.12925v32026How Much Static Structure Do Code Agents Need? A Study of Deterministic Anchoring
Zhihao Lin, Mingyi Zhou, Yizhuo Yang +1
cs.SEarXiv:2606.26979v22026RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue
Zhihao Lin, Mingyi Zhou, Zhensu Sun +4
cs.SEarXiv:2607.01213v12026Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution
Haotian Lin, Silin Chen, Xiaodong Gu +8
cs.SEarXiv:2607.11111v12026From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality
Suzhen Zhong, Shayan Noei, Bram Adams +1
cs.SEarXiv:2607.13196v12026When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents
Kaiyue Yang, Yuyan Bu, Jingwei Yi +5
cs.SEcs.AIcs.CLarXiv:2606.20023v22026To Run or Not to Run: Analyzing the Cost-Effectiveness of Code Execution in LLM-Based Program Repair
Zhihao Lin, Junhua Zhu, Mingyi Zhou +5
cs.SEarXiv:2606.26978v12026Teaching LLMs a Low-Resource Language: Enhancing Code Completion in Pharo
Kilian Kier, Alessandro Giagnorio, Omar AbedelKader +5
cs.SEarXiv:2607.04939v12026Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation
Julia Belikova, Rauf Parchiev, Evgeny Egorov +4
cs.AIcs.CLcs.SEarXiv:2606.23127v12026TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents
Shoufa Chen, Luyuan Wang, Xuan Yang +7
cs.SEcs.AIarXiv:2606.28480v12026Dockerless: Environment-Free Program Verifier for Coding Agents
Wenhao Zeng, Yuling Shi, Xiaodong Gu +10
cs.SEcs.AIarXiv:2606.28436v12026Building to the Test: Coding Agents Deliver What You Check, Not What You Requested
Yanuo Ma, Ben Kereopa-Yorke, Ben Schultz
cs.SEcs.AIarXiv:2606.28430v12026Does ISO-Grounded NFR Specification Improve LLM Code Generation? A Comparison of Rich and Structured Interventions against a Natural-Language Baseline
Joào Pedro Monteiro Pereira, Vinicius Cardoso Garcia
cs.SEcs.AIcs.LGarXiv:2608.13742v12026Ontology-Grounded Project Memory for Coding Agents
James Adam
cs.AIcs.SEarXiv:2608.13662v12026Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction
Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen +35
cs.CLcs.SEarXiv:2607.20911v12026StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
Yan Yang, Xiangru Jian, Ziyang Luo +7
cs.SEcs.CVarXiv:2607.22798v12026SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch
Yihao Chen, Shi Chang, Feng Lin +4
cs.SEcs.CLarXiv:2607.27167v12026MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis
Yihao Chen, Shi Chang, Khaled Chawa +4
cs.SEcs.CLcs.LGarXiv:2607.27146v12026UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation
Grace Man Chen, Litao Guo, Yifan Wu +5
cs.SEcs.AIcs.CVarXiv:2607.06306v12026NexForge: Scaling Agent Capabilities through Requirement-Driven Task Synthesis for LLMs
Jiarong Zhao, Zhikai Lei, Zhiheng Xi +5
cs.SEcs.AIcs.LGarXiv:2607.14186v62026JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models
Haoran Sun, Wentao Zhang, Junyang Hua +18
cs.DCcs.AIcs.SEarXiv:2607.16074v12026In the Driver's Seat: A Multi-Company Study on the Reality of Autonomous Driving System Testing
Qunying Song, Yuan Gao, Johannes Betz +3
cs.SEarXiv:2607.15820v12026DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
Runming He, Zhen Hao Wong, Hao Liang +4
cs.SEcs.AIarXiv:2607.16617v22026Engineering Signals of Human-AI Collaboration in the Agentic Coding Era: A Longitudinal Analysis of 33,228 Pull Requests from vLLM and SGLang with Implications for Biomedical AI Agents and Bioinformatics Pipeline Developmen
Jiada Li, Xuesong Ye, Olamide Olowoniyi
cs.SEcs.AIcs.ETarXiv:2608.13884v12026To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing
Amir M. Ebrahimi, Mohammed Mehedi Hasan, Aaditya Bhatia +2
cs.SEcs.AIcs.LGarXiv:2607.28887v12026Characterizing the Quality Profile of AI-Generated C++ in Production
Michael Tran, Fred Lewis, Kun Yang +5
cs.SEcs.AIarXiv:2608.06640v12026Fine-Tuning Qwen3-27B for C-to-Rust Code Translation: A Three-Stage Curriculum of Pretraining, Debugging-Aware SFT, and Task-Specific SFT
Pu Zhao, Changdi Yang, Yixiao Chen +4
cs.SEcs.AIcs.ETarXiv:2608.13681v12026DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds
Kishanthan Thangarajah, Boyuan Chen, Ahmed E. Hassan
cs.SEarXiv:2608.06113v12026Building AI-Intensive Software with AI: Early Results and a Cautionary Tale on Measuring Development Cost
Victor Barros de Miranda Neves, Kiev Santos da Gama, Vinicius Cardoso Garcia
cs.SEcs.AIcs.LGarXiv:2608.13730v12026