Software Engineering
Papers filed under cs.SE on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
1,201 to 1,260 of 1,390
SWE-World: Building Software Engineering Agents in Docker-Free Environments
Shuang Sun, Huatong Song, Lisheng Huang +11
cs.SEcs.CLarXiv:2602.03419v12026Scalable Distributed Simulation-Based Testing for Automated Driving Systems
Christian Geller, Benedikt Haas, Lutz Eckstein
cs.ROcs.DBcs.SEarXiv:2608.20904v12026A Survey of Machine Learning for Big Code and Naturalness
Miltiadis Allamanis, Earl T. Barr, Premkumar Devanbu +1
cs.SEcs.LGcs.PLarXiv:1709.06182v22017The Software Supply Chain as a Market for Lemons: A Multivocal Review of Trust Signal Collapse
Ranindya Paramitha, Christian Kästner, Laurie Williams
cs.CRcs.SEarXiv:2608.20678v12026Generation of Web Apps with Agentic IDEs: An Empirical Assessment
Manuel Marceca, Maria Teresa Rossi, Leonardo Mariani
cs.SEarXiv:2608.20903v12026AI-to-AI Code Reviews of GitHub Pull Requests
Niruthiha Selvanayagam, Taher A. Ghaleb
cs.SEarXiv:2608.21311v12026AutoMOOSE: Use Case and Logical Views of Agentic Phase-Field Simulation Software
Sukriti Manna, Henry Chan, Subramanian Sankaranarayanan
cond-mat.mtrl-scics.SEarXiv:2608.20571v12026Model Context Protocol (MCP) Tool Descriptions Are Smelly! Towards Improving AI Agent Efficiency with Augmented MCP Tool Descriptions
Mohammed Mehedi Hasan, Hao Li, Gopi Krishnan Rajbahadur +2
cs.SEcs.ETarXiv:2602.14878v32026SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks
Gabriel Orlanski, Devjeet Roy, Alexander Yun +7
cs.SEcs.AIcs.CLarXiv:2603.24755v22026FeatureBench: Benchmarking Agentic Coding for Complex Feature Development
Qixing Zhou, Jiacheng Zhang, Haiyang Wang +9
cs.SEcs.AIarXiv:2602.10975v12026UniXcoder: Unified Cross-Modal Pre-training for Code Representation
Daya Guo, Shuai Lu, Nan Duan +3
cs.CLcs.PLcs.SEarXiv:2203.03850v12022On the Time and Frequency Domain Representations of Signals for CPS Specification
Claudio Mandrioli, Drishti Yadav, Domenico Bianculli
cs.SEarXiv:2608.21167v12026Composer 2 Technical Report
Cursor Research, :, Aaron Chan +53
cs.SEcs.LGarXiv:2603.24477v22026Behavior Specification-Guided Program Synthesis for Binary Deobfuscation
Kangchen Zhu, Shangwen Wang, Zhiliang Tian +5
cs.SEarXiv:2608.20628v12026Natural-Language Workflows Are Not Software Yet: Artifact-Driven Compilation for Reliable Agent Execution
Xiangzhe Xu, Hanxi Guo, Guangyu Shen +2
cs.SEarXiv:2608.21341v12026AIDev: Studying AI Coding Agents on GitHub
Hao Li, Haoxiang Zhang, Ahmed E. Hassan
cs.SEcs.AIarXiv:2602.09185v12026Human-AI Collaboration in Requirements Engineering: Evidence of the Negative Effect of LLMs on Requirements Inspection
Giovanna Broccia, Julian Frattini, Chetan Arora +4
cs.SEarXiv:2608.21298v12026Beyond the Traceback: Using LLMs for Adaptive Explanations of Programming Errors
Alexandru-Radu Moraru, Shreyan Biswas, Ujwal Gadiraju
cs.SEcs.HCarXiv:2608.20896v12026SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents
Yuhang Wang, Yuling Shi, Mo Yang +7
cs.SEcs.CLarXiv:2601.16746v42026A Survey on Large Language Models for Code Generation
Juyong Jiang, Fan Wang, Jiasi Shen +2
cs.CLcs.AIcs.SEarXiv:2406.00515v22024Agent Skills: A Data-Driven Analysis of Claude Skills for Extending Large Language Model Functionality
George Ling, Shanshan Zhong, Richard Huang
cs.SEcs.SIarXiv:2602.08004v12026Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale
Yi Liu, Weizhe Wang, Ruitao Feng +5
cs.CRcs.AIcs.CLarXiv:2601.10338v12026SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?
Tingxu Han, Yi Zhang, Wei Song +4
cs.SEcs.AIarXiv:2603.15401v12026Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces
Mike A. Merrill, Alexander G. Shaw, Nicholas Carlini +82
cs.SEcs.AIarXiv:2601.11868v12026Investigating Autonomous Agent Contributions in the Wild: Activity Patterns and Code Change over Time
Razvan Mihai Popescu, David Gros, Andrei Botocan +3
cs.SEcs.AIcs.LGarXiv:2604.00917v12026Revision or Re-Solving? Decomposing Second-Pass Gains in Multi-LLM Pipelines
Jingjie Ning, Xueqi Li, Chengyu Yu
cs.SEcs.AIcs.CLarXiv:2604.01029v22026Executing as You Generate: Hiding Execution Latency in LLM Code Interpreters
Zhensu Sun, Zhihao Lin, Zhi Chen +4
cs.PLcs.AIcs.SEarXiv:2604.00491v22026GPA: Learning GUI Process Automation from Demonstrations
Zirui Zhao, Jun Hao Liew, Yan Yang +5
cs.CVcs.AIcs.SEarXiv:2604.01676v22026Squeez: Task-Conditioned Tool-Output Pruning for Coding Agents
Ádám Kovács
cs.SEcs.AIarXiv:2604.04979v12026Qualixar OS: A Universal Operating System for AI Agent Orchestration
Varun Pratap Bhardwaj
cs.AIcs.MAcs.SEarXiv:2604.06392v12026SkVM: Revisiting Language VM for Skills across Heterogenous LLMs and Harnesses
Le Chen, Erhu Feng, Yubin Xia +1
cs.SEcs.LGarXiv:2604.03088v32026Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning
Qisheng Su, Shiting Huang, Zhen Fang +3
cs.PFcs.SEarXiv:2604.05404v22026QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization
Changxin Ke, Rui Zhang, Jiaming Guo +10
cs.SEcs.LGarXiv:2604.05963v12026Spec Kit Agents: Context-Grounded Agentic Workflows
Pardis Taghavi, Santosh Bhavani
cs.SEcs.AIcs.MAarXiv:2604.05278v12026Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering
Chenyu Zhou, Huacan Chai, Wenteng Chen +18
cs.SEcs.MAarXiv:2604.08224v12026Do AI Coding Agents Log Like Humans? An Empirical Study
Youssef Esseddiq Ouatiti, Mohammed Sayagh, Hao Li +1
cs.SEarXiv:2604.09409v12026CodeTracer: Towards Traceable Agent States
Han Li, Yifan Yao, Letian Zhu +13
cs.SEcs.AIarXiv:2604.11641v32026Sema Code: Decoupling AI Coding Agents into Programmable, Embeddable Infrastructure
Huacan Wang, Jie Zhou, Ningyan Zhu +8
cs.SEarXiv:2604.11045v12026Dive into Claude Code: The Design Space of Today's and Future AI Agent Systems
Jiacheng Liu, Xiaohan Zhao, Xinyi Shang +1
cs.SEcs.AIcs.CLarXiv:2604.14228v22026Don't Make Models Guess Security and Safety: Symbolic Guardrails for Domain-Specific AI Agents
Yining Hong, Yining She, Eunsuk Kang +2
cs.SEcs.AIcs.CRarXiv:2604.15579v22026Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?
Wang Bill Zhu, Miaosen Chai, Shangshang Wang +5
cs.SEcs.CLarXiv:2604.17338v42026WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models
Xinping Lei, Xinyu Che, Junqi Xiong +16
cs.SEcs.AIarXiv:2604.18224v12026OpenGame: Open Agentic Coding for Games
Yilei Jiang, Jinyuan Hu, Qianyin Xiao +8
cs.SEarXiv:2604.18394v12026SWE-chat: Coding Agent Interactions From Real Users in the Wild
Joachim Baumann, Vishakh Padmakumar, Xiang Li +3
cs.AIcs.CYcs.SEarXiv:2604.20779v12026PlayCoder: Making LLM-Generated GUI Code Playable
Zhiyuan Peng, Wei Tao, Xin Yin +3
cs.SEarXiv:2604.19742v12026WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning
Juyong Jiang, Chenglin Cai, Chansung Park +4
cs.CLcs.LGcs.SEarXiv:2604.20398v12026AI with Authority, from Application to Silicon
Jason Hickey
cs.SEcs.AIcs.ARarXiv:2608.21356v12026PromptResponse: Optimizing Prompts for LLM Coding Tasks
Erik Thureck, Robert Kühnen, Tim Jacobowitz
cs.CLcs.AIcs.HCarXiv:2608.21074v12026BC-Bench: Evaluating Agentic Engineering in a Domain-Specific Language for ERP
Haoran Sun, Klaus Marius Hansen
cs.SEcs.AIarXiv:2608.20851v12026Temporal Validity on Real Software Histories: Eliminating Stale-Fact Errors in Code-Assistant Memory over GitHub Fixes
Neeraj Yadav
cs.SEcs.AIcs.CLarXiv:2608.20685v12026Trustworthy RAG: An Evaluation Agent for Detecting Misinformation and Knowledge Poisoning in Generative AI Systems
Balkrishna Giri, Md Toufique Hasan, Jussi Rasku +2
cs.SEcs.AIcs.CLarXiv:2608.21095v12026Making Deployments Safe at Meta: Health Checks for Continuous Change-Safety
Prakash KL, Anton Korenkov, Uttam Thakore +1
cs.SEcs.AIarXiv:2608.20513v12026Large Language Models at the Intersection of Software Engineering and Software Security:An Evidence-Centered Structured Survey and Research Agenda
Wei Lin, Tao Zhou, Zhaofei Xie +1
cs.AIcs.SEarXiv:2608.21107v12026Applying Anthropic Primitives at Large Enterprises: Harness Paradigm for Knowledge Work
George Juraj Salapa
cs.AIcs.SEarXiv:2608.20622v12026SDAD: Spec-Driven Agentic Development for the AI-Native SDLC
Vu Hung Nguyen, Thanh Nguyen
cs.AIcs.SEarXiv:2608.20341v12026Terminal Agents: A Survey of AI Agents in Command-Line Environments
Yi Bin, Xiaoyang Yuan, Haoxi Zeng +9
cs.AIcs.SEarXiv:2608.20485v12026Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains
Emaan Bilal Khan, Amy Winecoff, Miranda Bogen +1
cs.CYcs.SEarXiv:2604.24902v12026Microservices: yesterday, today, and tomorrow
Nicola Dragoni, Saverio Giallorenzo, Alberto Lluch Lafuente +4
cs.SEarXiv:1606.04036v42016Code World Model Preparedness Report
Daniel Song, Peter Ney, Cristina Menghini +21
cs.SEcs.AIarXiv:2605.00932v22026Devign: Effective Vulnerability Identification by Learning Comprehensive Program Semantics via Graph Neural Networks
Yaqin Zhou, Shangqing Liu, Jingkai Siow +2
cs.SEcs.CRcs.LGarXiv:1909.03496v12019