Software Engineering

Papers filed under cs.SE on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

1,201 to 1,260 of 1,390

  1. SWE-World: Building Software Engineering Agents in Docker-Free Environments

    Shuang Sun, Huatong Song, Lisheng Huang +11

    cs.SEcs.CLarXiv:2602.03419v12026
  2. Scalable Distributed Simulation-Based Testing for Automated Driving Systems

    Christian Geller, Benedikt Haas, Lutz Eckstein

    cs.ROcs.DBcs.SEarXiv:2608.20904v12026
  3. A Survey of Machine Learning for Big Code and Naturalness

    Miltiadis Allamanis, Earl T. Barr, Premkumar Devanbu +1

    cs.SEcs.LGcs.PLarXiv:1709.06182v22017
  4. The Software Supply Chain as a Market for Lemons: A Multivocal Review of Trust Signal Collapse

    Ranindya Paramitha, Christian Kästner, Laurie Williams

    cs.CRcs.SEarXiv:2608.20678v12026
  5. Generation of Web Apps with Agentic IDEs: An Empirical Assessment

    Manuel Marceca, Maria Teresa Rossi, Leonardo Mariani

    cs.SEarXiv:2608.20903v12026
  6. AI-to-AI Code Reviews of GitHub Pull Requests

    Niruthiha Selvanayagam, Taher A. Ghaleb

    cs.SEarXiv:2608.21311v12026
  7. AutoMOOSE: Use Case and Logical Views of Agentic Phase-Field Simulation Software

    Sukriti Manna, Henry Chan, Subramanian Sankaranarayanan

    cond-mat.mtrl-scics.SEarXiv:2608.20571v12026
  8. Model Context Protocol (MCP) Tool Descriptions Are Smelly! Towards Improving AI Agent Efficiency with Augmented MCP Tool Descriptions

    Mohammed Mehedi Hasan, Hao Li, Gopi Krishnan Rajbahadur +2

    cs.SEcs.ETarXiv:2602.14878v32026
  9. SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

    Gabriel Orlanski, Devjeet Roy, Alexander Yun +7

    cs.SEcs.AIcs.CLarXiv:2603.24755v22026
  10. FeatureBench: Benchmarking Agentic Coding for Complex Feature Development

    Qixing Zhou, Jiacheng Zhang, Haiyang Wang +9

    cs.SEcs.AIarXiv:2602.10975v12026
  11. UniXcoder: Unified Cross-Modal Pre-training for Code Representation

    Daya Guo, Shuai Lu, Nan Duan +3

    cs.CLcs.PLcs.SEarXiv:2203.03850v12022
  12. On the Time and Frequency Domain Representations of Signals for CPS Specification

    Claudio Mandrioli, Drishti Yadav, Domenico Bianculli

    cs.SEarXiv:2608.21167v12026
  13. Composer 2 Technical Report

    Cursor Research, :, Aaron Chan +53

    cs.SEcs.LGarXiv:2603.24477v22026
  14. Behavior Specification-Guided Program Synthesis for Binary Deobfuscation

    Kangchen Zhu, Shangwen Wang, Zhiliang Tian +5

    cs.SEarXiv:2608.20628v12026
  15. Natural-Language Workflows Are Not Software Yet: Artifact-Driven Compilation for Reliable Agent Execution

    Xiangzhe Xu, Hanxi Guo, Guangyu Shen +2

    cs.SEarXiv:2608.21341v12026
  16. AIDev: Studying AI Coding Agents on GitHub

    Hao Li, Haoxiang Zhang, Ahmed E. Hassan

    cs.SEcs.AIarXiv:2602.09185v12026
  17. Human-AI Collaboration in Requirements Engineering: Evidence of the Negative Effect of LLMs on Requirements Inspection

    Giovanna Broccia, Julian Frattini, Chetan Arora +4

    cs.SEarXiv:2608.21298v12026
  18. Beyond the Traceback: Using LLMs for Adaptive Explanations of Programming Errors

    Alexandru-Radu Moraru, Shreyan Biswas, Ujwal Gadiraju

    cs.SEcs.HCarXiv:2608.20896v12026
  19. SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents

    Yuhang Wang, Yuling Shi, Mo Yang +7

    cs.SEcs.CLarXiv:2601.16746v42026
  20. A Survey on Large Language Models for Code Generation

    Juyong Jiang, Fan Wang, Jiasi Shen +2

    cs.CLcs.AIcs.SEarXiv:2406.00515v22024
  21. Agent Skills: A Data-Driven Analysis of Claude Skills for Extending Large Language Model Functionality

    George Ling, Shanshan Zhong, Richard Huang

    cs.SEcs.SIarXiv:2602.08004v12026
  22. Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale

    Yi Liu, Weizhe Wang, Ruitao Feng +5

    cs.CRcs.AIcs.CLarXiv:2601.10338v12026
  23. SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?

    Tingxu Han, Yi Zhang, Wei Song +4

    cs.SEcs.AIarXiv:2603.15401v12026
  24. Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces

    Mike A. Merrill, Alexander G. Shaw, Nicholas Carlini +82

    cs.SEcs.AIarXiv:2601.11868v12026
  25. Investigating Autonomous Agent Contributions in the Wild: Activity Patterns and Code Change over Time

    Razvan Mihai Popescu, David Gros, Andrei Botocan +3

    cs.SEcs.AIcs.LGarXiv:2604.00917v12026
  26. Revision or Re-Solving? Decomposing Second-Pass Gains in Multi-LLM Pipelines

    Jingjie Ning, Xueqi Li, Chengyu Yu

    cs.SEcs.AIcs.CLarXiv:2604.01029v22026
  27. Executing as You Generate: Hiding Execution Latency in LLM Code Interpreters

    Zhensu Sun, Zhihao Lin, Zhi Chen +4

    cs.PLcs.AIcs.SEarXiv:2604.00491v22026
  28. GPA: Learning GUI Process Automation from Demonstrations

    Zirui Zhao, Jun Hao Liew, Yan Yang +5

    cs.CVcs.AIcs.SEarXiv:2604.01676v22026
  29. Squeez: Task-Conditioned Tool-Output Pruning for Coding Agents

    Ádám Kovács

    cs.SEcs.AIarXiv:2604.04979v12026
  30. Qualixar OS: A Universal Operating System for AI Agent Orchestration

    Varun Pratap Bhardwaj

    cs.AIcs.MAcs.SEarXiv:2604.06392v12026
  31. SkVM: Revisiting Language VM for Skills across Heterogenous LLMs and Harnesses

    Le Chen, Erhu Feng, Yubin Xia +1

    cs.SEcs.LGarXiv:2604.03088v32026
  32. Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning

    Qisheng Su, Shiting Huang, Zhen Fang +3

    cs.PFcs.SEarXiv:2604.05404v22026
  33. QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization

    Changxin Ke, Rui Zhang, Jiaming Guo +10

    cs.SEcs.LGarXiv:2604.05963v12026
  34. Spec Kit Agents: Context-Grounded Agentic Workflows

    Pardis Taghavi, Santosh Bhavani

    cs.SEcs.AIcs.MAarXiv:2604.05278v12026
  35. Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering

    Chenyu Zhou, Huacan Chai, Wenteng Chen +18

    cs.SEcs.MAarXiv:2604.08224v12026
  36. Do AI Coding Agents Log Like Humans? An Empirical Study

    Youssef Esseddiq Ouatiti, Mohammed Sayagh, Hao Li +1

    cs.SEarXiv:2604.09409v12026
  37. CodeTracer: Towards Traceable Agent States

    Han Li, Yifan Yao, Letian Zhu +13

    cs.SEcs.AIarXiv:2604.11641v32026
  38. Sema Code: Decoupling AI Coding Agents into Programmable, Embeddable Infrastructure

    Huacan Wang, Jie Zhou, Ningyan Zhu +8

    cs.SEarXiv:2604.11045v12026
  39. Dive into Claude Code: The Design Space of Today's and Future AI Agent Systems

    Jiacheng Liu, Xiaohan Zhao, Xinyi Shang +1

    cs.SEcs.AIcs.CLarXiv:2604.14228v22026
  40. Don't Make Models Guess Security and Safety: Symbolic Guardrails for Domain-Specific AI Agents

    Yining Hong, Yining She, Eunsuk Kang +2

    cs.SEcs.AIcs.CRarXiv:2604.15579v22026
  41. Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?

    Wang Bill Zhu, Miaosen Chai, Shangshang Wang +5

    cs.SEcs.CLarXiv:2604.17338v42026
  42. WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models

    Xinping Lei, Xinyu Che, Junqi Xiong +16

    cs.SEcs.AIarXiv:2604.18224v12026
  43. OpenGame: Open Agentic Coding for Games

    Yilei Jiang, Jinyuan Hu, Qianyin Xiao +8

    cs.SEarXiv:2604.18394v12026
  44. SWE-chat: Coding Agent Interactions From Real Users in the Wild

    Joachim Baumann, Vishakh Padmakumar, Xiang Li +3

    cs.AIcs.CYcs.SEarXiv:2604.20779v12026
  45. PlayCoder: Making LLM-Generated GUI Code Playable

    Zhiyuan Peng, Wei Tao, Xin Yin +3

    cs.SEarXiv:2604.19742v12026
  46. WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning

    Juyong Jiang, Chenglin Cai, Chansung Park +4

    cs.CLcs.LGcs.SEarXiv:2604.20398v12026
  47. AI with Authority, from Application to Silicon

    Jason Hickey

    cs.SEcs.AIcs.ARarXiv:2608.21356v12026
  48. PromptResponse: Optimizing Prompts for LLM Coding Tasks

    Erik Thureck, Robert Kühnen, Tim Jacobowitz

    cs.CLcs.AIcs.HCarXiv:2608.21074v12026
  49. BC-Bench: Evaluating Agentic Engineering in a Domain-Specific Language for ERP

    Haoran Sun, Klaus Marius Hansen

    cs.SEcs.AIarXiv:2608.20851v12026
  50. Temporal Validity on Real Software Histories: Eliminating Stale-Fact Errors in Code-Assistant Memory over GitHub Fixes

    Neeraj Yadav

    cs.SEcs.AIcs.CLarXiv:2608.20685v12026
  51. Trustworthy RAG: An Evaluation Agent for Detecting Misinformation and Knowledge Poisoning in Generative AI Systems

    Balkrishna Giri, Md Toufique Hasan, Jussi Rasku +2

    cs.SEcs.AIcs.CLarXiv:2608.21095v12026
  52. Making Deployments Safe at Meta: Health Checks for Continuous Change-Safety

    Prakash KL, Anton Korenkov, Uttam Thakore +1

    cs.SEcs.AIarXiv:2608.20513v12026
  53. Large Language Models at the Intersection of Software Engineering and Software Security:An Evidence-Centered Structured Survey and Research Agenda

    Wei Lin, Tao Zhou, Zhaofei Xie +1

    cs.AIcs.SEarXiv:2608.21107v12026
  54. Applying Anthropic Primitives at Large Enterprises: Harness Paradigm for Knowledge Work

    George Juraj Salapa

    cs.AIcs.SEarXiv:2608.20622v12026
  55. SDAD: Spec-Driven Agentic Development for the AI-Native SDLC

    Vu Hung Nguyen, Thanh Nguyen

    cs.AIcs.SEarXiv:2608.20341v12026
  56. Terminal Agents: A Survey of AI Agents in Command-Line Environments

    Yi Bin, Xiaoyang Yuan, Haoxi Zeng +9

    cs.AIcs.SEarXiv:2608.20485v12026
  57. Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains

    Emaan Bilal Khan, Amy Winecoff, Miranda Bogen +1

    cs.CYcs.SEarXiv:2604.24902v12026
  58. Microservices: yesterday, today, and tomorrow

    Nicola Dragoni, Saverio Giallorenzo, Alberto Lluch Lafuente +4

    cs.SEarXiv:1606.04036v42016
  59. Code World Model Preparedness Report

    Daniel Song, Peter Ney, Cristina Menghini +21

    cs.SEcs.AIarXiv:2605.00932v22026
  60. Devign: Effective Vulnerability Identification by Learning Comprehensive Program Semantics via Graph Neural Networks

    Yaqin Zhou, Shangqing Liu, Jingkai Siow +2

    cs.SEcs.CRcs.LGarXiv:1909.03496v12019