Software Engineering
Papers filed under cs.SE on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
361 to 420 of 1,405
AICD Bench: A Challenging Benchmark for AI-Generated Code Detection
Daniil Orel, Dilshod Azizov, Indraneil Paul +3
cs.LGcs.SEarXiv:2602.02079v12026Formal Scenario-Based Testing of Autonomous Vehicles: From Simulation to the Real World
Daniel J. Fremont, Edward Kim, Yash Vardhan Pant +7
eess.SYcs.LGcs.LOarXiv:2003.07739v22020BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks
Xinming Tu, Tianze Wang, Yingzhou +4
cs.CLcs.AIcs.SEarXiv:2604.24955v12026Building the Truman Show: A TrustZone-Based Framework for Lightweight Out-of-band Kernel Security Monitoring
Zhenling Duan, Pan Dong, Renshuang Jiang +2
cs.CRcs.SEarXiv:2608.29758v12026Cost-Effective Repository Exploration for Agentic Issue Localization
Mohammad Nour Al Awad, Sergey Ivanov
cs.SEcs.AIarXiv:2608.29675v12026A Survey of Learning-based Automated Program Repair
Quanjun Zhang, Chunrong Fang, Yuxiang Ma +2
cs.SEarXiv:2301.03270v32023Model Context Protocol Threat Modeling and Analyzing Vulnerabilities to Prompt Injection with Tool Poisoning
Charoes Huang, Xin Huang, Ngoc Phu Tran +1
cs.CRcs.SEarXiv:2603.22489v12026From Technical Debt to Cognitive and Intent Debt: Rethinking Software Health in the Age of AI
Margaret-Anne Storey
cs.SEarXiv:2603.22106v42026Debt Behind the AI Boom: A Large-Scale Empirical Study of AI-Generated Code in the Wild
Yue Liu, Ratnadira Widyasari, Yanjie Zhao +3
cs.SEarXiv:2603.28592v22026Automatically Discovering, Reporting and Reproducing Android Application Crashes
Kevin Moran, Mario Linares-Vásquez, Carlos Bernal-Cárdenas +2
cs.SEarXiv:1706.01130v12017Exploring Quantum Software Testing Across Research and Practice: Emerging Results from a Multivocal Literature Review
Rodolfo Gil-Pereira, Ronnie de Souza Santos, Cleyton Magalhaes +1
cs.SEarXiv:2609.00354v12026Clawdrain: Exploiting Tool-Calling Chains for Stealthy Token Exhaustion in OpenClaw Agents
Ben Dong, Hui Feng, Qian Wang
cs.CRcs.SEarXiv:2603.00902v12026Auditing Anonymous AI Models: A Four-Stage Protocol for Black-Box Identity Verification
Yisen Xi
cs.SEcs.AIcs.CRarXiv:2608.31142v12026EffiSkill: Agent Skill Based Automated Code Efficiency Optimization
Zimu Wang, Yuling Shi, Mengfan Li +4
cs.SEcs.CLarXiv:2603.27850v12026Evaluating Tiny Recursive Models Across Training for Code Generation
Anjani Sirivella, Aanisha Newaz, Glaucia Melo
cs.AIcs.LGcs.SEarXiv:2608.29376v12026SkillProbe: Security Auditing for Emerging Agent Skill Marketplaces via Multi-Agent Collaboration
Zihan Guo, Zhiyu Chen, Xiaohang Nie +3
cs.CRcs.SEarXiv:2603.21019v12026Pythia: AI-assisted Code Completion System
Alexey Svyatkovskiy, Ying Zhao, Shengyu Fu +1
cs.SEcs.LGarXiv:1912.00742v12019Structurally Aligned Subtask-Level Memory for Software Engineering Agents
Kangning Shen, Jingyuan Zhang, Chenxi Sun +2
cs.SEcs.AIarXiv:2602.21611v12026Real Money, Fake Models: Deceptive Model Claims in Shadow APIs
Yage Zhang, Yukun Jiang, Zeyuan Chen +3
cs.CRcs.AIcs.SEarXiv:2603.01919v22026SWE-bench Goes Live!
Linghao Zhang, Shilin He, Chaoyun Zhang +12
cs.SEcs.AIcs.CLarXiv:2505.23419v22025ARGUS: Defending LLM Agents Against Context-Aware Prompt Injection
Shihao Weng, Yang Feng, Jinrui Zhang +3
cs.CRcs.SEarXiv:2605.03378v22026AgentTrace: A Structured Logging Framework for Agent System Observability
Adam AlSayyad, Kelvin Yuxiang Huang, Richik Pal
cs.SEcs.AIarXiv:2602.10133v12026On the Impact of AGENTS.md Files on the Efficiency of AI Coding Agents
Jai Lal Lulla, Seyedmoein Mohsenimofidi, Matthias Galster +3
cs.SEcs.AIcs.ETarXiv:2601.20404v22026Fault Localization with Code Coverage Representation Learning
Yi Li, Shaohua Wang, Tien N. Nguyen
cs.SEarXiv:2103.00270v12021From Silicon to Boot Code: Extending Automated Program Repair to Firmware-Layer Security Workarounds
Maisha Mastora, Dean Sullivan
cs.SEarXiv:2609.01769v12026Modelstamp: Pre-Deserialization Verification of Machine-Learning Artifacts and Runtime Environment State
Anagha Dhekne
cs.SEcs.CRarXiv:2609.01781v12026Solver-Aided Verification of Policy Compliance in Tool-Augmented LLM Agents
Cailin Winston, Claris Winston, René Just
cs.SEcs.AIarXiv:2603.20449v12026MedPerf: Open Benchmarking Platform for Medical Artificial Intelligence using Federated Evaluation
Alexandros Karargyris, Renato Umeton, Micah J. Sheller +39
cs.LGcs.DCcs.PFarXiv:2110.01406v32021When Safe Skills Collide: Measuring Compositional Risk in Agent Skill Ecosystems
Su Wang, Pin Qian, Yihang Chen +6
cs.SEcs.AIcs.CRarXiv:2606.00448v12026GUI Agents for Continual Game Generation
Yixu Huang, Bo Li, Na Li +8
cs.SEcs.AIcs.CVarXiv:2605.28258v12026Software Model Checking via Large-Block Encoding
Dirk Beyer, Alessandro Cimatti, Alberto Griggio +2
cs.SEcs.PLarXiv:0904.4709v12009Towards Effective Bug Triage with Towards Effective Bug Triage with Software Data Reduction Techniques
Jifeng Xuan, He Jiang, Yan Hu +4
cs.SEarXiv:1704.04761v12017A Software Engineering Perspective on Engineering Machine Learning Systems: State of the Art and Challenges
Görkem Giray
cs.SEcs.LGarXiv:2012.07919v32020Humans are Missing from AI Coding Agent Research
Zora Z. Wang, John Yang, Kilian Lieret +10
cs.HCcs.AIcs.SEarXiv:2608.12355v12026Inside the Scaffold: A Source-Code Taxonomy of Coding Agent Architectures
Benjamin Rombaut
cs.SEcs.AIcs.ETarXiv:2604.03515v22026T(r)opical Islands: Visualizing & Understanding Socio-Technical Artifacts
Adam Štěpánek, Marco Raglianti, Vít Rusňák +3
cs.SEarXiv:2609.05254v12026Stop Comparing LLM Agents Without Disclosing the Harness
Yunbei Zhang, Janet Wang, Yingqiang Ge +3
cs.AIcs.SEarXiv:2605.23950v12026An Empirical Study on Learning Paths and Gender Dynamics in Scrum Master Roles
Manuela Petrescu, Paul Razvan Petrescu
cs.SEcs.CYarXiv:2609.05186v12026ASTRA - Agentic System for Ticket Resolution and Analysis
Shashidhar Reddy Javaji, Mohamed Trabelsi, Jin Cao +1
cs.MAcs.AIcs.IRarXiv:2608.28790v12026SkillOps: Managing LLM Agent Skill Libraries as Self-Maintaining Software Ecosystems
Hongji Pu, Xinyuan Song, Liang Zhao
cs.SEcs.MAarXiv:2605.13716v12026Rubric Is All You Need: Enhancing LLM-based Code Evaluation With Question-Specific Rubrics
Aditya Pathak, Rachit Gandhi, Vaibhav Uttam +11
cs.SEcs.AIarXiv:2503.23989v32025Automated Fixing of Programs with Contracts
Yu Pei, Carlo A. Furia, Martin Nordio +3
cs.SEarXiv:1403.1117v32014Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents
Xu Li, Simon Yu, Minzhou Pan +5
cs.CRcs.AIcs.CLarXiv:2602.13379v22026Flow-of-Action: SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis
Changhua Pei, Zexin Wang, Fengrui Liu +9
cs.SEarXiv:2502.08224v12025Evaluating Agent-based Program Repair at Google
Pat Rondon, Renyao Wei, José Cambronero +5
cs.SEcs.AIarXiv:2501.07531v12025Out of the BLEU: how should we assess quality of the Code Generation models?
Mikhail Evtikhiev, Egor Bogomolov, Yaroslav Sokolov +1
cs.SEcs.LGarXiv:2208.03133v22022Revisiting the Core Ontology and Problem in Requirements Engineering
Ivan Jureta, John Mylopoulos, Stephane Faulkner
cs.SEarXiv:0811.4364v12008Defining Smart Contract Defects on Ethereum
Jiachi Chen, Xin Xia, David Lo +3
cs.SEarXiv:1905.01467v32019Code to Think, Think to Code: A Survey on Code-Enhanced Reasoning and Reasoning-Driven Code Intelligence in LLMs
Dayu Yang, Tianyang Liu, Daoan Zhang +8
cs.CLcs.AIcs.LGarXiv:2502.19411v12025SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents
Shuzheng Gao, Wenhao Zeng, Zhaojian Yu +5
cs.SEcs.AIarXiv:2606.28434v12026Agent-Driven Verification of Memory Safety for liblzma Decoder Components with VST
Prokhor Shlyakhtun, Alexander Gryzlov, Vladimir Kukharenko +5
cs.SEarXiv:2608.29716v12026InteractBench: Benchmarking LLMs on Competitive Programming under Unrevealed Information
Jiaze Li, Aocheng Shen, Bing Liu +4
cs.SEcs.AIcs.CLarXiv:2608.29632v12026Rust's Type Checker Implementation Is Unsound: An Empirical Study on Soundness Bugs in rustc
Yusung Sim, Sukyoung Ryu, Jaemin Hong
cs.SEcs.PLarXiv:2608.28713v12026trajectory-judge: What Outcome-Only LLM Judges Miss on Agent Trajectories
Hadi Mohammadi
cs.CLcs.AIcs.SEarXiv:2609.00038v12026Towards Human-Bot Collaborative Software Architecting with ChatGPT
Aakash Ahmad, Muhammad Waseem, Peng Liang +3
cs.SEcs.AIarXiv:2302.14600v12023SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?
Shiqi Chen, Jingze Gai, Ruochen Zhou +13
cs.CLcs.SEarXiv:2603.00718v22026FlowCheck: Helping End-Users Specify and Verify Intent in Vibe-Coded Web Apps
Reya Vir, Lydia Chilton, Zhuo Zhang +1
cs.SEcs.HCcs.PLarXiv:2608.28880v12026Exploring the Responses of Large Language Models to Beginner Programmers' Help Requests
Arto Hellas, Juho Leinonen, Sami Sarsa +3
cs.CYcs.AIcs.CLarXiv:2306.05715v12023Formal Analysis and Supply Chain Security for Agentic AI Skills
Varun Pratap Bhardwaj
cs.CRcs.AIcs.SEarXiv:2603.00195v22026Understanding Flaky Tests: The Developer's Perspective
Moritz Eck, Fabio Palomba, Marco Castelluccio +1
cs.SEarXiv:1907.01466v12019