Software Engineering

Papers filed under cs.SE on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

181 to 240 of 1,389

  1. The Vibe Shift in Software Engineering: Evaluating AI-Led Conversational Programming for Performance, Cognition, and Responsible Adoption

    Sales G. Aribe, Louie Jay S. Labastida

    cs.SEcs.AIcs.ETarXiv:2609.09560v12026
  2. Thrilled by Your Progress! Large Language Models (GPT-4) No Longer Struggle to Pass Assessments in Higher Education Programming Courses

    Jaromir Savelka, Arav Agarwal, Marshall An +2

    cs.CYcs.AIcs.CLarXiv:2306.10073v12023
  3. subgraph2vec: Learning Distributed Representations of Rooted Sub-graphs from Large Graphs

    Annamalai Narayanan, Mahinthan Chandramohan, Lihui Chen +2

    cs.LGcs.AIcs.CRarXiv:1606.08928v12016
  4. Free Lunch for Testing: Fuzzing Deep-Learning Libraries from Open Source

    Anjiang Wei, Yinlin Deng, Chenyuan Yang +1

    cs.SEarXiv:2201.06589v42022
  5. Talking to Itself While Coding: What Makes Comments Help Code Generation?

    Dangfeng Pan, Zhensu Sun, Cenyuan Zhang +2

    cs.SEcs.AIarXiv:2609.09242v12026
  6. Testing Scientific Software: A Systematic Literature Review

    Upulee Kanewala, James M. Bieman

    cs.SEarXiv:1804.01954v12018
  7. UniParser: A Unified Log Parser for Heterogeneous Log Data

    Yudong Liu, Xu Zhang, Shilin He +9

    cs.SEarXiv:2202.06569v12022
  8. A Systematic Literature Review on the Use of Deep Learning in Software Engineering Research

    Cody Watson, Nathan Cooper, David Nader Palacio +2

    cs.SEcs.AIcs.LGarXiv:2009.06520v22020
  9. Applying CodeBERT for Automated Program Repair of Java Simple Bugs

    Ehsan Mashhadi, Hadi Hemmati

    cs.SEarXiv:2103.11626v22021
  10. Diffs vs. Whole Files: An Empirical Comparison of Iterative Edit-Based and Direct Generation for Flutter/Dart Code Models

    Andrej Andrejev

    cs.SEcs.AIarXiv:2609.05779v12026
  11. Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents

    Jingjie Ning, Shanshan Zhong, Xiaochuan Li +1

    cs.MAcs.AIcs.SEarXiv:2609.09219v12026
  12. RepoNav: From Snippet Retrieval to File-Centered Repository Navigation for Code Agents

    Hongzheng Chai, Jiakun Li, Hongyue Yu +1

    cs.SEcs.CLarXiv:2609.08355v12026
  13. Operation-Type-Aware Client Routing for Leader-Based Consensus Datastores

    Sri Saran Balaji Vellore Rajakumar, James Thompson

    cs.DCcs.SEarXiv:2609.00392v12026
  14. Granite Code Models: A Family of Open Foundation Models for Code Intelligence

    Mayank Mishra, Matt Stallone, Gaoyuan Zhang +43

    cs.AIcs.CLcs.SEarXiv:2405.04324v12024
  15. On the Efficiency of Test Suite based Program Repair: A Systematic Assessment of 16 Automated Repair Systems for Java Programs

    Kui Liu, Shangwen Wang, Anil Koyuncu +7

    cs.SEarXiv:2008.00914v12020
  16. Vectorizer: Vectorizing NumPy Programs with Shape-Guided Rewrite

    Jingqian Liu, Xiaoyu Liu, Yuepeng Wang

    cs.CLcs.SEarXiv:2609.08088v12026
  17. It Is Not My Code Anymore

    Augusto Camargo

    cs.SEcs.AIarXiv:2609.09022v12026
  18. Silent Revision: Measuring Undisclosed Change in the Safety Frameworks of Frontier AI Developers

    Louis Yiven Zhu

    cs.CYcs.AIcs.SEarXiv:2609.08789v12026
  19. Full-speed Fuzzing: Reducing Fuzzing Overhead through Coverage-guided Tracing

    Stefan Nagy, Matthew Hicks

    cs.CRcs.SEarXiv:1812.11875v22018
  20. The Unreliable Progress Bar: Can LLM Agents Reliably Report Task Progress Throughout Execution?

    Boyang Wang, Yunhan Wang, Yalun Wu

    cs.SEcs.AIcs.CLarXiv:2609.08589v12026
  21. AttnCompress: Dynamic Attention-Guided Trajectory Compression for Software Engineering Agents

    Zhengran Zeng, Yixin Li, Rui Xie +2

    cs.SEcs.AIarXiv:2609.08318v12026
  22. The Levels of Conceptual Interoperability Model: Applying Systems Engineering Principles to M&S

    Wenguang WANG, Andreas TOLK, Weiping WANG

    cs.SEarXiv:0908.0191v12009
  23. An Empirical Study on the Impact of Change Granularity in Refactoring Detection

    Lei Chen, Shinpei Hayashi

    cs.SEarXiv:2609.07482v12026
  24. Unblind Your Apps: Predicting Natural-Language Labels for Mobile GUI Components by Deep Learning

    Jieshan Chen, Chunyang Chen, Zhenchang Xing +4

    cs.HCcs.CVcs.SEarXiv:2003.00380v22020
  25. Linking Software Development and Business Strategy Through Measurement

    Victor R. Basili, Jens Heidrich, Mikael Lindvall +5

    cs.SEarXiv:1311.6224v12013
  26. AURA-Eval: Evaluation Framework for Acting Under Risk Awareness in LLM Agent Trajectories

    Ruoxi Shang, Christina-Maria Androna, Orfeas Menis Mastromichalakis +6

    cs.CRcs.AIcs.CLarXiv:2609.06783v12026
  27. Testing Database Engines via Pivoted Query Synthesis

    Manuel Rigger, Zhendong Su

    cs.DBcs.SEarXiv:2001.04174v12020
  28. Can ChatGPT replace StackOverflow? A Study on Robustness and Reliability of Large Language Model Code Generation

    Li Zhong, Zilong Wang

    cs.CLcs.AIcs.SEarXiv:2308.10335v52023
  29. SWE-Test: Benchmarking LLM Vulnerability Discovery via Input Prediction

    Yuanxiang Shi, Jiayi Lin, Xuanyong Lin +8

    cs.SEcs.AIarXiv:2609.06229v12026
  30. ExecCritic: Learn to Test, Test to Improve for Coding Agents

    Leitian Tao, Baolin Peng, Haorui Wang +7

    cs.AIcs.CLcs.SEarXiv:2609.09133v12026
  31. MeClear: Cooperative Game-Theoretic Attribution and Risk-Aware Memory Clearance for Long-Horizon LLM Agents

    Boyu Yang, Jiazheng Sun, Zilong Lu +3

    cs.AIcs.SEarXiv:2609.09115v12026
  32. LLM Critics Help Catch LLM Bugs

    Nat McAleese, Rai Michael Pokorny, Juan Felipe Ceron Uribe +3

    cs.SEcs.LGarXiv:2407.00215v12024
  33. API Benchmark Scores Do Not Reliably Transfer to Chatbot Interfaces

    Jennifer Wang, Joachim Baumann, Daniel E. Ho +1

    cs.AIcs.SEarXiv:2609.08861v12026
  34. EvolveScaler: Synthesizing Information-Evolution Contexts via Executable State Machines and Natural-Language Rendering

    Ziliang Zhao, Zenan Xu, Shuting Wang +6

    cs.AIcs.SEarXiv:2609.08435v12026
  35. cuQuantum SDK: A High-Performance Library for Accelerating Quantum Science

    Harun Bayraktar, Ali Charara, David Clark +19

    quant-phcs.PFcs.SEarXiv:2308.01999v12023
  36. When ChatGPT Meets Smart Contract Vulnerability Detection: How Far Are We?

    Chong Chen, Jianzhong Su, Jiachi Chen +7

    cs.SEarXiv:2309.05520v42023
  37. Qiushi Engine on AstaBench E2E-Bench-Hard

    Wenhao Li, Shuxing Yang, Fujia Chen +13

    cs.AIcs.SEarXiv:2609.08196v12026
  38. SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents

    Pujun Zheng, Zixin Shang, Shufan Jiang +5

    cs.AIcs.SEarXiv:2609.08149v12026
  39. Test Case Selection and Prioritization Using Machine Learning: A Systematic Literature Review

    Rongqi Pan, Mojtaba Bagherzadeh, Taher A. Ghaleb +1

    cs.SEarXiv:2106.13891v22021
  40. Copiloting the Copilots: Fusing Large Language Models with Completion Engines for Automated Program Repair

    Yuxiang Wei, Chunqiu Steven Xia, Lingming Zhang

    cs.SEcs.LGcs.PLarXiv:2309.00608v32023
  41. CERT: Continual Pre-Training on Sketches for Library-Oriented Code Generation

    Daoguang Zan, Bei Chen, Dejian Yang +6

    cs.SEcs.CLcs.PLarXiv:2206.06888v12022
  42. Ethics-Based Auditing of Automated Decision-Making Systems: Nature, Scope, and Limitations

    Jakob Mokander, Jessica Morley, Mariarosaria Taddeo +1

    cs.CYcs.SEarXiv:2110.10980v12021
  43. Is "Better Data" Better than "Better Data Miners"? (On the Benefits of Tuning SMOTE for Defect Prediction)

    Amritanshu Agrawal, Tim Menzies

    cs.SEarXiv:1705.03697v32017
  44. A Tool-Augmented, GPT-4 Chatbot for Real-Time Repository Data Analysis

    Muhammad Jawad Chowdhury, Md. Sakib Khan

    cs.AIcs.SEarXiv:2609.07586v12026
  45. CIT-CAD: Constraint Intent Tree-based CAD Code Generation and Verification

    Yali Du, Hui Sun, San-Zhuo Xi +1

    cs.AIcs.SEarXiv:2609.07434v12026
  46. Verification-Time Dependency on a Disappearing Evaluator

    Ho Wa Ku, Jameel Ahmed Siddiqui

    cs.CYcs.SEarXiv:2608.29912v12026
  47. Criticality Metrics for Automated Driving: A Review and Suitability Analysis of the State of the Art

    Lukas Westhofen, Christian Neurohr, Tjark Koopmann +6

    cs.ROcs.SEarXiv:2108.02403v22021
  48. No Need to Lift a Finger Anymore? Assessing the Quality of Code Generation by ChatGPT

    Zhijie Liu, Yutian Tang, Xiapu Luo +2

    cs.SEarXiv:2308.04838v22023
  49. PyMT5: multi-mode translation of natural language and Python code with transformers

    Colin B. Clement, Dawn Drain, Jonathan Timcheck +2

    cs.LGcs.SEarXiv:2010.03150v12020
  50. Prompting Is All You Need: Automated Android Bug Replay with Large Language Models

    Sidong Feng, Chunyang Chen

    cs.SEarXiv:2306.01987v32023
  51. On the Pragmatic Design of Literature Studies in Software Engineering: An Experience-based Guideline

    M. Kuhrmann, D. Méndez Fernández, M. Daneva

    cs.SEarXiv:1612.03583v12016
  52. Decentralised LTL Monitoring

    Andreas Bauer, Yliès Falcone

    cs.SEarXiv:1111.5133v32011
  53. Seeing Without Understanding: Large Language Model Evaluation of Mobile User Interface Quality, Failure Taxonomy, and Architectural Explanation

    Md Rejaul Korim Sadi, Golam Mostofa Naeem, Toufiqur Rahman Tasin +4

    cs.HCcs.CLcs.SEarXiv:2609.05423v12026
  54. A Unified Policy Architecture (UPA): The Governance Kernel for Enterprise AI Operating Systems

    Prabhu Raghav, Balamurugan Pandi, Arul Vivek +2

    cs.AIcs.CLcs.SEarXiv:2609.06543v12026
  55. How Effective Are Neural Networks for Fixing Security Vulnerabilities

    Yi Wu, Nan Jiang, Hung Viet Pham +5

    cs.SEcs.AIcs.CRarXiv:2305.18607v22023
  56. Traceability Transformed: Generating more Accurate Links with Pre-Trained BERT Models

    Jinfeng Lin, Yalin Liu, Qingkai Zeng +2

    cs.SEarXiv:2102.04411v22021
  57. Clustering-Based Predictive Process Monitoring

    Chiara Di Francescomarino, Marlon Dumas, Fabrizio Maria Maggi +1

    cs.SEarXiv:1506.01428v12015
  58. SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents

    Xin He, Yanlin Wang, Mingwei Liu +3

    cs.SEcs.AIarXiv:2609.04167v12026
  59. Object Detection for Graphical User Interface: Old Fashioned or Deep Learning or a Combination?

    Jieshan Chen, Mulong Xie, Zhenchang Xing +4

    cs.CVcs.HCcs.LGarXiv:2008.05132v22020
  60. PatchBench: Evaluating AI Agents for Vulnerability Patching

    Chihao Shen, Jiacheng Li, Aastha Mahajan +3

    cs.CRcs.AIcs.SEarXiv:2609.04075v12026