Software Engineering

Papers filed under cs.SE on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

541 to 600 of 1,389

  1. Beyond Retrieval: A Multitask Benchmark and Model for Code Search

    Siqiao Xue, Zihan Liao, Jin Qin +4

    cs.SEcs.AIarXiv:2605.04615v22026
  2. Machine Teaching: A New Paradigm for Building Machine Learning Systems

    Patrice Y. Simard, Saleema Amershi, David M. Chickering +8

    cs.LGcs.AIcs.HCarXiv:1707.06742v32017
  3. LocAgent: Graph-Guided LLM Agents for Code Localization

    Zhaoling Chen, Xiangru Tang, Gangda Deng +6

    cs.SEcs.AIcs.CLarXiv:2503.09089v22025
  4. R2E-Gym: Procedural Environments and Hybrid Verifiers for Scaling Open-Weights SWE Agents

    Naman Jain, Jaskirat Singh, Manish Shetty +3

    cs.SEcs.CLcs.LGarXiv:2504.07164v12025
  5. Effective Test Generation Using Pre-trained Large Language Models and Mutation Testing

    Arghavan Moradi Dakhel, Amin Nikanjam, Vahid Majdinasab +2

    cs.SEarXiv:2308.16557v12023
  6. Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving

    Daoguang Zan, Zhirong Huang, Wei Liu +16

    cs.SEcs.AIcs.CLarXiv:2504.02605v12025
  7. Trae Agent: An LLM-based Agent for Software Engineering with Test-time Scaling

    Trae Research Team, Pengfei Gao, Zhao Tian +12

    cs.SEcs.AIarXiv:2507.23370v12025
  8. DBcover: A White-box SQL Test Generation Framework for Coverage Improvement

    Yankai Rong, Shuang Liu, Jinhao Dong +4

    cs.DBcs.SEarXiv:2608.25573v12026
  9. ExplainBench: Evaluating Code Explanations from Agents

    Zhiyuan Pan, Sungmin Kang, Imam Nur Bani Yusuf +1

    cs.SEarXiv:2607.26451v12026
  10. Token Budgets: An Empirical Catalog of 63 LLM-Agent Budget-Overrun Incidents, with an Affine-Typed Rust Mitigation as a Case Study

    Sajjad Khan

    cs.SEcs.MAcs.PLarXiv:2606.04056v12026
  11. What Does an Agentic Software Engineering Benchmark Measure? Profiling Task Demands and Agent Behaviour Beyond What Category Labels Reveal

    Radin Shayanfar, Keheliya Gallaba, Ahmed E. Hassan

    cs.SEcs.CLarXiv:2609.01271v12026
  12. Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?

    Chunqiu Steven Xia, Zhe Wang, Yan Yang +2

    cs.SEcs.AIcs.CLarXiv:2511.13646v32025
  13. SmartBugs: A Framework to Analyze Solidity Smart Contracts

    João F. Ferreira, Pedro Cruz, Thomas Durieux +1

    cs.SEcs.CRarXiv:2007.04771v22020
  14. Optimized Execution of Business Processes on Blockchain

    Luciano García-Bañuelos, Alexander Ponomarev, Marlon Dumas +1

    cs.SEarXiv:1612.03152v12016
  15. Persona-Execution Separation: An Architecture Pattern for Evolving LLM Agents under Execution Audit

    Yisen Xi

    cs.SEcs.AIarXiv:2608.27427v12026
  16. Claude Code Complete User Handbook

    David Soldani

    cs.NIcs.SEarXiv:2608.26742v12026
  17. Report of the 2026 Workshop on Next-Generation Ecosystems for Scientific Computing: Harnessing Community, Software, and AI for Cross-Disciplinary Team Science

    Lois Curfman McInnes, Dorian Arnold, Prasanna Balaprakash +45

    cs.CEcs.SEarXiv:2608.26519v12026
  18. From Metrics to Improvement: A Lifecycle-Aware LLM Feedback Framework for Research Software Quality

    Nafis Tanveer Islam, Nafiseh Soveizi, Yutong Li +1

    cs.SEarXiv:2608.23118v12026
  19. A Multi-Viewpoint Modeling Framework for Digital Twin Integration and Reuse with LLM-Assisted Compatibility Analysis

    Nafiseh Soveizi, Milan Kopp, Parinaz Rashidi +4

    cs.SEarXiv:2608.23115v12026
  20. Fairness Hazard Analysis for Socio-Technical Processes: A Multiple-Case Study in Bias-sensitive Organisational Settings

    Giovanna Broccia, Lucio Lelii, Roberto Cirillo +5

    cs.SEarXiv:2608.22978v12026
  21. D-Diff: An Interactive Environment for Adjusting Commit Boundaries Based on an Editable 3-way Diff

    Daiki Muto, Takayoshi Ueno, Shinpei Hayashi

    cs.SEarXiv:2608.22207v12026
  22. Large Language Models for Requirements Engineering: A Cross-Task Empirical Evaluation

    Jacek Dąbrowski, Manjeshwar Aniruddh Mallya, Alessio Ferrari +2

    cs.SEarXiv:2608.21531v12026
  23. Specification Portability Across LLM Development Agents: Cross-Agent Compatibility in Specification-Driven Software Migration

    Oleg Grynets, Oleksii Ilchuk, Dariia Zatulna +1

    cs.SEcs.AIcs.LOarXiv:2608.21208v12026
  24. Building real-time digital twin instances with Function+Data Flow: user evaluation and extension for iterative pipelines

    Eduardo de Conto, Blaise Genest, Arvind Easwaran +2

    cs.SEcs.CLarXiv:2608.18480v12026
  25. CodeBERTScore: Evaluating Code Generation with Pretrained Models of Code

    Shuyan Zhou, Uri Alon, Sumit Agarwal +1

    cs.SEcs.LGcs.PLarXiv:2302.05527v22023
  26. A deep learning model for estimating story points

    Morakot Choetkiertikul, Hoa Khanh Dam, Truyen Tran +3

    cs.SEcs.LGstat.MLarXiv:1609.00489v22016
  27. SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

    Yuling Shi, Jinghan Xu, Kelin Fu +12

    cs.CLcs.SEarXiv:2608.09802v12026
  28. Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable

    Ruhan Wang, Yucheng Shi, Zongxia Li +7

    cs.AIcs.SEarXiv:2607.13285v12026
  29. AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

    Andrey Podivilov, Vadim Lomshakov, Sergey Savin +4

    cs.AIcs.LGcs.SEarXiv:2607.06624v22026
  30. Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?

    Zhi Chen, Zhensu Sun, Yuling Shi +2

    cs.SEcs.AIarXiv:2607.01211v12026
  31. JAMER: Project-Level Code Framework Dataset and Benchmark on Professional Game Engines

    Jianwen Sun, Chuanhao Li, Zizhen Li +5

    cs.SEcs.CLarXiv:2606.19830v22026
  32. Automating Database-Native Function Code Synthesis with LLMs

    Wei Zhou, Xuanhe Zhou, Qikang He +4

    cs.DBcs.AIcs.CLarXiv:2604.06231v12026
  33. GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance Engineers

    Shufan Jiang, Chios Chen, Zhiyang Chen

    cs.SEcs.AIarXiv:2604.02648v12026
    Summaries:한국어
  34. ReSyn: A Generalized Recursive Regular Expression Synthesis Framework

    Seongmin Kim, Hyunjoon Cheon, Su-Hyeon Kim +2

    cs.PLcs.SEarXiv:2603.24624v22026
  35. ToolRosella: Translating Code Repositories into Standardized Tools for Scientific Agents

    Shimin Di, Xujie Yuan, Hanghui Guo +10

    cs.SEcs.CEcs.MAarXiv:2603.09290v52026
  36. Practical Program Repair in the Era of Large Pre-trained Language Models

    Chunqiu Steven Xia, Yuxiang Wei, Lingming Zhang

    cs.SEarXiv:2210.14179v22022
  37. What Survives the Next Model? Benchmarking LLM-Based Techniques Against Single-Prompts

    Nahian Salsabil, Joy Saha, Simantika Bhattacharjee Dristi +4

    cs.SEarXiv:2609.00468v12026
  38. No More Fine-Tuning? An Experimental Evaluation of Prompt Tuning in Code Intelligence

    Chaozheng Wang, Yuanhang Yang, Cuiyun Gao +3

    cs.SEcs.AIarXiv:2207.11680v12022
  39. Athena: Vulnerability-Affected Library Identification via Knowledge Graph Completion

    Phong Trinh Duy, Trang Dang Yen, Hung Nguyen-Huu +5

    cs.SEcs.AIcs.CRarXiv:2609.01187v12026
  40. Revisiting Feedback-Driven LLM Code Repair: A Replication and Exploratory Java Extension

    Louis Lalonde, Wassim Keddache, Thomas Perron Touchette +2

    cs.SEarXiv:2609.00362v12026
  41. A Neural Model for Generating Natural Language Summaries of Program Subroutines

    Alexander LeClair, Siyuan Jiang, Collin McMillan

    cs.SEarXiv:1902.01954v12019
  42. Improving fairness in machine learning systems: What do industry practitioners need?

    Kenneth Holstein, Jennifer Wortman Vaughan, Hal Daumé +2

    cs.HCcs.CYcs.LGarXiv:1812.05239v22018
  43. Automated software vulnerability detection with machine learning

    Jacob A. Harer, Louis Y. Kim, Rebecca L. Russell +13

    cs.SEcs.LGstat.MLarXiv:1803.04497v22018
  44. Why We Refactor? Confessions of GitHub Contributors

    Danilo Silva, Nikolaos Tsantalis, Marco Tulio Valente

    cs.SEarXiv:1607.02459v12016
  45. A Comparison of 10 Sampling Algorithms for Configurable Systems

    Flávio Medeiros, Christian Kästner, Márcio Ribeiro +2

    cs.SEarXiv:1602.02052v32016
  46. Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity

    Joel Becker, Nate Rush, Elizabeth Barnes +1

    cs.AIcs.HCcs.SEarXiv:2507.09089v22025
  47. TianoForge: An Automated Bug Triage Approach for the TianoCore UEFI Firmware Development Community

    Nazanin Siavash, Terrance E. Boult, Armin Moin

    cs.SEarXiv:2608.23259v12026
  48. NeuroAbs: A Neuro-Symbolic RTL Abstraction Framework for Property Checking Acceleration

    Zhiyuan Yan, Xiaofeng Zhou, Ziyue Zheng +5

    cs.ARcs.AIcs.SEarXiv:2608.17304v12026
  49. XRFix: Exploring Performance Bug Repair of Extended Reality Applications with Large Language Models

    Jingwen Wu, Hanyang Guo, Hong-Ning Dai +1

    cs.SEarXiv:2608.21718v12026
  50. Benchmarking Automated Security Patch Backporting: How Far Are We?

    Jincheng Yang, Yulong Fu, Chengwei Liu +5

    cs.SEcs.AIcs.CRarXiv:2608.17671v12026
  51. GADR: Gathering Architecture Decision Records from Meeting Transcriptions

    Lucas Daniel Costa da Silva, Kiev Gama

    cs.SEcs.AIarXiv:2608.17694v12026
  52. Lossless Tensor Compression as Program Synthesis

    Jieke Shi, Junda He, Wenjia Jiang +11

    cs.SEcs.AIcs.PLarXiv:2608.02162v12026
  53. The jsonlite Package: A Practical and Consistent Mapping Between JSON Data and R Objects

    Jeroen Ooms

    stat.COcs.MScs.SEarXiv:1403.2805v12014
  54. ClawHub Security Signals: When VirusTotal, Static Analysis, and SkillSpector Disagree

    Vincent Koc, Patrick Erichsen, Jacob Tomlinson +3

    cs.CRcs.AIcs.SEarXiv:2606.01494v12026
  55. Learning Natural Coding Conventions

    Miltiadis Allamanis, Earl T. Barr, Christian Bird +1

    cs.SEarXiv:1402.4182v32014
  56. optimize_anything: A Universal API for Optimizing any Text Parameter

    Lakshya A Agrawal, Donghyun Lee, Shangyin Tan +11

    cs.CLcs.AIcs.LGarXiv:2605.19633v12026
  57. R$^3$-SQL: Ranking Reward and Resampling for Text-to-SQL

    Hojae Han, Yeonseok Jeong, Seung-won Hwang +2

    cs.SEcs.AIcs.CLarXiv:2604.25325v12026
  58. A Survey on Automated Log Analysis for Reliability Engineering

    Shilin He, Pinjia He, Zhuangbin Chen +3

    cs.SEarXiv:2009.07237v22020
  59. BestConfig: Tapping the Performance Potential of Systems via Automatic Configuration Tuning

    Yuqing Zhu, Jianxun Liu, Mengying Guo +5

    cs.PFcs.DBcs.DCarXiv:1710.03439v12017
  60. The Data Problem in Software Vulnerability Analysis: Artifacts, Quality, and Consumption

    Yu Nong, Yao Du, Tianxiang Xu +1

    cs.SEarXiv:2609.01503v12026