Software Engineering
Papers filed under cs.SE on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
541 to 600 of 1,389
Beyond Retrieval: A Multitask Benchmark and Model for Code Search
Siqiao Xue, Zihan Liao, Jin Qin +4
cs.SEcs.AIarXiv:2605.04615v22026Machine Teaching: A New Paradigm for Building Machine Learning Systems
Patrice Y. Simard, Saleema Amershi, David M. Chickering +8
cs.LGcs.AIcs.HCarXiv:1707.06742v32017LocAgent: Graph-Guided LLM Agents for Code Localization
Zhaoling Chen, Xiangru Tang, Gangda Deng +6
cs.SEcs.AIcs.CLarXiv:2503.09089v22025R2E-Gym: Procedural Environments and Hybrid Verifiers for Scaling Open-Weights SWE Agents
Naman Jain, Jaskirat Singh, Manish Shetty +3
cs.SEcs.CLcs.LGarXiv:2504.07164v12025Effective Test Generation Using Pre-trained Large Language Models and Mutation Testing
Arghavan Moradi Dakhel, Amin Nikanjam, Vahid Majdinasab +2
cs.SEarXiv:2308.16557v12023Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving
Daoguang Zan, Zhirong Huang, Wei Liu +16
cs.SEcs.AIcs.CLarXiv:2504.02605v12025Trae Agent: An LLM-based Agent for Software Engineering with Test-time Scaling
Trae Research Team, Pengfei Gao, Zhao Tian +12
cs.SEcs.AIarXiv:2507.23370v12025DBcover: A White-box SQL Test Generation Framework for Coverage Improvement
Yankai Rong, Shuang Liu, Jinhao Dong +4
cs.DBcs.SEarXiv:2608.25573v12026ExplainBench: Evaluating Code Explanations from Agents
Zhiyuan Pan, Sungmin Kang, Imam Nur Bani Yusuf +1
cs.SEarXiv:2607.26451v12026Token Budgets: An Empirical Catalog of 63 LLM-Agent Budget-Overrun Incidents, with an Affine-Typed Rust Mitigation as a Case Study
Sajjad Khan
cs.SEcs.MAcs.PLarXiv:2606.04056v12026What Does an Agentic Software Engineering Benchmark Measure? Profiling Task Demands and Agent Behaviour Beyond What Category Labels Reveal
Radin Shayanfar, Keheliya Gallaba, Ahmed E. Hassan
cs.SEcs.CLarXiv:2609.01271v12026Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?
Chunqiu Steven Xia, Zhe Wang, Yan Yang +2
cs.SEcs.AIcs.CLarXiv:2511.13646v32025SmartBugs: A Framework to Analyze Solidity Smart Contracts
João F. Ferreira, Pedro Cruz, Thomas Durieux +1
cs.SEcs.CRarXiv:2007.04771v22020Optimized Execution of Business Processes on Blockchain
Luciano García-Bañuelos, Alexander Ponomarev, Marlon Dumas +1
cs.SEarXiv:1612.03152v12016Persona-Execution Separation: An Architecture Pattern for Evolving LLM Agents under Execution Audit
Yisen Xi
cs.SEcs.AIarXiv:2608.27427v12026Claude Code Complete User Handbook
David Soldani
cs.NIcs.SEarXiv:2608.26742v12026Report of the 2026 Workshop on Next-Generation Ecosystems for Scientific Computing: Harnessing Community, Software, and AI for Cross-Disciplinary Team Science
Lois Curfman McInnes, Dorian Arnold, Prasanna Balaprakash +45
cs.CEcs.SEarXiv:2608.26519v12026From Metrics to Improvement: A Lifecycle-Aware LLM Feedback Framework for Research Software Quality
Nafis Tanveer Islam, Nafiseh Soveizi, Yutong Li +1
cs.SEarXiv:2608.23118v12026A Multi-Viewpoint Modeling Framework for Digital Twin Integration and Reuse with LLM-Assisted Compatibility Analysis
Nafiseh Soveizi, Milan Kopp, Parinaz Rashidi +4
cs.SEarXiv:2608.23115v12026Fairness Hazard Analysis for Socio-Technical Processes: A Multiple-Case Study in Bias-sensitive Organisational Settings
Giovanna Broccia, Lucio Lelii, Roberto Cirillo +5
cs.SEarXiv:2608.22978v12026D-Diff: An Interactive Environment for Adjusting Commit Boundaries Based on an Editable 3-way Diff
Daiki Muto, Takayoshi Ueno, Shinpei Hayashi
cs.SEarXiv:2608.22207v12026Large Language Models for Requirements Engineering: A Cross-Task Empirical Evaluation
Jacek Dąbrowski, Manjeshwar Aniruddh Mallya, Alessio Ferrari +2
cs.SEarXiv:2608.21531v12026Specification Portability Across LLM Development Agents: Cross-Agent Compatibility in Specification-Driven Software Migration
Oleg Grynets, Oleksii Ilchuk, Dariia Zatulna +1
cs.SEcs.AIcs.LOarXiv:2608.21208v12026Building real-time digital twin instances with Function+Data Flow: user evaluation and extension for iterative pipelines
Eduardo de Conto, Blaise Genest, Arvind Easwaran +2
cs.SEcs.CLarXiv:2608.18480v12026CodeBERTScore: Evaluating Code Generation with Pretrained Models of Code
Shuyan Zhou, Uri Alon, Sumit Agarwal +1
cs.SEcs.LGcs.PLarXiv:2302.05527v22023A deep learning model for estimating story points
Morakot Choetkiertikul, Hoa Khanh Dam, Truyen Tran +3
cs.SEcs.LGstat.MLarXiv:1609.00489v22016SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
Yuling Shi, Jinghan Xu, Kelin Fu +12
cs.CLcs.SEarXiv:2608.09802v12026Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable
Ruhan Wang, Yucheng Shi, Zongxia Li +7
cs.AIcs.SEarXiv:2607.13285v12026AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation
Andrey Podivilov, Vadim Lomshakov, Sergey Savin +4
cs.AIcs.LGcs.SEarXiv:2607.06624v22026Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?
Zhi Chen, Zhensu Sun, Yuling Shi +2
cs.SEcs.AIarXiv:2607.01211v12026JAMER: Project-Level Code Framework Dataset and Benchmark on Professional Game Engines
Jianwen Sun, Chuanhao Li, Zizhen Li +5
cs.SEcs.CLarXiv:2606.19830v22026Automating Database-Native Function Code Synthesis with LLMs
Wei Zhou, Xuanhe Zhou, Qikang He +4
cs.DBcs.AIcs.CLarXiv:2604.06231v12026GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance Engineers
Shufan Jiang, Chios Chen, Zhiyang Chen
cs.SEcs.AIarXiv:2604.02648v12026Summaries:한국어ReSyn: A Generalized Recursive Regular Expression Synthesis Framework
Seongmin Kim, Hyunjoon Cheon, Su-Hyeon Kim +2
cs.PLcs.SEarXiv:2603.24624v22026ToolRosella: Translating Code Repositories into Standardized Tools for Scientific Agents
Shimin Di, Xujie Yuan, Hanghui Guo +10
cs.SEcs.CEcs.MAarXiv:2603.09290v52026Practical Program Repair in the Era of Large Pre-trained Language Models
Chunqiu Steven Xia, Yuxiang Wei, Lingming Zhang
cs.SEarXiv:2210.14179v22022What Survives the Next Model? Benchmarking LLM-Based Techniques Against Single-Prompts
Nahian Salsabil, Joy Saha, Simantika Bhattacharjee Dristi +4
cs.SEarXiv:2609.00468v12026No More Fine-Tuning? An Experimental Evaluation of Prompt Tuning in Code Intelligence
Chaozheng Wang, Yuanhang Yang, Cuiyun Gao +3
cs.SEcs.AIarXiv:2207.11680v12022Athena: Vulnerability-Affected Library Identification via Knowledge Graph Completion
Phong Trinh Duy, Trang Dang Yen, Hung Nguyen-Huu +5
cs.SEcs.AIcs.CRarXiv:2609.01187v12026Revisiting Feedback-Driven LLM Code Repair: A Replication and Exploratory Java Extension
Louis Lalonde, Wassim Keddache, Thomas Perron Touchette +2
cs.SEarXiv:2609.00362v12026A Neural Model for Generating Natural Language Summaries of Program Subroutines
Alexander LeClair, Siyuan Jiang, Collin McMillan
cs.SEarXiv:1902.01954v12019Improving fairness in machine learning systems: What do industry practitioners need?
Kenneth Holstein, Jennifer Wortman Vaughan, Hal Daumé +2
cs.HCcs.CYcs.LGarXiv:1812.05239v22018Automated software vulnerability detection with machine learning
Jacob A. Harer, Louis Y. Kim, Rebecca L. Russell +13
cs.SEcs.LGstat.MLarXiv:1803.04497v22018Why We Refactor? Confessions of GitHub Contributors
Danilo Silva, Nikolaos Tsantalis, Marco Tulio Valente
cs.SEarXiv:1607.02459v12016A Comparison of 10 Sampling Algorithms for Configurable Systems
Flávio Medeiros, Christian Kästner, Márcio Ribeiro +2
cs.SEarXiv:1602.02052v32016Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity
Joel Becker, Nate Rush, Elizabeth Barnes +1
cs.AIcs.HCcs.SEarXiv:2507.09089v22025TianoForge: An Automated Bug Triage Approach for the TianoCore UEFI Firmware Development Community
Nazanin Siavash, Terrance E. Boult, Armin Moin
cs.SEarXiv:2608.23259v12026NeuroAbs: A Neuro-Symbolic RTL Abstraction Framework for Property Checking Acceleration
Zhiyuan Yan, Xiaofeng Zhou, Ziyue Zheng +5
cs.ARcs.AIcs.SEarXiv:2608.17304v12026XRFix: Exploring Performance Bug Repair of Extended Reality Applications with Large Language Models
Jingwen Wu, Hanyang Guo, Hong-Ning Dai +1
cs.SEarXiv:2608.21718v12026Benchmarking Automated Security Patch Backporting: How Far Are We?
Jincheng Yang, Yulong Fu, Chengwei Liu +5
cs.SEcs.AIcs.CRarXiv:2608.17671v12026GADR: Gathering Architecture Decision Records from Meeting Transcriptions
Lucas Daniel Costa da Silva, Kiev Gama
cs.SEcs.AIarXiv:2608.17694v12026Lossless Tensor Compression as Program Synthesis
Jieke Shi, Junda He, Wenjia Jiang +11
cs.SEcs.AIcs.PLarXiv:2608.02162v12026The jsonlite Package: A Practical and Consistent Mapping Between JSON Data and R Objects
Jeroen Ooms
stat.COcs.MScs.SEarXiv:1403.2805v12014ClawHub Security Signals: When VirusTotal, Static Analysis, and SkillSpector Disagree
Vincent Koc, Patrick Erichsen, Jacob Tomlinson +3
cs.CRcs.AIcs.SEarXiv:2606.01494v12026Learning Natural Coding Conventions
Miltiadis Allamanis, Earl T. Barr, Christian Bird +1
cs.SEarXiv:1402.4182v32014optimize_anything: A Universal API for Optimizing any Text Parameter
Lakshya A Agrawal, Donghyun Lee, Shangyin Tan +11
cs.CLcs.AIcs.LGarXiv:2605.19633v12026R$^3$-SQL: Ranking Reward and Resampling for Text-to-SQL
Hojae Han, Yeonseok Jeong, Seung-won Hwang +2
cs.SEcs.AIcs.CLarXiv:2604.25325v12026A Survey on Automated Log Analysis for Reliability Engineering
Shilin He, Pinjia He, Zhuangbin Chen +3
cs.SEarXiv:2009.07237v22020BestConfig: Tapping the Performance Potential of Systems via Automatic Configuration Tuning
Yuqing Zhu, Jianxun Liu, Mengying Guo +5
cs.PFcs.DBcs.DCarXiv:1710.03439v12017The Data Problem in Software Vulnerability Analysis: Artifacts, Quality, and Consumption
Yu Nong, Yao Du, Tianxiang Xu +1
cs.SEarXiv:2609.01503v12026