Computation and Language
Papers filed under cs.CL on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
11,041 to 11,100 of 11,224
When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents
Kaiyue Yang, Yuyan Bu, Jingwei Yi +5
cs.SEcs.AIcs.CLarXiv:2606.20023v22026Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining
Michael K. Chen, Xikun Zhang, Fan Bai +2
cs.LGcs.AIcs.CLarXiv:2606.16246v22026RoPE-Aware Bit Allocation for KV-Cache Quantization
Fengfeng Liang, Yuechen Zhang, Jiaya Jia
cs.LGcs.CLarXiv:2606.24033v12026Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents
Yifan Wu, Lizhu Zhang, Yuhang Zhou +5
cs.AIcs.CLarXiv:2607.08716v12026Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning
Lu Dai, Ziyang Rao, Yili Wang +3
cs.AIcs.CLarXiv:2607.08393v12026A Sovereign, Open-Source Foundation Model for German and English
Soofi-Team, :, Benedikt Droste +30
cs.CLcs.AIcs.LGarXiv:2607.09424v32026PAST-TIDE: Prototype-Anchored Statement Tuning with Topic-Invariant Normalization for Stance Detection
Md. Shakhoyat Rahman Shujon, MD Jahid Hasan Jim, Md. Milon Islam +2
cs.CLcs.LGarXiv:2607.04690v12026Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do
Zhuoran Jin, Kejian Zhu, Hongbang Yuan +5
cs.CLcs.AIcs.CVarXiv:2606.22565v12026Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation
Julia Belikova, Rauf Parchiev, Evgeny Egorov +4
cs.AIcs.CLcs.SEarXiv:2606.23127v12026Constraint Tax in Open-Weight LLMs: An Empirical Study of Tool Calling Suppression Under Structured Output Constraints
Fangzheng Li, Aimin Zhang, Chen Lv
cs.CLarXiv:2606.25605v12026Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction
Chenguang Wang, Ming Li, Xinyue Zeng +4
cs.CLcs.AIcs.CYarXiv:2606.28186v32026Measuring the Gap Between Human and LLM Research Ideas
Ziyu Chen, Yilun Zhao, Arman Cohan
cs.CLcs.AIarXiv:2607.01233v12026VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
Yi-Cheng Lin, Yusuke Hirota, Sung-Feng Huang +1
eess.AScs.CLcs.SDarXiv:2604.17248v22026When More Sampling Hurts: The Modal Ceiling and Correlation Ceiling of Test-Time Scaling
Yong Yi Bay, Kathleen A. Yearick
cs.LGcs.AIcs.CLarXiv:2606.28661v12026ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models
Karan Goyal, Afreen Hossain, Debojyoti Das +1
cs.CVcs.AIcs.CLarXiv:2607.20092v12026No Universal Signal Predicts Sample-Level LLM Regression under Version Updates
Jia Sheng, Yiwei Lu
cs.AIcs.CLcs.LGarXiv:2608.13607v12026Asymmetric Discourse Homogenization and Shared Language Technology: Evidence from Reddit
Fengming Liu
cs.CYcs.CLcs.SIarXiv:2608.13674v12026A Calibrated Test of Internal Action Maps: State Signals Without Global Affine Closure
Dekun Yang
cs.AIcs.CLcs.LGarXiv:2608.13626v12026Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges
Tuo Liang, Zhe Hu, Disheng Liu +2
cs.CLcs.AIcs.MMarXiv:2607.19011v12026Self-State Attacks on Self-Hosted AI Agents: How Far Can OS Defenses Go?
Yimeng Chen, Nathanaël Denis, Roberto Di Pietro +1
cs.CRcs.AIcs.CLarXiv:2607.17986v12026Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels
Zhuchenyang Liu, Yao Zhang, Yu Xiao
cs.CVcs.CLcs.IRarXiv:2607.24651v12026Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift
Zitong Huang, Gustavo Lucas Carvalho, Deqing Fu +1
cs.CLcs.LGarXiv:2607.17524v12026AI Tour Meeting: Group Travel Planning by LLM Agents
Daisuke Kikuta
cs.AIcs.CLcs.MAarXiv:2607.18806v12026Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations
Hiskias Dingeto
cs.AIcs.CLarXiv:2607.20379v12026Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control
Jiaxin Bai, Jiaxuan Xiong
cs.CLcs.ROarXiv:2607.25337v22026O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning
Mei Yuan, Qi Long, Qifeng Wu +5
cs.CVcs.AIcs.CLarXiv:2607.18142v12026Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization
Alexey Gavrilov, Alan-Barsag Gazzaev, Sergey Muravyov
cs.CLcs.LGarXiv:2607.24176v12026OpenForgeRL: Train Harness-native Agents in Any Environment
Xiao Yu, Baolin Peng, Ruize Xu +7
cs.AIcs.CLarXiv:2607.21557v32026A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever
Sietse Schelpe
cs.CLcs.AIcs.IRarXiv:2607.23806v12026Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations
Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña López
cs.CLcs.CYcs.LGarXiv:2607.28319v12026H$^2$SD: Hybrid Hindsight Self-Distillation
Qiye Cai, Yichuan Ma, Peiji Li +6
cs.LGcs.CLarXiv:2607.18955v42026LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks
Tianzhu Ye, Li Dong, Guanheng Chen +4
cs.LGcs.CLarXiv:2607.18110v12026Reading and Steering Representations of Materials-Science Mechanisms in an Open-Weight Language Model
Markus J. Buehler
cs.AIcond-mat.mes-hallcond-mat.mtrl-sciarXiv:2607.20058v12026SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response
Lehan Wang, Boli Chen, Ruixue Ding +7
cs.CRcs.AIcs.CLarXiv:2607.26791v12026Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction
Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen +35
cs.CLcs.SEarXiv:2607.20911v12026Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models
Gabeen Kim, Kyeongpil Kang
cs.CLarXiv:2607.21936v12026WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting
Zhaokai Wang, Tianlin Gui, Jiayuan Rao +3
cs.AIcs.CLcs.LGarXiv:2607.18084v12026DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations
Jiazhen Jiang, Boxi Cao, Lingyong Yan +6
cs.AIcs.CLcs.LGarXiv:2607.19865v12026AutoIndex: Learning Representation Programs for Retrieval
Sam O'Nuallain, Nithya Rajkumar, Ramya Narayanasamy +3
cs.IRcs.AIcs.CLarXiv:2607.18603v12026Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning
Zheng Wu, Chenhao Xue, Shijie Zheng +3
cs.CLarXiv:2607.28478v12026Beyond Feeling Better: Capability-Sustaining Emotional Dialogue as a Longitudinal Research Paradigm
Ming Wang, Jiaqi Wu Young, Wenfang Wu +2
cs.CLcs.HCcs.SIarXiv:2607.27851v12026Towards Robust Reinforcement Learning for Small-Scale Language Model Agents
Md Rezwanul Haque, Md. Milon Islam, Fakhri Karray
cs.AIcs.CLcs.LGarXiv:2607.25091v12026DataPrep-Bench: Benchmarking LLMs as Training Data Preparators
Hao Liang, Qifeng Cai, Yibo Lin +11
cs.LGcs.CLarXiv:2607.20465v12026Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models
Nischay Dhankhar, Dos Baha, Abulhair Saparov
cs.CLcs.LGarXiv:2607.19604v12026Scaling Native Multimodal Pre-Training From Scratch
Haoyuan Wu, Aoqi Wu, Hai Wang +3
cs.CLcs.CVarXiv:2607.22043v12026GPT-Red: Automated Red Teaming via Self-Play at Scale
Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal +15
cs.CRcs.AIcs.CLarXiv:2607.26115v12026Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability
Sizhe Zhou, Sheldon Yu, Hui Wei +8
cs.CLcs.AIarXiv:2607.26637v12026SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch
Yihao Chen, Shi Chang, Feng Lin +4
cs.SEcs.CLarXiv:2607.27167v12026Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing
Laurin Wagner, Mario Zusag, Bernhard Thallinger
cs.CLarXiv:2607.18934v12026Memory for Large Language Models
Sining Zhoubian, Dan Zhang, Evgeny Kharlamov +1
cs.CLarXiv:2607.25380v12026Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking
Haorui He, Xinwen Chen, Dacheng Wen +3
cs.CLcs.AIcs.MMarXiv:2607.23514v12026Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning
Junyao Yang, Yucheng Shi, Zongxia Li +6
cs.LGcs.CLarXiv:2607.18722v32026Shieldstral
Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli +273
cs.CLcs.CVarXiv:2607.25857v22026MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis
Yihao Chen, Shi Chang, Khaled Chawa +4
cs.SEcs.CLcs.LGarXiv:2607.27146v12026AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents
Kunlun Zhu, Xuyan Ye, Zhiguang Han +9
cs.AIcs.CLarXiv:2607.18754v12026Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL
Xiaojun Wu, Cehao Yang, Honghao Liu +7
cs.CLarXiv:2608.14312v12026You Only Pass Once: Answering and Abstaining Together in a Single Forward Pass of a Frozen Language Model
Ziyang Luo, Zhongyao Chu, Xinjie He +4
cs.CLcs.LGarXiv:2608.14465v12026Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation
Zhe Liu
cs.CLcs.AIcs.SDarXiv:2608.13624v12026Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking
Kailin Jiang, Lei Liu, Jian Xi +7
cs.CLarXiv:2607.19747v22026OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
Jingbo Zhou, Yusai Zhao, Qi Bao +12
cs.AIcs.CLcs.HCarXiv:2607.27155v12026