Computation and Language

Papers filed under cs.CL on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

11,041 to 11,100 of 11,224

  1. When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents

    Kaiyue Yang, Yuyan Bu, Jingwei Yi +5

    cs.SEcs.AIcs.CLarXiv:2606.20023v22026
  2. Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining

    Michael K. Chen, Xikun Zhang, Fan Bai +2

    cs.LGcs.AIcs.CLarXiv:2606.16246v22026
  3. RoPE-Aware Bit Allocation for KV-Cache Quantization

    Fengfeng Liang, Yuechen Zhang, Jiaya Jia

    cs.LGcs.CLarXiv:2606.24033v12026
  4. Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents

    Yifan Wu, Lizhu Zhang, Yuhang Zhou +5

    cs.AIcs.CLarXiv:2607.08716v12026
  5. Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning

    Lu Dai, Ziyang Rao, Yili Wang +3

    cs.AIcs.CLarXiv:2607.08393v12026
  6. A Sovereign, Open-Source Foundation Model for German and English

    Soofi-Team, :, Benedikt Droste +30

    cs.CLcs.AIcs.LGarXiv:2607.09424v32026
  7. PAST-TIDE: Prototype-Anchored Statement Tuning with Topic-Invariant Normalization for Stance Detection

    Md. Shakhoyat Rahman Shujon, MD Jahid Hasan Jim, Md. Milon Islam +2

    cs.CLcs.LGarXiv:2607.04690v12026
  8. Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

    Zhuoran Jin, Kejian Zhu, Hongbang Yuan +5

    cs.CLcs.AIcs.CVarXiv:2606.22565v12026
  9. Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation

    Julia Belikova, Rauf Parchiev, Evgeny Egorov +4

    cs.AIcs.CLcs.SEarXiv:2606.23127v12026
  10. Constraint Tax in Open-Weight LLMs: An Empirical Study of Tool Calling Suppression Under Structured Output Constraints

    Fangzheng Li, Aimin Zhang, Chen Lv

    cs.CLarXiv:2606.25605v12026
  11. Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction

    Chenguang Wang, Ming Li, Xinyue Zeng +4

    cs.CLcs.AIcs.CYarXiv:2606.28186v32026
  12. Measuring the Gap Between Human and LLM Research Ideas

    Ziyu Chen, Yilun Zhao, Arman Cohan

    cs.CLcs.AIarXiv:2607.01233v12026
  13. VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech

    Yi-Cheng Lin, Yusuke Hirota, Sung-Feng Huang +1

    eess.AScs.CLcs.SDarXiv:2604.17248v22026
  14. When More Sampling Hurts: The Modal Ceiling and Correlation Ceiling of Test-Time Scaling

    Yong Yi Bay, Kathleen A. Yearick

    cs.LGcs.AIcs.CLarXiv:2606.28661v12026
  15. ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

    Karan Goyal, Afreen Hossain, Debojyoti Das +1

    cs.CVcs.AIcs.CLarXiv:2607.20092v12026
  16. No Universal Signal Predicts Sample-Level LLM Regression under Version Updates

    Jia Sheng, Yiwei Lu

    cs.AIcs.CLcs.LGarXiv:2608.13607v12026
  17. Asymmetric Discourse Homogenization and Shared Language Technology: Evidence from Reddit

    Fengming Liu

    cs.CYcs.CLcs.SIarXiv:2608.13674v12026
  18. A Calibrated Test of Internal Action Maps: State Signals Without Global Affine Closure

    Dekun Yang

    cs.AIcs.CLcs.LGarXiv:2608.13626v12026
  19. Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

    Tuo Liang, Zhe Hu, Disheng Liu +2

    cs.CLcs.AIcs.MMarXiv:2607.19011v12026
  20. Self-State Attacks on Self-Hosted AI Agents: How Far Can OS Defenses Go?

    Yimeng Chen, Nathanaël Denis, Roberto Di Pietro +1

    cs.CRcs.AIcs.CLarXiv:2607.17986v12026
  21. Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

    Zhuchenyang Liu, Yao Zhang, Yu Xiao

    cs.CVcs.CLcs.IRarXiv:2607.24651v12026
  22. Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift

    Zitong Huang, Gustavo Lucas Carvalho, Deqing Fu +1

    cs.CLcs.LGarXiv:2607.17524v12026
  23. AI Tour Meeting: Group Travel Planning by LLM Agents

    Daisuke Kikuta

    cs.AIcs.CLcs.MAarXiv:2607.18806v12026
  24. Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations

    Hiskias Dingeto

    cs.AIcs.CLarXiv:2607.20379v12026
  25. Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control

    Jiaxin Bai, Jiaxuan Xiong

    cs.CLcs.ROarXiv:2607.25337v22026
  26. O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

    Mei Yuan, Qi Long, Qifeng Wu +5

    cs.CVcs.AIcs.CLarXiv:2607.18142v12026
  27. Where Quality Breaks in Compressed Short-Text Generation: Staged Bottleneck Localization

    Alexey Gavrilov, Alan-Barsag Gazzaev, Sergey Muravyov

    cs.CLcs.LGarXiv:2607.24176v12026
  28. OpenForgeRL: Train Harness-native Agents in Any Environment

    Xiao Yu, Baolin Peng, Ruize Xu +7

    cs.AIcs.CLarXiv:2607.21557v32026
  29. A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever

    Sietse Schelpe

    cs.CLcs.AIcs.IRarXiv:2607.23806v12026
  30. Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations

    Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña López

    cs.CLcs.CYcs.LGarXiv:2607.28319v12026
  31. H$^2$SD: Hybrid Hindsight Self-Distillation

    Qiye Cai, Yichuan Ma, Peiji Li +6

    cs.LGcs.CLarXiv:2607.18955v42026
  32. LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

    Tianzhu Ye, Li Dong, Guanheng Chen +4

    cs.LGcs.CLarXiv:2607.18110v12026
  33. Reading and Steering Representations of Materials-Science Mechanisms in an Open-Weight Language Model

    Markus J. Buehler

    cs.AIcond-mat.mes-hallcond-mat.mtrl-sciarXiv:2607.20058v12026
  34. SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response

    Lehan Wang, Boli Chen, Ruixue Ding +7

    cs.CRcs.AIcs.CLarXiv:2607.26791v12026
  35. Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

    Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen +35

    cs.CLcs.SEarXiv:2607.20911v12026
  36. Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models

    Gabeen Kim, Kyeongpil Kang

    cs.CLarXiv:2607.21936v12026
  37. WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting

    Zhaokai Wang, Tianlin Gui, Jiayuan Rao +3

    cs.AIcs.CLcs.LGarXiv:2607.18084v12026
  38. DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

    Jiazhen Jiang, Boxi Cao, Lingyong Yan +6

    cs.AIcs.CLcs.LGarXiv:2607.19865v12026
  39. AutoIndex: Learning Representation Programs for Retrieval

    Sam O'Nuallain, Nithya Rajkumar, Ramya Narayanasamy +3

    cs.IRcs.AIcs.CLarXiv:2607.18603v12026
  40. Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning

    Zheng Wu, Chenhao Xue, Shijie Zheng +3

    cs.CLarXiv:2607.28478v12026
  41. Beyond Feeling Better: Capability-Sustaining Emotional Dialogue as a Longitudinal Research Paradigm

    Ming Wang, Jiaqi Wu Young, Wenfang Wu +2

    cs.CLcs.HCcs.SIarXiv:2607.27851v12026
  42. Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

    Md Rezwanul Haque, Md. Milon Islam, Fakhri Karray

    cs.AIcs.CLcs.LGarXiv:2607.25091v12026
  43. DataPrep-Bench: Benchmarking LLMs as Training Data Preparators

    Hao Liang, Qifeng Cai, Yibo Lin +11

    cs.LGcs.CLarXiv:2607.20465v12026
  44. Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models

    Nischay Dhankhar, Dos Baha, Abulhair Saparov

    cs.CLcs.LGarXiv:2607.19604v12026
  45. Scaling Native Multimodal Pre-Training From Scratch

    Haoyuan Wu, Aoqi Wu, Hai Wang +3

    cs.CLcs.CVarXiv:2607.22043v12026
  46. GPT-Red: Automated Red Teaming via Self-Play at Scale

    Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal +15

    cs.CRcs.AIcs.CLarXiv:2607.26115v12026
  47. Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability

    Sizhe Zhou, Sheldon Yu, Hui Wei +8

    cs.CLcs.AIarXiv:2607.26637v12026
  48. SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch

    Yihao Chen, Shi Chang, Feng Lin +4

    cs.SEcs.CLarXiv:2607.27167v12026
  49. Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing

    Laurin Wagner, Mario Zusag, Bernhard Thallinger

    cs.CLarXiv:2607.18934v12026
  50. Memory for Large Language Models

    Sining Zhoubian, Dan Zhang, Evgeny Kharlamov +1

    cs.CLarXiv:2607.25380v12026
  51. Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

    Haorui He, Xinwen Chen, Dacheng Wen +3

    cs.CLcs.AIcs.MMarXiv:2607.23514v12026
  52. Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning

    Junyao Yang, Yucheng Shi, Zongxia Li +6

    cs.LGcs.CLarXiv:2607.18722v32026
  53. Shieldstral

    Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli +273

    cs.CLcs.CVarXiv:2607.25857v22026
  54. MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis

    Yihao Chen, Shi Chang, Khaled Chawa +4

    cs.SEcs.CLcs.LGarXiv:2607.27146v12026
  55. AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

    Kunlun Zhu, Xuyan Ye, Zhiguang Han +9

    cs.AIcs.CLarXiv:2607.18754v12026
  56. Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL

    Xiaojun Wu, Cehao Yang, Honghao Liu +7

    cs.CLarXiv:2608.14312v12026
  57. You Only Pass Once: Answering and Abstaining Together in a Single Forward Pass of a Frozen Language Model

    Ziyang Luo, Zhongyao Chu, Xinjie He +4

    cs.CLcs.LGarXiv:2608.14465v12026
  58. Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation

    Zhe Liu

    cs.CLcs.AIcs.SDarXiv:2608.13624v12026
  59. Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking

    Kailin Jiang, Lei Liu, Jian Xi +7

    cs.CLarXiv:2607.19747v22026
  60. OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

    Jingbo Zhou, Yusai Zhao, Qi Bao +12

    cs.AIcs.CLcs.HCarXiv:2607.27155v12026