Computation and Language

Papers filed under cs.CL on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

11,101 to 11,160 of 11,238

  1. Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability

    Sizhe Zhou, Sheldon Yu, Hui Wei +8

    cs.CLcs.AIarXiv:2607.26637v12026
  2. SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch

    Yihao Chen, Shi Chang, Feng Lin +4

    cs.SEcs.CLarXiv:2607.27167v12026
  3. Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing

    Laurin Wagner, Mario Zusag, Bernhard Thallinger

    cs.CLarXiv:2607.18934v12026
  4. Memory for Large Language Models

    Sining Zhoubian, Dan Zhang, Evgeny Kharlamov +1

    cs.CLarXiv:2607.25380v12026
  5. Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

    Haorui He, Xinwen Chen, Dacheng Wen +3

    cs.CLcs.AIcs.MMarXiv:2607.23514v12026
  6. Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning

    Junyao Yang, Yucheng Shi, Zongxia Li +6

    cs.LGcs.CLarXiv:2607.18722v32026
  7. Shieldstral

    Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli +273

    cs.CLcs.CVarXiv:2607.25857v22026
  8. MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis

    Yihao Chen, Shi Chang, Khaled Chawa +4

    cs.SEcs.CLcs.LGarXiv:2607.27146v12026
  9. AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

    Kunlun Zhu, Xuyan Ye, Zhiguang Han +9

    cs.AIcs.CLarXiv:2607.18754v12026
  10. Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL

    Xiaojun Wu, Cehao Yang, Honghao Liu +7

    cs.CLarXiv:2608.14312v12026
  11. You Only Pass Once: Answering and Abstaining Together in a Single Forward Pass of a Frozen Language Model

    Ziyang Luo, Zhongyao Chu, Xinjie He +4

    cs.CLcs.LGarXiv:2608.14465v12026
  12. Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation

    Zhe Liu

    cs.CLcs.AIcs.SDarXiv:2608.13624v12026
  13. Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking

    Kailin Jiang, Lei Liu, Jian Xi +7

    cs.CLarXiv:2607.19747v22026
  14. OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

    Jingbo Zhou, Yusai Zhao, Qi Bao +12

    cs.AIcs.CLcs.HCarXiv:2607.27155v12026
  15. CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

    Lai Wei, Chengqi Li, Jiapeng Li +3

    cs.CVcs.AIcs.CLarXiv:2607.25294v12026
  16. Progress Reward Modeling for Robotic Learning: A Comprehensive Survey

    Jianshu Zhang, Keliang Wu, Haoran Lu +8

    cs.ROcs.CLarXiv:2607.21655v12026
  17. Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

    Jian Hu, Huiying Li, Hao Zhang +8

    cs.LGcs.CLcs.DCarXiv:2607.21653v12026
  18. Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory

    Ruizhe Li, Mingxuan Du, Benfeng Xu +1

    cs.CLarXiv:2607.24368v12026
  19. K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs

    Hao Liang, Qihan Lin, Zhaoyang Han +5

    cs.CLarXiv:2605.09635v32026
  20. BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

    Pengyu Wang, Benfeng Xu, Shaohan Wang +5

    cs.CLarXiv:2607.26497v32026
  21. Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation

    Yuhang Zhu, Mingxuan Du, Benfeng Xu +3

    cs.CLcs.AIarXiv:2607.27816v22026
  22. EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents

    Luigi Sigillo, Matteo Silvestri, Francesco Tabaro +9

    cs.CLcs.AIcs.IRarXiv:2607.28229v12026
  23. GigaChat Audio: Time-aware Large Audio Language Model

    Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov +4

    eess.AScs.CLarXiv:2607.10387v12026
  24. GigaAM Multilingual: Foundation Model for Underrepresented Languages

    Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov +5

    eess.AScs.CLarXiv:2607.10371v12026
  25. Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

    Alexi Gladstone, Heng Ji, Yilun Du

    cs.LGcs.AIcs.CLarXiv:2607.27372v12026
  26. UEmbed: Unified Sparse and Dense Multimodal Embeddings

    Tingyu Song, Mingxin Li, Yanzhao Zhang +5

    cs.CVcs.AIcs.CLarXiv:2608.02583v12026
  27. Pass the Baton: Trajectory-Relayed On-Policy Distillation

    Haolei Xu, Xiaowen Xu, Haiwen Hong +5

    cs.CLcs.AIarXiv:2607.26057v12026
  28. AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

    Xiangning Lin, Shenzhe Zhu, Shu Yang +23

    cs.AIcs.CLcs.CYarXiv:2607.28617v22026
  29. The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads

    Yushi Sun, Yanjie Zhang, Rui Sheng

    cs.CLarXiv:2608.04570v12026
  30. A New Role for Relevance: Guiding Corpus Interaction in Agentic Search

    Jiangnan Li, Yuqing Li, Mo Yu +2

    cs.CLarXiv:2607.24223v22026
  31. When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation

    Jiabin Shen, Guang Chen, Chengjun Mao

    cs.CLcs.LGarXiv:2607.07050v42026
  32. Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making

    Amirhosein Ghasemabadi, Ruichen Chen, Bahador Rashidi +1

    cs.CLarXiv:2607.14277v12026
  33. Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

    Senqiao Yang, Kaichen Zhang, Zhaoyang Jia +20

    cs.CVcs.CLarXiv:2607.24904v12026
  34. AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis

    Bing Yan, Gregory Wolfe, Stefano Martiniani +1

    cs.CLcs.AIcs.IRarXiv:2607.28618v12026
  35. An Exam for Active Observers

    Jiarui Zhang, Muzi Tao, Shangshang Wang +3

    cs.CVcs.AIcs.CLarXiv:2607.16165v12026
  36. Metis: Memory Foundation Model

    Zeyu Zhang, Ziliang Guo, Yihang Sun +14

    cs.CLcs.LGarXiv:2607.26760v22026
  37. Can Multimodal Large Language Models Understand OCT?

    Baochen Fu, Wenzhi Deng, Baihao Jin +5

    cs.CVcs.CLarXiv:2607.16609v12026
  38. Multi-Turn On-Policy Distillation with Prefix Replay

    Baohao Liao, Hanze Dong, Christof Monz +3

    cs.LGcs.AIcs.CLarXiv:2607.04763v32026
  39. Agentic Transaction: Towards ACID-Compliant Agent Systems

    Zhaoyan Sun, Xiaoxiao Wang, Guoliang Li

    cs.DBcs.AIcs.CLarXiv:2608.13900v12026
  40. Split the Labor: Separating Evidence Interpretation from Decision Aggregation

    Zhelun Wu

    cs.AIcs.CLcs.LGarXiv:2608.14509v12026
  41. LLMs Don't Pay for the Jump

    Paras Balani, Subhrakanta Panda

    cs.AIcs.CLarXiv:2608.14397v12026
  42. Never the Number: Structural Abstention for AI Systems Whose Answers Are Consumed as Fact

    Zhelun, Wu

    cs.AIcs.CLcs.DBarXiv:2608.13926v12026
  43. Reading Between The Lines: Modeling and Evaluating Behavioral Realism in Legal Simulation

    Divya Vetticaden, Arya Gupta, Julian Nyarko +1

    cs.CYcs.AIcs.CLarXiv:2608.13712v12026
  44. Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements

    Xinke Tong, Xuanming Zhang, Tianyi Tang +10

    cs.CLarXiv:2607.28661v12026
  45. When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles

    Tobias Bersia, Tatiana Gaintseva

    cs.CLcs.AIarXiv:2607.23379v12026
  46. BM25-Augmented Many-Shot Translation for Low-Resource North-Eastern Indian Languages

    Aashish Dhawan, Christopher Driggers-Ellis, Dzmitry Kasinets +2

    cs.CLarXiv:2608.13722v12026
  47. Can MLLMs Decode the Creative Leap? Introducing C4 for Cross-Concept Understanding

    Ming Wang, Yuqing Zhang, Tingna Xie +5

    cs.AIcs.CLcs.MMarXiv:2608.06501v12026
  48. Zero-Mem: Zero-Token Memory Operations for LLM Agents

    Yilin Xiao, Zhehan Zhu, Yujing Zhang +8

    cs.CLarXiv:2607.29377v12026
  49. DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking Dialogues

    Takyoung Kim, Kang-wook Kim, Sang Hoon Woo +3

    cs.CLarXiv:2607.26178v12026
  50. SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

    Sirun Li, Minghao Liu, Ling Dai +4

    cs.CVcs.CLarXiv:2608.04244v12026
  51. When Lexical Change Misleads: Rethinking Dynamic Topic Model Evaluation with Traditional and LLM-Based Metrics

    Charu Karakkaparambil James

    cs.CLarXiv:2608.13835v12026
  52. RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems

    Haoran Ling, Yuecheng Li, Zeyu Song +5

    cs.IRcs.AIcs.CLarXiv:2607.29241v12026
  53. Geometric Filtering of LLM-Generated Samples for Few-Shot Text Classification

    Benjamín Schindler, Gonzalo A. Ruz

    cs.LGcs.CLarXiv:2608.13866v12026
  54. Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge

    Kexin Shi, Renhe Sun, Yuge Huang +4

    cs.CLarXiv:2608.14150v12026
  55. AnchorBench: A Multi-Pathway Benchmark for the Anchoring Effect in LLMs

    Yiderigun Borjigin, Alexander Hermann, Christian Cyron +1

    cs.AIcs.CLarXiv:2608.14320v12026
  56. Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance

    Zhuowen Han, Jinwei Xiao, Zhengxi Lu +9

    cs.CLarXiv:2608.00782v12026
  57. Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning

    Xinyan Guan, Jiali Zeng, Chunlei Xin +5

    cs.CLarXiv:2607.29211v12026
  58. RestoreKV: Recovering Full-Cache Behavior Under Aggressive Query-Agnostic KV Cache Eviction

    Changwoo Baek, Seungjun Shin, Kyeongbo Kong

    cs.CLcs.LGarXiv:2608.01247v12026
  59. When Attention Goes Blind: Numerical Failure in ALiBi Positional Encodings

    Christopher Schröder, Lukas Gienapp, Ferdinand Schlatt +2

    cs.CLarXiv:2608.03994v12026
  60. Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination

    Ruijie Hou, Yueyang Jiao, Zhao Wang +1

    cs.CLcs.AIarXiv:2608.07341v12026