Computation and Language

Papers filed under cs.CL on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

2,281 to 2,340 of 11,278

  1. Quantifying Uncertainties in Natural Language Processing Tasks

    Yijun Xiao, William Yang Wang

    cs.CLcs.AIcs.LGarXiv:1811.07253v12018
  2. Benchmark^2: Systematic Evaluation of LLM Benchmarks

    Qi Qian, Chengsong Huang, Jingwen Xu +13

    cs.CLarXiv:2601.03986v12026
  3. Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe

    Dain Kim, Eungi Cho, Kyumin Kim +2

    cs.AIcs.CLarXiv:2609.05395v12026
  4. PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice

    Yuzhen Shi, Huanghai Liu, Yiran Hu +27

    cs.CLcs.AIcs.CYarXiv:2601.16669v22026
  5. DynHD: Hallucination Detection for Diffusion Large Language Models via Denoising Dynamics Deviation Learning

    Yanyu Qian, Yue Tan, Yixin Liu +2

    cs.CLarXiv:2603.16459v22026
  6. Large Language Models for HVAC Operations in Building Energy Systems: A Critical Review of Methods, Applications, and Deployment Readiness

    Alexander Neubauer, Tianzhen Hong, Han Li +4

    cs.AIcs.CLeess.SYarXiv:2609.05314v12026
  7. PIArena: A Platform for Prompt Injection Evaluation

    Runpeng Geng, Chenlong Yin, Yanting Wang +2

    cs.CRcs.AIcs.CLarXiv:2604.08499v12026
  8. RubricRAG: Towards Interpretable and Reliable LLM Evaluation via Domain Knowledge Retrieval for Rubric Generation

    Kaustubh D. Dhole, Eugene Agichtein

    cs.IRcs.AIcs.CLarXiv:2603.20882v12026
  9. FadeMem: Biologically-Inspired Forgetting for Efficient Agent Memory

    Lei Wei, Xiao Peng, Xu Dong +2

    cs.AIcs.CLarXiv:2601.18642v22026
  10. Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability

    Ankit Goyal, Jaideep Ray

    cs.AIcs.CLcs.IRarXiv:2609.05339v12026
  11. Technical Manual for a Toolkit for Measuring Contextual Individuation in Transformer Language Models

    José Luciano Verçosa Marques, Frederico Jorge Heitmann, Daniel Omar Perez +2

    cs.AIcs.CLarXiv:2609.05333v12026
  12. The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents

    Ziyang Ma, Ruiyang Xu, Yinghao Ma +9

    cs.SDcs.CLcs.MMarXiv:2602.14224v12026
  13. Chain of Code: Reasoning with a Language Model-Augmented Code Emulator

    Chengshu Li, Jacky Liang, Andy Zeng +7

    cs.CLcs.AIcs.LGarXiv:2312.04474v42023
  14. DynaWeb: Model-Based Reinforcement Learning of Web Agents

    Hang Ding, Peidong Liu, Junqiao Wang +7

    cs.CLcs.AIarXiv:2601.22149v22026
  15. Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History

    Serin Kim, Sangam Lee, Dongha Lee

    cs.CLcs.AIarXiv:2602.17003v32026
  16. Reframing Human-AI Collaboration for Generating Free-Text Explanations

    Sarah Wiegreffe, Jack Hessel, Swabha Swayamdipta +2

    cs.CLarXiv:2112.08674v22021
    Summaries:한국어
  17. Reasoning Implicit Sentiment with Chain-of-Thought Prompting

    Hao Fei, Bobo Li, Qian Liu +3

    cs.CLarXiv:2305.11255v42023
  18. Bottom Up Top Down Detection Transformers for Language Grounding in Images and Point Clouds

    Ayush Jain, Nikolaos Gkanatsios, Ishita Mediratta +1

    cs.CVcs.CLarXiv:2112.08879v52021
  19. There Is More to Refusal in Large Language Models than a Single Direction

    Faaiz Joad, Majd Hawasly, Sabri Boughorbel +2

    cs.CLarXiv:2602.02132v12026
  20. Learning Private Neural Language Modeling with Attentive Aggregation

    Shaoxiong Ji, Shirui Pan, Guodong Long +3

    cs.CLcs.LGarXiv:1812.07108v22018
  21. Multi-granularity hierarchical attention fusion networks for reading comprehension and question answering

    Wei Wang, Ming Yan, Chen Wu

    cs.CLarXiv:1811.11934v12018
  22. Mr. TyDi: A Multi-lingual Benchmark for Dense Retrieval

    Xinyu Zhang, Xueguang Ma, Peng Shi +1

    cs.CLcs.IRarXiv:2108.08787v22021
  23. Zero-Shot Grounding of Objects from Natural Language Queries

    Arka Sadhu, Kan Chen, Ram Nevatia

    cs.CVcs.CLarXiv:1908.07129v12019
  24. A Survey on Long-Term Memory Security in LLM Agents: Attacks, Defenses, and Governance Across the Memory Lifecycle

    Zehao Lin, Xixuan Hao, Renyu Fu +5

    cs.CRcs.AIcs.CLarXiv:2604.16548v22026
  25. AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations

    Cheng Jiayang, Dongyu Ru, Lin Qiu +4

    cs.CLcs.AIarXiv:2603.01966v12026
  26. Verified Critical Step Optimization for LLM Agents

    Mukai Li, Qingcheng Zeng, Tianqing Fang +5

    cs.CLarXiv:2602.03412v22026
  27. LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark

    Ziyang Chen, Xing Wu, Junlong Jia +4

    cs.CLcs.AIarXiv:2601.02872v12026
  28. TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents

    Zhibo Yang, Chen Zhang, Yuewei Zhang +1

    cs.AIcs.CLarXiv:2609.05079v12026
  29. Controllable LLM Reasoning via Sparse Autoencoder-Based Steering

    Yi Fang, Wenjie Wang, Mingfeng Xue +4

    cs.AIcs.CLarXiv:2601.03595v22026
  30. Simulated Students in Tutoring Dialogues: Substance or Illusion?

    Alexander Scarlatos, Jaewook Lee, Simon Woodhead +1

    cs.CLcs.CYarXiv:2601.04025v22026
  31. Exploiting Document Knowledge for Aspect-level Sentiment Classification

    Ruidan He, Wee Sun Lee, Hwee Tou Ng +1

    cs.CLarXiv:1806.04346v12018
  32. When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents

    Jaylen Jones, Zhehao Zhang, Yuting Ning +6

    cs.CLcs.AIcs.CRarXiv:2602.08235v22026
  33. Generative Frontiers: Why Evaluation Matters for Diffusion Language Models

    Patrick Pynadath, Jiaxin Shi, Ruqi Zhang

    cs.LGcs.CLarXiv:2604.02718v12026
  34. Large Language Models are Few-Shot Health Learners

    Xin Liu, Daniel McDuff, Geza Kovacs +7

    cs.CLcs.LGarXiv:2305.15525v12023
  35. StitchCUDA: An Automated Multi-Agents End-to-End GPU Programing Framework with Rubric-based Agentic Reinforcement Learning

    Shiyang Li, Zijian Zhang, Winson Chen +3

    cs.MAcs.CLcs.PLarXiv:2603.02637v22026
  36. FBS: Modeling Native Parallel Reading inside a Transformer

    Tongxi Wang

    cs.AIcs.CLarXiv:2601.21708v22026
  37. A Length-Extrapolatable Transformer

    Yutao Sun, Li Dong, Barun Patra +6

    cs.CLarXiv:2212.10554v12022
  38. TeRo: A Time-aware Knowledge Graph Embedding via Temporal Rotation

    Chengjin Xu, Mojtaba Nayyeri, Fouad Alkhoury +2

    cs.CLcs.AIcs.LGarXiv:2010.01029v22020
  39. Find or Classify? Dual Strategy for Slot-Value Predictions on Multi-Domain Dialog State Tracking

    Jian-Guo Zhang, Kazuma Hashimoto, Chien-Sheng Wu +4

    cs.CLcs.AIarXiv:1910.03544v42019
  40. Trajectory2Task: Training Robust Tool-Calling Agents with Synthesized Yet Verifiable Data for Complex User Intents

    Ziyi Wang, Yuxuan Lu, Yimeng Zhang +12

    cs.CLarXiv:2601.20144v32026
  41. Large language models in medicine: the potentials and pitfalls

    Jesutofunmi A. Omiye, Haiwen Gui, Shawheen J. Rezaei +2

    cs.CLcs.AIcs.CYarXiv:2309.00087v12023
  42. Tracking Sentiment in Mail: How Genders Differ on Emotional Axes

    Saif M. Mohammad, Tony, Yang

    cs.CLarXiv:1309.6347v12013
  43. Translating a Math Word Problem to an Expression Tree

    Lei Wang, Yan Wang, Deng Cai +2

    cs.CLarXiv:1811.05632v22018
  44. TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding

    Mingyue Huo, Yiwen Shao, Yuheng Zhang

    eess.AScs.CLarXiv:2601.06896v22026
  45. Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning

    Lili Yu, Bowen Shi, Ramakanth Pasunuru +24

    cs.LGcs.CLcs.CVarXiv:2309.02591v12023
  46. FoE: Forest of Errors Makes the First Solution the Best in Large Reasoning Models

    Kehan Jiang, Haonan Dong, Zhaolu Kang +2

    cs.AIcs.CLarXiv:2604.02967v12026
  47. Training Question Answering Models From Synthetic Data

    Raul Puri, Ryan Spring, Mostofa Patwary +2

    cs.CLcs.AIarXiv:2002.09599v12020
  48. Library Drift: Diagnosing and Fixing a Silent Failure Mode in Self-Evolving LLM Skill Libraries

    Xing Zhang, Yanwei Cui, Guanghui Wang +4

    cs.AIcs.CLcs.SEarXiv:2605.19576v32026
  49. Large Language Models for Generative Recommendation: A Survey and Visionary Discussions

    Lei Li, Yongfeng Zhang, Dugang Liu +1

    cs.IRcs.AIcs.CLarXiv:2309.01157v22023
  50. The Third VoicePrivacy Challenge: Preserving Emotional Expressiveness and Linguistic Content in Voice Anonymization

    Natalia Tomashenko, Xiaoxiao Miao, Pierre Champion +7

    cs.CLcs.SDeess.ASarXiv:2601.11846v12026
  51. Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning

    Yiqi Wang, Wentao Chen, Xiaotian Han +7

    cs.CLcs.AIarXiv:2401.06805v22024
  52. Atlas: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Reasoning

    Jinyang Wu, Guocheng Zhai, Ruihan Jin +5

    cs.CLarXiv:2601.03872v22026
  53. Artificial Artificial Artificial Intelligence: Crowd Workers Widely Use Large Language Models for Text Production Tasks

    Veniamin Veselovsky, Manoel Horta Ribeiro, Robert West

    cs.CLcs.CYarXiv:2306.07899v12023
  54. Sycophancy Hides Linearly in the Attention Heads

    Rifo Genadi, Munachiso Nwadike, Nurdaulet Mukhituly +3

    cs.CLcs.AIarXiv:2601.16644v12026
  55. Memory Matters More: Event-Centric Memory as a Logic Map for Agent Searching and Reasoning

    Yuyang Hu, Jiongnan Liu, Jiejun Tan +2

    cs.AIcs.CLarXiv:2601.04726v12026
  56. Visually-Guided Policy Optimization for Multimodal Reasoning

    Zengbin Wang, Feng Xiong, Liang Lin +5

    cs.CVcs.AIcs.CLarXiv:2604.09349v22026
  57. Revisiting the Gold Standard: Grounding Summarization Evaluation with Robust Human Evaluation

    Yixin Liu, Alexander R. Fabbri, Pengfei Liu +8

    cs.CLarXiv:2212.07981v22022
  58. All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection

    Yuechen Jiang, Zhiwei Liu, Yupeng Cao +10

    cs.CLcs.CEq-fin.CParXiv:2601.04160v32026
  59. LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals

    Lihao Sun, Hang Dong, Bo Qiao +3

    cs.CLcs.AIcs.LGarXiv:2604.05655v12026
  60. Shaping Human-AI Collaboration: Varied Scaffolding Levels in Co-writing with Language Models

    Paramveer S. Dhillon, Somayeh Molaei, Jiaqi Li +3

    cs.HCcs.CLarXiv:2402.11723v12024