Computation and Language
Papers filed under cs.CL on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
2,281 to 2,340 of 11,278
Quantifying Uncertainties in Natural Language Processing Tasks
Yijun Xiao, William Yang Wang
cs.CLcs.AIcs.LGarXiv:1811.07253v12018Benchmark^2: Systematic Evaluation of LLM Benchmarks
Qi Qian, Chengsong Huang, Jingwen Xu +13
cs.CLarXiv:2601.03986v12026Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe
Dain Kim, Eungi Cho, Kyumin Kim +2
cs.AIcs.CLarXiv:2609.05395v12026PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
Yuzhen Shi, Huanghai Liu, Yiran Hu +27
cs.CLcs.AIcs.CYarXiv:2601.16669v22026DynHD: Hallucination Detection for Diffusion Large Language Models via Denoising Dynamics Deviation Learning
Yanyu Qian, Yue Tan, Yixin Liu +2
cs.CLarXiv:2603.16459v22026Large Language Models for HVAC Operations in Building Energy Systems: A Critical Review of Methods, Applications, and Deployment Readiness
Alexander Neubauer, Tianzhen Hong, Han Li +4
cs.AIcs.CLeess.SYarXiv:2609.05314v12026PIArena: A Platform for Prompt Injection Evaluation
Runpeng Geng, Chenlong Yin, Yanting Wang +2
cs.CRcs.AIcs.CLarXiv:2604.08499v12026RubricRAG: Towards Interpretable and Reliable LLM Evaluation via Domain Knowledge Retrieval for Rubric Generation
Kaustubh D. Dhole, Eugene Agichtein
cs.IRcs.AIcs.CLarXiv:2603.20882v12026FadeMem: Biologically-Inspired Forgetting for Efficient Agent Memory
Lei Wei, Xiao Peng, Xu Dong +2
cs.AIcs.CLarXiv:2601.18642v22026Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability
Ankit Goyal, Jaideep Ray
cs.AIcs.CLcs.IRarXiv:2609.05339v12026Technical Manual for a Toolkit for Measuring Contextual Individuation in Transformer Language Models
José Luciano Verçosa Marques, Frederico Jorge Heitmann, Daniel Omar Perez +2
cs.AIcs.CLarXiv:2609.05333v12026The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
Ziyang Ma, Ruiyang Xu, Yinghao Ma +9
cs.SDcs.CLcs.MMarXiv:2602.14224v12026Chain of Code: Reasoning with a Language Model-Augmented Code Emulator
Chengshu Li, Jacky Liang, Andy Zeng +7
cs.CLcs.AIcs.LGarXiv:2312.04474v42023DynaWeb: Model-Based Reinforcement Learning of Web Agents
Hang Ding, Peidong Liu, Junqiao Wang +7
cs.CLcs.AIarXiv:2601.22149v22026Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History
Serin Kim, Sangam Lee, Dongha Lee
cs.CLcs.AIarXiv:2602.17003v32026Reframing Human-AI Collaboration for Generating Free-Text Explanations
Sarah Wiegreffe, Jack Hessel, Swabha Swayamdipta +2
cs.CLarXiv:2112.08674v22021Summaries:한국어Reasoning Implicit Sentiment with Chain-of-Thought Prompting
Hao Fei, Bobo Li, Qian Liu +3
cs.CLarXiv:2305.11255v42023Bottom Up Top Down Detection Transformers for Language Grounding in Images and Point Clouds
Ayush Jain, Nikolaos Gkanatsios, Ishita Mediratta +1
cs.CVcs.CLarXiv:2112.08879v52021There Is More to Refusal in Large Language Models than a Single Direction
Faaiz Joad, Majd Hawasly, Sabri Boughorbel +2
cs.CLarXiv:2602.02132v12026Learning Private Neural Language Modeling with Attentive Aggregation
Shaoxiong Ji, Shirui Pan, Guodong Long +3
cs.CLcs.LGarXiv:1812.07108v22018Multi-granularity hierarchical attention fusion networks for reading comprehension and question answering
Wei Wang, Ming Yan, Chen Wu
cs.CLarXiv:1811.11934v12018Mr. TyDi: A Multi-lingual Benchmark for Dense Retrieval
Xinyu Zhang, Xueguang Ma, Peng Shi +1
cs.CLcs.IRarXiv:2108.08787v22021Zero-Shot Grounding of Objects from Natural Language Queries
Arka Sadhu, Kan Chen, Ram Nevatia
cs.CVcs.CLarXiv:1908.07129v12019A Survey on Long-Term Memory Security in LLM Agents: Attacks, Defenses, and Governance Across the Memory Lifecycle
Zehao Lin, Xixuan Hao, Renyu Fu +5
cs.CRcs.AIcs.CLarXiv:2604.16548v22026AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations
Cheng Jiayang, Dongyu Ru, Lin Qiu +4
cs.CLcs.AIarXiv:2603.01966v12026Verified Critical Step Optimization for LLM Agents
Mukai Li, Qingcheng Zeng, Tianqing Fang +5
cs.CLarXiv:2602.03412v22026LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
Ziyang Chen, Xing Wu, Junlong Jia +4
cs.CLcs.AIarXiv:2601.02872v12026TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents
Zhibo Yang, Chen Zhang, Yuewei Zhang +1
cs.AIcs.CLarXiv:2609.05079v12026Controllable LLM Reasoning via Sparse Autoencoder-Based Steering
Yi Fang, Wenjie Wang, Mingfeng Xue +4
cs.AIcs.CLarXiv:2601.03595v22026Simulated Students in Tutoring Dialogues: Substance or Illusion?
Alexander Scarlatos, Jaewook Lee, Simon Woodhead +1
cs.CLcs.CYarXiv:2601.04025v22026Exploiting Document Knowledge for Aspect-level Sentiment Classification
Ruidan He, Wee Sun Lee, Hwee Tou Ng +1
cs.CLarXiv:1806.04346v12018When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents
Jaylen Jones, Zhehao Zhang, Yuting Ning +6
cs.CLcs.AIcs.CRarXiv:2602.08235v22026Generative Frontiers: Why Evaluation Matters for Diffusion Language Models
Patrick Pynadath, Jiaxin Shi, Ruqi Zhang
cs.LGcs.CLarXiv:2604.02718v12026Large Language Models are Few-Shot Health Learners
Xin Liu, Daniel McDuff, Geza Kovacs +7
cs.CLcs.LGarXiv:2305.15525v12023StitchCUDA: An Automated Multi-Agents End-to-End GPU Programing Framework with Rubric-based Agentic Reinforcement Learning
Shiyang Li, Zijian Zhang, Winson Chen +3
cs.MAcs.CLcs.PLarXiv:2603.02637v22026FBS: Modeling Native Parallel Reading inside a Transformer
Tongxi Wang
cs.AIcs.CLarXiv:2601.21708v22026A Length-Extrapolatable Transformer
Yutao Sun, Li Dong, Barun Patra +6
cs.CLarXiv:2212.10554v12022TeRo: A Time-aware Knowledge Graph Embedding via Temporal Rotation
Chengjin Xu, Mojtaba Nayyeri, Fouad Alkhoury +2
cs.CLcs.AIcs.LGarXiv:2010.01029v22020Find or Classify? Dual Strategy for Slot-Value Predictions on Multi-Domain Dialog State Tracking
Jian-Guo Zhang, Kazuma Hashimoto, Chien-Sheng Wu +4
cs.CLcs.AIarXiv:1910.03544v42019Trajectory2Task: Training Robust Tool-Calling Agents with Synthesized Yet Verifiable Data for Complex User Intents
Ziyi Wang, Yuxuan Lu, Yimeng Zhang +12
cs.CLarXiv:2601.20144v32026Large language models in medicine: the potentials and pitfalls
Jesutofunmi A. Omiye, Haiwen Gui, Shawheen J. Rezaei +2
cs.CLcs.AIcs.CYarXiv:2309.00087v12023Tracking Sentiment in Mail: How Genders Differ on Emotional Axes
Saif M. Mohammad, Tony, Yang
cs.CLarXiv:1309.6347v12013Translating a Math Word Problem to an Expression Tree
Lei Wang, Yan Wang, Deng Cai +2
cs.CLarXiv:1811.05632v22018TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding
Mingyue Huo, Yiwen Shao, Yuheng Zhang
eess.AScs.CLarXiv:2601.06896v22026Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning
Lili Yu, Bowen Shi, Ramakanth Pasunuru +24
cs.LGcs.CLcs.CVarXiv:2309.02591v12023FoE: Forest of Errors Makes the First Solution the Best in Large Reasoning Models
Kehan Jiang, Haonan Dong, Zhaolu Kang +2
cs.AIcs.CLarXiv:2604.02967v12026Training Question Answering Models From Synthetic Data
Raul Puri, Ryan Spring, Mostofa Patwary +2
cs.CLcs.AIarXiv:2002.09599v12020Library Drift: Diagnosing and Fixing a Silent Failure Mode in Self-Evolving LLM Skill Libraries
Xing Zhang, Yanwei Cui, Guanghui Wang +4
cs.AIcs.CLcs.SEarXiv:2605.19576v32026Large Language Models for Generative Recommendation: A Survey and Visionary Discussions
Lei Li, Yongfeng Zhang, Dugang Liu +1
cs.IRcs.AIcs.CLarXiv:2309.01157v22023The Third VoicePrivacy Challenge: Preserving Emotional Expressiveness and Linguistic Content in Voice Anonymization
Natalia Tomashenko, Xiaoxiao Miao, Pierre Champion +7
cs.CLcs.SDeess.ASarXiv:2601.11846v12026Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning
Yiqi Wang, Wentao Chen, Xiaotian Han +7
cs.CLcs.AIarXiv:2401.06805v22024Atlas: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Reasoning
Jinyang Wu, Guocheng Zhai, Ruihan Jin +5
cs.CLarXiv:2601.03872v22026Artificial Artificial Artificial Intelligence: Crowd Workers Widely Use Large Language Models for Text Production Tasks
Veniamin Veselovsky, Manoel Horta Ribeiro, Robert West
cs.CLcs.CYarXiv:2306.07899v12023Sycophancy Hides Linearly in the Attention Heads
Rifo Genadi, Munachiso Nwadike, Nurdaulet Mukhituly +3
cs.CLcs.AIarXiv:2601.16644v12026Memory Matters More: Event-Centric Memory as a Logic Map for Agent Searching and Reasoning
Yuyang Hu, Jiongnan Liu, Jiejun Tan +2
cs.AIcs.CLarXiv:2601.04726v12026Visually-Guided Policy Optimization for Multimodal Reasoning
Zengbin Wang, Feng Xiong, Liang Lin +5
cs.CVcs.AIcs.CLarXiv:2604.09349v22026Revisiting the Gold Standard: Grounding Summarization Evaluation with Robust Human Evaluation
Yixin Liu, Alexander R. Fabbri, Pengfei Liu +8
cs.CLarXiv:2212.07981v22022All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection
Yuechen Jiang, Zhiwei Liu, Yupeng Cao +10
cs.CLcs.CEq-fin.CParXiv:2601.04160v32026LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals
Lihao Sun, Hang Dong, Bo Qiao +3
cs.CLcs.AIcs.LGarXiv:2604.05655v12026Shaping Human-AI Collaboration: Varied Scaffolding Levels in Co-writing with Language Models
Paramveer S. Dhillon, Somayeh Molaei, Jiaqi Li +3
cs.HCcs.CLarXiv:2402.11723v12024